谷歌推出EmbeddingGemma 2:支持多模态

发布时间:2026-10-07 07:13

  去年谷歌推出了 EmbeddingGemma,为开发者提供轻量高质量的文本嵌入方案,下载量已超 2000 万次,广泛应用于端侧工具和隐私优先检索增强生成管线。

  如今谷歌正式推出EmbeddingGemma 2,将能力从文本扩展到代码、图像、、音频,可将这些内容统一映射到同一个嵌入空间。

  援引博文介绍,该模型基于Gemma 4架构开发,采用商业友好的 Apache 2.0 许可发布,总参数为 7.4 亿,非常适合端侧推理。

  同尺寸顶尖性能:在子 1B 参数多模态嵌入模型中,于 MTEB Code、MAEB 等基准测试中取得领先分数,性能比肩甚至超越不少更大尺寸模型。

  模块化设计:纯文本任务仅需 2.7 亿参数,可按需添加 1.7 亿参数的

  存储高效:借助 Matryoshka 表示学习,开发者可动态将输出向量从 768 维截断至 512、256 或 128 维,本地向量数据库存储和内存占用最高可缩减 6 倍。

  支持扩展上下文:配备 8K Token 上下文窗口,比初代 EmbeddingGemma 大 4 倍,可在本地硬件直接处理最长 5.5 分钟音频、29 张图像、58 个帧,或上述内容的交错组合。

  在性能方面,EmbeddingGemma 2 保留了前代出色的多语言文本性能,同时代码性能大幅提升 9.92 分,非常适合本地代码库索引、语义代码和编程代理检索。

  在图像、、文档和音频任务中,该模型为子 1B 参数模型树立了单位参数质量新标杆,甚至性能超过不少尺寸两倍于它的专业模型。

  EmbeddingGemma 2 将强大能力直接带到端侧硬件,本地生成嵌入可保障数据隐私、降低管线延迟,支持开发者搭建完全离线运行的跨模态和检索系统。

  搭配 Gemma 4 等生成模型,还可实现理解复杂多模态数据的端侧 RAG 管线;由于二者架构同源,共享文本分词器和音频编码器,可在统一管线中同时运行,合计内存占用更低。

  特别

  女子景区游玩时金戒指掉落,瞬间被流沙覆盖,景区用2台金属探测仪搜寻4小时找到并寄回;8人团队已帮游客找回1800多台遗失手机

  “这才是线岁男子在自家小区当保安,房贷还有9年,每月还2100,月薪4200,下楼就能上班,网友:活明白了

  中国两岁女童在新加坡景区被蟒蛇咬伤,家长:孩子被咬后伤口瞬间红肿,已紧急送医处理,咬人的是网纹蟒,所幸无毒

排行

精选