谷歌在 10 月 6 日开源了 EmbeddingGemma 2。这个 740M 参数的小模型,把图片、视频、音频、文字和代码检索放进了同一套系统里,完整多模态版本量化后在 Pixel 11 Pro 上的内存占用约 567MB,支持在手机、笔记本和浏览器离线运行。

这是谷歌首个原生多模态开源嵌入模型。谷歌 CEO Sundar Pichai 也公开介绍了这次发布。发布一个多小时后,Hugging Face 的 Victor M 已经让它在浏览器里跑了起来:输入「birds singing」,页面中的鸟类照片和鸟叫录音会一起被排到前面,整次查询耗时 22 毫秒,不经过服务器,也没有调用 API。
文字、图片、音频和视频进入同一检索空间
Embedding 模型本身并不直接面向普通用户,但很多 AI 搜索和 RAG 问答都依赖它来完成资料召回。它的作用,是把不同内容转换成一串数字,也就是向量,再根据向量之间的距离判断语义是否接近。
上一代 EmbeddingGemma 只能处理文字。要检索图片或声音,通常还要接入其他模型,或者先把内容转成文字。EmbeddingGemma 2 则把文字、图片、视频和音频统一映射到同一个 768 维空间里。这样一来,猫的照片、「cat」这个词和猫叫声,就可以按语义关联在一起。

这带来的直接变化,是检索方式不再受内容类型限制。用户可以用一句话搜图片、搜视频,也可以用一段语音去找视频中的对应片段;文字、图片和视频也可以被放在一起,作为一条完整信息参与检索。
谷歌在模型卡中举了一个商品页的例子:页面里有一双跑鞋的文字介绍、两张细节图,以及鞋子在湿滑岩石上的防滑测试视频。模型可以把这组内容编码成一个向量,再去匹配「适合越野跑的防水鞋」这样的搜索请求。
8K 上下文窗口,支持 100 多种语言
EmbeddingGemma 2 的一次处理容量也比上一代更大。它的上下文窗口达到 8K,是上一代的 4 倍。
在只输入单一类型内容时,模型最多可容纳约 5.5 分钟音频、29 张图片或 58 帧视频,同时支持 100 多种语言。对于需要跨语言检索的场景,这意味着同一套索引可以覆盖更多输入形式。
谷歌公布的对比测试显示,EmbeddingGemma 2 与几个同量级模型相比,优势最明显的部分出现在图像和视频检索上。
- 图像检索得分为 57.3,Jina v5 Omni-Nano 为 31.6;
- 视频检索得分为 50.7,Jina v5 Omni-Nano 为 31.2;
- 多语言文本测试与上一代基本持平。
按谷歌给出的数据,EmbeddingGemma 2 在图像检索上比参数量高出三成的 Jina v5 Omni-Nano 高出 25.7 分,视频检索高出 19.5 分。
完整多模态模型约 567MB,可按需加载
虽然支持多模态检索,EmbeddingGemma 2 的整体体积仍被压在较小范围内。740M 参数中,文本部分占 270M,视觉编码器 170M,音频编码器 300M,支持按需加载。
如果只做文本检索,只需要加载 270M;如果要加入图片检索,再叠加视觉部分,总量为 440M。谷歌在 Pixel 11 Pro 上的测试显示,量化后的纯文本模型最低内存占用约 191MB,完整多模态模型约 567MB。
模型还支持对搜索索引做压缩,用更少的数字记录每段内容的语义,存储占用可减少三分之二。谷歌称,在其多语言文本检索测试中,这种压缩带来的分数下降不到 1 分。
谷歌给出多种本地应用样例
谷歌已经基于 EmbeddingGemma 2 做了几组应用打样。
- AI Edge Gallery 中的 Instant Media Search,可在相册里按语义搜索照片;
- Video Moments Finder 支持用一句话定位视频中的对应片段;
- Foresight 则把它与 Gemma 4 结合,在 Mac 上离线检索文件和会议记录。
开发工具侧也已经开始跟进。llama.cpp 已提供支持,Unsloth 也发布了量化版本,方便开发者在本地部署。

据 Mac 应用 Nativ 公布的实测,在 M5 Max 上,8-bit 量化版生成向量与原版的余弦相似度达到 0.9997,文本嵌入速度达到每秒 817 条。
开发者测试显示跨语言和错别字检索能力提升
土耳其开发者 Avenox 公布了一组更接近日常使用的测试。他的笔记大多用英文记录,但提问习惯使用土耳其语。过去依赖关键词匹配时,如果两边用词对不上,相关笔记就可能无法被召回。
他让 Claude 用一个小时搭建测试环境,选出 40 条笔记,再分别换一种说法,用土耳其语提问,观察正确笔记能否进入前 18 个候选。按他公布的结果,关键词匹配的命中比例为 15%,换成 EmbeddingGemma 2 后升至 97%。
随后,他又用 30 条带有错别字的真实消息做测试。EmbeddingGemma 2 找到的相关笔记数量是关键词匹配的两倍,每次查询约 50 毫秒,全部在本地完成。
另一位开发者 Nick Lo 则把模型装进了一块 Nano 开发板。输入一句话后,模型约 15 毫秒就能把文本转成用于搜索的向量;找到对应图片后,再交给一块 ESP32-S3 单片机逐行绘制图像。
代码检索分数从 68.76 提升到 78.68
除了多模态检索,EmbeddingGemma 2 在代码检索上的表现也有提升。
在代码检索基准 MTEB Code 上,它从上一代的 68.76 分提升到 78.68 分,增加近 10 分。谷歌称,这一成绩在同尺寸模型中处于领先位置。
这类能力适合代码 Agent 使用。像 Claude Code、Codex 这样的工具,在执行任务前通常需要先从整个代码库中找出相关代码片段。借助 270M 的纯文本版本,开发者可以在本地为代码库建立索引,再用自然语言检索相关代码,建索引和检索都可以留在本地完成。

谷歌把多模态 AI 搜索从云端带到设备侧
今年 3 月,谷歌曾推出云端多模态模型 Gemini Embedding 2,通过 API 调用并按用量计费。半年多后,谷歌又把多模态检索能力放进了一个可在手机运行的开源小模型中。
这意味着照片、录音和视频不一定要上传到云端处理,本地检索成为可选方案。谷歌给出的一个典型用法,是把 EmbeddingGemma 2 与 Gemma 4 搭配,构建离线、隐私优先的 RAG:前者负责检索资料,后者根据检索结果生成回答,检索和问答都在设备上完成。
过去,AI 搜索照片、视频和录音,很多时候依赖云端。现在,谷歌把这类检索能力压缩到几百 MB 的体积里,手机本地运行开始具备现实可行性。

