GEO资讯

谷歌开源多模态检索模型EmbeddingGemma 2,AI搜索向多模态延伸

发布于 2026/10/8 9 次阅读
谷歌开源多模态检索模型EmbeddingGemma 2,AI搜索向多模态延伸

10月6日,谷歌开放一个"小而全"的检索模型

10月6日,Google DeepMind发布开源嵌入模型EmbeddingGemma 2,采用Apache 2.0许可开放权重,允许商用。按官方模型卡口径,模型总参数7.4亿,由2.7亿文本骨干、1.7亿视觉编码器与3亿音频编码器组成,能把文本、代码、图像、视频和音频统一映射到768维的同一向量空间,支持超过100种语言。谷歌CEO皮查伊称,这是谷歌开放的原生多模态嵌入模型。

事件背景:它干的是检索层的活儿

嵌入模型不负责生成答案,它负责把各种内容变成机器可比较的数字向量,是搜索和检索增强生成(RAG)的地基。上一代EmbeddingGemma只处理文本,2025年发布。这次升级把图像、视频、音频补进同一空间,等于把"以文搜图、以文搜音"装进了同一个开源模型。EmbeddingGemma 2的特点在于小而模块化:只处理文本时约2.7亿参数,加上视觉4.4亿,全模态7.4亿,可按需加载。上下文窗口8192个token,约为上一代的4倍。借助Matryoshka表示学习,768维向量可截断到512、256或128维使用,官方称向量存储成本至多可节省约六倍空间。媒体转述的测试数据显示,量化后在Pixel 11 Pro上,纯文本权重约占191MB内存,全模态约占567MB,手机和笔记本就能跑。谷歌还披露,上一代EmbeddingGemma的下载量已超过2000万。

为什么强调"跑在本地"?检索环节往往要碰企业数据和个人文件。传统做法是把内容传给云端接口做向量化,来回一趟既产生费用,也带来数据外流的顾虑。检索在本地完成,原始内容可以不出设备,对医疗记录、法务文件、内部资料这类敏感内容尤其有意义。这也是开源轻量模型相对云端接口的一个差异化位置。

深度分析:基准成绩是厂商自报口径

基准成绩方面,官方博客称其MTEB Code得分从上一代的68.76升至78.68,并称在10亿参数以下的多模态嵌入模型中表现领先,甚至超过部分参数量翻倍的专业模型。需要说明,这些均为厂商自报口径,第三方独立复测尚未见到。权重已上架Hugging Face与Kaggle,支持Ollama、llama.cpp、sentence-transformers等工具,开发者可以自己测过再用。

对AI搜索引用链条的影响

值得做GEO优化的企业关注的是:检索是AI回答问题的前置环节。用户在AI搜索里看到的引用,先要经过"内容被检索、被理解"这一步。嵌入模型走向开源、轻量、多模态,意味着两件事。其一,检索能力进一步下沉到端侧和各种应用里,企业内容的分发入口在变多。其二,图像、视频、音频进入同一检索空间,官网里的产品图、演示视频、播客音频都可能是被AI引用的素材——前提是它们有清晰的标题、描述和上下文,能被机器正确理解。

企业侧可以怎么做

落到执行上,可以分三步。先盘点:把官网上的图片、视频、音频列个清单,看哪些缺标题、缺描述、缺文字稿。再补齐:给视觉素材写清楚这是什么、拍的是什么、说明什么事实,给音视频配上文字稿,让机器不用猜。后核验:核心产品信息、资质、案例,保证页面之间口径一致,别让检索环节抓到互相矛盾的版本。极欧互联在GEO优化项目里观察到的共性问题,是企业图片的替代文本、视频的文字稿这类"机器可读"信息大片空白,而这一块补齐的成本并不高,值得先做。

趋势研判:检索基础设施走向开放竞争

同一天,Mistral预告了万亿参数开源模型,Meta与Sierra发布了智能体接入标准。AI大模型的竞争重心,正从"谁的旗舰更能打"扩散到"谁的基础件被更多系统采用"。嵌入模型这类不起眼的零件,反而可能是走量的一层。对中小企业来说,短期内不必追着每个开源模型跑,务实的做法是先检查自己的多模态素材是否可被检索:图片有无准确描述、视频有无文字稿、核心事实有无结构化呈现。生成式引擎优化的战场,正在从网页文本扩展到全部内容形态。

信息来源