10月6日,谷歌开放一个"小而全"的检索模型
10月6日,Google DeepMind发布开源嵌入模型EmbeddingGemma 2,采用Apache 2.0许可开放权重,允许商用。按官方模型卡口径,模型总参数7.4亿,由2.7亿文本骨干、1.7亿视觉编码器与3亿音频编码器组成,能把文本、代码、图像、视频和音频统一映射到768维的同一向量空间,支持超过100种语言。谷歌CEO皮查伊称,这是谷歌开放的原生多模态嵌入模型。
事件背景:它干的是检索层的活儿
嵌入模型不负责生成答案,它负责把各种内容变成机器可比较的数字向量,是搜索和检索增强生成(RAG)的地基。上一代EmbeddingGemma只处理文本,2025年发布。这次升级把图像、视频、音频补进同一空间,等于把"以文搜图、以文搜音"装进了同一个开源模型。EmbeddingGemma 2的特点在于小而模块化:只处理文本时约2.7亿参数,加上视觉4.4亿,全模态7.4亿,可按需加载。上下文窗口8192个token,约为上一代的4倍。借助Matryoshka表示学习,768维向量可截断到512、256或128维使用,官方称向量存储成本至多可节省约六倍空间。媒体转述的测试数据显示,量化后在Pixel 11 Pro上,纯文本权重约占191MB内存,全模态约占567MB,手机和笔记本就能跑。谷歌还披露,上一代EmbeddingGemma的下载量已超过2000万。
为什么强调"跑在本地"?检索环节往往要碰企业数据和个人文件。传统做法是把内容传给云端接口做向量化,来回一趟既产生费用,也带来数据外流的顾虑。检索在本地完成,原始内容可以不出设备,对医疗记录、法务文件、内部资料这类敏感内容尤其有意义。这也是开源轻量模型相对云端接口的一个差异化位置。
深度分析:基准成绩是厂商自报口径
基准成绩方面,官方博客称其MTEB Code得分从上一代的68.76升至78.68,并称在10亿参数以下的多模态嵌入模型中表现领先,甚至超过部分参数量翻倍的专业模型。需要说明,这些均为厂商自报口径,第三方独立复测尚未见到。权重已上架Hugging Face与Kaggle,支持Ollama、llama.cpp、sentence-transformers等工具,开发者可以自己测过再用。
对AI搜索引用链条的影响
值得做GEO优化的企业关注的是:检索是AI回答问题的前置环节。用户在AI搜索里看到的引用,先要经过"内容被检索、被理解"这一步。嵌入模型走向开源、轻量、多模态,意味着两件事。其一,检索能力进一步下沉到端侧和各种应用里,企业内容的分发入口在变多。其二,图像、视频、音频进入同一检索空间,官网里的产品图、演示视频、播客音频都可能是被AI引用的素材——前提是它们有清晰的标题、描述和上下文,能被机器正确理解。
企业侧可以怎么做
落到执行上,可以分三步。先盘点:把官网上的图片、视频、音频列个清单,看哪些缺标题、缺描述、缺文字稿。再补齐:给视觉素材写清楚这是什么、拍的是什么、说明什么事实,给音视频配上文字稿,让机器不用猜。后核验:核心产品信息、资质、案例,保证页面之间口径一致,别让检索环节抓到互相矛盾的版本。极欧互联在GEO优化项目里观察到的共性问题,是企业图片的替代文本、视频的文字稿这类"机器可读"信息大片空白,而这一块补齐的成本并不高,值得先做。
趋势研判:检索基础设施走向开放竞争
同一天,Mistral预告了万亿参数开源模型,Meta与Sierra发布了智能体接入标准。AI大模型的竞争重心,正从"谁的旗舰更能打"扩散到"谁的基础件被更多系统采用"。嵌入模型这类不起眼的零件,反而可能是走量的一层。对中小企业来说,短期内不必追着每个开源模型跑,务实的做法是先检查自己的多模态素材是否可被检索:图片有无准确描述、视频有无文字稿、核心事实有无结构化呈现。生成式引擎优化的战场,正在从网页文本扩展到全部内容形态。
信息来源
- AI Insiders,《EmbeddingGemma 2 puts multimodal search on the device, offline》,2026-10-07,https://aiinsiders.net/article/embeddinggemma-2-puts-multimodal-search-on-the-device
- Data Studios,《Google launches EmbeddingGemma 2 with 740M parameters for on-device multimodal search and RAG》,2026-10,https://www.datastudios.org/post/google-embeddinggemma-2-740m-on-device-multimodal-search-rag
- AI Weekly,《Google ships EmbeddingGemma 2, 740M multimodal embedder, Apache 2.0》,2026-10,https://aiweekly.co/alerts/google-launches-embeddinggemma-2-a-740m-multimodal-embedder-under-apache-20

