蚂蚁开源百灵首个原生多模态模型
9月9日,蚂蚁集团宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。据软盟资讯等行业媒体报道,该模型基于百灵Ling-3.0-flash的混合专家架构拓展而来,总参数量124B,单次推理仅激活约5.5B参数,原生支持图像、文本与视频三种输入。模型已在Ling Studio提供在线体验,权重在Hugging Face与ModelScope两个平台开放下载,首批放出BF16与FP8精度版本,更多量化版本陆续跟进。
事件背景:从看得见到边做边看
百灵系列此前以文本模型为主,这次发布的VL版本把视觉能力做进了执行链路。其核心创新是视觉反馈闭环机制:模型处理任务时按照观察、行动、验证、修正四步循环推进,执行一个动作后会重新查看结果,判断与目标的偏差,再继续调整。以图片转网页为例,模型先生成代码并渲染页面,再对照渲染结果修改代码,而不是停在初次生成。
架构层面,模型配备了任意分辨率的视觉编码器与VideoRoPE时间编码,42层语言主干以约5比1的比例交替使用KDA与Gated MLA两种注意力结构。官方推荐部署配置的上下文窗口为256K token,适合长文档与长视频场景。
深度分析:智能体执行的入场券
过去一段时间,多数多模态模型停留在看图说话层面,视觉理解与任务执行是两条线。Ling-3.0-flash-VL把视觉验证塞进了智能体的工作循环,GUI自动化、前端代码生成、医疗报告阅读是官方点名的三类场景。作为GUI智能体,它可以识别界面结构,完成网页查数、整理表格、跨应用切换这类多步操作,并在每步之后重新观察页面状态。
评测方面需要说明口径:据厂商披露,模型在Artificial Analysis Intelligence Index v4.1.1版本中得分42,较纯文本版Ling-3.0-flash的38分提升4分;官方还称其以linthium代号参加Image-to-WebDev Arena评测时得分高于GPT-5.4。以上均为厂商自报口径,独立复现结果尚待观察。
企业视角:页面要经得起复核
这类模型对企业官网的实际影响在于:智能体不再只是引用一段文字,而是会打开页面、看图、核对结果。企业做GEO优化(生成式引擎优化)时,有三件事值得提前做:
- 图片信息可读:产品图、参数表、资质证书配好替代文本与图注,别把核心数据只藏在图片像素里;
- 界面与文档对齐:页面文字与实际服务口径一致,经得起智能体再看一遍式的交叉核验;
- 结构保持清晰:语义分层、要点明确的页面,更容易在AI搜索引用中被采信。
极欧互联(jiougeo.com)在GEO服务中观察到,模型能力越强,对信息可信度的筛选越严格,看不清、对不上的页面正在被AI检索端逐步过滤。
趋势研判:开源多模态降低智能体门槛
124B总参、5.5B激活的设计,让企业在有限算力环境下也能部署多模态智能体,开源权重叠加多个精度版本,进一步压低了使用成本。可以预期,私有化部署的多模态智能体会加速进入客服、巡检、文档处理等场景。对内容侧的启示是明确的:被AI引用的竞争,正从文字被读到扩展为信息被验证,企业官网的每张图、每张表都可能成为AI搜索引用的取材对象,GEO优化的颗粒度也要跟着变细。
信息来源
- 软盟资讯,《蚂蚁开源百灵首个原生多模态大模型,124B参数支持图、文、视频输入》,2026-09-09,https://news.softunis.com/kuaixun/74252.html
- Pandaily,《Ant Group Opens Ling-3.0-flash-VL Multimodal Model With Vision Feedback Loop》,2026-09,https://pandaily.com/ant-group-ling-3-0-flash-vl-open-source-vision-feedback
- DataNorth AI,《Ant Group releases Ling-3.0-flash-VL》,2026-09-10,https://datanorth.ai/news/ant-group-releases-ling-3-0-flash-vl

