9月15日,"物理世界大脑"开源
9月15日,武汉人工智能研究院推出并开源新一代面向物理世界的通用多模态大模型ZDTaichu5.0-9B。这个参数量约90亿的模型,能同时处理文字、单图、多图、长视频和任意分辨率画面,重点解决真实场景中的空间感知、换视角后的方位判断和机器人任务规划问题。权重已在Hugging Face、ModelScope及GitHub开放,同批公开的还有整套数据生产方案。
如果说过去两年的大模型主要在"看懂"数字世界里的图文视频,这一类模型要补的,是机器人真正干活时缺的那段判断:东西在哪、换个角度还认不认得出、伸手过去能不能放。
评测成绩:厂商披露口径
按团队公布的评测结果,在覆盖空间感知、三维推理、多视角变换、具身交互的九项国际空间理解基准中,ZDTaichu5.0-9B有八项取得同参数组头名(厂商披露口径,第三方复测情况未见披露)。具体数字上:代表复杂三维推演的MindCube-tiny拿到78.27分,较对比的Qwen3.5-9B高出20.67个百分点;跨视角评测ViewSpatial得分62.5。横向对比对象包括Qwen3.5-9B、STEP3-VL-10B等开源模型。
空间能力提升的同时,图文理解、文字识别、视觉数学、代码工具调用等通用能力保持在头部水平,这也是多模态模型长期难两全的地方:以往提升空间推理,往往要以牺牲通用能力为代价。
自适应循环推理:难题多算,简单少算
能力来自架构上的一个选择。模型原生内置自适应循环推理机制,运行在前向传播内部:确定性高的token直接输出,遇到空间变换、物体关系判断这类高不确定性节点,就在内部循环多算几轮,不依赖外部工具,也不明显拉高整体token成本。团队形容为"看题下菜"——算力向难题倾斜。
开源范围同样值得注意。多数开源项目只放权重,企业拿到模型却无法用自有数据迭代。紫东太初这次公开了整套空间多模态数据生产管线,覆盖预训练、监督微调、高质量退火到GRPO可验证强化学习的全部环节,包括数据去重、质量过滤、三维能力标签、思维链合成与一致性校验。科研机构和制造企业可以把自有的仿真、工业、实验数据接进来继续训练。
企业视角:多模态AI正在走向车间与实验室
该模型已完成两类场景验证:科研自动化方面跑通了从仿真计算到实体实验的闭环,能完成试管按序入架、滴管液体转移这类连续操作;智能制造方面,可根据工单规划跨工位配送、机台上料等任务,并直接输出设备控制指令。据了解,模型已在北京、佛山、青岛等地的具身智能训练场落地。
对做GEO优化的企业,这条新闻的启示在于:AI读取企业内容的方式正在从"读文字"扩展到"理解图像与空间"。产品图、场景图、操作流程图会越来越多地被多模态AI大模型直接解析,图片的替代文本、命名、周边说明文字不再是可有可无的装饰,而是被理解和被AI引用的入口。设备制造、工业服务类企业尤其值得把产品页面的图文信息补齐。
趋势:具身底座进入开源竞争
紫东太初由中国科学院自动化研究所与武汉人工智能研究院共同孵化。随着具身智能成为各家争抢的方向,空间理解底座的开源会拉低行业创新门槛,"权重与数据工艺一起开放"也有望成为国产开源的新常态。对企业来说,多模态内容资产的整理可以提上日程——这是少数现在动手就有回报的事。
信息来源
- 上海证券报·中国证券网(同花顺财经转载),《紫东太初开源9B多模态模型 聚焦空间具身与真实场景应用》,2026-09-18,https://field.10jqka.com.cn/20260918/c680044181.shtml
- 太平洋电脑网,《中国队9B全能王开源登场,空间具身能力领先》,2026-09-15,https://g.pconline.com.cn/x/2182/21821564.html
- 湖北日报,《紫东太初新一代面向物理世界的通用多模态大模型开源》,2026-09-15,https://www.toutiao.com/article/7685738741160116770

