9月23日,图像模型公司跨进机器人
9月23日,德国公司Black Forest Labs发布并开源了FLUX 3 Action,一个70亿参数的世界动作模型(World Action Model),专门用于机器人控制。这家公司因FLUX图像生成系列为业界所知,这次把同一套多模态骨干用到了新领域:模型读取多路相机画面、机器人自身状态和一条文字指令,然后同时预测未来的视频画面与下一组动作。官方说明与DataNorth、AI and Tech News等媒体报道了这次发布。
怎么做到又小又快
按官方技术报告,FLUX 3 Action的预训练以视频为主体,视频数据占训练词元的95%以上,再通过联合视频-动作训练适配到具体机器人本体。每次推理输出32个动作,按每秒15次指令的频率折算约2.13秒的运动量,在B200显卡上单块动作耗时约41毫秒。开源权重分为base、so101、droid三个版本,覆盖通用场景、低成本机械臂与DROID数据集,已放在Hugging Face上。
榜单成绩与真实机械臂表现
在NVIDIA的RoboLab-120仿真基准上,FLUX 3 Action以42.92%的任务成功率排在开源模型前列(厂商自报口径;其多种子均值为42.24%±0.36),超过160亿参数的Cosmos 3 Nano的36.8%,也高于π0.5的28.0%,而参数量只有对方的一半不到,速度快至3.95倍。真机测试方面,Positronic Robotics在一台Franka机械臂上做了30次盲测尝试,完成28次,成功率达93.3%——这一数字同样来自厂商口径,任务清单未逐项公开,参考时需留出余地。
开源不等于随便商用
两个细节值得注意。其一,模型采用新的FLUX Kommunity License,非商业使用免费,但商业条款尚未公布,想拿它做产品的团队暂时还无法评估成本。其二,官方只与开源模型做了对比,没有与闭源系统同台比较,"开源领先"不等于"全场领先"。此外,模型输出的是原始关节控制量,官方明确提示需要自行加装安全层。对打算跟进的团队,建议先在仿真环境里复测榜单成绩,再决定是否投入真机调试。
企业视角:具身智能的内容窗口
对机器人与自动化产业链上的企业,这类开源模型是实打实的基础设施:7B参数意味着消费级与工作站显卡就能跑,微调大约需要200条演示数据,验证门槛明显低于以往。企业与其观望,不如尽早把自家设备的接口说明、能力边界与案例数据整理成机器可读的结构化内容——具身智能生态的检索需求正在形成,谁的技术文档先被AI大模型准确引用,谁就在新一轮AI搜索里拿到先手。具体可以从产品参数页、常见问题与售后文档三块做起,逐步形成可被检索引用的资料体系。这也是GEO优化在硬件行业的机会点,极欧互联建议相关企业提前布局。
趋势研判:从数字界面走向物理世界
世界动作模型路线的核心,是让机器先"想象"再行动:预测画面就是预测后果。官方还提到,游戏环境可以作为导航能力的试验场,下一步指向对延迟敏感的computer-use智能体。可以预期,随着开源权重、小参数化与本地部署的组合成熟,智能体会同时涌向数字界面与物理世界,企业内容面对的"机器读者"种类只会更多。
信息来源
- Black Forest Labs官方,《FLUX 3 Action: A 7B World Action Model for Robot Control》,2026-09-23,https://bfl.ai/models/flux-3-action
- DataNorth AI,《Black Forest Labs releases FLUX 3 Action》,2026-09-23,https://datanorth.ai/news/black-forest-labs-releases-flux-3-action
- AI and Tech News,《Black Forest Labs Launches FLUX 3 Action Open Robotics AI Model》,2026-09,https://www.aiandtech.news/article/black-forest-labs-launches-flux-3-action-open-robotics-ai-model

