GEO资讯

Nex-AGI开源Nex-N2.5,智能体模型三档齐发

发布于 2026/9/13 152 次阅读
Nex-AGI开源Nex-N2.5,智能体模型三档齐发

万亿参数级智能体模型开放权重

9月8日,由上海创智学院发起的创新联盟Nex-AGI发布并开源智能体模型家族Nex-N2.5,包含Mini、Pro、Max三档,权重已在Hugging Face与ModelScope开放下载。其中Max为1.6T总参、每Token激活49B的纯文本MoE架构,基于DeepSeek-V4-Pro-Base,是官方首次在万亿参数规模完成完整后训练。据ModelScope社区及多家第三方跟踪站点信息,三个版本均以Apache-2.0协议开源,可商用、可修改、可本地部署。

事件背景:让模型在真实环境里持续行动

按官方页面介绍,Nex-N2.5的主线是真实环境中的长程任务:Mini与Pro延续Nex-N2的多模态底座,重点强化计算机使用、网页浏览与视觉辅助的能动性;Mini档为35B总参的MoE架构(激活参数约3B),面向高性价比部署。三档模型依靠视觉反馈持续行动与自我修正——操作计算机与浏览器、运行并测试程序,观察到结果与预期不符时调整后续动作。官方把视觉定位为智能体感知环境、验证结果与推进任务的接口,而不只是一种输入模态。配套的NexRT推理引擎支持在8张H100或H200上运行Pro版本,通过定制CUDA内核与完整解码计算图优化解码路径。

深度分析:评测表上的位置与边界

官方公布的评测表(厂商自报口径,其中部分对比分数取自各家官方榜单)显示:Max在Terminal-Bench 2.1得86.1分、SWE-Bench Pro得65.7分、BrowseComp得92.6分;Pro在OSWorld-G得87.4分;Mini在Terminal-Bench 2.1得73.4分。与Claude Opus 5等闭源模型相比,Nex-N2.5在部分智能体单项上领先,在编程与综合基准上仍有差距,第三方评测媒体普遍将其概括为单项可胜、整体在追。需要留意的是,官方评测采用自家harness与特定采样参数,社区尚缺独立复现,实际表现有待检验。

企业视角:智能体落地门槛下移

  • 可商用的开源协议降低了自部署门槛:Mini档面向边缘与本地场景,中小企业可在内部工具自动化、网页操作等任务上小成本试点;
  • 桌面与浏览器型智能体增多,企业官网的服务信息要经得起自动化操作:表单能提交、口径能匹配、流程能走通;
  • 自报分数谨慎采信:选型时安排贴近自身业务的实测,榜单分数只作参考。

极欧互联(jiougeo.com)在GEO服务中提醒客户:当越来越多智能体以操作者身份访问网站,内容优化对象正从引用型回答扩展到执行型任务,页面结构与流程可用性会直接影响被选用概率。

趋势研判:开源追平的节奏在加快

从Nex-N2到Nex-N2.5,官方对比口径下Mini档DeepSWE v1.1得分升至36.1,开源智能体基线抬升的速度可见一斑。国产阵营在万亿参数规模跑通完整后训练并开放权重,说明开源体系已有能力在智能体这一前沿方向上与闭源模型同题竞争。评估脚本、部署命令与推理引擎细节随权重一并公开,也为社区留下了一份可复用的智能体训练参考。对多数企业而言,不必追赶每一款新模型,值得关注的是趋势本身:会操作电脑的模型正在变多、部署成本在下降,网站作为被智能体操作的对象,会越来越常规。把信息结构、表单流程与事实口径整理清楚的企业,会在这一轮入口变化中占到先手。

信息来源