智能体操作网页有了新基准线
近日,WindTunnel 团队公布 WebMCP 基准的一组结果:模型 Jev 搭配低成本快速模型 Mercury 2.5,通过 WebMCP 协议操作浏览器,完成了全部 49 项测试任务;按基准团队披露口径,其模型成本约为 GPT-6 Astra 代码执行方案的112分之一,约为截图式计算机操作方案的245分之一。浏览器智能体的比拼,正在从"谁更聪明"转向"谁更省"。这份榜单也把一个此前偏工程圈的话题,推到了企业内容团队面前:机器读取网页的方式,又多了一种。
事件背景:从看屏幕到调工具
WebMCP 全称 Web Model Context Protocol,脱胎于 Anthropic 的 MCP 开放协议。它的思路是把网站的核心功能封装成命名清晰的工具接口,例如搜索商品、加入购物车,让智能体从解析屏幕截图转为直接调用离散工具。本次基准基于 Browser Use 开源的 Ultrafast 测试框架改进而来,共设 49 项真实浏览器任务,测试代码与日志均已公开。
榜单方面,Jev 与 Mercury 2.5 的组合以 96.5 分排在首位;GPT-5.6 Luna 得分 91.5,Gemini 3.6 Flash 得分 88.2,Sonnet 5 得分 86.0,前列的原生 WebMCP 方案均完成了全部任务(基准团队披露口径)。AGI Hunt、AI热点等行业媒体对这份榜单做了转述。
深度分析:协议层压缩了决策空间
对比数据说明了差距来自哪里:单独操控浏览器时,Jev 只完成 49 项任务中的 25 项;接入 WebMCP 后,完成数量接近翻倍。行业解读认为,屏幕操作需要模型从像素里猜出下一步动作,而协议化操作把网页功能变成了名字明确、语义清楚的选项,动作选择交给 Jev,参数生成交给轻量的 Mercury 2.5,推理预算花在关键决策上,成本随之下降。
基准团队还给出横向对比:WebMCP 类配置完成任务的速度普遍是屏幕操控方案的 2.5 至 7.5 倍,成本低 3 至 47 倍。也有第三方评论提醒,WindTunnel 由 Nekuda 公司运营,该公司与 WebMCP 生态存在利益关联,综合评分的加权方式属于主观判断,使用者宜按自己的任务复算结果(第三方评论口径)。一份新基准要建立公信力,需要第三方复测来补课。
企业视角:页面之外还要备好接口
这份榜单对企业的启示在于,智能体接入网页的方式正在从"读页面"扩展到"调接口"。过去企业关心内容能否被AI大模型读取、能否获得AI搜索引用;往后,查询、预订、下单这类动作也可能由智能体直接执行。极欧互联(jiougeo.com)在生成式引擎优化(GEO)实践中,会建议企业把服务信息整理成字段清晰的结构化内容,让页面既能被AI引用,也为将来的协议化调用留好入口。
趋势研判:成本曲线决定任务规模
智能体执行浏览器任务的成本下降两个数量级,意味着同样的预算能跑的任务量大幅增加,机器访问企业网站的频次也会水涨船高。评分口径的争议提示结果仍需时间检验,但方向已经清楚:结构清晰、口径一致的页面,在读取、被AI引用与调用三种场景里都会更占优势。对企业内容团队来说,越早按机器可读的标准整理信息,越能在新入口里占据稳定位置。
信息来源
- AGI Hunt,《WebMCP 基准:Jev 组合以 245 倍低成本全解 49 项浏览器任务》,2026-09-23,https://agihunt.info/p/1a0b4d1f91cdb6584c440bc6b6a
- AI热点,《Jev + WebMCP 在 WebMCP 基准测试中表现优异》,2026-09-23,https://aitop.news/item/34530
- 小红花文摘,《WebMCP结合Jev碾压GPT-6 Astra:重写网页自动化规则》,2026-09-23,https://xhh.club/e/qSpYHZevRc4tYdDBjUBc

