一项跨四家平台的智能体搜索实测
9月16日,编号 arXiv 2609.19244 的论文上线,研究团队对 ChatGPT、Claude、Grok 与 DeepSeek 四家对话平台的网页搜索行为做了端到端拆解,9月18日起被多家行业媒体转述。这是把真实用户对话与同平台模型的受控实验放在一起、跨四家平台对比智能体搜索全流程的公开研究,研究对象正是企业关心的链路:AI大模型怎么决定搜不搜、搜什么、引谁。
事件背景:研究怎么做
研究分两条线:一条是真实环境,分析四个平台脱敏后的真实用户交互;另一条是受控实验,用各家官方接口在相同问题上复现行为。团队沿智能体搜索的生命周期逐段检查——要不要调用网页搜索、用什么策略改写查询、结果里有没有域名偏好、答案如何落到引用上,并提出"引用率"作为量化指标:搜索结果里的链接,有多少比例被写进了答案。
三条发现值得企业记下。其一,各平台是否联网搜索的决策差异明显,搜得多不等于答得好,两者没有稳定的正比关系。其二,各平台自带的搜索会把结果偏向自家偏好的域名,同一个问题,不同助手拿到的信源并不相同。其三,答案大体基于搜索结果生成,但部分表述找不到对应的引用,来源标注存在缺口。
深度分析:为什么搜索频次不是质量指标
直觉上,联网搜的次数越多,答案应该越可靠。这项研究给出的解释是:搜索决策的质量、查询改写的水平与结果筛选的能力才是决定因素,频次只是动作数量。这个逻辑对企业同样成立——被AI引用的多少,不取决于机器来过多少次,而取决于内容在关键节点上是否提供了别的来源给不了的可核验事实。域名偏好那条发现更值得琢磨:如果各平台的信源清单不同,只在单一平台做监测的企业,看到的是被平台滤镜筛过的世界。
这项研究也有边界:真实会话来自志愿捐赠,未必覆盖全体用户;自动标注与人工标注的一致率超过九成,但机器判断仍可能带入偏差。把它当作方向性证据,比当作精确结论更合适。
企业视角:把跨引擎监测做成台账
落到操作层面,极欧互联(jiougeo.com)在生成式引擎优化(GEO)服务中的做法可以概括为一张台账:固定一组覆盖业务的问题,按周期在四类以上平台各问一遍,记录谁被引用、引用的是哪个页面、口径是否正确;再对照台账找缺口——哪个平台从不引你、引到的页面是否过期、答案里的数字与官网是否一致。找到缺口逐条处置:补结构化数据、统一事实口径、更新过期内容。AI搜索引用的机会,就藏在这些具体条目里。
趋势研判:可核验性是跨平台公约数
平台各有偏好,算法各有取舍,但它们在一点上一致:都倾向引用能被核验、口径清楚的内容。跨平台监测告诉你去哪里补,可核验的内容决定机器引用谁。把企业官网、产品页、行业问答的事实口径先对齐,再谈覆盖与曝光,是被AI引用这件事里稳定成立的部分。
信息来源
- arXiv,《Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses》,2026-09-16,https://arxiv.org/abs/2609.19244
- MindPattern,《Web search agents don't get better the more they search》,2026-09-18,https://mindpattern.ai/s/2026-09-18-more-web-search-calls-did-not-produce-better-answers-on-any-of-four-platforms
- Pith(论文评述平台),《Pith review of Characterizing Web Search by Conversational LLM Agents》,2026-09,https://pith.science/paper/2609.19244

