对话式 AI 产品接上搜索引擎已经两年多了,但一个基本问题始终没人认真量过:这些智能体到底是怎么上网的?什么时候决定搜、拿什么词去搜、拿到了什么、又怎么把结果写进回答——arXiv 2609.19244 把这条链路拆开,用四大平台 ChatGPT、Claude、Grok 和 DeepSeek 的数据,给这个方向补上了系统性的刻画。
研究设计用了两条腿走路:invivo 一路分析平台的真实用户交互,看自然场景下智能体的搜索行为;invitro 一路用同一平台模型的 API 做受控实验,把变量钉死再做归因。两条线互相校验,避免了只看单一数据源得出的偏读。
三个发现,个个都有后劲
其一,是否调用搜索这个决策本身,跨平台、跨模型的差异相当大,而且——这是反直觉的部分——调用得更频繁并不必然带来更好的回答质量。「多搜几下总没错」的直觉在数据面前站不住:搜索时机与查询质量才是变量,次数不是。
其二,平台自家的搜索通道存在域偏好。不同平台的搜索引擎会倾向返回特定域的结果,也就是说,智能体眼里的「全网」,其实是被各自的检索层筛过一遍的网。这对做内容与 SEO 的人是个重要提醒:你的站点在传统搜索里的位置,和在各个答案引擎实际引用的域分布里,可能是两回事。
其三,回答虽然大多有搜索结果接地,但部分声明依赖的是未被标注来源的结果。引用链上的这道缺口,直接关系到归因与可靠性——用户以为每个说法都有出处,实际上有些出处在水面之下。
给内容方与开发者的行动清单
这份刻画对两类读者有直接的可操作含义。内容与增长团队:既然各平台的检索层有域偏好,监测口径就要从单一搜索排名改成「逐平台的引用域分布」;引用链缺口则提示,品牌信息的结构化程度——清晰的实体页面、明确的出处标注——会直接影响被正确引用的概率。智能体开发者:搜索时机应当作为显式策略来设计与评测,而不是隐式地依赖模型直觉;对「搜了没搜、搜了什么」的日志化,是评测回答可靠性的前置条件。
方法层面也留了口子:四大平台的检索层持续迭代,真实交互与受控实验的结论可能随版本漂移,这份刻画更像一张需要定期重绘的地图,而不是一劳永逸的结论。
往深处看一层
这篇研究真正的贡献是给了行业一份基线:在智能体成为搜索流量的重要来源之后,检索行为本身成了值得独立研究的对象。对搜索引擎厂商,它提示对话式检索需要一套不同于传统排序的优化目标;对智能体开发者,它说明搜索策略应该作为可调度的显式决策来设计,而不是隐式地交给模型直觉。
也要看到局限:四大平台之外的长尾智能体、企业内部检索场景,都不在这次刻画的范围内;平台的检索层也在快速迭代,今天的域偏好未必是明天的。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。但方向已经清楚了——当回答的入口从网页列表变成智能体,整条搜索价值链的度量衡都要重造。