谷歌工程师5580次实验:把搜索结果操纵到第一,AI智能体的推荐率也只涨8个点

GEO(生成式引擎优化)行业这两年讲的故事很简单:让品牌在 AI 的搜索结果里排到前面,智能体就会替你说话。谷歌云工程师 Joe Shirey 用 5580 次实验给这个故事做了一次压力测试,结论相当扎心——哪怕他把搜索结果彻底操纵到自家产品排第一,Claude Sonnet 5 的首选推荐率也只从 9.2% 涨到 17.1%;而在不加干预的基线状态下,模型每 1000 次回答里只有 3 次主动联网搜索。决定智能体推荐什么的,主要不是它临时抓到的网页,而是训练阶段就刻进权重里的认知。
实验:310 道架构题、5580 次试验、被操纵的搜索结果
先看实验怎么做的。Shirey 用 Claude Sonnet 5 回答 310 道软件架构选型题,累计跑了 5580 次试验;他自建了一个 MCP 服务器,专门拦截智能体发出的搜索请求并注入偏向性结果——不管问题问什么,搜索返回的前排永远是谷歌云(GCP)的产品。这相当于给「搜索结果决定论」安排了最理想的实验条件:搜索通道畅通、结果被人为操纵到第一,剩下的就看模型买不买账。这个实验的动机也很现实:有调查显示 46% 的 AI 用户已经开始把 ChatGPT、Claude 这类平台当作产品调研的第一站,厂商自然急着在 AI 答案里占位。
三组数字:0.3% 的主动搜索、1 个百分点、8 个百分点的天花板
结果是三组数字。第一组:基线状态下,Claude Sonnet 5 只有 0.3% 的试验主动调用搜索工具,几乎全部回答直接来自训练数据——智能体根本不搜,你优化的搜索结果自然没人看。第二组:搜索可用但不被鼓励时,被操纵的结果对选择率的影响只有大约 1 个百分点。第三组:即便强制搜索、结果被完全操纵向 GCP,首选推荐率也只是从 9.2% 爬到 17.1%,天花板大约 8 个百分点。三组数字指向同一个结论:搜索只是智能体的备用通道,训练语料里的口碑——官方文档、教程、社区讨论、开源生态——才是推荐行为的主发动机。
被提及 89%,不等于被推荐
实验里还有一个容易误读的细节:操纵搜索结果能把产品「被提到」的概率从 56% 拉高到 89%,但实际「被推荐为首选」的提升却弱得多。也就是说,被提及和被推荐是两个完全不同的事件,堆曝光不等于赢得推荐。这对当下火热的 GEO 生意是个重要提醒:不少服务商交付的是「AI 答案里出现品牌名」的次数,而客户真正要的是「AI 愿意把品牌作为首选推荐」——两个指标之间隔着训练数据的鸿沟,短期搜索优化跨不过去。
放在行业背景里看:GEO 正在挤水分
把这条实验放进更大的背景里看,GEO 行业正在经历一轮「挤水分」。10 月初刚发布的一份200 页 AI 可见度手册引用了一组反差数据:对 4 万多个美国大型网站的统计显示,传统搜索流量同比下降只有约 2.5%,远低于「搜索已死」叙事里 25% 到 60% 的夸张说法;而另一份针对 41 个 B2B 品牌的监测报告显示,ChatGPT 在可测 AI 引荐中的份额八个月里从 89% 降到 63%,Claude 的份额从 1.4% 涨到 18.5%——单一引擎优化的押注风险在上升,「一次性优化一劳永逸」的承诺更不可信。Shirey 的实验等于从机制层面补了最后一刀:连搜索结果这个 GEO 最可控的抓手,对智能体决策的影响都有明确天花板。
写给从业者:三条可执行建议
对品牌和从业者,实验给出了三条可执行的建议。其一,把预算从「短期 GEO 黑科技」挪向长期语料建设:高质量官方文档、真实用户教程、社区与开源生态的持续投入,这些才是被模型「记住」的素材。其二,别只盯 ChatGPT 一家做优化,多引擎监测(含 Claude、Perplexity、Gemini 及国内模型)应该成为标配,份额此消彼长,押注单点的风险在放大。其三,验收 GEO 服务时把指标从「提及次数」换成「首选推荐率与推荐排名」,并在改版前后做对照组测试——只看曝光量的交付,很可能只是把你买来的提及误报成了效果。
写在最后
Anthropic 的收录页;追踪 GEO 行业的最新研究与数据报告,则推荐 https://www.ai30.com/website/qbitai-com”>量子位 这类持续跟踪 AI 行业动态的中文垂媒。
(文 / AI30媒体部 | 2026年10月3日)



