97%的llms.txt整月零请求:Ahrefs用137210个域名给GEO做法做了个体检

过去两年,做AI搜索优化的人手里有一份几乎人人照抄的清单:给网站加一个 llms.txt、把结构化数据补齐、按套路重写文案加上数据与引述,然后坐等AI答案里出现自己的品牌。这份清单的问题不在于它听起来合理,而在于它几乎从没被认真验过。今年6月,Ahrefs 把 137210 个域名的服务端日志翻了一遍,结果有点难堪:发布了 llms.txt 的网站里,97% 在整个5月没有收到任何一次请求——不是很少,是一次都没有。
一份让行业尴尬的服务端日志
Ahrefs 的样本是它自家网站分析产品中在 2026 年 5 月有流量的 137210 个域名,先确认根目录下的 llms.txt 返回 200 且是真正的 Markdown(排除 HTML 页与软 404),再回到日志里统计这些路径的每一次请求。结论有三层。第一层,采用率是 28%,约 38000 个域名真的发布了文件。研究自己提示这个比例偏高,因为样本是装着SEO分析工具、对流量最敏感的一批站——也就是说,这是「最有意愿把 llms.txt 做对」的人群,而他们的文件依然没人读。第二层,剩下约 1100 个域名、约 22000 次请求里,排第一的访客是SEO审计工具,占 21.7%,其中 Ahrefs 自家爬虫就贡献了 10.6 个百分点;再加上技术画像工具 11.6%、GEO扫描器与校验器一类,接近四成的流量来自「靠检查网站吃饭」的软件。第三层最扎心:AI检索机器人——真正为了回答用户问题去抓页面的那一类——只占全部请求的 1.1%,整个月合计 233 次。
谁在读 llms.txt:审计工具,不是AI
还有一个细节比百分比更能说明问题:没有 llms.txt 的站点,从来没有收到过针对这个文件的请求。换句话说,AI爬虫根本不会主动去探测这个文件。一个没有东西会去找的文件,不可能是发现通道,它只能被已经爬到你的站点的程序顺手读到——而那些程序本来就已经找到你了。Google 的表态也早就摆在那儿:其搜索中心的AI优化指引明确写了不需要为AI搜索准备特殊文件,llms.txt 就在「可以跳过」的清单里;Google 的 Gary Illyes 说不支持、也没计划支持;John Mueller 在被追问时的说法更直接——只有真正给你带客户的平台开口要这个文件时再做,否则「先满足需求,再谈理想」。不过 llms.txt 并非全无用处:Cursor、GitHub Copilot、Claude Code、Cline、Windsurf 这类IDE编程智能体在访问文档站时确实会去抓 /llms.txt,因为一份干净的 Markdown 索引比刮几百个渲染后的 HTML 页面便宜得多。Anthropic、Cloudflare、Mintlify 也在为自己的文档站提供它。但它帮的是「已经决定用你产品的智能体」,而不是「第一次听说你的引擎」。
那个「40%」,度量口径是论文自创的
llms.txt 只是清单上的一条。真正定义了这个行业话术的,是GEO原论文里那个「可见性最多提升 40%」。这篇由 Aggarwal 等人在 KDD 2024 发表的论文(arXiv:2311.09735)确实报告了加引用来源、加引述、加统计数据三类手法带来最多约 40% 的提升,但那个数字的度量口径是「位置加权词数」——一个论文自创的指标,不是点击、不是流量、不是排名;同一篇论文在主观印象指标上给的是 28%。更要紧的是实验设置:每个查询的候选源本来就取自Google前五名的结果,论文作者也写明了「受搜索引擎黑箱所限,我们没有评估GEO方法对搜索排名的影响」。它测的不是「怎么被检索到」,而是「已经进了候选池之后,能占多大篇幅」。同一个实验里,给第五名的源加引用能涨 115%,给第一名的源加同样内容却掉了 30.3%——这本质上是一次候选池内部的再分配,而不是把蛋糕做大。
复现研究把符号改了:改文案常常是负收益
2025 到 2026 年,几篇独立研究把这些数字按真实链路重测了一遍,符号反了。C-SEO Bench(Puerto 等,NeurIPS 2025,arXiv:2506.11097)覆盖约 1900 条查询、16360 篇文档,在问答与商品推荐两类任务上做经多重比较校正的检验,结论是多数改写方法「大体无效,而且经常对文档排名产生负面影响」,主实验 54 个方法与领域组合里只有 3 个显著为正,问答任务一个都没有;反过来,把目标文档放到模型上下文第一位带来的增益,远大于任何一种文案改写手法。SAGEO Arena(KDD 2026,arXiv:2602.12187)把检索与重排阶段也补上,用 171003 篇文档、2700 条查询跑全链路:只改正文时,top-20 检索命中平均下降 9%,重排后 top-10 下降 16%,最终被引用率下降 6%。今年8月提交的 Beyond the Vacuum 更进一步——它让竞争对手也一起优化,当采纳率拉满时,单一策略的效果会跌破「谁都不改」的基线;连研究者自己设计的、按对手动作动态选策略的方法,也从最高分下滑了 11.4%。今年7月一篇对45篇GEO研究的批判性综述给出的判断是:目前没有任何一种方法被证明能在跨平台稳定提升可发现性、流量或生意结果。
真正验证有效的三件事,都不新鲜
把这些研究翻完,会发现真正被反复验证有效的东西少得可怜,而且大多不新鲜。第一是主题相关性——Sprinklr 团队在 SIGIR 2026 发表的 What Gets Cited 做了 252000 组配对试验、横跨 6 个模型,每次只改一个内容因素,结果显示决定「谁被先引用」的最强变量是主题相关性与列表位置,显式价格信息和较新的时间戳稳定加分,而纯粹的排版格式调整几乎没用。这基本就是传统SEO里「内容要对题、要有实体权威」的老话。第二是站外声量。AirOps 分析 21311 条品牌提及后发现,品牌通过第三方来源被提到的概率是自有域名的 6.5 倍;Ahrefs 对 7.5 万个品牌的相关性测算里,品牌在网络上的提及与ChatGPT、AI Mode、AI Overviews 里的可见度相关系数在 0.66 到 0.71 之间,YouTube 提及更是达到约 0.737,而外链的相关性弱得多。第三是可验证性。今年9月一篇综合八项研究的学术综述(IJNREFM)指出,AI摘要让自然点击下降约 40% 到 47%,而提升「证据密度」——引文、统计、可核对的来源——在受控测试里最多能提高约 40% 的收录概率;同一份综述也提醒,在一份行业审计里 61.7% 的域名出现其实只是「被引用」而非「被点名」。
给国内团队的三条结论
对国内正在卖或正在买GEO服务的团队,这份体检报告有三条可落地的结论。第一,别再拿「加 llms.txt、补 schema、通用改写,可见性+40%」当方案书,这三个说法在2026年的证据下都站不住:Ahrefs 另有对照实验显示,给 1885 个页面加结构化数据、对比约 4000 个对照页观察七个月,在ChatGPT与Google AI Mode上没有测到任何提升。schema 依然值得做,因为它换的是富媒体结果与实体基建,但它不买AI引用。第二,把预算从「改自己的页面」挪一部分到「让别人提到你」——评测、对比、社区问答、视频与第三方媒体,这些引擎真正检索的地方,目前比自家官网文案的边际收益高得多。第三,交付口径要诚实:承诺「引用占比、被点名率、各平台分别的趋势」这类可复核指标,别把单次截图或者一个混合可见度分数当成果,更不要把销量归因写进KPI——行业到11月才可能拿出第一份归因框架。
写在最后
GEO 从概念跑成生意只用了两年,跑成一个可被验证的学科还需要更久。这份体检报告的真正价值不是「GEO没用」,而是把「哪一部分没用」说清楚了:被检索到之前的一切都还依赖传统功夫,被引用之后的那一段才轮到GEO登场;而中间那段最贵、最难、最不可控的部分,恰恰是过去两年卖得最火的部分。下一个季度,这个行业会比拼谁先把交付口径换成能被客户独立复核的数字。
延伸阅读
Perplexity 收录页;国内中文语境下的AI问答与引用形态,可以参考 https://www.ai30.com/website/zhihu-com”>知乎 的产品页。
(文 / AI30媒体部 | 2026年10月2日)



