如何针对答案引擎优化网站

Louise Linehan的画像

按 Louise Linehan

Ahrefs 内容营销专员

审核人

你的内容可能很优秀,却依然永远不会出现在 AI 回答里。

每一种 AI 优化策略都默认 AI 系统能访问你的页面、读取内容并判断你是谁。但这些都不是必然的。约有 5.89% 的网站会直接屏蔽 GPTBot;ChatGPT 似乎会放弃响应时间超过约两秒的页面;而且大多数 AI 爬虫根本不运行 JavaScript。

好消息是,这是 AEO 里最容易修复的部分。这里没有任何一项能单独为你赢得引用,但其中任意一个问题都可能悄悄让你失去原本可以获得的所有引用。

在 YouTube 上继续学习


第1部分

不要在 robots.txt 中屏蔽 AI 爬虫

如果 AI 爬虫无法读取你的页面,本指南中的任何技巧都无关紧要。被屏蔽的页面无法被引用,而这种情况往往是无意造成的。

我们分析了 约 1.4 亿个网站,发现 GPTBot 目前是被屏蔽最多的 AI 机器人(5.89% 的网站),ClaudeBot 紧随其后。

Cloudflare 默认会屏蔽 AI 平台,所以请检查你的 CDN 是否在你不知情的情况下把你排除在外。

示意图:robots.txt 文件阻止了一个爬虫(画成一只粉色蜘蛛,举着一个橙色的“a”),因此爬虫无法到达网页,网页也无法在 AI 搜索中被引用。

“允许 AI 爬虫”并不是一个单一的决策,因为每个平台都会运行多个执行不同任务的机器人。

仅 OpenAI 就运行着三个:

  • GPTBot 会收集内容用于训练
  • OAI-SearchBot 会构建 ChatGPT 用来检索的搜索索引
  • ChatGPT-User 会在对话中有人问到某个页面时实时抓取该页面

两者的取舍点各不相同。屏蔽 GPTBot 会让你的内容不会进入下一代模型的训练数据——这通常是出版商在权衡的决定。屏蔽 OAI-SearchBot 会让你从 ChatGPT 搜索的索引中消失,而这正是当下会让你损失引用和引荐流量的原因。很多网站原本只想做到前者,却不小心把后者也屏蔽了。

最快了解自己处于什么状态的方法,是使用 AI Crawler Access Checker 之类的工具:它会读取你的 robots.txt,并告诉你哪些爬虫被允许访问。

AI 爬虫访问检查器显示了 ahrefs.com 的检测结果,数据来自 ahrefs.com/robots.txt。列出的 27 个爬虫从 Amazonbot 到 anthropic-ai 都显示为允许,GPTBot 和 OpenAI 条目被圈出。

想了解实际出现的是哪些机器人,而不是哪些被允许访问的机器人,请查看 Ahrefs’ Bot Analytics。它通过 Cloudflare 的服务端数据,追踪 12 类机器人(包含专门的 AI 筛选),因此无需在你的网站上添加任何 JavaScript 也能使用。


第2部分

不要将内容隐藏在大量 JavaScript 代码之后

AI 爬虫往往会读取原始 HTML,而且大多不会像浏览器那样渲染 JavaScript。

这意味着,任何只在客户端 JS 执行后才出现的内容,对它们来说都可能是不可见的。

稳妥起见,坚持使用服务端渲染,让你的页面尽可能获得更高的 AI 可见性。


第3部分

提升页面速度

加载缓慢的页面会对你在传统搜索中的表现产生负面影响;但如果说有什么不同,那就是它在答案引擎中的惩罚似乎更大。页面速度似乎有助于决定你是否能进入模型的上下文窗口。1

在 Site Audit 中检查你的页面速度(也称为首字节时间):

1
前往 Page Explorer 报告
2
设置一个高级筛选条件:首字节时间(ms)> 200
3
然后按自然搜索流量排序,找出最重要、可能需要优化的内容
Ahrefs Site Audit 的“页面浏览器”界面,标注了 1 到 3 的编号徽标:分别位于“页面浏览器”标题处、一个高级筛选器(当前首字节时间(ms)大于 200)处,以及“自然搜索流量”列。该筛选器匹配 162 条结果。

第4部分

不必在 llms.txt 上花心思了

llms.txt 是一项拟议中的标准版规范:在你的根域名下放置一个 Markdown 文件(例如 website.com/llms.txt),告诉 LLM 你最优质的内容在哪里:文档、政策、产品分类体系等。原则上,它就像语言模型版的 robots.txt。

但在实践中,还没有任何主流 LLM 提供商承诺会读取它。OpenAI 没有,Anthropic 没有,Google 也没有。

我们检验了网站添加 llms.txt 后实际会发生什么。在使用 Ahrefs Web Analytics 的 137,000 个域名中,28% 发布了 llms.txt 文件。在约 38,000 个有效 llms.txt 文件中,97% 在我们测量的那个月里收到的请求数为 0 次请求。

97% 的 llms.txt 文件从未被请求过

Ahrefs 使用 Ahrefs Web Analytics 对 137,000 个域名进行的研究。

域名柱状图:总计 137K,其中 38K 具有有效的 llms.txt,只有 1.1K 的文件收到过任何请求。最后一根柱上方的括号标注:97% 的文件请求次数为 0。

在那些确实被抓取到的少量文件中,96% 的请求来自机器人。 Slackbot(链接预览机器人)抓取 llms.txt 的频率比 PerplexityBot 还高。简单来说,最重要的 AI 搜索引擎似乎并不会使用它。

Google 在这一点上说得很明确。其 生成式 AI 功能优化 指南中有一节标题就叫“辟谣”,告诉网站所有者:像 llms.txt 这类机器可读文件,并不是出现在生成式 AI 搜索结果中的必要条件。John Mueller 还更进一步,将它比作旧式的 keywords meta 标签:

引号

据我所知,没有任何 AI 服务说过他们在使用 LLMs.TXT(而且你查看服务器日志就能看出来,他们甚至都不会去检查它)。在我看来,这和 keywords meta 标签差不多——这是站长声称自己网站是关于什么的……(网站真的是那样吗?嗯,你可以去核实。既然如此,那为什么不直接检查网站本身呢?)

John Mueller,搜索倡导者,Google

那你应该做一个吗?如果你发布开发者文档,成本大约只要十分钟,而且确实有一个合理的使用场景。Mueller 将其称为 AI 编码工具解析文档时的“临时拐杖,或许是为了省一些令牌”。对其他人而言,这是一项无法衡量回报的投入;同时还有一个小小的副作用:会让竞争对手更容易把你的内容整段抓取走。


第5部分

修复 AI 幻觉生成的与你网站相关的 URL

AI 助手经常会为你的网站编造链接。我们检查了 ChatGPT、Perplexity、Copilot、Gemini、Claude 和 Mistral 引用的 1600 万个 URL 的 HTTP 状态,发现 AI 助手将访客带到 404 页面的概率是 Google 搜索的 2.87 倍。

ChatGPT 的问题最严重,远超其他。它被点击的 URL 中有 1.01% 会返回 404,而 Google 的基准值为 0.15%。

按引荐渠道划分的 404 率

网站分析数据——已分析 16,000,000 个 URL。

按 AI 来源页面划分的预估 404 率柱状图:ChatGPT 1.01%、Perplexity 0.31%、Copilot 0.34%、Gemini 0.21%、Claude 0.58%、Mistral 0.12%。

Perplexity(0.87%)和 Gemini(0.86%)几乎与 Google 自己的被引用 URL 404 率 0.84% 完全一致。这很合理,因为两者都从 Google 索引中检索内容,所以它们继承的是 Google 的失效链接,而不是自己凭空造出失效链接。

这些虚构的 URL 是根据你现有的模式推断出来的。我们网站上一个常见的“幻觉 URL”是 ahrefs.com/keywords,因为我们经常写关键词相关内容,模型就以为一定存在这样的页面。但实际上并没有。

这是 AEO 中少数真正“白捡”的免费机会之一。一个带着明确意图的人问了你的产品相关问题,被引导到你的网站,却走进了死胡同。你会遇到三种不同类型:

  • 幻觉 URL。 模型根据您的 URL 结构虚构出来的页面。
  • 过时的 URL。 曾经存在过的页面,可能被训练数据或其他陈旧数据源记住。
  • 拼写错误或变体 URL。 与真实页面非常接近的错误。

因此,我们在 网站分析 中新增了一个筛选器,只需两次点击就能帮你找出幻觉 URL。如果你在寻找一个简单的 Google Analytics 替代方案(每月最多 100 万次事件免费),不妨看看:

Ahrefs Web Analytics 的“页面”报告,并圈出了“退出页面”下拉菜单。在展开的菜单中,圈出的“可能的 404”选项会列出那些有访问量但标题包含 404 或 not found 的页面——当 AI 聊天机器人生成幻觉 URL 时,就可能出现这种情况。

如果一个幻觉 URL 一直被请求,模型是在告诉你:访客希望你有哪个页面。


第6部分

成为可识别的实体

本指南中的每一种策略,最终都取决于一件事:AI 系统是否将你的品牌识别为一个独立实体。

您知道吗?

实体是指任何搜索引擎或 AI 能够识别,并与其他事物区分开来的现实世界中的独立对象——特定的人、地点、公司、产品或概念(例如“Dmytro Gerasymenko”、“Ahrefs”或“Singapore”),而不仅仅是用来描述它的词语。

一条关于 Ahrefs 的 AI Overview,其中三个实体以黄色标出,并在旁边标注:Ahrefs 为公司实体,Dmytro Gerasymenko 为人物实体,新加坡为地点实体。

Google 的 Knowledge Graph——一个包含 540 亿个实体、以及关于它们之间关系的 1.6 万亿条以上事实的数据库——不再只是 Knowledge Panels 背后的引擎。

它如今已成为 AI Overviews、AI Mode 和 Gemini 的核心基础设施。

如果你的品牌没有作为一个实体被清晰建立起来,并且在你的网站、结构化数据以及权威第三方来源中缺乏一致信号,你就有可能在 AI 答案里“隐形”——不仅仅是在蓝色链接里。

Schema 经常被宣传为快速提升 AI 可见性的捷径,而且表面相关性看起来很有说服力:被 AI 引用的页面使用 JSON-LD 的概率几乎高出三倍。

在被 AI 引用的页面上,Schema 更常见

Ahrefs 对 600 万个页面的研究(每组 200 万个页面)。

一张柱状图对比有无 JSON-LD 的页面:未被引用的页面中有 18.3% 使用了 JSON-LD,而被参考引用的页面为 51.6%,被内联引用的页面为 53.1%。

但相关性不等于因果关系。我们将 添加了 JSON-LD 的 1,885 个页面与 4,000 个对照页面进行追踪比较,发现 AI Mode 或 ChatGPT 并没有显著提升;AI Overview 还有小幅下降,但我们无法将其明确归因于 Schema。

那 Schema 就没用了吗?不是,但它的作用缓慢且间接,不是能快速见效的策略。

你可以使用 Google 的 Knowledge Graph API 或免费检测工具,查看 Google 是否已经识别了你,以及它给你分配了哪种实体类型、相关属性是否正确。

例如,Carl Hendy 的 Knowledge Graph Tool 可以为你展示人物、公司、产品、地点及其他实体的结果。

在 audits.com 上使用 Google 的 Knowledge Graph Search Tool 搜索“CNN”。它找到了 20 条结果,排在首位的是 Cable News Network, Inc.,类型为 Corporation 和 Organization,其后是 CNN Türk 和 CNN Brazil。

接下来,尝试从权威出版物中争取提及,并确保你在各处的信息一致:在你的网站、个人资料页和第三方列表中使用相同的名称、描述和类别。

然后在合适的地方添加 Schema,优先选择那些能定义你的实体及其关系的类型:

  • Organization 和 sameAs Schema:链接到你的 Wikipedia、Wikidata 以及社交资料

  • 为你网站作者添加 Person Schema

  • 为你的产品/服务添加 Product Schema

提示

找出你的 最高权威页面,并确保这些页面使用了干净的 Schema 标记。

你可以在 Site Audit 中进入 Page Explorer 报告,并按“Page Rating”排序来做到这一点。

页面评分(PR)显示的是该 URL 相对于抓取范围内其他 URL 的内部和外部反向链接概况的强度。

然后查看“Schema 条目”列来审计你现有的 Schema,并查看“结构化数据问题”列来发现缺失或无效的结构化数据。

Ahrefs 的 Site Audit 页面资源管理器按 PR 排序,图中圈出了 PR 列以及 Schema 项和结构化数据问题列。首页的 PR 为 77,包含 Organization schema,并存在 Schema.org 验证错误;定价页包含 FAQPage 和 Organization schema,也有同样的错误。

第7部分

为智能体之间的营销做好准备

最后留给你一个思考:你试图影响的“读者”中,越来越多其实是代表你的受众进行浏览和购买的 AI 智能体。

事实上,2026 年 6 月,Cloudflare CEO Matthew Prince 披露:在互联网历史上,agentic(机器人/爬虫/智能体)流量首次超过 50%。2, 3

Cloudflare CEO Matthew Prince 于 2026 年 6 月 3 日在 X 上发布的一条帖子,内容为:“唉,这发生得比我预测的还快。我本以为会在 2027 年底,然后又觉得是 2027 年初,但 agentic 流量增长太快,机器人流量现在首次在互联网历史上超过了人类在线流量。”帖子链接到 Cloudflare Radar 的 Traffic Worldwide 页面。

“agentic AI”的搜索量远非边缘案例或新奇现象,三年内增长了 84 倍;与此同时,运行一个智能体的成本也从几美元降到了几美分。

美国月搜索量

关键词:“agentic AI”和“what is agentic AI”

折线图显示 2023 到 2026 年美国月度搜索量。“agentic AI”(蓝色)从 2024 年几乎为零攀升至 122,175,而“what is agentic AI”(粉色)在 2025 年年中达到峰值,最终为 14,206。

来源:Ahrefs(经由 Agent A)

你还不需要为了 AI 智能体而彻底重建网站。但过去那种“只为人类创作内容,不用担心机器人”的建议,可能已经不如以前那么适用了。

本章讲的是影响人类所信任的 AI,而智能体对智能体营销正是如此——只是又更进一步。

Louise Linehan的画像
指南作者:Louise Linehan

Louise 是 Ahrefs 的内容营销人员。在过去十年里,她曾在多家 SaaS 品牌担任高级内容岗位,包括 Pi Datametrics、BuzzSumo 和 Cision。在此期间,她发布了数百篇博客文章,主导了行业领先的研究,并打造了由专家主讲的网络研讨会项目。

Louise 在企业版 SEO 公司 Pi 任职期间首次系统学习了 SEO。入职数周内,她就发表了一篇关于关键词蚕食的文章,吸引了当时 SEO 领域最大咖:Rand Fishkin 的关注。此后,她写作的主题覆盖从操纵性链接建设到内容联合发布,再到搜索需求预测。业余时间里,她为两家本地企业搭建网站,进一步加深了对 SEO 的实战理解。

你可以在 Search Engine Watch、The Drum、The Telegraph 和 Spin Sucks 等行业媒体上读到 Louise 的文章。

审核人

浏览所有 AEO 指南

/01

什么是答案引擎优化(AEO)?

从这里开始。了解 AEO 是什么、它与 SEO 有何不同,以及入门的七个步骤。

/02

答案引擎的工作原理

了解提示词与答案之间的运作过程,以及你的品牌可以在哪些环节切入。

/03

如何追踪 AI 可见度

看不见,就无从优化。七种方法,帮你衡量品牌在 AI 答案中的曝光情况。

/04

如何选择要跟踪的最佳提示词

跟踪提示词集群,而非单次回复。11 个渠道,帮你找到值得持续监测的查询。

/05

如何针对答案引擎优化内容

排名让你进入候选范围,而以下方法才能获得引用——包括有效的主题、内容形式和页面优化调整。

/06

如何监测并赢得 AI 答案中的品牌提及

AI 会推荐它在其他地方看到有人讨论过的品牌。以下介绍如何监测这些提及,并赢得更多提及的方法。

/07

如何针对答案引擎优化网站

决定 AI 能否访问你的页面、读取内容并识别你的身份的技术性修复措施。