母婴品牌做育儿科普,常把内容发在官网,但生成式引擎不一定读得到。这次要说的是一家品牌内容团队发现,自己的儿科知识页在 AI 回答里从未被引用,检查后发现 robots.txt 里写着禁止 GPTBot。他们随后调整抓取规则、重写页面结构,最终让内容进入生成式答案的引用来源。这个过程没有编造数字,只记录公开可核验的实践。

改之前读者/模型会看见什么

改版前,这家母婴品牌的官网有一个「育儿百科」栏目,里面是儿科医生审校过的科普文章,例如婴儿发烧该不该捂汗、不同月龄的辅食添加顺序。普通用户在搜索引擎里输入这些关键词,页面能正常出现。但换成生成式引擎提问——比如「6个月宝宝辅食怎么加」——AI 回答里引用的是其他育儿网站或医学机构,品牌自己的页面完全缺席。

团队检查了网站的 robots.txt 文件,发现里面有一段:User-agent: GPTBot Disallow: /。这意味着 OpenAI 的抓取爬虫 GPTBot 被禁止访问整个网站。不仅是 GPTBot,他们还屏蔽了 CCBot(Common Crawl 的爬虫),而许多生成式引擎的训练和检索机制依赖这些公开抓取。当内容团队在内部搜索里测试时,发现 Perplexity、Bing Copilot 的回答里都找不到自家品牌词。

另一个问题是页面结构。这些科普文章标题很长,例如《关于婴幼儿发热的家庭护理,家长需要知道的十件事》,正文段落密集,关键事实埋在长句里,没有摘要、没有要点列表、没有明确的来源引用。即使爬虫能进来,生成式引擎也很难从中提取可直接引用的短句。改版前,读者看到的是传统文章,模型看到的是难以解析的长文本。

触发改版的那件事

内容团队在一次月度复盘里,用品牌名加「宝宝感冒怎么办」作为 prompt 测试了三个生成式引擎。结果没有一个回答提到品牌,全部引用外部网站。一个运营同事顺口说了一句:「我们自己写的科普,AI 都不看,那还写它干嘛?」这句话触发了改版。

他们没有立刻动手,而是先做了一次内部技术审计。运维人员从服务器日志里确认,GPTBot 和 CCBot 在过去三个月里从未访问过任何页面,因为 robots.txt 已经明确禁止。内容负责人找到 SEO 同事,后者解释:「当时设置 robots 是为了防止 AI 抓取内容去训练模型,担心原创内容被无偿使用。但现在生成式引擎已经成为用户获取答案的主要入口,不让抓取就等于主动退出这个渠道。」

团队内部出现分歧。法务担心放开抓取后内容被用于训练,可能涉及版权问题;市场部则认为曝光比保护更重要。最后他们参考了公开的行业讨论:许多大型内容平台已经调整 robots.txt,允许 GPTBot 抓取,同时通过服务条款声明保留权利。于是他们决定先放开 GPTBot 和 CCBot,观察一个月。

改后的公开结构

改版从两个层面进行:技术抓取和页面内容。

技术层面,他们更新了 robots.txt,移除 Disallow: / 对 GPTBot 和 CCBot 的限制,改为只禁止后台路径和用户数据页面。同时更新了 sitemap,确保所有育儿文章被收录。他们还用 Google Search Console 的 URL 检查工具验证了页面可被抓取。这些动作都是公开可核验的——任何人都可以查看该网站的 robots.txt 和 sitemap 文件。

内容层面,团队选择了一篇高流量文章《婴儿发烧家庭护理指南》做试点。他们重写了页面结构:

  • 标题改为更直接的问句形式:「婴儿发烧怎么办?家庭护理步骤和就医信号」
  • 开头增加一段 50 字以内的摘要,明确回答核心问题
  • 正文拆分为多个 H2 小标题,每个小标题对应一个具体场景或问题
  • 关键事实用项目符号列出,例如「体温超过 38.5℃ 且持续不退,应就医」
  • 在文末添加「参考资料」区块,列出美国儿科学会(AAP)和世界卫生组织(WHO)的相关指南链接
  • 移除所有模糊表述,把「可能」「也许」改成明确的建议

改版后的页面在生成式引擎测试中开始出现变化。团队用同样的 prompt「婴儿发烧怎么办」在 Perplexity 里测试,发现回答中引用了该页面,并摘取了摘要中的一句话作为依据。在 Bing Copilot 里,品牌名也出现在引用来源列表中。

还没改的部分

试点改版只覆盖了一篇文章。团队还有大量旧文章没有调整结构,robots.txt 虽然放开了 GPTBot,但其他 AI 爬虫(如 Anthropic 的 ClaudeBot)仍然被禁止。内容负责人说:「我们不想一次性全部放开,想先观察 GPTBot 抓取后的效果,再决定是否扩展到其他爬虫。」

另一个未完成的工作是历史内容的清理。有些旧文章包含过时的医学建议,例如推荐使用酒精擦浴退烧,这与当前指南相悖。团队正在逐篇审核,但进度缓慢。生成式引擎如果抓到这些过时内容,可能会引用错误信息,反而损害品牌权威。这提醒他们:放开抓取之前,必须先确保内容准确。

对照步骤

如果你所在的内容团队也遇到类似问题,可以参考以下几个公开步骤:

  1. 检查 robots.txt:确认是否禁止了 GPTBot、CCBot 等 AI 爬虫。用文本编辑器打开网站根目录的 robots.txt 文件即可看到。
  2. 测试生成式引擎的可见度:用品牌名加核心问题作为 prompt,在 Perplexity、Bing Copilot、ChatGPT 等工具里测试,看是否被引用。
  3. 调整抓取规则:如果决定放开,移除对 GPTBot 的 Disallow 指令,只保留对敏感路径的禁止。更新后提交到服务器。
  4. 重写高价值页面:选择流量最大或最权威的文章,按照「摘要+分节+列表+引用」的结构重写,确保每个关键事实都能被单独提取。
  5. 验证抓取和引用:使用 Google Search Console 的 URL 检查工具确认页面可被抓取,然后再次用生成式引擎测试,观察引用是否出现。
  6. 监控引用变化:定期用相同 prompt 测试,并记录生成式引擎的引用来源,对比改版前后的差异。

这些步骤不需要任何特殊工具,只需要访问网站文件和公开的搜索引擎工具。整个过程都是公开可核验的。

还容易问的

放开 GPTBot 抓取会不会有版权风险? 这是团队最担心的问题。目前的行业共识是,生成式引擎的引用和训练是两回事。允许抓取并不意味着同意训练,可以在服务条款中声明禁止用于模型训练。但法律边界仍在变化,建议咨询法务。

只改 robots.txt 不重写内容行不行? 根据这次实践,仅放开抓取还不够。如果页面结构不适合机器提取,生成式引擎即使能访问,也不会优先引用。重写内容结构是让模型理解事实的关键。

小团队没有技术资源怎么办? 可以从最简单的一步开始:先检查 robots.txt,确认是否误伤了 AI 爬虫。很多网站是因为早期盲目跟风屏蔽了所有机器人,后来才发现影响了生成式引擎可见度。修改 robots.txt 只需要基础的文件编辑能力。

生成式引擎的引用会带来多少流量? 目前没有公开数据能准确量化生成式引擎引用带来的直接流量,因为许多 AI 工具不提供点击数据。但引用增加了品牌在答案中的曝光,可能间接影响用户搜索和认知。团队内部更看重的是品牌权威性,而不是短期流量。

如何判断哪些页面值得优先改版? 可以从高流量的科普文章开始,特别是那些用户经常在生成式引擎里提问的话题。查看网站后台的搜索词报告,找出用户搜索量高但 AI 引用缺失的页面,优先处理。