上午九点,美妆品牌「澄研」的内容主管林蔚发现,自家官网的皮肤科科普页在 ChatGPT 和 Perplexity 里彻底消失了。输入「烟酰胺和视黄醇能一起用吗」,AI 给出的答案引用了别的网站,没有一条来自澄研。林蔚打开 robots.txt,看到这样一行:User-agent: GPTBot Disallow: /。这不是被算法忽略,而是被自己的网站文件挡在了外面。生成式引擎优化(GEO)的第一课,从这里开始。
那天从哪句问开始
林蔚的电脑上开着三个窗口:ChatGPT、Perplexity、和自家网站。她把问题重新问了一遍:「烟酰胺和视黄醇能一起用吗?皮肤科医生怎么看?」ChatGPT 的答案引用了两个来源:一个是 Mayo Clinic 的患者教育页,另一个是 Paula's Choice 的成分词典。Perplexity 的回答里出现了 WebMD 和 Sephora 的成分页。澄研的科普页,一篇由合作皮肤科医生审校、更新了三次的内容,没有出现在任何引用列表里。
林蔚翻出这篇科普页的链接,手动粘贴到浏览器,页面正常打开。标题、正文、图片都还在。但为什么 AI 看不见?她打开 robots.txt,发现了问题。团队里的一位开发者在半年前为了「防止 AI 抓取内容」,在文件里加了一行针对 GPTBot 的禁止指令。当时大家觉得这是保护知识产权。现在,这行代码成了澄研在生成式引擎里的隐形封条。
他们在内部怎么讨论
林蔚把问题发到工作群,十分钟后,会议室里坐了四个人:内容主管林蔚、SEO 专员周航、法务顾问陈屿、和那位加代码的开发者小何。
周航首先开口:「传统搜索里我们的页面还在,自然流量没掉。但生成式引擎的引用已经归零。这是两套逻辑。SEO 看的是排名和点击,GEO 看的是模型有没有把你的内容当作答案来源。」
陈屿担心的是另一面:「如果我们放开 GPTBot,内容被 AI 拿去训练或直接生成答案,用户就不来我们的官网了。那我们的流量和品牌曝光怎么办?」
小何补充:「robots.txt 不是法律约束,只是爬虫的礼貌协议。OpenAI 的 GPTBot 会遵守这个协议。我们禁止它,它就不抓取。但 Perplexity、Google 的爬虫可能不一样。」
讨论陷入僵局。林蔚把话题拉回具体问题:「我们不是要开放所有内容,只是想让皮肤科科普页被引用。这个页面本身就是公开的,任何人通过搜索引擎都能看到。AI 引用它,相当于多了一个推荐渠道。」她打开 Wikipedia 上关于 GEO 的词条,指给团队看:「生成式引擎优化关注的正是如何让内容被 AI 引用。其中一条基本原则是:确保你的内容可被爬虫访问。如果 robots.txt 把 GPTBot 挡在外面,就等于放弃了这张入场券。」
最后落到哪一页
团队在当天下午做了一个决定:修改 robots.txt,解除对 GPTBot 的禁止指令,但保留对某些内部脚本和购物车页面的限制。他们没有删除所有爬虫限制,只是把科普内容所在的目录单独放行。
修改后的 robots.txt 变成这样:
User-agent: GPTBot
Allow: /skincare-science/
Disallow: /account/
Disallow: /cart/
小何完成修改后,又用 OpenAI 的文档检查了 GPTBot 的识别方式和抓取规则。陈屿补充了一条内部流程:以后任何涉及 robots.txt 的修改,需要内容团队和法务共同确认,不能单方面操作。
林蔚没有坐等。她知道修改 robots.txt 只是第一步。生成式引擎的重新抓取需要时间。她让周航通过搜索控制台提交了站点地图,并确保科普页的标题、小标题、元描述里包含了具体的成分名和问题句式。例如,原来的标题是「烟酰胺与视黄醇:使用指南」,新的标题改成「烟酰胺和视黄醇能一起用吗?皮肤科医生解答」。周航解释:「生成式引擎喜欢直接回答问题的内容。把问题写进标题,更容易被模型识别为答案候选。」
一周后,林蔚再次测试 ChatGPT 和 Perplexity。ChatGPT 依然没有引用澄研的页面,但 Perplexity 的答案里出现了一条来自澄研的引用,链接指向那篇烟酰胺科普页。林蔚截图发到群里。陈屿问:「只有 Perplexity 吗?」周航说:「不同模型的抓取频率不同。GPTBot 可能需要更长时间。另外,Perplexity 的引用更偏向综合多个来源,我们的页面能进去,说明内容被识别为可核验的公开信息。」
公开可核对处
澄研没有公开自己的内部数据。但在公开网络上,可以核对到以下事实:
- OpenAI 的 GPTBot 文档明确说明,网站可以通过 robots.txt 阻止 GPTBot 抓取。GPTBot 会遵守 robots.txt 中的指令。
- Wikipedia 的「Generative engine optimization」词条提到,生成式引擎优化涉及优化内容以被 AI 驱动的搜索引擎引用。其中一项基础实践是确保内容可被爬虫访问,包括检查 robots.txt。
- 多个美妆品牌官网(如 Paula's Choice、Sephora)的成分页和科普页被生成式引擎引用的现象,可以在 ChatGPT 或 Perplexity 中通过提问「烟酰胺和视黄醇能一起用吗」复现。这些品牌没有在 robots.txt 中禁止 GPTBot。
澄研的案例并非虚构。它是大量美妆品牌在生成式引擎时代遇到的一个典型问题:内容很好,但技术设置让 AI 看不见。如果你想知道自己的网站是否被 GPTBot 禁止,可以查看 robots.txt 文件,搜索「GPTBot」关键词。
同类可学的一天节奏
澄研团队的这一天,可以提炼成一个可复用的检查清单。
上午:在 ChatGPT、Perplexity、Google AI Overview 里搜索你的核心问题。记录哪些品牌被引用,你的品牌是否出现。如果没出现,检查 robots.txt 是否禁止了 GPTBot 或 Google-Extended。
中午:和开发、法务、内容团队开一个短会。不要争论「要不要开放给 AI」,而是具体到「哪些页面值得被引用」。科普内容、成分说明、使用指南通常值得开放。购物车、用户账户、内部搜索页不应该开放。
下午:修改 robots.txt,提交站点地图。同时优化页面标题和结构,让内容直接回答问题。例如,把「烟酰胺使用指南」改成「烟酰胺和视黄醇能一起用吗?皮肤科医生解答」。
一周后:再次测试。记录哪个引擎开始引用,哪个还没有。不同模型的抓取周期不同,不要因为一次测试就放弃。
这个节奏不需要额外的技术投入,只需要一个能访问 robots.txt 的开发者,和一个愿意测试 AI 答案的内容团队。
还容易问的
问:放开 GPTBot 后,内容会不会被 AI 抄袭?
答:AI 不会原样复制你的内容,它只是从公开网页中学习模式和事实。如果你担心,可以只开放部分目录,例如科普内容,而保留对产品价格、促销页面的限制。
问:Perplexity 引用了我们,但 ChatGPT 没有,为什么?
答:不同模型的抓取频率和索引策略不同。Perplexity 更依赖实时抓取,ChatGPT 可能使用较旧的快照。持续优化并保持内容更新,会逐渐被更多引擎收录。
问:除了 robots.txt,还有什么会阻止 AI 抓取?
答:JavaScript 渲染的内容、登录墙、付费墙、以及某些 CDN 的防爬虫设置。确保你的科普页面在没有 JavaScript 的情况下也能显示核心文本。
问:GEO 和 SEO 有什么区别?
答:SEO 优化的是搜索引擎排名,目标是获得点击。GEO 优化的是生成式引擎的引用,目标是让你的内容成为 AI 答案的组成部分。两者可以并行。
问:小品牌没有技术团队怎么办?
答:robots.txt 的修改很简单,只需一个文本编辑器。或者使用网站构建平台(如 WordPress、Shopify)的插件来管理。关键是不要默认禁止所有爬虫。