生成式引擎优化(GEO)的关键时刻,往往藏在技术抓取与内容可读性的交叉点。Paula's Choice 的皮肤科科普页曾因 robots.txt 禁止 GPTBot,让 INCI 成分解读在 AI 答案里彻底失声。本文拆解这页的公开结构,看它为何无法成为默认引用源。
这页回答哪句问
当用户问「烟酰胺和视黄醇能不能一起用」或「这款精华的 INCI 成分表可信吗」,生成式引擎会尝试从公开网页里找答案。Paula's Choice 的成分页本应回答这类问句:它列出 INCI 名称、浓度范围、pH 值和皮肤科评注,是典型的结构化科普内容。但直到 2025 年初,该页所在的 robots.txt 里包含 User-agent: GPTBot Disallow: /,这意味着 ChatGPT 的抓取器无法访问任何页面。于是,当 Bing Copilot 或 ChatGPT 被问到成分安全问题时,它们只能引用维基百科、通用美妆博客或 Reddit 讨论,而品牌自己的官方解读被挡在答案之外。这页回答的是「这个成分是否安全、如何起效」,但生成引擎读不到,答案就落到了别处。
结构上的硬功夫
从公开页面看,Paula's Choice 的成分页在结构上相当扎实:每个成分有独立 URL、标题包含 INCI 名称、正文有定义段落、安全评级、参考文献链接,还有「专家综述」栏目。页面底部有「最后更新」日期,这对生成式引擎的时效性判断很关键。但硬功夫被 robots.txt 抵消了。维基百科的词条「Generative engine optimization」指出,GEO 的首要原则是确保内容可被检索和引用。如果机器人无法抓取,结构再好也进不了答案场。另一个问题是,成分页虽然列了 INCI 名称,却很少解释「INCI 与商品名的对应关系」,而用户提问经常用商品名,例如「烟酰胺就是 niacinamide 对吗」。这种问句需要页面明确写出同义词映射,否则生成引擎会去引用其他来源。
它避开了什么
Paula's Choice 的页面避开了很多美妆内容常见的坑:没有夸大功效、没有宣称「医疗级」、没有把用户评论塞进科普区。它用「可能」「有研究支持」等措辞,符合《联邦食品、药品和化妆品法》对化妆品宣传的边界。但它在技术层面避开了生成引擎的抓取,这等于把合规内容锁在保险箱里。一些第三方测评网站反而被 AI 频繁引用,因为它们没有 robots.txt 限制,且用问答体直接回答用户问题。Paula's Choice 的页面更像品牌官方声明,而不是为「用户提问」设计的答案页。维基百科的「Search engine optimization」词条强调,可读性、抓取性和语义结构是搜索排名的基础,这些同样适用于 GEO。
你的页缺哪一块
美妆品牌的内容团队常犯三个错误。第一,把所有页面都放在 robots.txt 的 Disallow 下,以为这样能保护知识产权,结果连科普页也一起禁止。第二,页面标题用品牌名开头,而不是用户会问的问题,例如「Paula's Choice 烟酰胺精华」而不是「烟酰胺是什么?它如何改善毛孔」。第三,页面没有提供结构化的问答区块,生成引擎难以抽取直接答案。对照 Paula's Choice 的页面,它缺的是「问答体摘要」——在每个成分页顶部放一段 50 字内的直接回答,用「是/否/如何」开头。另外,页面没有用 schema.org 的 FAQPage 标记,导致模型无法识别哪些内容是答案候选。
迁移步骤
从 Paula's Choice 的教训出发,美妆个护品牌可以做五件事。第一,检查 robots.txt,允许 GPTBot、Google-Extended 和 PerplexityBot 抓取科普类页面,只禁止购物车或账户页。第二,为每个核心成分创建可索引的公开页,标题包含 INCI 名称和常见别名。第三,在页面顶部写一段「快速答案」,用自然语言直接回答用户最可能问的问题。第四,添加 FAQPage schema,把问答对标记出来,方便生成引擎提取。第五,在页面底部链接到官方参考文献或皮肤科共识,例如《国际化妆品成分字典和手册》,让模型有据可依。这些步骤不需要技术大改,重点是让公开页从「品牌介绍」变成「可核验的答案源」。
还容易问的
读者常问:如果我的页面被 GPTBot 禁止,生成引擎会怎么处理?答案是它不会引用你的页面,而是从其他来源拼凑,可能产生错误。另一个问题是,只开放 robots.txt 就够了吗?不够,你还需要页面内容直接回答问题,而不是只堆成分表。还有团队问,要不要为每个成分都做独立页?建议从搜索量最高的 20 个成分开始,逐步扩展。最后,FAQPage schema 会不会被滥用?只要内容是真实问答,不是关键词堆砌,就不会有问题。生成式引擎优化的核心是让机器人读得到、读得懂、信得过。