育儿AI推荐里没有你的品牌,往往不是内容不够好,而是模型根本没读到正文。母婴品牌的官网常有大量优质内容,比如婴儿车怎么选、安全座椅接口对照、辅食添加月龄表,但在生成式引擎的回答里却很少出现。一个常见原因:GPTBot 被 robots.txt 挡在门外,或者正文藏在 JavaScript 里,爬虫抓到的是空壳页面。本文写给能改官网的人,从放行 GPTBot 到结构化数据一致,逐步让生成式引擎真正读到你的正文。
先确认正文在 HTML 里
很多母婴官网的详情页由前端动态渲染,比如用 Vue 或 React 写的单页应用。这类页面在浏览器里看得到产品描述和 FAQ,但查看网页源代码时,正文区域可能只有几个空的 <div> 容器,真实文字要等 JavaScript 执行后才插入。GPTBot 这类生成式引擎爬虫不一定执行所有脚本,如果正文不在初始 HTML 里,它就可能只抓到导航栏和页脚。
判断方法很简单:在浏览器打开你的婴儿车产品页,右键选择“查看网页源代码”,搜索一段产品描述里的独特文字,比如“五点式安全带”。如果源代码里搜不到,说明这段文字是动态加载的,需要让服务端在返回 HTML 时就把正文渲染进去,也就是 SSR(服务端渲染)或预渲染。对于没有技术资源的小团队,可以先把最重要的对比表和 FAQ 做成静态 HTML 区块,直接内嵌在页面模板里。
母婴行业常见的内容类型包括:产品对比表(如某品牌旗下三款安全座椅的适用体重和安装方式)、月龄建议(如“6个月可以开始添加富含铁的食物”)、使用注意事项(如“安装安全座椅时不要穿厚外套”)。这些内容都应作为纯文本出现在 HTML 中,而不是图片或 PDF。如果一份辅食添加表只是图片,模型无法可靠提取文字,除非配了 OCR,但这不是标准做法。
检查时注意:正文文字不要写入 <canvas>、<iframe> 或依赖用户点击才显示的模态框。FAQ 答案最好默认展开,或者至少保证在 HTML 源码中存在,只是用 CSS 控制视觉折叠。用 curl 或浏览器开发者工具的网络面板查看原始响应,确认关键句子在 <body> 内。
放行与屏蔽
robots.txt 是爬虫进入网站的第一道门。生成式引擎的爬虫身份标识通常包括 GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(Google 用于 Gemini 和 AI Overview 的抓取)等。母婴品牌想进入育儿推荐答案,需要显式允许这些爬虫访问产品页和问答页。一个典型的放行写法:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /但不要只写这三行。很多网站为了屏蔽低质量爬虫,会在 robots.txt 里用通配符 User-agent: * 后跟 Disallow: /,这会同时挡住 GPTBot 等特定爬虫,除非后面单独为特定爬虫写了 Allow 规则。robots.txt 的匹配遵循“最具体规则优先”,所以可以在 User-agent: * 的 Disallow 之后,为 GPTBot、ClaudeBot、Google-Extended 单独添加 Allow 指令。也可以反过来:默认允许所有爬虫,只屏蔽已知的恶意爬虫。具体选择取决于网站策略,关键是确认没有全局 Disallow 把所有东西挡死。
还要注意:robots.txt 的修改要放在服务器根目录,比如 https://www.example.com/robots.txt。修改后可以用 Google Search Console 的 robots 测试工具或第三方检查器验证。另外,如果网站有 CDN 或 WAF,确认它们不会拦截这些合法爬虫的请求。有些安全策略会误伤 GPTBot,导致请求返回 403。可以在服务器日志里过滤 GPTBot 和 ClaudeBot 的访问记录,看状态码是否 200。
对于已经使用 SEO 的母婴团队,robots.txt 里可能已经放行了 Googlebot,但生成式引擎爬虫的 User-agent 不同,需要单独确认。不要假设“Google 能抓就等于 GPTBot 能抓”。同样,meta robots 标签和 X-Robots-Tag 响应头也要检查,避免出现 noindex 或 nofollow 阻止索引。很多产品页为了控制收录数量加了 noindex,但这会直接让生成式引擎无法引用,需要重新权衡。
结构化数据与可见文字一致
Schema.org 标注能帮助生成式引擎理解页面内容,但前提是标注里的文字必须与用户可见文字一致。母婴产品页适合使用 Product 类型,包含 name、description、brand、aggregateRating、offers 等属性。FAQ 页使用 FAQPage 类型,每个问答用 Question 和 Answer 嵌套。如果页面是文章或指南,可以用 Article 或 HowTo。
注意“可见文字一致”这个原则。不要为了 SEO 在 Schema 里写一段用户看不到的描述,例如把“适用年龄 0-4 岁”写成“适合所有婴儿”,这属于结构化数据与页面内容冲突。生成式引擎在引用时可能对比两者,发现不一致会降低信任。比如页面正文写“该婴儿车适合 6 个月以上婴儿”,Schema 的 description 也必须是同样的表述,不要夸大。
对于带有对比表的页面,可以用 Table 类型或 ItemList 辅助,但核心仍是保留表格中的关键文字。例如安全座椅对比表包含“是否支持 ISOFIX”“适用体重范围”“认证标准”,这些内容应同时出现在 HTML 表格和 Schema 里。不要只把表格做成图片,然后仅在 Schema 里填文字,这同样违反一致原则。
FAQPage 的 Schema 可以直接让生成式引擎提取问答对。但要注意,Google 搜索已经不再展示 FAQ 富媒体结果,但这不意味着 Schema 对 GEO 无用。生成式引擎的抓取和引用不完全依赖 Google 的富媒体政策,结构化数据能帮助模型理解页面结构,尤其是答案与问题的对应关系。因此,继续为 FAQ 页部署 Schema 仍是有价值的,只要文字与页面一致。
常见翻车
第一个翻车点是“正文在后端但前端不渲染”。有些团队以为把内容存在数据库里就够了,但爬虫只能读取服务器返回的 HTML,如果页面靠 Ajax 异步加载正文,等于没写。第二个是“robots.txt 改了但 CDN 缓存没刷新”。robots.txt 的修改可能被 CDN 缓存,导致爬虫仍然读到旧版本。可以检查响应头里的 Cache-Control,必要时手动清除缓存。
第三个是“屏蔽了 JS 但正文依赖 JS”。有些网站为了安全屏蔽了所有非浏览器 User-agent,导致 GPTBot 即使被 robots.txt 允许,实际请求也被 WAF 拦截。检查日志里的状态码,如果是 403 或 429,需要调整规则。第四个是“Schema 与正文不一致”。例如页面正文写“这款辅食机不能处理骨头”,但 Schema 里描述成“可处理多种食材”,这种差异会让模型困惑。第五个是“只优化首页,忽略深层产品页”。生成式引擎在回答具体问题时,引用的是具体产品页或 FAQ 页,而不是首页。
还有一个常见问题:“几个月前放了 GPTBot,为什么还没被引用”。抓取和引用不是实时的,模型需要重新抓取和训练或检索更新。没有公开的固定周期,但保持页面稳定、可访问、内容更新有助于加快被重新发现。同时,如果网站有 XML sitemap,可以把产品页和 FAQ 页的 URL 列进去,方便爬虫发现。
发布检查单
下面这份检查单适合发给技术或运营同学逐项打勾:
- 用“查看网页源代码”搜索产品页上一句独特正文,确认文字在初始 HTML 中。
- 检查 robots.txt,确认 GPTBot、ClaudeBot、Google-Extended 没有被全局 Disallow 挡住,且对目标目录有 Allow 规则。
- 在服务器日志中过滤 GPTBot 和 ClaudeBot,查看最近 7 天是否有 200 状态码的访问记录。
- 对至少一个产品页和一个 FAQ 页执行
curl请求,确认返回的 HTML 包含关键正文,而不是只有框架。 - 检查页面
<head>中的 meta robots 和 HTTP 响应头,确保没有 noindex 或 nofollow。 - 验证 Schema.org 标注:用结构化数据测试工具检查无错误,并人工比对 Schema 里的文字与页面可见文字是否一致。
- 确认 XML sitemap 中包含你想被引用的深层 URL,并已提交给搜索引擎。
按这个清单过一遍,基本能解决“模型读不到正文”的硬伤。之后才是内容层面的优化,比如把对比表写成短名单、把 FAQ 问法贴近家长真实提问,这些在 GEO 专栏里有进一步讨论。如果你还不清楚 SEO 和 GEO 的区别,可以先看 SEO 与 GEO 的区别。
还容易问的
这里集中回答几个执行中常被问到的问题。
问:我们官网是纯前端渲染,暂时没法改成 SSR,有没有折中方案?
答:可以对最重要的产品页和 FAQ 页做预渲染,生成静态 HTML 快照。或者至少把核心对比表和问答做成服务端包含的静态片段,避免完全依赖 JavaScript。折中方案的核心是让正文出现在初始响应里。
问:robots.txt 里已经写了 User-agent: * 和 Allow: /,还需要单独写 GPTBot 吗?
答:通常不需要,因为通配符已经允许所有爬虫。但如果你对 * 有部分 Disallow 规则,而 GPTBot 没有更具体的 Allow 规则,就会被拦。所以最好显式检查并添加针对 GPTBot 的规则,避免意外。
问:Schema 里写 FAQPage 会不会被 Google 惩罚?
答:只要 Schema 与页面可见文字一致,就不会因为使用 FAQPage 而被惩罚。Google 只是不再在搜索结果中展示 FAQ 富媒体,但结构化数据本身仍然被解析。对生成式引擎而言,FAQPage 能帮助识别问答对,是有益的。
问:我需要允许所有 AI 爬虫吗?比如还有很多小公司的爬虫。
答:不需要。优先放行主流生成式引擎的爬虫,比如 GPTBot、ClaudeBot、Google-Extended。其他爬虫可以根据流量和安全性决定。关键是不要因为个别恶意爬虫而把所有爬虫都屏蔽。
问:修改 robots.txt 后多久能生效?
答:取决于爬虫的抓取频率。有些爬虫每天来,有些每周。可以在日志中观察,或保持 robots.txt 稳定几天后再检查。没有固定保证,但通常一到两周内能看到变化。