养宠问答里,AI 给猫家长推荐驱虫药、给狗主人推荐低敏粮时,引用来源往往不是宠物论坛,而是那些官网正文清晰、技术抓取顺畅的品牌站。宠物医疗与用品团队想让自己的诊疗指南、成分说明、适用体重表进入生成式引擎的答案,第一步不是堆关键词,而是让爬虫和模型真正读到正文。

很多宠物官网的正文其实藏在 JavaScript 后面,或者被 robots.txt 拦在门外。GPTBot 抓不到,模型就不会把你的医院名称、药品规格、粮的配方写进回答。本文说的不是玄学,是抓取与结构数据:先确认正文在 HTML 里,再放行该放行的爬虫,最后用结构化数据把可见文字钉死。

先确认正文在 HTML 里

打开自家宠物医院或用品页,右键查看网页源代码。如果正文内容不在 HTML 里,而是点击后才由 JS 加载,GPTBot 很可能读不到。生成式引擎的抓取器对客户端渲染支持并不稳定,尤其是复杂的交互式页面。

技术负责人可以做一件事:用 curl 或浏览器开发者工具,查看原始 HTML 响应。搜索页面上的核心句子,比如“本品适用于 6 周龄以上幼猫”。如果这句话不在原始 HTML 里,就需要服务端渲染(SSR)或预渲染,把正文直接输出到 HTML。

同时检查页面是否依赖 cookie 弹窗、地区选择器才显示内容。GPTBot 不会点“同意”,也不会选城市。如果正文默认隐藏,模型就看不到。

宠物行业常见的问题页包括:药品说明书页、疫苗程序页、处方粮适应症页、用品材质与尺寸页。这些页面应当用纯 HTML 承载核心信息,而不是图片或 PDF。图片里的文字,模型不一定提取。

放行与屏蔽

robots.txt 是抓取的第一道门。很多宠物网站为了防采集,误伤了所有爬虫,包括 GPTBot。GPTBot 是 OpenAI 的网页爬虫,用于抓取可公开访问的网页内容,供 ChatGPT 等模型引用。它遵循 robots.txt 规则。

如果你的 robots.txt 里写着:

User-agent: *
Disallow: /

那么 GPTBot 也会被禁止。要放行 GPTBot,可以单独写:

User-agent: GPTBot
Allow: /

但注意,Allow 指令并不是所有爬虫都支持,更稳妥的写法是只列出 Disallow 的路径,并确保 GPTBot 不被包含在禁止列表中。

除了 GPTBot,其他生成式引擎也有自己的爬虫,例如 PerplexityBot、ClaudeBot、Google-Extended。宠物品牌如果只想让一部分模型抓取,可以分别指定。如果希望所有生成式引擎都能读,可以在 robots.txt 中明确放行这些 User-agent。

放行不等于收录。GPTBot 抓取后,模型是否引用还取决于内容质量、权威度和结构化标记。但若连抓取都不放行,后面都免谈。

结构化数据与可见文字一致

养宠问答里,AI 常被问“这款猫粮适合几岁的猫”“这家医院能不能看异宠”。如果页面用 schema.org 标记了 VeterinaryCare、Product、FAQPage 等类型,模型更容易理解上下文并引用。

关键原则:结构化数据必须与用户可见文字完全一致。不要为了骗模型而在 JSON-LD 里写页面没有的内容。例如,页面可见文字写“适用于成猫”,schema 里也必须是“成猫”,不能写“全阶段”。不一致会被搜索引擎判定为垃圾标记,生成式引擎也会降低信任。

宠物医疗页面建议标记:

  • 医院名称、地址、电话(LocalBusiness / VeterinaryCare)
  • 医生资质、执业编号(Person)
  • 药品或保健品说明(Product,含 activeIngredient)
  • 常见问题(FAQPage)

宠物用品页面建议标记:

  • 产品名称、品牌、型号(Product)
  • 适用物种、年龄、体重范围(additionalProperty)
  • 材质、尺寸、注意事项(description)
  • 用户关心的问答(FAQPage)

把 FAQPage 标记在页面底部,问题与正文中的问题保持一致。例如正文有“幼猫可以用这款驱虫药吗”,JSON-LD 里也写同样的问题和答案。

常见翻车

宠物行业官网做 GEO 抓取时,有几个高频错误:

翻车点后果修正
正文在图片里GPTBot 读不到文字改为 HTML 文本,图片仅作辅助
robots.txt 禁止 GPTBot模型无法抓取单独放行 GPTBot
JS 渲染才显示内容爬虫拿到空壳SSR 或预渲染
schema 与正文不一致信任度下降逐字段核对
只做 FAQPage 不写正文模型认为页面单薄先写完整正文,再加 schema

另一个翻车点是频繁改版。宠物医院改版时把旧 URL 重定向到不相关内容,或者直接 404,导致模型之前抓取的链接失效。应保留 301 重定向,并更新 sitemap。

发布检查单

每次发布或更新宠物医疗与用品页面,按下面清单过一遍:

  1. 查看原始 HTML,确认核心句子可见。
  2. 检查 robots.txt,确认 GPTBot 未被禁止。
  3. 用 curl 模拟 GPTBot 抓取,看返回内容是否完整。
  4. 确认页面没有关键内容藏在登录后或地区选择后。
  5. 检查 JSON-LD 是否有语法错误,可用 Google 富媒体测试工具验证。
  6. 逐字对比 schema 与可见文字,确保一致。
  7. 提交 XML sitemap,包含重要问答页和产品页。
  8. 观察服务器日志,确认 GPTBot 有访问记录。

这些步骤不需要额外预算,但需要技术同事配合。宠物行业内容团队可以把这个清单当作上线前的固定动作。

还容易问的

宠物团队常问的几个问题,答案如下:

  • GPTBot 抓了就会引用吗?不一定。抓取是前提,引用还看内容质量、权威度和结构化标记。但若不抓取,一定不会引用。
  • 屏蔽其他爬虫会影响 GPTBot 吗?如果 robots.txt 里用 User-agent: * 屏蔽所有,GPTBot 也会被屏蔽。需要单独放行。
  • 宠物医院的医生介绍页要做 schema 吗?建议做 Person 标记,包含姓名、职称、专业方向。模型在回答“附近看猫的医生”时更容易结构化引用。
  • 宠物用品的对比表怎么让模型引用?对比表用 HTML 表格呈现,并配合 Product 或 ItemList 标记。表格文字要在 HTML 中可见。
  • FAQPage 会不会被搜索引擎惩罚?只要问题与页面可见内容一致,不堆砌,就不会。滥用或隐藏内容才会被惩罚。

想系统了解 GEO 与 SEO 的关系,可以看SEO 与 GEO 的区别。宠物行业的具体执行,也可以从GEO 优化基础开始。