装修顾客在生成式引擎里问“瓷砖还是地板”“旧房翻新工期多久”,答案页常引用攻略站和论坛,官网却很少出现。不是品牌没有内容,而是抓取和结构数据没做到位。下面这套做法写给能改官网的人,从抓取到发布检查都覆盖。

先确认正文在 HTML 里

生成式引擎的抓取器读的是 HTML 正文,不是图片里的字,也不是前端渲染后的视觉结果。家装官网常见问题是:产品册图片嵌入文字、装修案例用轮播图、问答内容靠 JavaScript 点击才出现。这些内容对用户可见,但抓取器可能拿不到。

第一步先在无痕窗口打开页面,右键查看源代码,搜索页面里那句关键话,比如“瓷砖适合客厅还是卧室”。如果源代码里找不到,抓取器大概率也读不到。

对多页应用(SPA)类官网,可以检查是不是需要服务端渲染(SSR)。把关键内容直接放进初始 HTML,而不是等浏览器执行脚本后再插入。家装官网的 FAQ 页、材料对比页、工期说明页,尤其要保证正文在 HTML 里。

这一步没做完,后面放行和 Schema 都白搭。先让正文可见,再谈抓取。

放行与屏蔽

生成式引擎的抓取器有独立标识,比如 GPTBot。检查 robots.txt 是否误伤了它们。有些家装官网为了防采集,把 User-agent: * 设成 Disallow: /,或者只允许 Googlebot,其他全拦。结果生成式引擎的抓取器进不来。

在 robots.txt 里给 GPTBot 明确放行:

User-agent: GPTBot
Allow: /

同时区分要屏蔽的路径,比如内部搜索、购物车、用户中心:

User-agent: GPTBot
Allow: /
Disallow: /cart
Disallow: /account

不建议为了“安全”把整个 /wp-admin 或 /admin 也 Disallow,这些路径生成式引擎本来就不该抓。真正要管的是正文页和产品页是否开放。

放行之后,还要监控抓取日志。看 GPTBot 是否真的来了,抓了哪些 URL,有没有大量 404 或重定向。抓不到内容,放行只是形式。

结构化数据与可见文字一致

结构化数据是给机器看的,但必须和用户看到的文字一致。家装官网常见翻车:Schema 里写“品牌名:某某装饰”,页面标题却是“某某装饰公司”;地址写“北京市朝阳区”,页脚却写“北京朝阳”。这种不一致让生成式引擎犹豫,不敢把你当成同一个实体来引用。

优先补这几类 Schema:

  • Organization:公司名、logo、联系方式、社交主页。公司名要和首页标题、页脚完全一致。
  • LocalBusiness:门店名、地址、营业时间、电话。地址要和页面可见地址一模一样,不要一个写“朝阳区”一个写“朝阳”。
  • FAQPage:装修问答页用这个标注。问题和答案必须和页面可见文字完全一致,不要 Schema 里写“瓷砖适合客厅吗”,页面却写“客厅选瓷砖还是地板”。
  • Product:建材产品页可以标注名称、品牌、材质、规格。价格如果会变,宁可不标,也不要标过期价格。

给家装 FAQ 页加 Schema 的例子:

{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "客厅选瓷砖还是地板?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "客厅选瓷砖还是地板,主要看家庭生活习惯。有宠物或小孩,瓷砖更耐磨;追求脚感,地板更舒适。具体对比见下方表格。"
    }
  }]
}

别为了标注而标注。Schema 里出现的每一句话,都要能在页面上找到对应文字。否则就是给机器一个版本,给用户另一个版本,生成式引擎会降低信任。

常见翻车

家装官网做抓取和结构数据,最容易踩这几个坑:

  • robots.txt 放行了,但 CDN 或 WAF 把 GPTBot 挡在门外。 有些安全策略按 User-Agent 拦截未知爬虫,GPTBot 可能被误杀。检查 CDN 日志,看 GPTBot 是否真的进入了源站。
  • Schema 加了,但 JSON-LD 里有语法错误。 一个逗号或引号错误,整个结构化数据失效。用 Google 富媒体测试工具或 Schema.org 验证器检查。
  • 页面可见文字改了,Schema 没同步。 比如价格改了、门店搬了,页面上改了,但 JSON-LD 里还是旧值。生成式引擎读到冲突信息,可能放弃引用。
  • 只放行 GPTBot,没放行其他生成式引擎的抓取器。 不同引擎有不同标识,比如 ClaudeBot、PerplexityBot。如果不确定,至少把主流生成式引擎的抓取器都放行。
  • 把全站都 Disallow 了,只允许几个页面。 生成式引擎需要看到关联页面才能理解品牌实体,只开一个页面可能不够。

这些翻车往往不是技术做不到,而是没有列入发布流程。把检查项放进上线清单,才能持续避免。

发布检查单

  1. 关键正文是否在初始 HTML 里?用源代码搜索验证。
  2. robots.txt 是否放行了 GPTBot、ClaudeBot、PerplexityBot 等生成式引擎抓取器?
  3. CDN 或 WAF 是否放行了这些抓取器?查看源站日志确认。
  4. Organization、LocalBusiness、FAQPage、Product 等 Schema 是否已加,且字段值准确?
  5. Schema 里的文字和页面可见文字是否完全一致?逐字对照。
  6. JSON-LD 是否通过验证器检查,没有语法错误?
  7. 页面抓取返回码是否正常,没有 404、500 或大量重定向?
  8. 内部链接是否让抓取器能发现所有重要页面?
  9. 是否定期查看抓取日志,确认生成式引擎持续抓取?

这份检查单可以打印出来,贴在发布流程旁边。每次上线新页面,照着走一遍。

还容易问的

放行 GPTBot 后,多久能看到 AI 引用?
没有固定时间。生成式引擎的抓取和索引是异步的,可能几天到几周。持续提供高质量、可抓取的正文,比催时间更重要。

Schema 加了,AI 还是不引用怎么办?
先检查 Schema 是否正确、是否和可见文字一致。再看页面内容本身是否回答了用户问题。结构化数据是辅助,不是替代。如果正文没有真正回答“瓷砖还是地板”,加再多 Schema 也没用。

只做家装官网,不写百科,能被 AI 引用吗?
能。生成式引擎会从多个来源汇总,官网是第一方来源,可信度更高。关键是官网内容要完整、准确、可抓取。

要不要给每个产品页都加 Product Schema?
不必。优先加 FAQPage、Organization、LocalBusiness 这些能帮助实体识别的 Schema。产品页如果参数明确、价格稳定,再加 Product Schema。

如果官网是模板站,改不了 HTML 怎么办?
先确认 CMS 或建站工具是否支持插入 JSON-LD 或修改 robots.txt。大多数现代建站工具都支持。如果都不行,至少确保正文在 HTML 里,并把关键信息放在页面显眼位置。