工业设备商常遇到这种场景:销售接到客户电话,问“这台型号的功率够不够我们车间用”,或者“和另一款比,哪个更适合粉尘环境”。客户说他在AI问答里搜过,但AI没提我们的型号,只推荐了竞品。问题往往不在产品不好,而在官网的正文根本没被生成式引擎和搜索爬虫读进去。生成式引擎(比如ChatGPT、Perplexity、Bard这类)在回答工业选型问题时,优先引用结构清晰、可验证、正文直接给出答案的页面。如果你的页面被robots拦住,或者正文藏在JS里,AI根本看不到,自然不可能引用。
这篇文章写给能改官网的人:市场部负责内容、技术部负责部署、或者外部服务商。我们不讲品牌故事,只讲怎么让模型和搜索爬虫真的读到正文,尤其是工业设备FAQ页里那种“这台功率够不够”的直接答案。
先确认正文在 HTML 里
很多人以为“网页能打开,AI就能看到”。实际上,生成式引擎的爬虫(比如GPTBot)和传统搜索引擎爬虫类似,主要读取服务器返回的HTML源码。如果你的正文是通过JavaScript动态加载的,比如SPA(单页应用)里点击后才渲染内容,爬虫可能只抓到空壳。工业设备官网常见用Vue、React等前端框架,产品参数和FAQ内容通过API异步加载,这在浏览器里看起来正常,但爬虫抓取时拿不到正文。
检查方法很简单:在浏览器里打开你的FAQ页,右键“查看网页源代码”(不是开发者工具里的Elements),搜索你的关键句子,比如“额定功率”。如果源代码里搜不到,说明正文不在HTML里,AI和搜索爬虫很可能也读不到。解决方向有两个:一是做成服务端渲染(SSR),让服务器直接返回包含正文的HTML;二是对关键内容做预渲染或静态化,比如把FAQ答案直接写在HTML模板里,不依赖客户端渲染。
另一个常见问题是正文被包在图片里。有些设备商喜欢把参数表做成图片,觉得美观。但AI对图片里的文字识别不可靠,而且爬虫通常不把图片内容当正文。参数表、选型对比、售后条款这些核心内容,应该用HTML文本呈现,不用图片。如果必须用图片,也要在图片旁边或alt属性里给出同等文字,但最好直接文本化。
放行与屏蔽
确认正文在HTML里之后,下一步是确保爬虫被允许抓取。robots.txt是网站根目录下的一个文件,告诉爬虫哪些页面可以抓,哪些不可以。如果你之前为了省服务器资源,把所有BOT都禁了,或者只允许Googlebot,那么GPTBot、PerplexityBot、ClaudeBot这些生成式引擎爬虫就被挡在门外,自然读不到你的内容。
具体做法:检查robots.txt里有没有类似这样的规则:
User-agent: *
Disallow: /这意味着禁止所有爬虫抓取整个网站。你需要改成允许,或者针对特定爬虫放行。比如GPTBot的User-agent是“GPTBot”,PerplexityBot是“PerplexityBot”,ClaudeBot是“ClaudeBot”。你可以写:
User-agent: GPTBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /但要注意,robots.txt只是建议,不是强制。有些爬虫不遵守。不过主流生成式引擎都会遵守,所以放行是必要的。
除了robots.txt,还要检查页面meta标签里有没有noindex或nofollow。noindex告诉搜索引擎不要收录这个页面,生成式引擎往往也会尊重。如果你的FAQ页被加了noindex,AI就无法引用。用浏览器开发者工具查看页面源代码,搜索“noindex”,看是否出现。工业设备官网有时会误把所有产品参数页设成noindex,怕被抄袭,结果自己也被AI排除。
另外,服务器防火墙或WAF(Web应用防火墙)可能拦截爬虫。有些企业为了保护网站,会设置规则屏蔽非浏览器User-Agent,或者对频繁访问的IP进行拦截。生成式引擎爬虫的请求频率可能较高,容易被误伤。检查服务器日志,看是否有GPTBot等爬虫的访问记录,返回状态码是否200。如果是403或429,说明被拦截了,需要调整防火墙规则。
结构化数据与可见文字一致
把正文放行之后,还要让AI更容易理解页面内容。结构化数据(Schema.org)是一种标准,告诉机器“这里有一个FAQ问题,这里是答案”。生成式引擎在回答问题时,会优先考虑带有FAQPage、Product、TechArticle等结构化标记的页面。对于工业设备FAQ页,常用FAQPage schema。你可以在页面HTML里嵌入JSON-LD代码,标记问题和答案。
关键原则:结构化数据必须与页面可见文字一致。不能为了骗AI,在schema里写一些页面上没有的内容。比如页面上写“额定功率37kW”,schema里也必须是同样的文字。如果schema里写了“额定功率45kW”但正文是37kW,AI抓取后会认为内容矛盾,可能放弃引用,甚至降低信任。工业设备参数繁多,很容易出现不一致,要专人核对。
另一个常用schema是Product,用于标记设备型号、品牌、参数。比如:
{
"@context": "https://schema.org",
"@type": "Product",
"name": "变频器X200",
"brand": "某真实设备商",
"description": "适用于风机水泵的变频器,额定功率37kW",
"additionalProperty": [
{"@type": "PropertyValue", "name": "额定功率", "value": "37kW"}
]
}但注意,品牌名必须是你自己的真实品牌,不要虚构。除了FAQPage和Product,工业设备商还可以用TechArticle标记技术文章、Service标记售后服务、Organization标记公司实体。这些都能帮助AI理解页面主题。
结构化数据部署后,可以用Google Rich Results Test或Schema.org验证工具检查是否有效。但验证通过不等于AI一定引用,只是基础条件。还要确保页面加载速度、移动端可用性等基本体验,因为爬虫在抓取时也会评估这些。
常见翻车
第一,只放行GPTBot,忽略其他生成式引擎。不同AI产品使用不同爬虫,比如Perplexity用PerplexityBot,Claude用ClaudeBot,甚至还有Bing的搜索爬虫(可能被Copilot使用)。如果只放行GPTBot,你只能被ChatGPT引用,其他AI问答还是看不到你。所以robots.txt里要把主流生成式引擎爬虫都列出来放行。
第二,正文在HTML里,但被折叠或隐藏。有些设备商为了页面整洁,把详细参数放在“点击展开”里,通过CSS隐藏,用户点击才显示。爬虫抓取HTML时,隐藏内容可能依然在源码里,但AI可能认为这些内容不重要,或者无法判断可见性。最好把关键答案直接可见,不要藏在折叠区。
第三,FAQ页内容过于泛泛,没有直接回答“这台功率够不够”。AI在选型问答时,会优先引用给出明确参数和适用条件的页面。如果你的FAQ只写“请联系销售”,AI无法引用。比如问题“这台设备功率够不够”,答案应该写“该型号额定功率37kW,适用于200平方米以下车间,若连续满负荷运行建议选45kW型号”。这样AI才能直接摘录。
第四,结构化数据与正文不一致,或者过度标记。Schema里塞满关键词,但正文没有对应内容,会被视为垃圾标记。AI可能降低信任。保持自然,只标记真实存在的内容。
发布检查单
- 打开FAQ页,查看源代码,确认答案文字在HTML里,不是JS动态加载。
- 检查robots.txt,放行GPTBot、PerplexityBot、ClaudeBot等主流生成式引擎爬虫,同时保留Googlebot等搜索爬虫。
- 检查页面meta,确认没有noindex、nofollow。
- 在服务器日志里确认这些爬虫访问返回200状态码,没有被WAF拦截。
- 为FAQ页添加FAQPage schema,确保问题答案与可见文字完全一致。
- 为产品参数页添加Product schema,标记型号、品牌、关键参数。
- 用验证工具测试结构化数据,修复错误。
- 确保页面移动端加载正常,不要用超大图片拖慢速度。
- 发布后,用site:命令或生成式引擎测试搜索,看能否找到自己的页面。
这篇检查单可以打印出来,每次发布新FAQ或产品页时逐项核对。工业设备官网的页面往往很多,建议把检查单做成内部流程,让市场和技术共同负责。
还容易问的
问:我们官网是第三方建站平台做的,改不了robots.txt怎么办?
答:很多建站平台提供robots.txt编辑功能,或者可以在后台设置“允许搜索引擎抓取”。如果完全无法修改,考虑迁移到自有服务器或使用反向代理。另外,确保页面本身没有noindex,因为有些平台默认加noindex。
问:放行GPTBot会不会导致内容被AI抄袭?
答:放行抓取只是让AI能读到你的内容,这是被引用的前提。如果担心抄袭,可以在robots.txt里选择性放行,比如只允许抓取FAQ页,禁止抓取内部技术文档。但工业设备参数本身很难保密,重点是让AI引用时带上你的品牌名和出处,这需要内容里明确写出品牌和型号。
问:结构化数据部署后多久能看到效果?
答:生成式引擎的抓取频率不确定,可能需要几天到几周。你可以主动在Search Console里提交页面,或者用生成式引擎的提交工具(如果有)。同时,确保页面在传统搜索引擎里被收录,因为AI有时会参考搜索引擎索引。
问:工业设备FAQ页需要多少条问答?
答:没有固定数量,但至少覆盖客户最常问的选型问题,比如功率、电压、防护等级、适用环境、售后保修。每条答案要具体,给出参数范围或明确条件,避免“视情况而定”。
问:除了FAQ,还有什么页面值得优化让AI引用?
答:产品对比页、技术白皮书、安装指南、故障排除指南。这些页面提供深度信息,AI在回答专业问题时更愿意引用。同样要确保正文在HTML里、可被抓取、有结构化数据。
更多GEO方法可参考GEO实战指南,以及SEO与GEO的区别。