律所官网上的法律问答页,很多工程师写完就上线,但生成式引擎根本没读到正文。当用户在ChatGPT或Perplexity里问“离婚冷静期怎么算”“试用期被辞退有赔偿吗”,模型只能引用它能抓取的页面。如果你的robots.txt拦住了GPTBot,或者正文藏在JavaScript后面,AI就看不到你的专业答案。
这篇写给律所官网的一线执行者,从robots放行到Schema验证,用7步清单让法律问答正文真的进入生成式引擎的抓取范围。
先确认正文在 HTML 里
很多律所官网使用前端框架,法律问答的正文靠JavaScript异步加载。爬虫拿到的是空壳,正文在浏览器渲染后才出现。对GPTBot这类生成式引擎爬虫,如果首屏HTML里没有完整问答,它可能放弃等待。
检查方法:在浏览器里右键查看网页源代码,搜索一篇问答里的核心法律术语,比如“冷静期”“赔偿金”。如果源代码里找不到,说明正文不在HTML里。对重要法律问答页,建议服务端渲染(SSR)或预渲染,让首屏HTML直接包含问答全文。
同时,检查页面是否依赖Cookie弹窗、地区选择器等交互才能显示内容。爬虫通常不会点击“我已阅读”或选择地区,这类拦截会让正文不可见。
放行与屏蔽
robots.txt是爬虫访问的第一个文件。要允许生成式引擎抓取法律问答页,需要显式放行相关爬虫。目前公开可核验的生成式引擎爬虫包括OpenAI的GPTBot、Anthropic的ClaudeBot、Perplexity的PerplexityBot等。
在robots.txt中,可以这样写:
User-agent: GPTBot
Allow: /legal-qa/
User-agent: ClaudeBot
Allow: /legal-qa/
User-agent: PerplexityBot
Allow: /legal-qa/
注意不要用通配符Disallow所有爬虫,那会同时拦住搜索引擎和生成式引擎。如果某些目录包含内部资料或客户隐私,应该单独Disallow,而不是整体屏蔽。例如:
User-agent: *
Disallow: /internal/
Disallow: /client-portal/
Allow: /legal-qa/
放行后,可以用各平台的验证工具(如OpenAI的爬虫验证页面)检查GPTBot是否能访问目标URL。同时查看服务器日志,观察GPTBot是否真的来抓取了。
结构化数据与可见文字一致
Schema.org提供法律相关的类型,如FAQPage、QAPage、Attorney、LegalService等。在律所问答页上标注FAQPage,能让生成式引擎更准确地解析问答结构。但前提是:Schema里的文字必须与页面可见文字完全一致。
很多人犯的错误是:页面上写“离婚冷静期为30天”,Schema里却写“冷静期为一个月”,或者Schema里添加了页面没有的内容。这种不一致会让爬虫认为数据不可信,从而放弃引用。
正确做法:先写正文,再从正文中提取问答,生成JSON-LD格式的FAQPage。确保每个问题和答案与可见文字逐字对应。同时,可以在Organization或LegalService类型里标注律所名称、地址、电话,与页面底部信息一致。
需要注意的是,不要为了SEO堆砌关键词而修改Schema,也不要使用隐藏文字。生成式引擎会交叉验证可见内容和结构化数据,不一致会降低可信度。
常见翻车
律所官网在抓取和结构化数据上最常见的翻车点:
- robots.txt整体屏蔽:早年为了防爬虫,Disallow: /,后来忘了改,导致GPTBot无法访问。
- 正文依赖JS渲染:用Vue/React写的问答页,源代码里只有。
- Schema与正文不一致:例如问题写“试用期被辞退有赔偿吗”,Schema里却写“试用期辞退赔偿”,导致解析歧义。
- 作者和日期缺失:生成式引擎倾向引用有明确作者、发布和更新日期的页面。只写“本站”或没有日期,可信度低。
- 法律依据不完整:回答“怎么算”却不引用具体法条或司法解释,生成式引擎无法验证,不敢引用。
| 翻车点 | 后果 | 修复动作 |
|---|---|---|
| robots.txt屏蔽GPTBot | AI无法抓取,页面完全不可见 | 放行GPTBot,检查验证工具 |
| JS渲染正文 | 爬虫只看到空壳 | 改SSR或预渲染 |
| Schema与正文不符 | 数据被判定不可信 | 逐字对齐Schema |
| 无作者/日期 | 引用优先级低 | 添加律师署名和更新日期 |
| 法条不完整 | AI无法验证,不敢引用 | 补充具体法律依据 |
发布检查单
上线法律问答页前,逐项检查:
- 查看网页源代码,确认问答正文完整出现在HTML中。
- 检查robots.txt,确认GPTBot、ClaudeBot、PerplexityBot未被禁止,目标目录已放行。
- 用各平台爬虫验证工具,测试目标URL是否能被正常抓取。
- 检查JSON-LD,确认FAQPage/Schema与页面可见文字完全一致。
- 确认页面有明确的作者(律师姓名)和发布/更新日期。
- 确认每个法律结论都附有可核验的法律依据(如《民法典》第几条)。
- 用无痕浏览器或爬虫模拟工具,确认页面不依赖Cookie弹窗或交互。
这7步可以在30分钟内完成,适合律所官网运维人员或外部技术供应商执行。不要一次改全站,先选2-3个核心法律问答页试点,验证生成式引擎的引用变化。
还容易问的
在实际操作中,律所团队经常问这些问题:
- GPTBot抓取后,多久能在ChatGPT里看到引用? 没有固定时间。生成式引擎的索引更新周期不公开,且引用取决于检索相关性。抓取是前提,但不是保证。
- Schema标注越多越好吗? 不是。只标注与页面内容相关的类型,且保证数据准确。过度标注或虚假标注可能适得其反。
- 需要同时放行所有生成式引擎爬虫吗? 建议放行主流的GPTBot、ClaudeBot、PerplexityBot,具体根据目标平台的公开文档确认。
- 法律问答页可以复制法规原文吗? 可以引用法规条文,但应注明出处,并加入律师解读。纯复制法规不会被生成式引擎优先引用,因为缺乏专业分析。
- 如果官网是WordPress,需要改代码吗? 不一定。可以用SEO插件生成robots.txt和Schema,但需要检查插件生成的Schema是否与正文一致。
把抓取和结构化数据做好,是律所进入生成式引擎引用池的基础。后续还需要持续监测哪些法律问题在AI回答里被引用,以及你的页面是否出现在来源中。更多方法可以参考SEO与GEO的区别,以及GEO优化指南。