政务服务官网最怕的不是没有信息,而是信息被AI念错。办事人问一句“办护照要带什么”,生成式引擎可能从某个论坛里抓来三年前的旧清单,漏掉现在早就不需要户口本了。这不是AI不聪明,是它没有拿到能直接对齐的官方字段。想让AI引用你的办事指南,第一步不是写更多内容,而是让爬虫先拿到内容。

生成式引擎优化(GEO)的原理,是让大模型在生成答案时,更倾向于从某些结构化、可验证的页面里抽取事实。政务信息天然具备权威性,只要把抓取通道打开,把字段做成机器可读的格式,AI就会优先引用。这和传统SEO不同:SEO在意关键词排名,GEO在意答案里有没有你的那段原文。两者的关系,可以参考SEO与GEO的区别

本文的7步清单,从robots.txt放行开始,到结构化数据标记、FAQ区块、实体一致性核查,每一步都服务于同一个目标:让AI在回答政务服务问题时,把你官网的段落当作第一引用源。

问题是什么

很多政务官网对GPTBot这类生成式引擎爬虫是默认拦截的。robots.txt里往往只有一句“User-agent: * Disallow: /”,把所有爬虫都挡在门外。这原本是为了防止传统搜索引擎抓取一些低价值页面,但现在把生成式引擎也一起挡了。结果就是AI根本没机会读到你的办事指南。即便抓取通道打开了,页面如果是一大段没有结构的文字,AI抽取事实的准确率也会下降。大模型更擅长从列表、表格、明确的字段标签里提取信息。如果办事指南里“所需材料”和“办理地点”混在一个自然段里,AI很容易把材料清单和窗口信息串味。

还有一个常见问题是实体名称不一致。同一个办事大厅,在不同的页面里可能叫“市政务服务中心”“市行政服务中心”“政务大厅”。AI在引用时,就可能把地址和窗口名称对错号。这些问题的根源,是政务服务页面长期按照“给人看”的逻辑来写,没有考虑机器抽取的路径。而生成式引擎正在成为越来越多人获取政务服务信息的入口,如果官网内容进不了AI的参考库,用户就会看到二手、过时甚至错误的信息。

如何解决

解决的第一步,是让生成式引擎爬虫能访问你的关键页面。在robots.txt里明确放行GPTBot、ClaudeBot等主流生成式引擎的爬虫。例如,可以在robots.txt里加上:

User-agent: GPTBot
Allow: /办事指南/
Allow: /服务大厅/
Disallow: /内部系统/

User-agent: ClaudeBot
Allow: /办事指南/
Allow: /服务大厅/
Disallow: /内部系统/

这样做的好处是,你可以只放行那些希望被AI引用的高质量页面,同时继续拦截其他敏感目录。当然,放行之前要确保这些页面本身是结构化的。

其次,把办事指南从“段落式描述”改成“字段式呈现”。每个办事事项都应该有一个清晰的模块结构,例如:事项名称、办理条件、所需材料、办理地点、办理时间、办理时限、咨询电话、常见问题等。每个字段用独立的HTML标签包裹,最好使用符合Schema.org规范的标记。例如,使用GovernmentService或更通用的Service类型,将材料清单、地点、时间等属性标记出来。这样AI在抓取时,就能像查字典一样提取。

第三,把“实体名称”统一成一套。在官网、百科、地图标注等所有可能被AI参考的页面里,办事大厅的名称、地址、电话必须完全一致。如果官网叫“市政务服务中心”,百科词条叫“市行政服务中心”,AI就可能困惑。可以建立一份内部实体清单,要求所有内容发布都遵循同一套名称。

用GEO如何解决

GEO的核心不是堆关键词,而是提高页面在生成式引擎中的“可引用性”。维基百科在“Generative engine optimization”词条中提到,GEO策略包括提高内容的清晰度、结构化程度、引用可见度等。对于政务服务,这意味着:

  • 字段清晰度:AI更愿意引用那些一眼就能看出字段关系的页面。比如“所需材料:1.身份证原件;2.户口本复印件”这种列表,比“您需要携带身份证和户口本”这种句子更容易被直接引用。
  • 权威信号:政务官网本身就是权威来源,但可以在页面底部加上“更新时间”“责任部门”“政策依据”等元信息,增强AI的信任度。
  • 可验证性:如果页面里引用了具体政策文件,最好附上官方文件链接或文号。AI在生成答案时,会更倾向于引用带有可验证来源的段落。
  • 实体一致性:如上文所述,统一实体名称,并且使用Schema.org的GovernmentOfficeLocalBusiness类型标记,让AI能够准确关联地点和名称。

GEO不是一次性的优化,而是持续的内容治理过程。每次政策调整、材料变化,都要同步更新官网的结构化字段,并且确保其他参考源(如百科词条)也跟着更新。否则AI抓到的还是旧版本。

操作步骤

  1. 打开你的政务官网根目录,找到robots.txt文件。如果不存在,就在根目录创建一个。
  2. 在robots.txt里添加针对GPTBot和ClaudeBot的放行规则,指定允许抓取的目录(如/办事指南/),并明确禁止抓取内部系统路径。
  3. 保存robots.txt后,使用爬虫模拟工具(如Google的Rich Results Test或第三方爬虫检测工具)验证GPTBot能否成功抓取目标页面。
  4. 选取一个试点事项(比如“护照办理”),打开该事项的现有办事指南页面,把内容从段落式改为字段式。
  5. 为每个字段添加合适的Schema.org标记。例如,使用GovernmentService类型,标记serviceTypeproviderareaServedavailableChannel等属性。材料清单可以用additionalProperty或自定义属性。
  6. 在页面底部增加“更新时间”和“责任部门”字段,用dateModifiedprovider标记。
  7. 确保页面里出现的办事大厅名称、地址、电话与官网其他页面、百科词条、地图标注完全一致。如果不一致,先统一内部称呼,再去修改外部参考源。
  8. 在该事项页面下方添加一个FAQ区块,用FAQPage标记。列出3-5个高频问题,例如“护照办理可以加急吗”“周末可以办理吗”,每个问题用QuestionAnswer标记。
  9. 发布页面后,用结构化数据测试工具检查标记是否正确,没有报错。
  10. 第二天,在Google搜索“护照办理 需要什么材料”,看看是否出现你的官网页面。同时,在ChatGPT或Perplexity中提问同样的问题,观察AI的答案是否引用了你的页面内容。
  11. 如果AI没有引用,检查爬虫日志,确认GPTBot是否实际访问了该页面。如果访问了但未引用,可能是字段结构还不够清晰,尝试进一步拆分字段,例如把“所需材料”按人群(首次申领、换发、补发)分别列出。
  12. 定期(至少每月一次)检查政策变化,更新页面字段和FAQ,并重新提交给搜索引擎或直接等待爬虫下次抓取。
  13. 为每个办事事项建立一份“实体一致性检查表”,包括名称、地址、电话、办理时间、材料清单,每次更新时逐项核对。
  14. 将其他参考源(如本地宝、百科词条)的信息与官网对齐。如果发现外部源有误,主动联系更正或提交官方信息。
  15. 持续监测生成式引擎的引用情况。可以定期在主要AI问答产品里输入你的核心办事问题,记录是否出现官网来源,并分析未被引用时的原因。

做完如何验收

验收分三个层面:抓取、结构化、引用。首先,用爬虫模拟工具确认GPTBot能够访问目标页面,并且robots.txt没有误拦。其次,用结构化数据测试工具检查Schema.org标记无错误。最后,在至少两个生成式引擎(如ChatGPT、Perplexity)中提问该事项的典型问题,观察答案中是否出现了你的官网信息。如果出现,并且引用的字段准确(材料清单、地点、时间),说明优化生效。如果连续一周未被引用,需要回头检查字段结构和实体一致性。

常见问题

问:放行GPTBot会不会导致内部系统被爬?
不会。你可以在robots.txt里只放行特定目录,继续禁止其他目录。只要规则写清楚,爬虫只会访问你允许的路径。

问:政务官网必须用Schema.org标记吗?
不是强制,但强烈推荐。Schema.org标记能帮助AI更准确地理解字段含义,提高引用概率。如果暂时无法标记,至少要把内容做成清晰的列表和表格。

问:AI引用我的页面后,还需要做SEO吗?
需要。SEO和GEO不是二选一。传统搜索仍然重要,而且结构化良好的页面往往在两者中表现都更好。

问:如果外部参考源的信息和官网不一致,AI会信谁?
AI通常会参考多个来源。如果官网信息结构清晰、权威性高,被引用的概率更大。但最好主动修正外部源的不一致,减少冲突。

问:多久能看到AI引用效果?
取决于爬虫的抓取频率和AI模型的更新周期。有些页面可能几周内就被引用,有些可能需要更长时间。持续维护结构化内容,效果会更稳定。