市民在生成式搜索里问“办居住证要带什么材料”,AI给出的回答里却混着三年前的收费标准、已经取消的线下窗口地址,甚至一个已经404的活动页。政务网站的团队查了后台,发现这些过期页面依然能被爬虫抓取,而且因为没有明确的新鲜度信号,生成式引擎在多个来源里优先选中了它们。
这不是个例。政务与公共服务网站的内容治理,正在从“别让用户看到错信息”升级为“别让AI替你传播错信息”。过期信息一旦被生成式答案引用,影响的不是一次点击,而是一整条办事链路。
本文面向政务网站的内容运营和运维团队,讲清AI为什么总挑过期页面,以及如何用一套最小可执行的治理动作,把权威的办事指南页变成AI的首选引用源。
先承认一个误区
很多团队认为,过期信息只要在页面上标注“已失效”或“已过期”,AI就应该能识别并避开。实际情况是,生成式引擎并不天然理解“失效”的语义。它判断一个页面是否值得引用,主要看几个可机器读取的信号:页面是否可访问(HTTP状态码)、结构化数据里是否声明了有效日期、页面被其他权威来源引用的频率、以及内容是否与问题相关。
如果过期页面没有返回404或301,也没有在结构化数据里声明有效期,同时因为历史原因积累了不少外链,它就可能在AI的候选池里占据优势。一个典型场景:某市政务网曾有一个“2023年家电消费券活动页”,活动结束后页面未删除,也未标注有效期。在生成式搜索回答“今年还有消费券吗”时,这个页面因为标题和关键词匹配度高、域名权威性强,被AI当成了现行政策来源。
所以,先承认一个误区:过期不等于消失,标注不等于隔离。AI不会因为你的页面写了一句“本活动已结束”就跳过它,除非你提供了机器可读的明确信号。
真正起作用的机制
生成式引擎选择来源的机制,可以拆成三层:抓取、解析、排序。
抓取层:AI爬虫(如GPTBot、ClaudeBot等)会定期访问你的网站。如果robots.txt没有放行,AI根本不会读你的页面;但如果放行了,所有可访问的页面都可能被纳入索引。过期页面如果不设置301跳转或404,就会被继续抓取。
解析层:AI会从页面中提取标题、正文、发布时间、结构化数据等。如果页面带有Article或FAQPage等Schema.org标记,AI会更容易理解页面主题。但许多过期活动页没有结构化数据,AI只能靠文本判断,这就容易出错。
排序层:AI会综合相关性、权威性、新鲜度等信号来决定引用哪个来源。政务域名的权威性通常较高,但如果权威页面没有提供新鲜度信号(如dateModified、datePublished),而过期页面恰好有大量外链和关键词匹配,AI就可能选错。
因此,真正起作用的机制是:用技术手段让过期页面从AI的候选池里消失,同时给权威办事指南页加装明确的新鲜度和结构化信号。两者缺一不可。
对照改哪一类页
政务网站里最容易出问题的页面类型,可以对照下表来识别和处理:
| 页面类型 | 常见问题 | 治理动作 |
|---|---|---|
| 活动页(消费券、补贴、抽奖等) | 活动结束后页面仍可访问,无有效期标记 | 设置301跳转到当前政策列表页,或返回410 Gone;若需保留内容,添加Event结构化数据并声明endDate |
| 价格公示页(收费标准、罚款金额等) | 旧价格未更新,页面标题和URL未变 | 更新价格内容,并在dateModified字段写入最新修改日期;若价格已废止,跳转到新标准页 |
| 办事指南页(材料清单、流程、窗口地址) | 信息已变更,但页面未更新或未标记更新时间 | 更新内容并添加FAQPage结构化数据,将“要带什么材料”写成清晰的问答对 |
| 已下线的服务入口页 | 页面返回200但内容已无意义 | 设置301跳转到替代服务页,或返回404并优化404页提供搜索和导航 |
重点不是把所有过期页面都删掉,而是让AI明确知道哪些页面是“现行有效”的。对于历史存档页面,可以在页头添加机器可读的声明,例如使用meta标签标注robots为noindex,或在结构化数据中声明validThrough。
本周可做的动作
以下动作按优先级排列,可以在本周内启动:
- 盘点过期页面:用爬虫工具(如Screaming Frog)扫描全站,找出返回200但内容已过期的页面,列成清单。
- 处理活动页和价格页:对已结束的活动页,设置301跳转到当前政策列表页;对旧价格页,更新内容或跳转。
- 给核心办事指南页加结构化数据:在“办理材料”“办理流程”“收费标准”等页面添加
FAQPage或HowTo结构化数据,并确保dateModified字段准确。 - 检查robots.txt和爬虫日志:确认AI爬虫(如GPTBot)没有被屏蔽,同时查看服务器日志,了解AI爬虫最近抓取了哪些页面,优先处理被频繁抓取的过期页。
- 建立更新提醒机制:在CMS里为有明确时限的政策页面设置到期提醒,到期后自动触发下架或跳转流程。
不要迷信的指标
做GEO治理时,有几个指标容易让人误判:
- AI引用次数:短期内AI引用次数可能波动很大,不要只看这一项。更重要的是引用的是否是正确页面。如果AI引用的是过期页,引用次数越高越危险。
- 页面浏览量:过期页面的浏览量可能因为AI引用而上升,但这不代表治理成功。要关注的是用户是否因错误信息而投诉或办事失败。
- 结构化数据验证通过:通过了Schema.org验证器不代表AI一定会引用。结构化数据只是让AI更容易解析,不等于AI一定选择你的页面。
- 域名权威性:政务域名权威性高是优势,但如果内容不新鲜、不结构化,权威性也救不了你。
真正需要盯住的指标是:过期页面是否已经从AI的引用中消失,权威办事指南页是否开始被AI稳定引用。可以通过在AI对话中反复测试典型问题来观察变化,但不要追求精确的引用次数排名。
常见问题
1. 为什么AI会引用已经404的页面?
如果页面返回404,AI通常不会引用。但如果AI之前已经缓存了该页面的内容,可能在短期内仍会引用。需要等待AI重新抓取并更新索引。确保404响应正确,并在robots.txt中允许AI爬虫访问,以便它发现页面已不存在。
2. 给过期页面添加“已失效”提示文字有用吗?
对AI来说,单纯在页面上写“已失效”作用有限。AI可能识别不出这是机器可读的失效声明。更有效的方法是设置301跳转、返回410 Gone,或添加结构化数据声明有效期已过。
3. 政务网站可以屏蔽AI爬虫吗?
可以,但不建议。屏蔽AI爬虫会阻止AI引用你的任何内容,包括权威的办事指南。正确的做法是放行AI爬虫,但通过技术手段让过期页面不被索引。
4. 办事指南页需要多高的更新频率?
没有固定频率,但每次政策或流程变更后必须及时更新。同时确保dateModified字段反映最新修改时间。AI会参考这个字段判断新鲜度。
5. 如何知道AI正在引用我的哪些页面?
可以在服务器日志中查看AI爬虫(如GPTBot、ClaudeBot)的抓取记录,分析它们最常访问的URL。结合在AI对话中的测试,可以大致了解引用情况。