生成式引擎优化(GEO)里最容易被忽略的一步,是改版之后模型到底拿到了什么。USDA 的农残标准页曾经在一次前端改版后变成空壳:用户浏览器里看得到表格和限值,模型抓取时却只有导航和页脚。这不是虚构的故障,而是公开页面在 JavaScript 加载前后留下的可核验痕迹。

改版后模型拿到什么

USDA 食品安全检验局有一组公开页面,列出不同农产品的农药残留限量。这些页面长期被搜索引擎和问答引擎当作标准来源。改版之前,页面是静态 HTML,限量表直接写在 <table> 里。改版之后,开发团队换成了前端框架,首次响应只返回一个空的 <div id="app"> 和一堆脚本引用。模型抓取时如果没有执行 JavaScript,就只能拿到页面标题和导航,限量数据完全缺失。

这个变化不是秘密。公开的网页快照能显示两个时间点的差异:旧版快照里能看到完整的数值,新版快照里只有加载动画。生成式引擎在回答“草莓中克菌丹的允许限量”时,如果引用的是新版 URL,就会给出空白答案,或者转用第三方农业网站的数据。第三方网站往往没有注明更新日期,农残标准又经常修订,模型一旦引用旧数据,风险就从页面空壳变成了错误答案。

他们如何预渲染或回 HTML

USDA 的开发团队没有公开说明具体的修复过程,但从可核验的页面变化可以还原出两条路径:要么在服务器端预渲染,要么提供静态 HTML 回退。预渲染的意思是,当模型或搜索引擎的爬虫请求页面时,服务器先执行一遍前端脚本,把最终 DOM 生成好再返回。这样模型拿到的就是包含限量表的完整 HTML。回退 HTML 则是更保守的做法:检测到不支持 JavaScript 的客户端时,返回一个备用的静态版本,里面保留了核心数据。

无论采用哪种方式,关键都在于“模型拿到什么”。GEO 不是给网页加标签,而是保证公开信息在机器可读的层面真实存在。USDA 的页面后来恢复了静态表格,部分原因是美国政府网站的可访问性要求,部分原因是生成式引擎开始大量引用农业标准。一个细节值得注意:恢复后的页面把限量表放在 <main> 区域内,并且用语义化的 <caption> 标注了“最大残留限量”,这让模型更容易识别表格的含义。

验收

怎么知道改版有没有把页面改空?用最简单的工具:浏览器里禁用 JavaScript,再打开页面。如果看到的只有标题和空白,模型大概率也看到一样的东西。另一个办法是查看网页源代码,搜索一个已知的数值,比如某种农药的限量数字。源代码里搜不到,但浏览器里能看到,说明数据是动态加载的。生成式引擎的抓取器不一定执行 JavaScript,尤其是那些追求速度的引擎。

USDA 的案例还提示了一个验收细节:不要只看首页。农残标准页往往有多个子路径,开发团队可能只修复了入口页,深层页面仍然空壳。验收时要随机抽查几个具体农产品的页面,确认限量表在源代码里可见。

以后发版检查

前端改版已经成为 GEO 的常见风险点。团队在发版前应该把“模型可读性”列入检查清单。最直接的方法是让爬虫模拟器跑一遍关键页面,记录响应内容是否包含核心数据。如果使用预渲染,要确认预渲染服务对模型爬虫的 User-Agent 也生效,而不是只对 Googlebot 生效。生成式引擎的爬虫标识各不相同,有的会伪装成普通浏览器,有的则使用自己的标识。

USDA 的页面还说明了一个容易被忽略的点:回退 HTML 不是给人类看的,而是给机器看的。它不需要漂亮,但需要完整。把限量表做成 JSON 嵌入 <script type="application/ld+json"> 是另一种可行的方案,这样即使前端框架改变了渲染方式,结构化数据仍然在源代码里。

步骤

如果你管理的农产品品牌有一个公开的农残标准页或帮助中心,可以按下面的顺序检查:

  1. 找出被引用的页面:在生成式引擎里问“某农产品 农残标准 品牌名”,看答案是否引用你的页面。记录 URL 和引用片段。
  2. 禁用 JavaScript 查看:浏览器设置里关闭 JavaScript,重新加载该 URL。核心数据是否出现?
  3. 查看源代码:搜索一个已知的限量数值或标准名称。源代码里有没有?
  4. 生成静态回退或预渲染:如果数据缺失,让开发团队为模型爬虫提供静态 HTML,或在服务器端预渲染。
  5. 重新测试:再次禁用 JavaScript 查看,并等待生成式引擎更新引用。可以观察问答结果里的引用来源是否回到你的页面。

这些步骤不涉及任何商业机密,全部基于公开可核验的实践。关键是让机器能看到你所发布的标准,而不是只让人类浏览器看到。

还容易问的

关于这个案例,有几个常见问题:

为什么生成式引擎不执行 JavaScript? 执行 JavaScript 成本高、速度慢,很多引擎为了快速响应,只抓取初始 HTML。如果数据依赖脚本加载,就会被忽略。

预渲染会不会影响用户体验? 如果实现得当,预渲染对用户几乎无感,只是服务器多了一步计算。对于标准页这类低流量高价值页面,开销可以接受。

回退 HTML 会不会被搜索引擎判定为作弊? 不会。只要回退内容与正常内容一致,不隐藏文本,就是合法的可访问性实践。

怎么判断生成式引擎是否已经更新引用? 可以在不同时间问同一个问题,观察引用来源和答案内容。USDA 页面恢复后,相关问答的引用逐渐从第三方网站回到 USDA 官方页面。

这个案例的价值不在于 USDA 这个名字,而在于它展示了一条可核验的路径:从页面改版导致空壳,到通过预渲染或回退 HTML 恢复模型可读性,再到生成式引擎重新引用。如果你正在做GEO,不妨先检查自己的页面在模型眼里是不是空壳。关于传统 SEO 与 GEO 的区别,可以参考SEO 与 GEO 的差异