WebMD 的医疗内容团队发现,他们帮助中心里一组关于「药品相互作用查询」的操作步骤,总是不被 Perplexity 和 Google AI Overview 引用。这些步骤写得很清楚,但模型在回答开发者提问时,却只引用第三方论坛或维基百科。问题出在格式:关键步骤全部放在一个 PDF 文件里,而生成式引擎优化(GEO)的前提是内容能被模型读取。当团队把步骤迁移到 HTML 页面后,引用才开始出现。这不是一次大改版,而是一次「把事实从 PDF 里放出来」的小工程。

事实原来藏在哪

WebMD 的帮助中心有一个专区,专门解释如何通过 API 查询药品相互作用。内容团队把详细步骤做成了一份 PDF,挂在帮助中心的一个链接上。这份 PDF 里有查询参数、返回字段说明、错误码表。团队以为这样就够了——用户点击下载,开发者也能用。但生成式引擎的爬虫不会点击下载按钮,也不会解析 PDF 里的文字。在公开的检索结果里,这份 PDF 从未出现在任何 AI 回答的引用来源中。事实被封装在一个模型读不到的文件里,等于对生成式引擎隐形。

更糟的是,第三方开发者论坛里有人手动复制了 PDF 里的步骤,贴在回答里。那些复制出来的步骤往往不完整,或者被改写了。当用户问「WebMD 药品相互作用 API 怎么用」时,模型引用的是论坛里的二手内容,而不是 WebMD 官方的准确步骤。WebMD 的内容团队在内部检索时发现,官方 PDF 的下载量并不低,但在生成式引擎的引用列表里,它从未出现过。问题不在内容质量,而在内容格式。

迁到 HTML 之后

内容团队决定把 PDF 里的步骤逐条拆解,迁移到一个新的 HTML 页面。这个页面使用标准的语义化标签:标题用 H1/H2,步骤用有序列表,参数用表格,错误码用定义列表。页面 URL 可稳定访问,没有登录墙,也没有 JavaScript 动态加载。迁移完成后,团队提交了 sitemap 更新,并等待搜索引擎重新抓取。

几周后,情况发生了变化。Perplexity 在回答「WebMD 药品相互作用 API 查询步骤」时,开始引用这个新的 HTML 页面。Google AI Overview 也在相关查询中显示了这个页面的摘要。更关键的是,开发者问答社区里,有人直接把官方 HTML 页面的链接作为「正确步骤」的来源。引用不是一夜之间发生,但迁移到 HTML 后,模型终于能在公开网络上读到这些事实。

这个变化没有伴随任何付费推广,也没有改变页面在传统搜索结果中的排名。团队观察到的是:生成式引擎的爬虫能够识别 HTML 中的结构化内容,并将其作为可引用的来源。PDF 里的同样内容,即使被下载过很多次,也不会被模型当作事实来源。

图片文字的问题

在迁移过程中,团队还发现另一个隐患:部分步骤的截图里含有关键信息,比如 API 返回的 JSON 示例。这些截图被放在 HTML 页面里,但模型无法读取图片中的文字。团队最初没有意识到这一点,直到他们在 Perplexity 里测试时,发现模型只引用了页面上的文字部分,对截图中的示例完全忽略。于是他们把截图中的 JSON 示例用代码块重新写在 HTML 里,并给图片添加了详细的 alt 文本。之后,模型在回答中开始引用这些 JSON 示例。

这个细节说明:即使页面已经是 HTML,如果关键事实仍然以图片形式存在,模型依然读不到。生成式引擎优化要求所有关键信息都以可解析的文本形式呈现。图片只能作为辅助,不能作为唯一载体。

怎样验收读得到

WebMD 团队没有依赖「感觉」来判断内容是否被模型读取。他们建立了一个简单的验收流程:用 Perplexity 和 Google AI Overview 分别提出三个与 API 步骤相关的问题,检查答案中是否出现 WebMD 官方页面的链接或摘要。如果出现,则视为「读得到」;如果只出现第三方内容,则继续排查格式问题。

他们还定期检查服务器日志,看生成式引擎的爬虫(如 GPTBot、PerplexityBot)是否访问了该 HTML 页面。虽然爬虫访问不等于一定引用,但至少说明内容进入了模型的候选池。这个流程帮助他们发现了一个新的问题:一个旧的重定向页面仍在返回 302,导致爬虫无法到达新页面。修复后,引用进一步稳定。

验收的核心不是「排名上升」,而是「被生成式引擎当作事实来源」。对于医疗健康内容,被准确引用比流量更重要。

步骤

  1. 找出关键事实的藏身之处:审查所有对外提供操作步骤或技术说明的内容,列出哪些以 PDF、图片或动态加载形式存在。
  2. 将关键事实迁移到 HTML:把 PDF 中的步骤、参数、错误码等内容,用语义化 HTML 重新发布。确保 URL 稳定、无需登录、无 JavaScript 依赖。
  3. 处理图片中的文字:所有截图或图片中的重要信息,必须同时以文本形式出现在 HTML 中。给图片添加准确的 alt 文本。
  4. 提交更新并等待抓取:更新 sitemap,确保新页面可被爬虫访问。检查是否有重定向或 robots.txt 阻止。
  5. 验收生成式引擎的读取情况:用 Perplexity、Google AI Overview 等工具测试相关问题,检查是否引用官方页面。同时监控爬虫日志。
  6. 持续维护:当内容有更新时,直接在 HTML 上修改,不要重新生成 PDF。保持页面的可读性和稳定性。

这个过程不需要复杂的工具,只需要坚持一个原则:关键事实必须放在模型能读到的 HTML 里。这是生成式引擎优化的基础,也是医疗健康内容建立权威的可核验路径。

还容易问的

关于 WebMD 这次 PDF 转 HTML 的实践,读者可能会问以下几个问题。