AI搜索已经进入健身决策场景:用户问“跑步机和椭圆机哪个好”“膝盖不好能不能练深蹲”,生成式引擎会从全网抓取内容组织答案。如果健身机构的训练计划、运动品牌的装备评测没有被抓取,它们就不会出现在AI的推荐里。这不是猜想,而是抓取机制决定的:AI引擎依赖爬虫获取网页,robots.txt 禁止抓取等于自我排除。本文从放行GPTBot开始,给出健身行业进入AI推荐短名单的操作清单。

问题是什么

健身机构和运动品牌的内容往往藏在官网深处,或者以图片、视频形式存在,AI引擎无法解析。更普遍的情况是,网站为了省流量或防止爬虫,在 robots.txt 里无差别屏蔽了所有机器人,包括生成式引擎的抓取器。根据维基百科对生成式引擎优化的定义,生成式引擎依赖检索增强生成(RAG)技术,先从互联网抓取内容,再生成答案。如果抓取被禁止,内容就不会进入答案生成的候选池。这意味着,即使用户在ChatGPT、Perplexity或Google AI Overview里问“适合新手的训练计划”,你的专业内容也不会被引用。另外,健身内容常以“经验分享”形式散落在社交媒体,缺乏结构化、可验证的实体信息,AI引擎难以建立信任。要解决这个问题,需要先让抓取器能进来,再提供AI容易理解和引用的内容。

如何解决

解决路径分三步:放行抓取、整理实体、验证收录。第一步是修改 robots.txt,明确允许 GPTBot、PerplexityBot、Google-Extended 等生成式引擎抓取器。第二步是整理可引用的内容,把训练计划、装备对比、适用人群等写成结构化的常青页,并统一机构名称、地址、教练资质等实体信息。第三步是定期检查服务器日志和AI引擎的引用情况,确认抓取和索引生效。整个过程不需要技术背景,但需要运营人员按清单逐项执行。同时要理解,SEO与GEO并非对立:传统SEO优化关键词和链接,GEO更关注内容能否被AI理解并摘录为答案。两者可以并行。

用GEO如何解决

GEO(生成式引擎优化)的核心是让内容在AI生成答案时被选中。维基百科指出,生成式引擎会综合多个来源生成答案,并标注引用。因此,健身品牌需要让自己的页面成为“可引用的来源”。具体做法包括:在页面开头直接回答问题,使用清晰的标题和列表;为训练动作、装备参数提供结构化数据(如FAQPage、Product schema);在多个权威平台保持一致的实体信息(如官网、百科、地图)。放行GPTBot只是第一步,更重要的是让AI觉得你的内容可靠、完整、易于摘录。例如,一个“膝盖不好能不能练深蹲”的问答页,应该先给出明确结论“可以,但需要调整动作或选择替代训练”,再列出注意事项和引用来源。这种格式比长篇经验分享更容易被AI引用。

操作步骤

  1. 打开网站根目录的 robots.txt 文件,通常通过 FTP 或网站管理后台访问。
  2. 在文件中找到 User-agent: * 的段落,检查是否有 Disallow: / 或类似的全面禁止规则。
  3. 如果存在全面禁止,先评估是否需要保留对其他爬虫的限制,但至少为生成式引擎放行。
  4. 添加以下段落允许 GPTBot(OpenAI 的抓取器):
    User-agent: GPTBot
    Allow: /
  5. 添加以下段落允许 PerplexityBot:
    User-agent: PerplexityBot
    Allow: /
  6. 添加以下段落允许 Google-Extended(用于 Google AI Overview):
    User-agent: Google-Extended
    Allow: /
  7. 保存 robots.txt 并上传到服务器,确保可以通过 https://你的域名/robots.txt 访问。
  8. 在官网首页或“关于我们”页面检查机构名称、地址、联系电话是否完整,确保与地图和百科一致。
  9. 选择3-5个用户高频问题,如“新手第一周训练计划”“跑步机和椭圆机哪个好”“膝盖不好怎么练腿”,每个问题创建一个独立页面。
  10. 在页面标题和首段直接给出答案,例如“膝盖不好可以练腿,推荐靠墙静蹲和坐姿腿屈伸,避免深蹲和跳跃”。
  11. 在页面中使用列表、表格或步骤说明,避免大段文字;每个要点尽量控制在50字以内。
  12. 为训练计划页面添加 FAQ 结构化数据,标记问题和答案,方便AI直接提取。
  13. 为装备评测页面添加 Product 结构化数据,标记产品名称、品牌、适用人群。
  14. 在页面底部添加“更新日期”和“审核人”(如认证教练),增加内容可信度。
  15. 第二天检查服务器日志,搜索“GPTBot”“PerplexityBot”等关键词,确认它们是否访问了新增页面。
  16. 一周后在 ChatGPT 或 Perplexity 中搜索相关问题,查看你的内容是否出现在引用来源里。

做完如何验收

验收分三个层面:抓取、索引、引用。抓取层面,查看服务器日志,确认 GPTBot、PerplexityBot 等爬虫在修改 robots.txt 后访问了目标页面,且返回 200 状态码。索引层面,在生成式引擎的对话中提问,观察答案是否引用了你的页面;如果尚未出现,可能是索引延迟或内容竞争力不足,需要继续优化。引用层面,检查答案中是否准确摘录了你的核心信息,例如训练计划的步骤是否完整、装备推荐的型号是否正确。如果答案引用了你的页面但内容有误,需要调整页面表述,使其更简洁明确,减少AI误解的可能。另外,定期复查 robots.txt,确保没有被误改回禁止状态。

常见问题

问:放行GPTBot会不会导致网站被恶意抓取?
答:GPTBot 是 OpenAI 官方爬虫,遵循 robots.txt 规则。放行它不会增加安全风险,但建议同时保留对其他未知爬虫的限制。可以通过服务器日志监控异常流量。

问:修改 robots.txt 后多久能看到效果?
答:抓取器通常会在几天到几周内重新访问网站,但AI引擎的索引和引用更新可能更慢。建议耐心等待,同时持续优化内容质量。

问:如果官网没有技术团队,怎么修改 robots.txt?
答:很多建站平台(如 WordPress、Shopify)提供 robots.txt 编辑功能,或者可以通过插件管理。如果实在无法修改,可以联系网站托管服务商协助。

问:健身内容很多是视频,AI抓不到怎么办?
答:为每个视频添加文字描述和字幕,并在页面中总结关键要点。AI引擎无法直接理解视频内容,但可以抓取文字摘要。

问:是否需要在所有平台(如微博、小红书)也放行抓取?
答:生成式引擎主要抓取公开网页,社交媒体平台的 robots.txt 通常由平台控制,个人无法修改。建议将核心内容同时发布在官网和可控制的博客上,增加被引用的机会。