AIEO
技术实现

如何理解 AI 爬虫与访问控制

谁在抓取你的页面——搜索爬虫、AI 爬虫、带浏览能力的助手——robots.txt 和服务器级控制如何生效,以及如何做出有意识的访问决策。

如果 AI 系统根本拿不到你的内容,其他一切努力都无从谈起。这篇指南解释今天谁在抓取网页、访问控制如何生效,以及如何做出有意识的决策而不是偶然的配置。

三类抓取者

  1. 传统搜索爬虫 —— Googlebot、Bingbot 等。它们建立搜索结果索引,也越来越常充当 AI 回答的检索层。
  2. AI 训练爬虫 —— AI 公司用来收集训练语料的 User-agent(如 GPTBot、ClaudeBot、Google-Extended)。这些抓取最终可能进入冻结的模型,而不是实时检索索引。
  3. 回答时的浏览型 Agent —— 用户提问时实时抓取页面、让回答立足当前来源的系统。它们的访问有时受同一份 robots.txt 约束,有时遵循另一套公开政策。

区分很重要,因为同一个访问决策对不同对象后果不同:屏蔽训练爬虫不会让你从已训练的模型里消失,而全部放行也不保证获得引用。

访问控制如何工作

主要的文档化控制是 Robots Exclusion Protocol:域名根目录下的 robots.txt,按 User-agent 分组:

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /
  • 规则按声明的 User-agent 匹配,* 是兜底分组。
  • 这些指令是建议性的:守规矩的爬虫会遵守;不守规矩的客户端可以完全无视 robots.txt。
  • 服务器级控制(WAF 规则、限流、认证)是另一套,技术上确实强制生效——但它们同样会拦截你可能需要的合规工具。

大多数平台会公布自家的爬虫 User-agent 及控制方式。读这些文档时注意区分该 User-agent 用于训练、实时检索还是两者——同一家公司往往运营多个。

有意识地做决策

访问是带权衡的业务决策,不是技术默认值:

  • 允许抓取内容 → 你的页面可以被检索和引用。获得可测量性和潜在触达,同时接受无法完全控制的使用方式。
  • 屏蔽训练爬虫 → 选择不为未来模型训练贡献内容。这不影响过去的训练,也不必然把你从实时回答中移除。
  • 屏蔽回答时抓取 → 回答无法立足你的页面;在该系统上别指望引用。

把决策连同日期写下来。真正的敌人是配了一半的状态:

边界与限制

最常见的失败不是"决策错了",而是"决策是继承来的":staging 的 robots.txt 被部署到生产、CDN 规则误伤整块内容路径,或者信号互相矛盾(robots.txt 允许某个爬虫,服务器规则却屏蔽它;noindex 与 Allow 并存)。

验证你的真实配置

  1. 抓取自己的 robots.txt,把每个分组对照你的关键路径——你最重要的五个 URL,对每个你在意的爬虫是否可达?
  2. 查服务器日志,找你预期的(和没预期的)User-agent。robots.txt 回答不了"谁真的在抓",日志可以。
  3. 手工模拟纯抓取:curl -A "某User-agent" https://your-site.com/page,与浏览器里的页面对比。服务器级屏蔽和纯 JS 内容会同时现形。见第一次网站检查。

访问控制做不到什么

  • 它不能追溯把内容从已训练的模型里移除。
  • 它不能强迫助手引用你——是否给引用是平台的选择。
  • 它不能只靠 robots.txt 验证——服务器行为和真实日志才是事实。

访问控制是循环中的一个输入:检查基础条件、改进、再用观察来验证。关于回答如何对待你的领域的观察,见 AIEO、GEO 与 SEO 的关系,以及演示中的 AI 回答观察视图。

本指南引用的规则

相关指南

最后更新于

本页目录