AIEO
技术实现

本章速查与总结

本章术语速查

术语通俗解释
User-Agent请求方声明的客户端身份字符串,可被冒充
CDN将内容缓存到靠近用户的边缘网络
WAFWeb 应用防火墙,可能误拦自动爬虫
初始 HTML服务器首次响应返回的页面源码
渲染后 DOMJavaScript 执行完成后的页面结构
robots.txt表达自动爬虫路径访问规则的公开文件
noindex要求支持该指令的系统不要索引页面
canonical表达重复页面中首选规范 URL 的信号
Sitemap向搜索系统提供重要 URL 的清单
IndexNow向参与搜索引擎通知 URL 变化的协议
JSON-LD常用于结构化数据的 JSON 格式
hreflang表达页面语言或地区替代版本关系的标记
x-defaulthreflang 中用于默认或语言选择页的值
llms.txt面向 LLM 推理时站点导览的社区提案

本章参考资料

核验日期:2026-10-04。爬虫名称、IP 范围、平台支持与搜索功能会变化,实施前应重新核对官方资料。

官方资料

  1. OpenAI:Overview of OpenAI Crawlers
    用于区分搜索、训练和用户触发访问,以及核对当前 User-Agent 与 IP 范围。

  2. Perplexity:Perplexity Crawlers
    用于核对自动搜索与用户触发访问、robots 和 WAF 配置。

  3. Google:JavaScript SEO basics
    用于理解 Google 的 JavaScript 抓取、渲染与索引流程。

  4. Google:Consolidate duplicate URLs
    用于 canonical、重定向和 Sitemap 规范化信号。

  5. Google:Robots meta tag specifications
    用于 noindex、nosnippet 与 X-Robots-Tag。

  6. Google:Build and submit a sitemap
    用于 Sitemap 内容、提交和限制。

  7. Google:Localized versions of your pages
    用于 hreflang、双向关系与多语言 URL。

  8. Google:Optimizing your website for generative AI features
    用于 Google 生成式搜索的技术基础、结构化数据和 llms.txt 边界。

  9. IndexNow:Documentation
    用于 URL 更新通知协议与提交方式。

规范与补充资料

  1. RFC 9309:Robots Exclusion Protocol
    robots.txt 的协议基础。

  2. Schema.org
    结构化数据词汇表。具体搜索功能仍应以目标平台文档为准。

  3. llms.txt proposal
    用于理解 llms.txt 的社区提案格式;不代表搜索平台已采用为排名信号。

编辑与使用说明

  • 示例域名、价格和配置仅用于教学,不应原样部署。
  • 任何 robots 或 WAF 变更都应先明确业务、合规和安全边界。
  • 技术配置成功不等于被索引、被引用或获得流量。
  • 搜索、训练和用户触发访问必须分别判断。
  • 平台专属规则不得外推为所有搜索和 AI 系统的统一行为。

最后更新于

本页目录