本章速查与总结
本章术语速查
| 术语 | 通俗解释 |
|---|---|
| User-Agent | 请求方声明的客户端身份字符串,可被冒充 |
| CDN | 将内容缓存到靠近用户的边缘网络 |
| WAF | Web 应用防火墙,可能误拦自动爬虫 |
| 初始 HTML | 服务器首次响应返回的页面源码 |
| 渲染后 DOM | JavaScript 执行完成后的页面结构 |
| robots.txt | 表达自动爬虫路径访问规则的公开文件 |
| noindex | 要求支持该指令的系统不要索引页面 |
| canonical | 表达重复页面中首选规范 URL 的信号 |
| Sitemap | 向搜索系统提供重要 URL 的清单 |
| IndexNow | 向参与搜索引擎通知 URL 变化的协议 |
| JSON-LD | 常用于结构化数据的 JSON 格式 |
| hreflang | 表达页面语言或地区替代版本关系的标记 |
| x-default | hreflang 中用于默认或语言选择页的值 |
| llms.txt | 面向 LLM 推理时站点导览的社区提案 |
本章参考资料
核验日期:2026-10-04。爬虫名称、IP 范围、平台支持与搜索功能会变化,实施前应重新核对官方资料。
官方资料
-
OpenAI:Overview of OpenAI Crawlers
用于区分搜索、训练和用户触发访问,以及核对当前 User-Agent 与 IP 范围。 -
Perplexity:Perplexity Crawlers
用于核对自动搜索与用户触发访问、robots 和 WAF 配置。 -
Google:JavaScript SEO basics
用于理解 Google 的 JavaScript 抓取、渲染与索引流程。 -
Google:Consolidate duplicate URLs
用于 canonical、重定向和 Sitemap 规范化信号。 -
Google:Robots meta tag specifications
用于 noindex、nosnippet 与 X-Robots-Tag。 -
Google:Build and submit a sitemap
用于 Sitemap 内容、提交和限制。 -
Google:Localized versions of your pages
用于 hreflang、双向关系与多语言 URL。 -
Google:Optimizing your website for generative AI features
用于 Google 生成式搜索的技术基础、结构化数据和 llms.txt 边界。 -
IndexNow:Documentation
用于 URL 更新通知协议与提交方式。
规范与补充资料
-
RFC 9309:Robots Exclusion Protocol
robots.txt 的协议基础。 -
Schema.org
结构化数据词汇表。具体搜索功能仍应以目标平台文档为准。 -
llms.txt proposal
用于理解 llms.txt 的社区提案格式;不代表搜索平台已采用为排名信号。
编辑与使用说明
- 示例域名、价格和配置仅用于教学,不应原样部署。
- 任何 robots 或 WAF 变更都应先明确业务、合规和安全边界。
- 技术配置成功不等于被索引、被引用或获得流量。
- 搜索、训练和用户触发访问必须分别判断。
- 平台专属规则不得外推为所有搜索和 AI 系统的统一行为。
最后更新于