AIEO
概念基础

如何完成第一次网站检查

一套可复现、以证据为先的网站基础检查流程——可抓取性、服务端 HTML、标题、canonical、标题层级与日期。不需要专门工具。

这篇指南带你对自己控制的网站做第一次全面检查。小站点大约需要 30–60 分钟,只需要浏览器和终端(或"查看源代码"),产出的东西比一个分数更有价值:一份带证据的书面发现清单。

无论网站有五个页面还是五万个,方法都一样——站点大就按页面类型抽样(首页、文章页、商品页、落地页),不必逐页检查。

开始之前:如何记录发现

对下面的每一项检查,写下三件事:

  1. 观察到了什么 —— 记录实际值或原文片段,而不是判断。(记 <title> = "Home — ACME",不要记"标题很差"。)
  2. URL 和日期 —— 在哪个页面、哪一天观察的。
  3. 状态,从这三项中选:待处理、需人工复核、未检查。"未检查"是合法的结果——绝不要悄悄把它记成"通过"。

这份记录是后续验证的基础:改了什么之后,你对照的是记录下来的证据,而不是记忆。

第 1 步 — 爬虫能到达你的页面吗?

请求 https://your-site.com/robots.txt,主动找两类问题:

  • 覆盖了真实内容路径的 Disallow: 规则(比如从 staging 带到生产的 Disallow: /)。
  • 针对特定 User-agent 的屏蔽,特别是那些你没有明确决策过的 AI 爬虫。它们是谁、意味着什么,见 AI 爬虫与访问控制。

文件缺失或为空意味着"没有限制"——可以接受,前提是这是决策,不是事故。

理想状态是一份很短的 robots.txt:每条 Disallow 都对应一个明确的排除意图(后台路径、搜索结果页、API),并且没有任何规则误伤内容目录。

关于证据

把你在依赖的 robots.txt 原文行记录下来,附上日期。robots 文件会变, 你的记录才能让以后的比较有意义。

第 2 步 — 内容在服务端 HTML 里吗?

打开一个页面查看源代码(Ctrl+U / 右键 →"查看网页源代码"——不是 DOM 检查器),在原始 HTML 里搜一句只存在于正文中的话。

  • 源代码里能找到 —— 不渲染页面的爬虫也能读到你的内容。这是合格基线。
  • 只在渲染后的 DOM 里 —— 内容依赖客户端 JavaScript。有的爬虫会渲染,有的不会;只存在于 JS 之后的内容在所有场景下都有风险。

稳妥的修复方向是服务端渲染(或至少把关键内容注入到服务端 HTML),而不是"针对某些爬虫优化"。

边界与限制

这个手工测试只是抽样。纯客户端内容常常藏在模板变体里—— 每种模板类型各查一页,不要只查首页。

第 3 步 — 标题与 meta description

对每个抽样页面,从源代码提取 <title> 和 <meta name="description">。

检查:

  • 唯一 —— 重要页面之间不共享标题。
  • 有描述性 —— 标题说明页面是什么,而不是只有品牌名。
  • 描述存在且有意义 —— 不是全站复用的模板字符串。

搜索结果和许多回答系统在"指名"你的页面时,仍然主要依赖这些字段。

第 4 步 — Canonical URL

在源代码中找 <link rel="canonical">。

  • 它应当指向你希望这个页面被收录的 URL——通常就是它自己。
  • 警惕指向不同协议(http://)、不同主机(www. 与裸域)的 canonical,以及所有页面都指向首页的写法——最后一种等于告诉所有系统:其他页面不是独立文档。

如果同一内容会出现在带参数的 URL 下,canonical 就是你指定"干净版本"的方式;确保每个变体的指定都一致。

第 5 步 — 标题层级

从源代码(或渲染后的大纲)按顺序提取标题。

  • 唯一一个 h1,说明页面主题。
  • 层级不跳跃(h2 后直接出现 h4 会破坏大纲)。
  • 标题文字读起来像用户真实的问题或话题——按段落抽取内容时靠的就是它。

标题措辞好不好属于人工判断;上面的结构检查是机械的。

第 6 步 — 日期与新鲜度信号

看页面在哪里显示了日期(如果有)。

  • 可见的"最后更新"时间与真实内容变更一致,会同时赢得读者信任和版本比对系统的信任。
  • 每次部署都自动刷新、内容却没变的日期,比没有日期更糟。

如果你的构建系统自动盖时间戳,确认它来自内容的版本历史(git),而不是构建时间。

检查之后:排序与行动

给发现排序:

  1. 访问问题优先(robots、服务端 HTML)——它们会让后面的一切失效。
  2. 元信息与结构 —— 便宜、机械的修复。
  3. 内容证据 —— 更慢的工作,属于人工判断的领域。

然后到交互演示里看同样的发现被产品组织起来是什么样子:证据、解释、建议,以及每条主张的适用边界。

说明

一次检查只是快照。本站教授的循环——检查、定位、改进、验证—— 需要在改动之后做第二次观察。保留第一次的记录,你会用到。

本指南引用的规则

相关指南

最后更新于

本页目录