AIEO
研究与实验

实验计划:llms.txt 和 Markdown 是否改变实际访问

机器人来过,不等于内容被采用;内容被采用,不等于用户看见;用户看见,也不等于产生转化。

先说人话:我们到底在测什么

llms.txt 是一种社区提出的站点说明文件,Markdown 则是一种更简洁的文本格式。它们常被宣传为“让 AI 更容易读网站”,但这句话至少包含四个不同问题:

  1. AI 机器人会不会请求这个文件?
  2. 它请求后,会不会继续访问其中列出的页面?
  3. 页面改为 Markdown 后,机器人访问量会不会改变?
  4. 访问改变后,引用、品牌表述或业务结果会不会改变?

这四件事不能合并成一个“GEO 效果”。Google 当前官方指南明确表示,其生成式搜索不需要 llms.txt、专用 Markdown 或其他特殊 AI 文件;其他工具或平台是否读取,则应逐个平台核验。Profound 2026 年的厂商研究对 6 个站点、381 个页面进行了约 3 周的 Markdown 与 HTML 随机对照,但即使观察到机器人流量差异,也不能自动推出引用或转化差异。

机器人来过,不等于内容被采用;内容被采用,不等于用户看见;用户看见,也不等于产生转化。

适合谁做

  • **零基础创业者:**先完成“小样本可观察实验”,不要一上来重构全站。
  • **有技术背景者:**增加请求日志、响应格式和机器人身份复核。
  • **有 SEO/GEO 背景者:**把访问、引用和业务结果拆成三层指标。

实验问题与假设

建议拆成两个独立实验。

实验 A:llms.txt 是否被访问

H0:发布 llms.txt 前后,目标 AI 机器人对核心页面的访问没有可辨识变化。
H1:发布 llms.txt 后,部分目标机器人会请求该文件,且核心页面访问发生变化。

实验 B:Markdown 与 HTML 是否影响访问

H0:在内容等价时,提供 Markdown 不改变目标 AI 机器人的访问行为。
H1:在内容等价时,提供 Markdown 会改变访问频率、抓取深度或响应成功率。

注意:H1 只说“改变”,不要提前写“提升”。

最小可行实验

项目建议设置
页面样本至少选择 20–40 个主题、流量、深度相近的页面
分组随机分为实验组与对照组
实验组提供内容等价的 Markdown,或加入 llms.txt 导航
对照组继续只提供现有 HTML,不做额外变化
观察期先记录 2 周基线,再观察至少 3–4 周
主要指标已验证机器人的页面请求次数、独立抓取页面数、状态码
次要指标可见引用次数、品牌表述准确率、AI 引荐会话
保持不变页面事实、标题、内链、发布日期、推广活动和访问权限

如果站点流量很低,可以延长观察期,而不要为了“有数据”把真人流量或无法验证的 User-Agent 混进去。

技术实施

1. 保存基线

实验前导出:

  • URL;
  • 页面主题与类型;
  • 发布和更新时间;
  • 过去 14 天机器人请求;
  • HTTP 状态码;
  • 当前可见引用;
  • 当前 AI 引荐会话。

2. 创建内容等价版本

Markdown 版本必须和 HTML 保持相同事实、链接与更新时间。不要一边改格式,一边新增统计、改标题或补案例,否则无法知道差异来自哪里。

3. 验证机器人身份

User-Agent 可以伪造。至少结合平台官方 IP 说明、反向 DNS、CDN/WAF 日志或已验证机器人字段进行复核。无法验证的请求单列为“疑似机器人”。

4. 分层统计

访问层:请求了什么、何时请求、是否成功
采用层:回答是否引用或提及页面
业务层:是否产生访问、注册、试用或购买

可直接复制的记录模板

## llms.txt / Markdown 实验记录

- 实验 ID:
- 站点与目录:
- 开始日期:
- 基线期:
- 观察期:
- 负责人:

### 假设
- H0:
- H1:

### 分组
| URL | 主题 | 页面类型 | 分组 | HTML/Markdown | 其他改动 |
|---|---|---|---|---|---|
| | | | 实验/对照 | | 无 |

### 每周观测
| 周次 | 组别 | 已验证机器人请求 | 成功请求 | 独立页面 | 可见引用 | AI 引荐会话 |
|---|---|---:|---:|---:|---:|---:|
| | | | | | | |

### 异常事件
- 模型或平台变化:
- 网站发布或推广:
- WAF/CDN 配置变化:
- 日志缺失:

### 结论状态
- [ ] 没有发现可辨识差异
- [ ] 发现差异,但只限访问层
- [ ] 发现访问与引用同时变化
- [ ] 数据不足以判断

如何解释结果

  • **文件被请求,但核心页面不变:**说明机器人发现了文件,不说明它影响引用。
  • **实验组访问增加,引用不变:**只能报告访问层差异。
  • **访问与引用都增加:**仍要检查同期更新、推广和模型变化。
  • **没有访问:**可能是平台不使用,也可能是样本和观察期不足。

实操清单

  • 将访问、引用、转化拆开
  • 设置基线期和对照组
  • 随机分配页面
  • 保持内容事实等价
  • 验证机器人身份
  • 记录平台和模型版本
  • 保存原始日志与查询结果
  • 用“未发现”而不是“证明无效”描述阴性结果

资料与边界


最后更新于

本页目录