研究与实验
实验计划:llms.txt 和 Markdown 是否改变实际访问
机器人来过,不等于内容被采用;内容被采用,不等于用户看见;用户看见,也不等于产生转化。
先说人话:我们到底在测什么
llms.txt 是一种社区提出的站点说明文件,Markdown 则是一种更简洁的文本格式。它们常被宣传为“让 AI 更容易读网站”,但这句话至少包含四个不同问题:
- AI 机器人会不会请求这个文件?
- 它请求后,会不会继续访问其中列出的页面?
- 页面改为 Markdown 后,机器人访问量会不会改变?
- 访问改变后,引用、品牌表述或业务结果会不会改变?
这四件事不能合并成一个“GEO 效果”。Google 当前官方指南明确表示,其生成式搜索不需要 llms.txt、专用 Markdown 或其他特殊 AI 文件;其他工具或平台是否读取,则应逐个平台核验。Profound 2026 年的厂商研究对 6 个站点、381 个页面进行了约 3 周的 Markdown 与 HTML 随机对照,但即使观察到机器人流量差异,也不能自动推出引用或转化差异。
机器人来过,不等于内容被采用;内容被采用,不等于用户看见;用户看见,也不等于产生转化。
适合谁做
- **零基础创业者:**先完成“小样本可观察实验”,不要一上来重构全站。
- **有技术背景者:**增加请求日志、响应格式和机器人身份复核。
- **有 SEO/GEO 背景者:**把访问、引用和业务结果拆成三层指标。
实验问题与假设
建议拆成两个独立实验。
实验 A:llms.txt 是否被访问
H0:发布 llms.txt 前后,目标 AI 机器人对核心页面的访问没有可辨识变化。
H1:发布 llms.txt 后,部分目标机器人会请求该文件,且核心页面访问发生变化。实验 B:Markdown 与 HTML 是否影响访问
H0:在内容等价时,提供 Markdown 不改变目标 AI 机器人的访问行为。
H1:在内容等价时,提供 Markdown 会改变访问频率、抓取深度或响应成功率。注意:H1 只说“改变”,不要提前写“提升”。
最小可行实验
| 项目 | 建议设置 |
|---|---|
| 页面样本 | 至少选择 20–40 个主题、流量、深度相近的页面 |
| 分组 | 随机分为实验组与对照组 |
| 实验组 | 提供内容等价的 Markdown,或加入 llms.txt 导航 |
| 对照组 | 继续只提供现有 HTML,不做额外变化 |
| 观察期 | 先记录 2 周基线,再观察至少 3–4 周 |
| 主要指标 | 已验证机器人的页面请求次数、独立抓取页面数、状态码 |
| 次要指标 | 可见引用次数、品牌表述准确率、AI 引荐会话 |
| 保持不变 | 页面事实、标题、内链、发布日期、推广活动和访问权限 |
如果站点流量很低,可以延长观察期,而不要为了“有数据”把真人流量或无法验证的 User-Agent 混进去。
技术实施
1. 保存基线
实验前导出:
- URL;
- 页面主题与类型;
- 发布和更新时间;
- 过去 14 天机器人请求;
- HTTP 状态码;
- 当前可见引用;
- 当前 AI 引荐会话。
2. 创建内容等价版本
Markdown 版本必须和 HTML 保持相同事实、链接与更新时间。不要一边改格式,一边新增统计、改标题或补案例,否则无法知道差异来自哪里。
3. 验证机器人身份
User-Agent 可以伪造。至少结合平台官方 IP 说明、反向 DNS、CDN/WAF 日志或已验证机器人字段进行复核。无法验证的请求单列为“疑似机器人”。
4. 分层统计
访问层:请求了什么、何时请求、是否成功
采用层:回答是否引用或提及页面
业务层:是否产生访问、注册、试用或购买可直接复制的记录模板
## llms.txt / Markdown 实验记录
- 实验 ID:
- 站点与目录:
- 开始日期:
- 基线期:
- 观察期:
- 负责人:
### 假设
- H0:
- H1:
### 分组
| URL | 主题 | 页面类型 | 分组 | HTML/Markdown | 其他改动 |
|---|---|---|---|---|---|
| | | | 实验/对照 | | 无 |
### 每周观测
| 周次 | 组别 | 已验证机器人请求 | 成功请求 | 独立页面 | 可见引用 | AI 引荐会话 |
|---|---|---:|---:|---:|---:|---:|
| | | | | | | |
### 异常事件
- 模型或平台变化:
- 网站发布或推广:
- WAF/CDN 配置变化:
- 日志缺失:
### 结论状态
- [ ] 没有发现可辨识差异
- [ ] 发现差异,但只限访问层
- [ ] 发现访问与引用同时变化
- [ ] 数据不足以判断如何解释结果
- **文件被请求,但核心页面不变:**说明机器人发现了文件,不说明它影响引用。
- **实验组访问增加,引用不变:**只能报告访问层差异。
- **访问与引用都增加:**仍要检查同期更新、推广和模型变化。
- **没有访问:**可能是平台不使用,也可能是样本和观察期不足。
实操清单
- 将访问、引用、转化拆开
- 设置基线期和对照组
- 随机分配页面
- 保持内容事实等价
- 验证机器人身份
- 记录平台和模型版本
- 保存原始日志与查询结果
- 用“未发现”而不是“证明无效”描述阴性结果
资料与边界
- Google:针对生成式 AI 功能优化网站:适用于 Google 搜索;其“不需要特殊文件”不能外推到所有 AI 工具。
- Profound:Markdown 与 HTML 的受控机器人实验:厂商实验,样本为 6 个站点、381 页、约 3 周;应查看原文方法和限制,不把机器人访问差异等同于排名或收入。
最后更新于