AIEO
研究与实验

实验计划:引用能持续多久,更新后是否改变

半衰期描述的是一个样本如何变化,不是给所有内容设置的保质期。

先区分三件事

  1. **引用持续时间:**某页面从首次出现到不再出现的时间。
  2. **引用份额:**某页面在一组固定问题的全部引用中占多少。
  3. **更新时间:**页面真实内容发生变化的时间,而不是手工刷新日期。

Profound 2026 年研究跟踪了 88.3 万个页面和 7 个 AI 搜索引擎,并以特定“引用份额衰减”口径报告中位页面约 11 天损失一半引用份额。这个数字不是所有文章的寿命,更不是“每 11 天更新一次”的操作规则。不同主题、引擎、样本筛选和峰值定义都会改变结果。

半衰期描述的是一个样本如何变化,不是给所有内容设置的保质期。

两个实验要分开做

实验 A:自然持续时间

不改页面,只观察固定问题中引用是否出现、消失和重新出现。目标是建立自己的时间序列。

实验 B:真实更新的影响

选择内容相近页面,随机安排一部分做实质更新,另一部分保持不变。目标是比较更新组与对照组,而不是比较“更新前后”。

什么算实质更新

可以包括:

  • 修正已经变化的价格、版本或限制;
  • 增加新的第一手测试及方法;
  • 替换已失效的截图和操作步骤;
  • 补充新的官方来源;
  • 修复读者无法完成任务的缺口。

不包括:

  • 只改 dateModified;
  • 调整标点和同义词;
  • 把年份从 2025 换成 2026;
  • 没有事实变化却声称“全面更新”。

时间序列设计

项目建议
页面至少 30 个;按主题和页面类型分层
问题固定问题集并保存版本
频率每日或每周固定时点,保持一致
时长至少 8–12 周;高波动主题更长
平台独立记录,不合成一个“全网分数”
指标是否引用、引用份额、首次/最后出现、回归次数
事件模型更新、索引变化、推广和页面改动

不要被“峰值”欺骗

如果某页面偶然只被引用一次,那么从 1 次降到 0 次就是“下降 100%”,但业务意义可能很小。应同时报告:

  • 绝对引用次数;
  • 有效回答总数;
  • 引用率;
  • 连续出现周期;
  • 样本量和缺失数据。

不要只从最高点开始画下降曲线,这会产生峰值选择偏差。

更新实验

  1. 按主题、历史引用率和页面类型配对。
  2. 在每对中随机选择一个页面更新。
  3. 预先定义更新内容与完成时间。
  4. 对照页不做内容和推广变化。
  5. 继续使用同一问题集和采样环境。
  6. 比较两组“变化量之差”。

简化表示:

更新效果估计 =(更新组后期 − 更新组基线)−(对照组后期 − 对照组基线)

这是一个帮助排除共同趋势的思路,不代表样本很小就能得到可靠因果结论。

实际例子

假设有 20 篇 SaaS 产品比较页,过去 4 周平均引用率如下:

组别更新前更新后
更新组12%18%
对照组11%13%

计算:

更新组变化 = 18% − 12% = 6 个百分点
对照组变化 = 13% − 11% = 2 个百分点
变化量之差 = 6 − 2 = 4 个百分点

你可以说:

在本次页面、问题集和观察期内,更新组相对对照组多增加了 4 个百分点的引用率。

不能直接说:

更新内容必然让 AI 引用率提升 4%。

还需检查样本量、置信区间、模型变化、页面是否被重新抓取,以及更新组是否获得额外推广。

可直接复制的时间序列模板

## 引用持续与更新实验

- 实验 ID:
- 平台与模式:
- 问题集版本:
- 基线期:
- 更新日期:
- 观察期:

### 页面分组
| URL | 主题 | 历史引用率 | 分组 | 实质更新摘要 | 更新时间 |
|---|---|---:|---|---|---|
| | | | 更新/对照 | | |

### 周期记录
| 日期 | 问题 ID | URL | 是否引用 | 引用支持的主张 | 回答有效 | 异常事件 |
|---|---|---|---|---|---|---|
| | | | 是/否 | | 是/否 | |

### 汇总
| URL | 首次出现 | 最后出现 | 有效回答数 | 引用次数 | 引用率 | 回归次数 |
|---|---|---|---:|---:|---:|---:|
| | | | | | | |

### 组间比较
- 更新组基线:
- 更新组后期:
- 对照组基线:
- 对照组后期:
- 变化量之差:

### 结论状态
- [ ] 未发现稳定变化
- [ ] 观察到短期变化
- [ ] 观察到持续变化
- [ ] 数据不足以判断

什么时候该更新

按照事实变化速度,而不是统一日历:

  • **价格、政策、产品版本:**事实变化就更新。
  • **实操教程:**界面或流程变化影响任务完成时更新。
  • **行业研究:**有新样本、新方法或旧结论不再适用时更新。
  • **稳定定义:**事实没有变化时,不需要为了“新鲜”重写。

实操清单

  • 先定义引用份额和有效样本
  • 固定问题集、平台和采样时间
  • 同时记录消失与重新出现
  • 避免从偶然峰值开始计算
  • 真实更新,不只改日期
  • 设置未更新对照组
  • 记录重新抓取与模型事件
  • 报告绝对次数、比例和样本量
  • 不把单一研究的中位数当更新周期

资料与边界


附录 A:四类实验共用的证据等级

等级证据可以怎么说
A随机对照、样本充分、预注册指标在本实验范围内,处理与结果差异一致
B有对照的前后观察观察到相对变化,但仍可能有未控制因素
C单组时间序列变化与修改同期发生,不能确认因果
D单次截图或个案仅说明该时点发生过,不代表稳定规律

证据等级决定措辞强度。数据越弱,语言越要克制。

附录 B:实验发布前检查表

  • 已写出 H0 与 H1
  • 已明确唯一主要变量
  • 已设置对照组或说明为何不能设置
  • 已保存实验前基线
  • 已预先定义主要指标和成功条件
  • 已固定问题集、语言、地区、平台和模式
  • 已记录模型或产品版本
  • 已保存所有结果,包括失败和未引用样本
  • 已区分访问、采用、引用、点击和转化
  • 已披露样本量、缺失数据和异常事件
  • 已写明结论适用范围
  • 未把相关性写成平台机制或普遍因果

附录 C:实验文章推荐结构

# 实验标题

## 摘要
- 问题:
- 方法:
- 样本:
- 观察期:
- 主要结果:
- 限制:

## 背景与已有证据
## 假设
## 样本与分组
## 变量与指标
## 执行过程
## 完整结果
## 异常与缺失数据
## 结论
## 不能得出的结论
## 原始数据与复现说明
## 参考资料

本章总结

第七章不是一组“最新技巧”,而是一套防止自我欺骗的方法:

  1. 把模糊主张拆成可观察问题;
  2. 一次只改变尽可能少的变量;
  3. 先写成功条件,再看结果;
  4. 保存全部样本,而不是挑最好看的截图;
  5. 把访问、引用、点击和转化分开;
  6. 用与证据强度相匹配的语言发布结论。

真正有价值的 GEO 内容,不是把别人的结论再说一遍,而是让读者看见你如何得到结论、哪里可能错、怎样才能复现。


参考资料总表

资料核验日期:2026 年 10 月 4 日。

  1. Google:针对 Google 搜索中的生成式 AI 功能优化网站
  2. GEO: Generative Engine Optimization(arXiv)
  3. Profound:Markdown 与 HTML 的 AI 机器人受控实验
  4. Profound:查询语言如何重塑 AI 引用
  5. Profound:AI 引用的半衰期是 11 天

阅读这些资料时要保留的边界

  • Google 文档只代表其公开说明的 Google 搜索机制,不能代替其他平台文档。
  • GEO 论文来自特定基准、策略与时期,不等于跨平台固定排名公式。
  • Profound 的资料属于厂商研究,样本规模可提供重要观察,但仍需核对定义、筛选、产品覆盖和商业背景。
  • 本章公式和评分模板用于实验组织与内部判断,不是任何平台公开的排名算法。

最后更新于

本页目录