研究与实验
实验计划:引用能持续多久,更新后是否改变
半衰期描述的是一个样本如何变化,不是给所有内容设置的保质期。
先区分三件事
- **引用持续时间:**某页面从首次出现到不再出现的时间。
- **引用份额:**某页面在一组固定问题的全部引用中占多少。
- **更新时间:**页面真实内容发生变化的时间,而不是手工刷新日期。
Profound 2026 年研究跟踪了 88.3 万个页面和 7 个 AI 搜索引擎,并以特定“引用份额衰减”口径报告中位页面约 11 天损失一半引用份额。这个数字不是所有文章的寿命,更不是“每 11 天更新一次”的操作规则。不同主题、引擎、样本筛选和峰值定义都会改变结果。
半衰期描述的是一个样本如何变化,不是给所有内容设置的保质期。
两个实验要分开做
实验 A:自然持续时间
不改页面,只观察固定问题中引用是否出现、消失和重新出现。目标是建立自己的时间序列。
实验 B:真实更新的影响
选择内容相近页面,随机安排一部分做实质更新,另一部分保持不变。目标是比较更新组与对照组,而不是比较“更新前后”。
什么算实质更新
可以包括:
- 修正已经变化的价格、版本或限制;
- 增加新的第一手测试及方法;
- 替换已失效的截图和操作步骤;
- 补充新的官方来源;
- 修复读者无法完成任务的缺口。
不包括:
- 只改
dateModified; - 调整标点和同义词;
- 把年份从 2025 换成 2026;
- 没有事实变化却声称“全面更新”。
时间序列设计
| 项目 | 建议 |
|---|---|
| 页面 | 至少 30 个;按主题和页面类型分层 |
| 问题 | 固定问题集并保存版本 |
| 频率 | 每日或每周固定时点,保持一致 |
| 时长 | 至少 8–12 周;高波动主题更长 |
| 平台 | 独立记录,不合成一个“全网分数” |
| 指标 | 是否引用、引用份额、首次/最后出现、回归次数 |
| 事件 | 模型更新、索引变化、推广和页面改动 |
不要被“峰值”欺骗
如果某页面偶然只被引用一次,那么从 1 次降到 0 次就是“下降 100%”,但业务意义可能很小。应同时报告:
- 绝对引用次数;
- 有效回答总数;
- 引用率;
- 连续出现周期;
- 样本量和缺失数据。
不要只从最高点开始画下降曲线,这会产生峰值选择偏差。
更新实验
- 按主题、历史引用率和页面类型配对。
- 在每对中随机选择一个页面更新。
- 预先定义更新内容与完成时间。
- 对照页不做内容和推广变化。
- 继续使用同一问题集和采样环境。
- 比较两组“变化量之差”。
简化表示:
更新效果估计 =(更新组后期 − 更新组基线)−(对照组后期 − 对照组基线)这是一个帮助排除共同趋势的思路,不代表样本很小就能得到可靠因果结论。
实际例子
假设有 20 篇 SaaS 产品比较页,过去 4 周平均引用率如下:
| 组别 | 更新前 | 更新后 |
|---|---|---|
| 更新组 | 12% | 18% |
| 对照组 | 11% | 13% |
计算:
更新组变化 = 18% − 12% = 6 个百分点
对照组变化 = 13% − 11% = 2 个百分点
变化量之差 = 6 − 2 = 4 个百分点你可以说:
在本次页面、问题集和观察期内,更新组相对对照组多增加了 4 个百分点的引用率。
不能直接说:
更新内容必然让 AI 引用率提升 4%。
还需检查样本量、置信区间、模型变化、页面是否被重新抓取,以及更新组是否获得额外推广。
可直接复制的时间序列模板
## 引用持续与更新实验
- 实验 ID:
- 平台与模式:
- 问题集版本:
- 基线期:
- 更新日期:
- 观察期:
### 页面分组
| URL | 主题 | 历史引用率 | 分组 | 实质更新摘要 | 更新时间 |
|---|---|---:|---|---|---|
| | | | 更新/对照 | | |
### 周期记录
| 日期 | 问题 ID | URL | 是否引用 | 引用支持的主张 | 回答有效 | 异常事件 |
|---|---|---|---|---|---|---|
| | | | 是/否 | | 是/否 | |
### 汇总
| URL | 首次出现 | 最后出现 | 有效回答数 | 引用次数 | 引用率 | 回归次数 |
|---|---|---|---:|---:|---:|---:|
| | | | | | | |
### 组间比较
- 更新组基线:
- 更新组后期:
- 对照组基线:
- 对照组后期:
- 变化量之差:
### 结论状态
- [ ] 未发现稳定变化
- [ ] 观察到短期变化
- [ ] 观察到持续变化
- [ ] 数据不足以判断什么时候该更新
按照事实变化速度,而不是统一日历:
- **价格、政策、产品版本:**事实变化就更新。
- **实操教程:**界面或流程变化影响任务完成时更新。
- **行业研究:**有新样本、新方法或旧结论不再适用时更新。
- **稳定定义:**事实没有变化时,不需要为了“新鲜”重写。
实操清单
- 先定义引用份额和有效样本
- 固定问题集、平台和采样时间
- 同时记录消失与重新出现
- 避免从偶然峰值开始计算
- 真实更新,不只改日期
- 设置未更新对照组
- 记录重新抓取与模型事件
- 报告绝对次数、比例和样本量
- 不把单一研究的中位数当更新周期
资料与边界
- Profound:AI 引用的半衰期是 11 天:厂商研究,跟踪 88.3 万页面和 7 个引擎;“11 天”取决于其引用份额、样本筛选和分析方法,不可视为普遍定律。
附录 A:四类实验共用的证据等级
| 等级 | 证据 | 可以怎么说 |
|---|---|---|
| A | 随机对照、样本充分、预注册指标 | 在本实验范围内,处理与结果差异一致 |
| B | 有对照的前后观察 | 观察到相对变化,但仍可能有未控制因素 |
| C | 单组时间序列 | 变化与修改同期发生,不能确认因果 |
| D | 单次截图或个案 | 仅说明该时点发生过,不代表稳定规律 |
证据等级决定措辞强度。数据越弱,语言越要克制。
附录 B:实验发布前检查表
- 已写出 H0 与 H1
- 已明确唯一主要变量
- 已设置对照组或说明为何不能设置
- 已保存实验前基线
- 已预先定义主要指标和成功条件
- 已固定问题集、语言、地区、平台和模式
- 已记录模型或产品版本
- 已保存所有结果,包括失败和未引用样本
- 已区分访问、采用、引用、点击和转化
- 已披露样本量、缺失数据和异常事件
- 已写明结论适用范围
- 未把相关性写成平台机制或普遍因果
附录 C:实验文章推荐结构
# 实验标题
## 摘要
- 问题:
- 方法:
- 样本:
- 观察期:
- 主要结果:
- 限制:
## 背景与已有证据
## 假设
## 样本与分组
## 变量与指标
## 执行过程
## 完整结果
## 异常与缺失数据
## 结论
## 不能得出的结论
## 原始数据与复现说明
## 参考资料本章总结
第七章不是一组“最新技巧”,而是一套防止自我欺骗的方法:
- 把模糊主张拆成可观察问题;
- 一次只改变尽可能少的变量;
- 先写成功条件,再看结果;
- 保存全部样本,而不是挑最好看的截图;
- 把访问、引用、点击和转化分开;
- 用与证据强度相匹配的语言发布结论。
真正有价值的 GEO 内容,不是把别人的结论再说一遍,而是让读者看见你如何得到结论、哪里可能错、怎样才能复现。
参考资料总表
资料核验日期:2026 年 10 月 4 日。
- Google:针对 Google 搜索中的生成式 AI 功能优化网站
- GEO: Generative Engine Optimization(arXiv)
- Profound:Markdown 与 HTML 的 AI 机器人受控实验
- Profound:查询语言如何重塑 AI 引用
- Profound:AI 引用的半衰期是 11 天
阅读这些资料时要保留的边界
- Google 文档只代表其公开说明的 Google 搜索机制,不能代替其他平台文档。
- GEO 论文来自特定基准、策略与时期,不等于跨平台固定排名公式。
- Profound 的资料属于厂商研究,样本规模可提供重要观察,但仍需核对定义、筛选、产品覆盖和商业背景。
- 本章公式和评分模板用于实验组织与内部判断,不是任何平台公开的排名算法。
最后更新于