平台指南
ChatGPT Search:可访问性、内容与引用检查
先说结论
ChatGPT 的搜索访问、模型训练和用户触发访问是不同用途。网站希望具备进入 ChatGPT Search 的机会,应重点检查 OAI-SearchBot,而不是把所有 OpenAI 机器人混为一谈。
三种角色不要混淆
| 角色 | 主要用途 | 站长决策 |
|---|---|---|
OAI-SearchBot | 支持 ChatGPT 搜索发现与结果展示 | 是否允许搜索发现 |
GPTBot | 可能用于改进或训练基础模型 | 是否允许训练用途 |
ChatGPT-User | 用户动作触发的页面访问 | 评估公开页面与交互安全 |
因此,“允许搜索,但不允许训练”在策略上是可以分别表达的。
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /这只是策略示例,不是所有网站的统一答案。发布前应由业务、技术与合规负责人共同确认。
四层检查法
第一层:政策
先回答:
- 哪些公开页面允许用于搜索?
- 是否允许潜在训练用途?
- 哪些页面只能由登录用户访问?
- 产品是否包含客户数据、私有项目或未发布信息?
真正私密的内容必须使用身份认证和授权,不能靠 robots.txt 保密。
第二层:网络
检查 CDN、WAF、Bot 管理和速率限制。robots.txt 写着允许,只说明表达了许可,不证明请求真的成功。
日志至少记录:
time | user_agent | source_ip | url | status | response_size重点排查 403、429、验证码、重定向循环和空响应。
第三层:页面
让关键事实直接出现在可读取正文中:
- 产品是什么;
- 适合谁;
- 价格与计费周期;
- 功能、限制和版本;
- 证据、日期和责任人。
不要只把重要信息放在登录后的控制台、鼠标悬停提示或客户端异步请求里。
第四层:答案与引用
对每次测试同时记录:
- 是否启用了搜索;
- 问题原文;
- 日期、语言和地区;
- 是否提及品牌;
- 对品牌的描述是否准确;
- 引用了哪些 URL;
- 是否产生来自 ChatGPT 的访问;
- 访问是否完成注册或咨询。
OpenAI 的发布者说明提到,ChatGPT 推荐链接可使用 utm_source=chatgpt.com 识别。即使如此,也不要把“出现引用”“获得点击”和“完成转化”合并成一个指标。
实际例子
假设用户问:
“适合独立开发者、能导出 Next.js 代码的 AI 建站工具有哪些?”
回答提到了你的品牌,却说“不能导出代码”。检查后发现:
- 首页说“完全拥有代码”;
- 定价页没有导出规则;
- 帮助中心旧文章写着“暂不支持”;
- 新版本已经支持导出。
这不是先改标题的问题,而是品牌事实冲突。正确顺序是:确认当前产品规则 → 指定权威页 → 更新旧文档 → 增加版本和日期 → 再以相同问题复测。
当 AI 说错你的产品时,先检查你自己是否说过三个版本。
ChatGPT Search 检查模板
## ChatGPT Search 观察记录
- 问题 ID:
- 问题原文:
- 测试日期:
- 语言 / 地区:
- 是否明确启用搜索:是 / 否 / 不确定
- 品牌是否出现:是 / 否
- 描述是否准确:准确 / 部分准确 / 错误
- 引用 URL:
- 错误事实:
- 对应权威页面:
- 可能修复动作:
- 复测日期:
- 结论:无问题 / 有问题 / 数据不足边界
允许 OAI-SearchBot 只是搜索发现的技术条件之一,不保证抓取、收录、引用、推荐次序或流量。OpenAI 没有公开可供网站操纵的完整排序公式。
最后更新于