AIEO
平台指南

Perplexity:爬虫、用户访问和来源观察

先说结论

Perplexity 的优势之一是来源链接较显眼,因此它很适合做“答案—主张—来源”的人工核验。但可见引用不等于完整检索过程:你看到的是最终展示的来源,不是系统考虑过的所有候选页面。

区分两个访问角色

官方文档区分:

  • PerplexityBot:自动抓取并支持搜索索引;
  • Perplexity-User:响应用户请求访问页面。

它们的目的和控制方式不同。若使用严格的 WAF,应结合 Perplexity 官方公布的 IP 数据核验请求,而不是只相信可以伪造的 User-Agent。

三步观察法

第一步:检查访问

  • robots.txt 是否允许预期的机器人;
  • CDN/WAF 是否拦截官方请求;
  • 核心页面是否返回 200;
  • 正文是否无需复杂交互即可读取;
  • 日志里是否有成功和失败记录。

第二步:拆解答案

把一段答案拆成具体主张:

主张是否准确引用来源来源是否真的支持
产品支持代码导出是产品文档是
免费版包含导出否第三方旧评测否,已过期
适合非技术用户部分准确官网首页只有营销表述

这一步能发现“有引用但引用不支持结论”的情况。

第三步:决定动作

  • 自有事实缺失:补充产品页或帮助中心;
  • 自有事实冲突:统一名称、价格、版本与限制;
  • 第三方内容过期:公开身份联系作者并提供证据;
  • 答案无依据:记录原文和日期,不猜测内部原因;
  • 来源选择波动:扩大样本,不凭单次回答判断趋势。

来源观察模板

## Perplexity 来源核验

- 问题 ID:
- 问题:
- 测试日期 / 地区 / 语言:
- 模式或产品入口:

| 答案主张 | 结论 | 引用 URL | 来源原文支持度 | 新旧程度 | 行动 |
|---|---|---|---|---|---|
| | 正确/错误/未知 | | 完全/部分/不支持 | 当前/过期/未知 | |

- 未被引用但应核验的权威页:
- 需要修复的自有页面:
- 结论:无问题 / 有问题 / 数据不足

不要把第三方经验包装成官方规则

目前不能仅凭行业文章声称:

  • 添加 llms.txt 会提升 Perplexity 引用;
  • 某个 Schema 会增加引用概率;
  • 某种段落长度是固定偏好;
  • 机器人访问一次就会很快出现在答案中。

引用可见,是核验的起点,不是算法透明的终点。


最后更新于

本页目录