平台指南
Perplexity:爬虫、用户访问和来源观察
先说结论
Perplexity 的优势之一是来源链接较显眼,因此它很适合做“答案—主张—来源”的人工核验。但可见引用不等于完整检索过程:你看到的是最终展示的来源,不是系统考虑过的所有候选页面。
区分两个访问角色
官方文档区分:
PerplexityBot:自动抓取并支持搜索索引;Perplexity-User:响应用户请求访问页面。
它们的目的和控制方式不同。若使用严格的 WAF,应结合 Perplexity 官方公布的 IP 数据核验请求,而不是只相信可以伪造的 User-Agent。
三步观察法
第一步:检查访问
robots.txt是否允许预期的机器人;- CDN/WAF 是否拦截官方请求;
- 核心页面是否返回 200;
- 正文是否无需复杂交互即可读取;
- 日志里是否有成功和失败记录。
第二步:拆解答案
把一段答案拆成具体主张:
| 主张 | 是否准确 | 引用来源 | 来源是否真的支持 |
|---|---|---|---|
| 产品支持代码导出 | 是 | 产品文档 | 是 |
| 免费版包含导出 | 否 | 第三方旧评测 | 否,已过期 |
| 适合非技术用户 | 部分准确 | 官网首页 | 只有营销表述 |
这一步能发现“有引用但引用不支持结论”的情况。
第三步:决定动作
- 自有事实缺失:补充产品页或帮助中心;
- 自有事实冲突:统一名称、价格、版本与限制;
- 第三方内容过期:公开身份联系作者并提供证据;
- 答案无依据:记录原文和日期,不猜测内部原因;
- 来源选择波动:扩大样本,不凭单次回答判断趋势。
来源观察模板
## Perplexity 来源核验
- 问题 ID:
- 问题:
- 测试日期 / 地区 / 语言:
- 模式或产品入口:
| 答案主张 | 结论 | 引用 URL | 来源原文支持度 | 新旧程度 | 行动 |
|---|---|---|---|---|---|
| | 正确/错误/未知 | | 完全/部分/不支持 | 当前/过期/未知 | |
- 未被引用但应核验的权威页:
- 需要修复的自有页面:
- 结论:无问题 / 有问题 / 数据不足不要把第三方经验包装成官方规则
目前不能仅凭行业文章声称:
- 添加
llms.txt会提升 Perplexity 引用; - 某个 Schema 会增加引用概率;
- 某种段落长度是固定偏好;
- 机器人访问一次就会很快出现在答案中。
引用可见,是核验的起点,不是算法透明的终点。
最后更新于