Perplexity 引用你的内容,只有两个前提:爬虫能够抓取页面,系统能够理解页面在讲什么。很多网站在第一关就被挡住了,却毫无察觉。robots.txt 中一条带通配符的规则、CDN 默认防护,或未获放行的 user agent,都足以让你彻底从 Perplexity 的回答中消失。允许 PerplexityBot 抓取只是最低门槛,并不保证一定获得引用;但如果连这一步都没做到,后续所有 GEO 工作都无从谈起。
先把基础概念理清:Perplexity 会派出两类行为完全不同的爬虫。
不少人以为 Perplexity 只有一个爬虫,配置时只处理一个名称,便认为网站已经完全开放或关闭,结果往往与预期相反。Perplexity 官方文档列出了两个 agent:PerplexityBot 负责建立搜索索引,并判断页面是否有资格出现在结果中,它会遵守 robots.txt;Perplexity-User 则会在用户提问时即时抓取特定 URL。由于这种抓取是对用户直接操作的响应,通常不受 robots.txt 限制。这个差异非常关键:在 robots.txt 中屏蔽爬虫,可以阻止页面进入索引,却未必能阻止即时抓取。
- PerplexityBot:用于建立并更新 Perplexity 的搜索索引,判断你的页面能否进入候选信息源,并遵守 robots.txt 规则。
- Perplexity-User:用户提问时即时访问特定页面。这是响应用户操作的抓取行为,通常不会应用 robots.txt 的屏蔽规则。
- 验证身份:两类爬虫都可能被冒充。不要只看 user agent 字符串,还应通过 Perplexity 公布的 IP 地址段或反向 DNS 进行核验,确认其可解析回 perplexity.ai。
- 常见误区:在 robots.txt 中允许抓取,并不代表页面一定会被抓取或引用,只代表它有资格进入候选池。
robots.txt:最容易因为一行配置误伤全站的地方
我们为客户开展 GEO 审核时,最常见、也最致命的第一处问题就是 robots.txt。有的网站通过 User-agent: * 与 Disallow: / 的组合屏蔽全站,上线后却忘了开放;有的网站误封了 /blog/ 或 /resources/ 等核心内容目录;更隐蔽的问题则来自 Cloudflare、Vercel 等平台的 Bot 管理或防火墙规则。即使 robots.txt 没有问题,这些规则也可能在边缘层直接向 PerplexityBot 返回 403。此类问题不会主动弹出错误提示,只会让你悄无声息地缺席 Perplexity 的回答。最低限度的正确配置其实很简单:在网站根目录的 robots.txt 中明确允许 PerplexityBot,并指向 sitemap。
- 明确授权:单独写入 User-agent: PerplexityBot,并在下一行配置 Allow: /,避免受到 User-agent: * 屏蔽规则的影响。
- 指定 sitemap:在文件末尾添加 Sitemap: https://yourdomain/sitemap.xml ,让爬虫一次获得完整的 URL 列表。
- 检查 CDN 与 WAF:确认 Cloudflare、Vercel 和 AWS WAF 没有在边缘层统一屏蔽所有已知的 AI 爬虫。
- 不要一边设置 noindex,一边期待获得引用:如果页面的 robots meta 中带有 noindex,就等于同时告诉搜索引擎和 Perplexity“不要收录我”。
- 通过日志验证:在服务器访问日志中搜索 PerplexityBot,确认它确实来过,并且得到的是 200,而不是 403 或 429。
llms.txt:值得花十分钟配置,但不要把它当成引擎收录入口
llms.txt 是 Answer.AI 的 Jeremy Howard 在 2024 年提出的一项建议:在网站根目录放置一个 /llms.txt Markdown 文件,用精简的结构列出最重要的页面及其说明,帮助大语言模型快速理解网站重点。这个想法很好,但必须如实看待它的现状——截至本文发布时,包括 Perplexity 和 Google 在内的主流引擎,都未公开表示会实际读取 llms.txt。Google 的 John Mueller 也曾公开表示,没有搜索引擎将它作为抓取或排名依据。那还要不要做?我的建议是做,但要明确它的作用。它的成本极低,一个文件就能整理支柱内容、产品说明和联系信息;对于愿意读取它的 agent,或未来可能支持它的引擎,它可以提供一层清晰的内容入口。更现实的价值在于,编写 llms.txt 会迫使你想清楚“哪些页面才是核心页面”,这个过程本身就有助于 GEO。不要把全部预算和期待都押在它上面。真正决定 Perplexity 能否抓取你的网站的,仍然是 robots.txt 和干净的 HTML。

能被抓取只是拿到入场券,关键是让 Perplexity 选择你作为信息源
Perplexity 回答问题时,通常只会引用少数信息源。它更偏好与问题直接对应、能够被清晰提取的段落。如果真正的答案藏在第八段,前面堆满“随着 AI 的发展”之类的铺垫;或者一个段落同时讨论三件事,引擎就很难准确截取并引用你的内容。先给结论,一个段落只讲一个重点,让标题本身能够回答问题。这些并非单纯追求简洁的写作偏好,而是会直接影响内容能否入选信息源。
- 答案前置:每一节的第一句话先给出结论,再补充原因和具体做法。
- 让标题对应问题:用 H2 和 H3 写出用户真正会提出的问题,方便引擎与查询意图匹配。
- 段落能够独立成立:每段只讲一个关键点,不以读者看过上一段为前提,确保内容可以被单独引用。
- 添加结构化数据:文章关联 Article,问答区域使用 FAQPage schema,帮助引擎确认内容类型与问答形式相匹配。
- 提供数字与背景信息:可核验的事实比形容词更容易获得引用。
内容时效性:Perplexity 尤其看重“最新更新”
Perplexity 将自己定位为处理当前信息和时效性问题的工具,因此明显偏好较新的内容。这意味着两件事:第一,页面必须如实提供 dateModified,不能让去年更新过的文章看起来像三年前的旧内容;第二,核心页面必须保持真实的更新节奏,补充新的数字和实践方法,而不是只改日期欺骗引擎。我们为客户维护内容引擎时,会定期回访高价值页面,补充最新的执行经验。这会切实影响 Perplexity 对信息源的选择。
能否获得 Perplexity 引用,90% 取决于技术基础:内容能被抓取、可以阅读,而且足够新。再好的内容,如果爬虫进不去,也不会有任何机会。— Tenten GEO Consulting Team
上线前的 30 分钟自查清单
- 在浏览器中打开“你的域名/robots.txt”,确认没有误用 Disallow: / 屏蔽全站,并且已明确允许 PerplexityBot。
- 在服务器日志中搜索 PerplexityBot,确认近期确实有访问记录,并返回 200。
- 检查 CDN 和 WAF 的 Bot 规则,确认 AI 爬虫没有在边缘层被屏蔽。
- 随机检查三篇核心文章,确认首段是否先给结论,标题是否对应用户真正关心的问题。
- 确认 sitemap 可以正常访问、dateModified 准确无误,并将 llms.txt 作为内容地图。
这份清单里的大多数问题,一个下午就能修好。真正困难的是发现自己漏掉了什么,尤其是藏在 CDN 规则和平台默认屏蔽策略中的问题;如果不主动检查,你根本看不到它们。想确认 Perplexity 目前能否抓取你的网站,以及你错过了哪些获得引用的机会,可以前往 /contact 预约一次 30 分钟 GEO 诊断。我们会直接检查网站的 robots、日志与内容结构,并逐项列出缺口。



