Tenten AIGEO
ブログに戻る
AIプラットフォームでの可視性導入・実行

Perplexityに見つけてもらうには? robots.txt、llms.txt、クローラー設定の実践ガイド

Perplexityに引用されるには、まず自社サイトを正しくクロールしてもらう必要があります。PerplexityBotとPerplexity-Userの違い、robots.txtとllms.txtの適切な書き方、引用元に選ばれやすいコンテンツ設計を整理し、公開前に確認できるクローラー設定チェックリストも紹介します。

Tenten GEO 編集部公開日 2024-09-075 分で読めます
幾層もの半透明な保護レイヤーを柔らかな光が通り抜け、輝くノードへ到達する抽象的なビジュアル。PerplexityのクローラーがWebサイトのコンテンツを円滑に取得し、引用する様子を表している。

Perplexityに引用されるための前提は、ページを取得できることと、その内容を理解できることの2つだけです。しかし、多くのサイトは最初の段階でつまずいています。ワイルドカードを含むrobots.txtの1行、CDNのデフォルト保護、許可されていないユーザーエージェント。どれか1つでも該当すれば、Perplexityの回答から完全に姿を消しかねません。PerplexityBotを許可することは最低条件であり、引用を保証するものではありません。それでも、この条件を満たさなければ、その後のGEO施策はすべて机上の空論になります。

まず押さえておきたいのは、Perplexityが挙動のまったく異なる2種類のクローラーを使っていることです。

Perplexityのクローラーは1種類だけだと考え、設定時に1つの名称だけをブロックして「閉じた」「開放した」と判断するケースがあります。しかし、それでは意図した結果になりません。Perplexityの公式文書には2つのエージェントが記載されています。PerplexityBotは検索インデックスを構築し、ページを検索結果の候補にできるか判断する役割を持ち、robots.txtに従います。一方、Perplexity-Userは、ユーザーが質問した際に特定のURLを即時取得するために送信されます。ユーザーの直接的な操作に応じたアクセスであるため、通常はrobots.txtによる制限の対象になりません。この違いは重要です。robots.txtでクローラーを遮断すればインデックス登録は防げますが、リアルタイムの取得まで止められるとは限りません。

  • PerplexityBot:Perplexityの検索インデックスを構築・更新し、ページを引用元候補として扱えるか判断します。robots.txtのルールに従います。
  • Perplexity-User:ユーザーが質問した際に、特定のページへ即時アクセスします。ユーザーの操作に応じたアクセスであるため、一般にrobots.txtによるブロックは適用されません。
  • 正当性の確認:どちらも偽装される可能性があります。ユーザーエージェント文字列だけで判断せず、Perplexityが公開するIPレンジ、または逆引きDNS(perplexity.aiへ解決されること)で確認してください。
  • よくある誤解:robots.txtで許可しても、必ずクロールや引用が行われるわけではありません。引用元の候補に入る資格を得るだけです。

robots.txt:たった1行の設定ミスで、クロールを止めてしまう場所

クライアントのGEO監査で、最初に見つかる致命的な問題の多くがrobots.txtです。User-agent: *とDisallow: /を組み合わせてサイト全体を遮断し、公開後も解除していないケースや、/blog/、/resources/といった主要コンテンツのディレクトリをブロックしているケースがあります。さらに見つけにくいのが、CloudflareやVercelなどのBot管理・ファイアウォール設定です。robots.txtに問題がなくても、エッジ層でPerplexityBotに403を返すことがあります。この種の問題はエラーとして通知されず、Perplexityの回答に自社サイトが出てこないだけです。最低限の設定は難しくありません。ルートディレクトリのrobots.txtでPerplexityBotを明示的に許可し、サイトマップの場所を指定します。

  • 許可を明示する:User-agent: PerplexityBotに続けてAllow: /を記述し、User-agent: *のブロックルールに巻き込まれないようにします。
  • サイトマップを指定する:ファイル末尾にSitemap: https://yourdomain/sitemap.xmlを追加し、クローラーがURL一覧をまとめて取得できるようにします。
  • CDNとWAFを確認する:Cloudflare、Vercel、AWS WAFが、既知のAIクローラーをエッジ層で一律にブロックしていないか確認します。
  • 引用を望むページにnoindexを付けない:robots metaにnoindexがあれば、検索エンジンとPerplexityの双方に「登録しないでほしい」と伝えることになります。
  • ログで検証する:サーバーのアクセスログでPerplexityBotを検索し、実際にアクセスがあり、403や429ではなく200を返しているか確認します。

llms.txt:10分で用意する価値はある。ただし、検索エンジンへの登録窓口ではない

llms.txtは、Answer.AIのJeremy Howardが2024年に提案した仕組みです。WebサイトのルートディレクトリにMarkdown形式の/llms.txtを置き、重要なページとその説明を簡潔な構造で並べることで、大規模言語モデルがサイトの要点を把握しやすくします。発想は優れていますが、2024年9月7日時点で、PerplexityやGoogleを含む主要な検索エンジンはllms.txtを実際に利用すると公表していません。GoogleのJohn Muellerも、クロールやランキングの根拠としてllms.txtを利用する検索エンジンはないと公に述べています。それでも作るべきでしょうか。おすすめは「役割を正しく理解したうえで作る」です。コストは極めて低く、1つのファイルにピラーコンテンツ、製品説明、問い合わせ情報を整理できます。llms.txtを読むエージェントや、将来対応するかもしれないエンジンに対して、情報を明快に提示する補助レイヤーにもなります。より実務的な価値は、「どのページが中核なのか」を整理する過程そのものにあります。これはGEOにも有効です。ただし、予算や期待をllms.txtだけに集中させるべきではありません。Perplexityがページを取得できるかどうかを実際に左右するのは、robots.txtとクリーンなHTMLです。

Perplexityの2種類のクローラーが、インデックス作成とリアルタイム取得という別々の経路をたどり、robots.txtとllms.txtが引用への入口となることを示したインフォグラフィック。
PerplexityBotはインデックス作成、Perplexity-Userはリアルタイム取得を担い、共通する最初の入口がrobots.txtです。

クロールされるだけでは不十分。重要なのは「引用元に選ばれる」こと

Perplexityが1つの質問に対して引用する情報源は、数件に限られることが一般的です。選ばれやすいのは、質問に直接答え、内容をきれいに切り出せる文章です。肝心の答えが8段落目に埋もれ、その前に「AIの台頭に伴い」といった前置きが続いていたり、1つの段落で3つの論点を扱っていたりすると、エンジンは引用箇所を抽出しにくくなります。結論を先に置く、1段落につき1つの論点に絞る、見出し自体を問いへの答えにする。こうした書き方は単なる文体上の好みではなく、引用元として選ばれる可能性を直接左右します。

  • 結論を先に示す:各セクションの最初の1文で答えを提示し、その理由や具体的な方法を後に続けます。
  • 見出しを問いにする:ユーザーが実際に検索・質問する表現をH2やH3に使い、エンジンがクエリと対応付けやすくします。
  • 段落だけで意味が通じるようにする:1段落では1つの要点だけを扱い、前段落を読んでいなくても理解できる形にします。単独で引用しやすくなります。
  • 構造化データを実装する:記事にはArticle、Q&A部分にはFAQPageのschemaを使い、コンテンツの種類とQ&Aの対応関係をエンジンが確認できるようにします。
  • 数値と文脈を示す:形容詞による評価よりも、検証可能な事実のほうが引用されやすくなります。

鮮度:Perplexityは「最新の更新」を重視する

Perplexityは、現在進行中の話題や時間の影響を受ける質問に答えるツールとして位置付けられており、新しいコンテンツを明確に重視します。ここで必要なのは2点です。まず、ページに正確なdateModifiedを設定し、昨年更新した記事が3年前の情報に見えないようにします。次に、主要ページを実際の更新サイクルに乗せ、新しい数値や実務上の知見を加えます。日付だけを書き換えてエンジンを欺こうとしてはいけません。私たちがクライアントのコンテンツ運用を支援する際も、価値の高いページを定期的に見直し、最新の実行経験を追記しています。こうした継続的な更新は、Perplexityの引用元選定に実務上の差を生みます。

Perplexityに引用されるかどうかは、90%が技術面で決まります。クロールできること、読み取りやすいこと、十分に新しいことです。どれほど内容が優れていても、クローラーがページへ到達できなければ引用される可能性はありません。Tenten GEO Consulting Team

公開前に30分でできるセルフチェック

  1. ブラウザで「自社ドメイン/robots.txt」を開き、Disallow: /でサイト全体を誤ってブロックしていないこと、PerplexityBotを明示的に許可していることを確認します。
  2. サーバーログでPerplexityBotを検索し、最近アクセスがあり、200を返していることを確認します。
  3. CDNとWAFのBotルールを確認し、エッジ層でAIクローラーをブロックしていないことを確かめます。
  4. 主要記事を3本抽出し、第1段落で結論を先に示しているか、見出しが実際の問いに対応しているか確認します。
  5. サイトマップへ正常にアクセスできること、dateModifiedが正しいことを確認し、コンテンツマップとしてllms.txtを設置します。

このチェックリストの大半は、半日あれば修正できます。難しいのは、何を見落としているかを把握することです。特にCDNのルールやプラットフォームのデフォルト設定に潜むブロックは、自分から調べなければ見つかりません。現在Perplexityが自社サイトを取得できる状態にあるか、どこで引用機会を逃しているかを確認したい場合は、/contactから30分のGEO診断をご予約ください。robots.txt、ログ、コンテンツ構造を実際に確認し、不足している点を1つずつ整理してお伝えします。

よくある質問

Perplexityのクローラー名は? robots.txtではどう許可すればよいですか?
Perplexityには主に2種類のクローラーがあります。PerplexityBotは検索インデックスを担当し、robots.txtに従います。Perplexity-Userは、ユーザーが質問した際にリアルタイムでページを取得します。許可するには、robots.txtにUser-agent: PerplexityBotとAllow: /を記述し、サイトマップの場所も指定してください。
llms.txtはPerplexityに有効ですか? 用意する必要はありますか?
現時点で、Perplexityはllms.txtを利用すると公表していません。公式規格というより、AI向けのコンテンツマップを提案する仕組みです。作成コストが極めて低く、主要ページの整理にも役立つため、用意することをおすすめします。ただし、実際にクロールできるかどうかを左右するのは、引き続きrobots.txtとクリーンなHTMLです。
robots.txtで許可しているのに、Perplexityがクロールできないのはなぜですか?
CDNやWAFがエッジ層でAIクローラーをブロックしている、ページにnoindexが設定されている、サイトマップへアクセスできない、といった原因が考えられます。サーバーログでPerplexityBotを検索し、403や429ではなく200を返しているか確認すれば、問題がどの層にあるか切り分けられます。

次の一手へ

あなたのブランドはAIの回答にどれだけ登場していますか?

30分のGEO診断で、主要AIエンジンにおける可視性の課題と、優先して改善すべきポイントを確認します。

30分の診断を予約