Tenten AIGEO
ブログに戻る
GEOの導入とパートナー選定比較・検討

AI可視性は施策前後で比較できる──GEOの効果をどう測るか

AI可視性は感覚ではなく、時系列で測定できる数値です。本稿では、GEO成果を捉える4つの中核指標、信頼できるベースラインの設定方法、30日後の比較、そして陥りやすい測定上の罠を解説します。

Tenten GEO 編集部公開日 2025-06-214 分で読めます
暗いフィルム調の光の中、低い位置から上昇する曲線で、測定されたGEO効果とAI可視性の伸びを表現したビジュアル

AI可視性は測定できます。そして、その結果はブランド側の自己認識と大きく食い違うことが少なくありません。B2B SaaS企業の初回ベンチマークでよく見られるのが、マーケティングチームは「ChatGPTで関連質問をすれば、自社名が出てくるはずだ」と考えていたものの、代表的な質問群で調べると、実際の言及率はごく低く、競合は安定して候補に挙がっていたというケースです。これは感覚で評価するものではありません。再現可能な数値として捉える必要があります。

なぜ、たまたま得られた回答を成果とみなせないのか

生成AIエンジンの回答には揺らぎがあります。同じ質問を3回行っても、表現や引用元が変わることがあります。昨日、自分のアカウントでブランド名が表示されたとしても、モデルが閲覧履歴の影響を受けた可能性もあれば、たまたま該当する出力が得られただけかもしれません。特定のアカウント、特定の質問、特定の言い回しで得た結果だけを根拠に「可視性がある」と判断するのは、わずかな試行だけでサイコロの公平性を決めるようなものです。成果を論じるには、測定条件を固定し、再現できる状態にする必要があります。

AI可視性を測る4つの中核指標

可視性は、特定の数値だけでは判断できません。複数の指標を組み合わせて見る必要があります。観測範囲が狭いと、過度に楽観的、あるいは悲観的な結論を導きかねません。ここでは、私たちがGEO監査で継続的に追跡している4つの指標を、自社でも運用できるよう定義とともに紹介します。

  1. 言及率(Citiation Rate):固定した代表質問のうち、AIの回答で自社ブランドやコンテンツが明示的に言及または引用された割合です。最も直感的に把握しやすい指標です。
  2. モデル内シェア(Share of Mode Voice):同じ質問セットにおいて、自社が競合と比べてどの程度言及されたかを示します。つまり、「同じ質問に対して、モデルがどのブランドをより多く取り上げるか」を測る指標です。
  3. 言及の文脈と掲載位置:最初に推奨されるのか、候補一覧に含まれるのか、それとも否定的な文脈や補足として触れられるだけなのかを確認します。商談への影響は、これらの扱われ方によって大きく異なります。
  4. 参照元の追跡可能性:ブランド名が出るだけでなく、自社サイトやコンテンツへの参照があるかを確認します。参照元をたどれるかどうかは、その露出が検索流入やその後の接点につながる可能性を見極める材料になります。

信頼できる施策前後比較には、ベースラインの厳密な固定が欠かせない

施策前後の比較で最も誤りが生じやすいのは、結果そのものよりベースラインの設定です。ベースラインを厳密に固定しなければ、その後の成長率に意味はありません。私たちは、質問、エンジンとアカウント条件、サンプル数を固定します。質問セットは通常40〜80件で、用語、比較、課題場面、ブランドを意識した質問を含め、確定後は変更しません。各質問はクリーンな環境で複数回実行し、ChatGPT、Perplexity、Gemini、Google AI Overviewsなど複数のエンジンで記録します。エンジン間で結果が一致しないことは珍しくなく、特定のエンジンだけを見れば判断を誤る可能性があるためです。

固定した質問セットを複数のAIエンジンで反復実行し、4つの指標で施策前後のAI可視性を比較するフロー図
固定した質問セット、複数エンジンでの反復検証、4つの指標による施策前後の比較が、信頼できるAI可視性測定の基本です。

30日後の比較結果をどう読むか

開発者向けツールを提供するクライアントの事例から、比較レポートの読み方を見てみましょう。ベースラインでは、60問を4つのエンジンで各5回実行しました。施策前のブランド全体の言及率は約11%。比較質問、たとえば「XとYは、どの規模のチームに適しているか」ではほぼゼロで、参照元を追跡できる回答はさらに少ない状態でした。多くはブランド名に触れるだけで、サイトやコンテンツへの参照はありません。つまり、モデルはブランドの存在を認識しているものの、推奨回答に引用できる十分な材料を持っていなかったのです。

続く30日間で、比較情報の不足を補う構成を整え、製品の位置づけと適した利用場面を明快な文章にまとめ、クローラーが内容を正しく取得できない原因となっていた技術的な問題を修正しました。その後、同じ質問セットを同じ条件で再測定したところ、全体の言及率は27%まで上昇。ほぼゼロだった比較質問でも安定して言及されるようになり、参照元を追跡できる回答も増えました。重要なのは、特定の数値が見栄えよく伸びたことではありません。4つの指標が同じ方向へ動いたことで、「たまたま良い回答が出ただけ」という可能性を排除できた点です。

可視性向上を示す最も信頼性の高いシグナルは、固定した測定方法のもとで、独立した複数の指標が同時に上昇することです。特定の質問で特定の指標だけが急上昇しても、十分な根拠にはなりません。

特定の回答に惑わされない──よくある測定の罠

回答のスクリーンショットを成果として提示し、隔週で別の画面を撮って「順位が下がった」と判断するチームを、私たちは数多く見てきました。生成AIの回答にはもともと揺らぎがあるため、スクリーンショットを意思決定の根拠にすると、出力のばらつきに振り回されます。次に多い罠は、特定のエンジンだけを見ることです。Perplexityでは参照元として引用され、ChatGPTでは文章中で言及されるなど、エンジンによって扱い方は異なります。自社に有利なエンジンだけを選べば、可視性を過大評価することになります。さらに、自社が勝ちやすい偏った質問だけを設定しても、その伸びは実際の市場での評価を表しません。

見落としやすい点として、可視性とコンバージョンは同じではありません。AIに引用されることはファネル上流の接点であり、比較検討の候補に入る可能性は高めますが、商談や受注を保証するものではありません。そのため、可視性指標と、その後のWebサイト流入や行動は分けて確認します。露出の増加だけで業績の変化を説明したり、反対に業績の変化だけでAI可視性を評価したりすることは避けるべきです。

測定結果を施策につなげる

測定するだけで可視性が高まるわけではありません。測定によって分かるのは、どこに課題があるかです。モデルがブランドを認識していないのか、認識はしていても引用できる材料がないのか、それともコンテンツはあるのにモデルが取得できないのか。原因によって必要な対策はまったく異なり、打ち手を誤れば四半期を無駄にしかねません。ベースラインを設定し、指標を明確に定義すれば、その後のコンテンツ改善や技術調整が有効だったかを判断できるようになります。TentenのAI可視性モニタリングが行うのも、AI上での見え方を、読み取れて追跡できる推移に変えることです。現在地と課題の種類を把握したい方は、30分のGEO診断をご予約ください。実際の質問を使ってベースラインを測定します。

よくある質問

AI可視性は、具体的にどのように測定しますか?
固定した代表質問のセットを用意し、ログインしていないクリーンな環境で複数のAIエンジンを反復実行します。そのうえで、言及率、モデル内シェア、言及の文脈、参照元の追跡可能性という4つの指標を集計します。特定のスクリーンショットではなく、再現可能な平均値で評価することが重要です。
同じ質問でも、AIの回答が変わるのはなぜですか?
生成AIエンジンの出力にはもともと揺らぎがあり、表現や参照元が変化するほか、アカウントの状態から影響を受ける場合もあります。そのため、特定の問い合わせ結果だけでは有効な測定になりません。条件を固定して再測定を行い、言及率の平均を確認する必要があります。
AI可視性の施策前後比較には、どのくらいの期間が必要ですか?
信頼できるベースラインの構築には約1〜2週間かかります。施策の実施後は通常30日を観測期間とし、同じチームメンバーと条件で再測定します。重視すべきなのは、特定の質問で特定の数値だけが跳ねることではなく、4つの指標が同じ方向へ動くことです。

次の一手へ

あなたのブランドはAIの回答にどれだけ登場していますか?

30分のGEO診断で、主要AIエンジンにおける可視性の課題と、優先して改善すべきポイントを確認します。

30分の診断を予約