GEO

ROBOTS 政策 · 官方來源矩陣

決定你的 robots.txt 要如何對待 AI 爬蟲。

把搜尋曝光、模型訓練與使用者觸發擷取分開判斷;工具只會產生供應商現行文件明確表示可由 robots.txt 控制的群組。

先選營運立場

預設會填入所有可控 token;複製前仍可逐項調整。

控制矩陣

每個 token,都做明確決定

只有標示「可控制」的列會進入草稿;提示列說明使用者觸發行為,但不會產生誤導規則。

OpenAIOAI-SearchBot
搜尋探索可控制

OpenAI 搜尋爬蟲,用於在 ChatGPT 搜尋中呈現並連結網站。

與 GPTBot 獨立;允許它不等於允許訓練爬取。

OAI-SearchBot: 你的指令
OpenAIGPTBot
模型訓練可控制

OpenAI 爬蟲,內容可能用於訓練基礎模型。

Disallow 是針對未來內容的訊號,與 ChatGPT 搜尋收錄分開。

GPTBot: 你的指令
OpenAIChatGPT-User
使用者擷取僅供提示

由使用者操作觸發的 OpenAI 擷取器,不是自動網路爬蟲。

OpenAI 表示 robots.txt 可能不適用,且它不決定搜尋收錄,因此不產生規則。

僅供提示
AnthropicClaudeBot
模型訓練可控制

Anthropic 爬蟲,網路內容可能投入模型訓練。

Anthropic 現行文件表示其 bots 遵守 robots.txt。

ClaudeBot: 你的指令
AnthropicClaude-SearchBot
搜尋探索可控制

Anthropic 搜尋爬蟲,用於改善搜尋結果品質。

這項決定應與 ClaudeBot 的訓練存取分開。

Claude-SearchBot: 你的指令
AnthropicClaude-User
使用者擷取可控制

為使用者請求而觸發的 Anthropic 擷取器。

Anthropic 目前記載可用 robots.txt 控制;封鎖可能降低使用者要求的網路擷取。

Claude-User: 你的指令
GoogleGoogle-Extended控制 token,非 HTTP User-Agent
訓練 + grounding可控制

Google 用於 Gemini 訓練及 Google Search grounding 的控制 token。

它沒有獨立 HTTP User-Agent,也不影響 Google 搜尋收錄或排名。

Google-Extended: 你的指令
PerplexityPerplexityBot
搜尋探索可控制

Perplexity 搜尋爬蟲,用於呈現及連結網站。

Perplexity 表示它不用於基礎模型訓練。

PerplexityBot: 你的指令
PerplexityPerplexity-User
使用者擷取僅供提示

Perplexity 的使用者觸發擷取器,不是爬站或訓練 bot。

Perplexity 表示它通常忽略 robots.txt,因此不產生規則。

僅供提示

部署邊界

產生內容刻意保持窄範圍。請把它當成審查素材,而非直接覆蓋檔案。

  1. 01將草稿合併到現有 robots.txt;整份替換可能刪掉其他搜尋爬蟲規則。
  2. 02發布前再次確認供應商文件;名稱、用途與 robots 行為都可能改變。
  3. 03即使 robots.txt 允許,WAF、CDN、主機規則或 IP 封鎖仍可能拒絕爬蟲。
  4. 04robots.txt 不保證存取,也不保證索引、模型能見度、提及或引用;使用者觸發擷取器可能有不同處理方式。

發布前須知

Allow 能保證 AI 引擎存取或引用網站嗎?

不能。robots.txt 是爬蟲偏好訊號;網路層控制、供應商系統、相關性與產品行為是另外的條件。

為什麼輸出沒有 ChatGPT-User 和 Perplexity-User?

官方文件描述的使用者觸發行為,可能不適用或通常忽略 robots.txt。產生規則會誇大可控程度。

可以用輸出直接覆蓋現有 robots.txt 嗎?

不可以。只把審核過的群組合併進現有檔案,保留搜尋與資產規則,再測試正式環境回應。