OAI-SearchBotOpenAI 搜尋爬蟲,用於在 ChatGPT 搜尋中呈現並連結網站。
與 GPTBot 獨立;允許它不等於允許訓練爬取。
ROBOTS 政策 · 官方來源矩陣
把搜尋曝光、模型訓練與使用者觸發擷取分開判斷;工具只會產生供應商現行文件明確表示可由 robots.txt 控制的群組。
預設會填入所有可控 token;複製前仍可逐項調整。
控制矩陣
只有標示「可控制」的列會進入草稿;提示列說明使用者觸發行為,但不會產生誤導規則。
OAI-SearchBotOpenAI 搜尋爬蟲,用於在 ChatGPT 搜尋中呈現並連結網站。
與 GPTBot 獨立;允許它不等於允許訓練爬取。
GPTBotOpenAI 爬蟲,內容可能用於訓練基礎模型。
Disallow 是針對未來內容的訊號,與 ChatGPT 搜尋收錄分開。
ChatGPT-User由使用者操作觸發的 OpenAI 擷取器,不是自動網路爬蟲。
OpenAI 表示 robots.txt 可能不適用,且它不決定搜尋收錄,因此不產生規則。
ClaudeBotAnthropic 爬蟲,網路內容可能投入模型訓練。
Anthropic 現行文件表示其 bots 遵守 robots.txt。
Claude-SearchBotAnthropic 搜尋爬蟲,用於改善搜尋結果品質。
這項決定應與 ClaudeBot 的訓練存取分開。
Claude-User為使用者請求而觸發的 Anthropic 擷取器。
Anthropic 目前記載可用 robots.txt 控制;封鎖可能降低使用者要求的網路擷取。
Google-Extended控制 token,非 HTTP User-AgentGoogle 用於 Gemini 訓練及 Google Search grounding 的控制 token。
它沒有獨立 HTTP User-Agent,也不影響 Google 搜尋收錄或排名。
PerplexityBotPerplexity 搜尋爬蟲,用於呈現及連結網站。
Perplexity 表示它不用於基礎模型訓練。
Perplexity-UserPerplexity 的使用者觸發擷取器,不是爬站或訓練 bot。
Perplexity 表示它通常忽略 robots.txt,因此不產生規則。
產生內容刻意保持窄範圍。請把它當成審查素材,而非直接覆蓋檔案。
不能。robots.txt 是爬蟲偏好訊號;網路層控制、供應商系統、相關性與產品行為是另外的條件。
官方文件描述的使用者觸發行為,可能不適用或通常忽略 robots.txt。產生規則會誇大可控程度。
不可以。只把審核過的群組合併進現有檔案,保留搜尋與資產規則,再測試正式環境回應。