يضيف كثيرون سطر Disallow إلى robots.txt لحظر GPTBot، ظنًا منهم أن ذلك سيمنع ظهور محتواهم كمصدر في ChatGPT. لكن النتيجة لا تكون كذلك. فمهمة GPTBot تقتصر على جمع البيانات المستخدمة في تدريب النموذج، بينما يتولى زاحف آخر باسم OAI-SearchBot تحديد إمكانية ظهور صفحاتك ضمن إجابات ChatGPT. إنها زواحف تابعة للشركة نفسها، لكن لكل منها مهمة وUser-Agent مختلفان. لذلك ابدأ بفهم وظيفة كل اسم في القائمة، حتى لا تؤدي إعدادات السماح والحظر في robots.txt إلى عكس ما تريده تمامًا.
لنبدأ بالفارق الأساسي: زواحف الذكاء الاصطناعي تنقسم فعليًا إلى ثلاثة أنواع
- زاحف التدريب: يجمع محتواك لإدراجه في مجموعة البيانات المستخدمة لتدريب النموذج. تجري هذه العملية عادةً بلا اتصال مباشر بالإنترنت، ولا ترتبط مباشرة بالإجابة التي يراها المستخدم في لحظتها. من أمثلته GPTBot (OpenAI) وClaudeBot (Anthropic) وCCBot (Common Crawl) وMeta-ExternalAgent وBytespider (ByteDance).
- زاحف البحث والفهرسة: ينشئ فهرسًا قابلًا للبحث الفوري تستخدمه محركات إجابات الذكاء الاصطناعي، ولذلك يؤثر مباشرة في إمكانية اعتماد صفحتك كمصدر مرجعي. من أمثلته OAI-SearchBot (بحث ChatGPT) وPerplexityBot وGooglebot (تعتمد AI Overviews على فهرسه الحالي) وApplebot (لخدمات Siri وApple Intelligence).
- الزاحف الذي يعمل بطلب المستخدم: يبدأ الزحف عندما يلصق المستخدم عنوان URL الخاص بك داخل المحادثة أو يطلب التحقق منه فورًا. يقرأ عادةً صفحة واحدة في كل مرة، ولا يضيفها إلى بيانات التدريب. من أمثلته ChatGPT-User وPerplexity-User وClaude-User.
إذا كان هدفك أن يستشهد الذكاء الاصطناعي بمحتواك، فلا تحظر النوعين الأخيرين. فعندما تعجز زواحف البحث عن الوصول إلى موقعك، لن تدخل صفحاتك قائمة المصادر المرشحة. وإذا حظرت الزواحف التي تعمل بطلب المستخدم، فلن يتمكن الذكاء الاصطناعي من قراءة المحتوى حتى عندما يرسل إليه أحدهم رابطك مباشرة. أما زواحف التدريب، فيمكن تقرير موقفك منها وفق استراتيجية العلامة التجارية: احظرها إن كنت لا تريد استخدام محتواك مجانًا في التدريب، واسمح لها إن كنت ترغب في زيادة احتمال دخوله ضمن البيانات الأساسية للنموذج. الخلط بين هذه الوظائف الثلاث هو السبب الجذري وراء ضبط معظم ملفات robots.txt في الاتجاه الخطأ.
OpenAI: GPTBot وOAI-SearchBot وChatGPT-User
- GPTBot: مخصص لأغراض التدريب. يتضمن User-Agent القيمة "GPTBot/1.2"، أما الرمز المستخدم في robots.txt فهو "GPTBot". وتنشر OpenAI أيضًا نطاقات IP الخاصة بالزاحف في ملف JSON، ما يتيح التحقق من أن الزيارة أصلية.
- OAI-SearchBot: مسؤول عن إدراج صفحتك ضمن نتائج بحث ChatGPT ومصادره التي يستشهد بها، والرمز الخاص به هو "OAI-SearchBot". حظره يعادل الانسحاب طوعًا من فرص الظهور في ChatGPT، ومع ذلك فهو الزاحف الذي يحظره كثيرون عن طريق الخطأ.
- ChatGPT-User: يعمل عندما يطلب المستخدم تصفح عنوان URL الخاص بك أو التحقق منه داخل المحادثة. رمزه هو "ChatGPT-User". ينفذ زحفًا فوريًا لصفحة واحدة، ولا يضيف محتواها إلى بيانات التدريب.
Google-Extended ليس زاحفًا، بل مفتاح تحكم
غالبًا ما يرد Google-Extended ضمن «قوائم زواحف الذكاء الاصطناعي»، لكنه ليس زاحفًا سيظهر في سجلات خادمك أصلًا، بل رمز منتج داخل robots.txt. السماح له أو حظره يؤثر فقط في إمكانية استخدام Google لمحتواك في تدريب Gemini وبعض عمليات التوليد، ولا يؤثر إطلاقًا في الفهرسة العامة التي ينفذها Googlebot. لذلك لن يؤدي حظر Google-Extended إلى إخراج موقعك من بحث Google، وغالبًا لن يزيله من AI Overviews أيضًا، لأن هذه الميزة تعتمد أساسًا على بيانات فهرس Googlebot الحالي. ويتبع Applebot-Extended من Apple التصميم نفسه؛ فهو مفتاح التحكم في تدريب Apple Intelligence، ويختلف عن Applebot المسؤول عن الفهرسة العامة.
PerplexityBot والزواحف التي لا تلتزم بالقواعد
لكي يستشهد Perplexity بمحتواك، يجب السماح لكل من PerplexityBot المخصص للفهرسة وPerplexity-User المخصص لطلبات المستخدم الفورية. لكن ينبغي الانتباه إلى واقع عملي: robots.txt ليس سوى اتفاق طوعي ولا يملك قوة إنفاذ. ففي 2025، اتهمت Cloudflare شركة Perplexity علنًا بأنها واصلت الزحف بعد حظرها عبر robots.txt، مستخدمةً User-Agent غير معلن يحاكي متصفحًا عاديًا. كما اشتهر Bytespider سابقًا بزحفه عالي التردد مع مراعاة محدودة جدًا لمعدل الطلبات. وهكذا تصح حقيقتان في الوقت نفسه: قد لا تنجح في إيقاف الزاحف الذي تريد حظره، كما أن السماح لزاحف مرغوب فيه يتطلب وسيلة تؤكد أنه الزاحف الأصلي فعلًا.
Amazonbot وClaudeBot وأسماء أخرى ستصادفها في السجلات
- ClaudeBot: زاحف التدريب التابع لـAnthropic. وقد تظهر في السجلات أيضًا رموز Claude-User المخصص لطلبات المستخدم، إلى جانب الرمزين الأقدم anthropotic-ai وClaude-Web.
- Amazonbot: تستخدمه Alexa وخدمات الذكاء الاصطناعي من Amazon، ويتضمن User-Agent القيمة "Amazonbot/0.1".
- CCBot: الزاحف التابع لـCommon Crawl. ليست Common Crawl شركة ذكاء اصطناعي، لكن مجموعتها العامة من البيانات تُستخدم في تدريب عدد كبير من النماذج. لذلك تمثل مسارًا غير مباشر للتدريب يسهل إغفاله عند ضبط سياسات الوصول.
- أسماء شائعة أخرى: Meta-ExternalAgent (لتدريب Meta) وMeta-ExternalFetcher (يعمل بطلب المستخدم) وYouBot (You.com) وDuckAssistBot (DuckDuckGo) وcohere-ai (Cohere) وMistralAI-User وDiffbot وTimpibot.

كيف تكتب robots.txt في 2026
لا توجد سياسة واحدة تناسب الجميع. لكن الإعداد الافتراضي المنطقي لمعظم مواقع B2B الساعية إلى تحسين GEO هو السماح لزواحف البحث والزواحف التي تعمل بطلب المستخدم، حتى تتمكن محركات الذكاء الاصطناعي من قراءة المحتوى والاستشهاد به. أما زواحف التدريب، فيُتخذ القرار بشأن كل منها وفق قيمة المحتوى واستراتيجية العلامة التجارية. وفيما يلي مثال يعطي الأولوية للظهور.
- User-agent: OAI-SearchBot → Allow: / (للحفاظ على الظهور في ChatGPT)
- User-agent: PerplexityBot → Allow: / (للدخول إلى مجموعة مصادر Perplexity)
- User-agent: ChatGPT-User وPerplexity-User → Allow: / (لا تحظر عملية التحقق التي يطلبها المستخدم مباشرة)
- User-agent: Googlebot → Allow: / (تعتمد AI Overviews والنتائج العامة على الفهرس نفسه، لذا يجب السماح له)
- User-agent: GPTBot وCCBot وGoogle-Extended → يُحدد القرار وفق السياسة (استخدم Disallow: / إذا كنت لا تريد استخدام المحتوى في التدريب، ولن يؤثر ذلك في فرص الظهور المذكورة أعلاه)
لا تعتمد على robots.txt وحده
يستطيع robots.txt إيقاف الزواحف الملتزمة بالقواعد، لكنه لن يردع زاحفًا مصممًا على تجاوزها. وإذا أردت تحكمًا فعليًا، فعليك الانتقال إلى مستوى آخر: استخدم البحث العكسي في DNS مع التحقق الأمامي، وقارن عناوين IP بنطاقات العناوين التي تعلنها كل شركة رسميًا للتحقق من هوية الزاحف. وعند مواجهة انتحال الهوية أو الزحف عالي التردد، استخدم WAF أو أدوات Cloudflare لإدارة زواحف الذكاء الاصطناعي أو تقييد معدل الطلبات، بدل الاكتفاء بإضافة سطر آخر إلى robots.txt. ولا تقل المراقبة أهمية عن الحظر: راجع سجلات وصول الخادم بانتظام لمعرفة زواحف الذكاء الاصطناعي التي زارت موقعك فعلًا ومدى تكرار زياراتها. هذه إشارتك المباشرة لقياس ظهورك في GEO، وهي أدق من أي توقع.
تتغير قائمة زواحف الذكاء الاصطناعي كل موسم؛ تظهر أسماء جديدة وتتبدل الرموز المستخدمة. وبدل حفظ كل اسم، تذكّر منطق التصنيف: التدريب والاسترجاع والتشغيل بطلب المستخدم، فلكل فئة أثر استراتيجي مختلف. وإذا لم تكن متأكدًا من محركات الذكاء الاصطناعي التي تزحف إلى موقعك حاليًا، أو من الصفحات الغائبة عن المصادر المرجعية، فإن تدقيق GEO من Tenten يعرض سجلات وصول الزواحف وحالة الاستشهاد بالمحتوى في صورة واضحة. ولتحديد الفجوات أولًا، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة عبر (/contact).



