عندما يحظر معظم الناس برامج زحف الذكاء الاصطناعي في robots.txt، فهم لا يحمون المحتوى بقدر ما يستبعدون مواقعهم من إجابات ChatGPT وPerplexity وClaude. فالسبب أن OpenAI وAnthropic وPerplexity لا ترسل كل منها زاحفًا واحدًا، بل اثنين أو ثلاثة: أحدها يجمع محتواك لتدريب النموذج، وآخر يسترجع صفحتك لحظيًا ويضيف رابط المصدر إلى الإجابة. غالبًا ما تريد حظر الأول، بينما ينبغي لك بالتأكيد إبقاء الثاني. لكن قاعدة عامة مثل User-agent: * مع Disallow: / ستغلق الباب أمام الاثنين معًا.
زواحف التدريب وزواحف الاسترجاع تؤدي وظائف مختلفة
لنأخذ OpenAI مثالًا: يتولى GPTBot جمع المحتوى وإضافته إلى corpus لاستخدامه لاحقًا في تدريب النماذج، بينما يضيف OAI-SearchBot صفحتك إلى فهرس بحث ChatGPT كي تظهر كمصدر مع رابط في الإجابات الفورية. أما ChatGPT-User فلا يعمل إلا عندما يطلب المستخدم زيارة عنوان URL محدد أثناء المحادثة. لذلك، يؤثر حظر GPTBot في «استخدام المحتوى للتدريب» فقط، ولا يمنع ChatGPT من الاستشهاد بك في الوقت الحالي. تتبع Anthropic وPerplexity المنطق نفسه في توزيع المهام، لكن بأسماء مختلفة. وإذا لم تميز بين هذه الطبقات، فقد تحظر ما يجب السماح له وتترك ما كنت تريد منعه.
- "GPTBot" (OpenAI): يجلب المحتوى لتدريب النماذج الأساسية؛ ولن يؤدي حظره إلى إخفاء موقعك من نتائج بحث ChatGPT.
- "OAI-SearchBot" (OpenAI): يفهرس المحتوى لبحث ChatGPT وإجاباته الفورية، ويجلب استشهادات المصادر؛ فإذا أردت الاستشهاد بموقعك، فعليك السماح له.
- "ChatGPT-User" (OpenAI): يُفعّل عندما يطلب المستخدم صراحةً زيارة عنوان URL محدد أثناء المحادثة.
- "ClaudeBot" (Anthropic): يجمع المحتوى لأغراض التدريب واستخدام النماذج.
- "Claude-SearchBot" و"Claude-User" (Anthropic): يتولى الأول فهرسة البحث، بينما يتولى الثاني عمليات الاسترجاع التي يطلبها المستخدم.
- "PerplexityBot" (Perplexity): يفهرس المحتوى لمحرك إجابات Perplexity؛ وحظره يعني انسحاب موقعك من قائمة مراجع Perplexity.
- "Perplexity-User" (Perplexity): يجلب المحتوى فور طرح المستخدم للسؤال. وقد وُجهت إليه اتهامات بعدم الالتزام الكامل بتعليمات robots.txt.
- أسماء أخرى شائعة: "Google-Extended" (ليس زاحفًا فعليًا، بل أداة تحكم تحدد ما إذا كان المحتوى سيُستخدم في تدريب Gemini وإسناد إجاباته إلى المصادر)، و"CCBot" (التابع لـ Common Crawl، وهو مصدر بيانات تدريب لعدد كبير من النماذج)، و"Bytespider" (التابع لـ ByteDance، ويُعرف بكثافة الزحف).
أساسيات robots.txt: لا تتعجل في نشر الإعدادات
يجب وضع robots.txt في الدليل الجذري للنطاق، ويكون عنوانه ثابتًا: اسم نطاقك متبوعًا بـ /robots.txt. ولكل مضيف نسخته المستقلة؛ فـ blog.example.com وwww.example.com مضيفان مختلفان، ولا تتحكم قواعد الأول في الثاني. كذلك تُعد بروتوكولات http وhttps والمنافذ المختلفة مصادر منفصلة. تعتمد الصياغة على ثلاث كلمات مفتاحية: تحدد User-agent الجهة المعنية، وتحظر Disallow المسار، بينما تنشئ Allow استثناءات. وعند تعارض Allow مع Disallow، تطبق محركات البحث الرئيسية قاعدة «المسار الأطول أولًا»، ما يتيح لك استخدام Allow لفتح مسار محدود داخل نطاق حظر واسع.
- robots.txt هو «طلب» وليس «جدار حماية»: تلتزم به برامج الزحف المنضبطة مثل GPTBot وClaudeBot وGooglebot، لكن يمكن للزواحف الخبيثة أو غير المنضبطة تجاهله. وإذا أردت فرض الحظر فعليًا، فعليك الاعتماد على WAF أو قواعد جدار الحماية أو آليات التحقق على مستوى الخادم.
- منع الزحف لا يعني حذف البيانات الموجودة: لا يؤثر robots.txt إلا في «إمكانية الزحف إلى المحتوى لاحقًا»، ولن يزيل المحتوى الذي أُدرج بالفعل ضمن بيانات التدريب.
- يجب كتابة اسم User-agent بدقة: المطابقة غير حساسة لحالة الأحرف، لكن الخطأ الإملائي — مثل كتابة GPT-Bot أو Perplexity Bot — يعني عمليًا أن الإعداد غير موجود. كما لا تسري كل مجموعة من القواعد إلا على User-agent المطابق لها.
السيناريو 1: السماح بالاستشهاد ورفض التدريب (الخيار الافتراضي لمعظم شركات B2B SaaS)
إذا أردت الظهور في إجابات الذكاء الاصطناعي مع الإشارة إلى موقعك كمصدر، من دون إتاحة محتواك مجانًا لتدريب الجيل التالي من النماذج، فاسمح لزواحف البحث واحظر زواحف التدريب. هذا هو الإعداد الافتراضي الذي نستخدمه لمعظم عملائنا في قطاع B2B: الأولوية للظهور، أما السماح بالتدريب فقرار اختياري. عمليًا، اكتب كل زاحف ضمن مجموعة User-agent مستقلة بقواعدها الخاصة. كما أن إضافة Allow: / بوضوح إلى زاحف البحث تعبّر عن الغرض مباشرةً ويمكنها تجاوز أي إعداد قديم يحظر الموقع بالكامل.
- User-agent: GPTBot → Disallow: / (زاحف تدريب، يُحظر)
- User-agent: ClaudeBot → Disallow: / (زاحف تدريب، يُحظر)
- User-agent: CCBot → Disallow: / (مصدر بيانات تدريب Common Crawl، يُحظر)
- User-agent: OAI-SearchBot → Allow: / (مراجع بحث ChatGPT، يُسمح له)
- User-agent: PerplexityBot → Allow: / (مراجع Perplexity، يُسمح له)
- User-agent: Claude-SearchBot → Allow: / (البحث عن المراجع في Claude، يُسمح له)
- إذا لم ترد إدراج محتواك ضمن تدريب Gemini، يمكنك إضافة User-agent: Google-Extended → Disallow: / (لا يؤثر ذلك في ترتيب نتائج بحث Google)

السيناريو 2: حظر وصول الذكاء الاصطناعي بالكامل، بما في ذلك الاستشهادات
قد يستدعي المحتوى المحمي بجدار دفع، أو المعلومات الحساسة للامتثال، أو المواد التي لا تزال قيد التفاوض على الترخيص، منع عمليات الاسترجاع أيضًا. والطريقة هي إدراج جميع أسماء User-agent المعروفة للذكاء الاصطناعي واحدًا تلو الآخر وتعيين Disallow: / لكل منها. لكن انتبه إلى التكلفة: بعد الحظر، ستتراجع إشارات المصادر إلى موقعك في إجابات الذكاء الاصطناعي إلى الصفر، وكأنك تنسحب طوعًا من قناة زيارات متنامية. لذلك يكون هذا عادةً إجراءً دفاعيًا مؤقتًا، ولا ينبغي اعتماده إعدادًا افتراضيًا لمواقع التسويق الموجهة إلى B2B.
- OpenAI: عيّن Disallow: / لكل من GPTBot وOAI-SearchBot وChatGPT-User على حدة.
- Anthropic: عيّن Disallow: / لكل من ClaudeBot وClaude-SearchBot وClaude-User على حدة.
- Perplexity: عيّن Disallow: / لكل من PerplexityBot وPerplexity-User على حدة.
- خيارات حظر إضافية: عيّن Disallow: / لكل من Google-Extended وApplebot-Extended وBytespider وCCBot على حدة.
لا تدع قالب «حظر كل أدوات الذكاء الاصطناعي بنقرة واحدة» يضر باستراتيجية GEO
تنتشر على الإنترنت قوالب كثيرة تعدك بأن «تلصق هذه الفقرة في robots.txt لحظر الذكاء الاصطناعي». المشكلة أنها تضبط Disallow: / لجميع أسماء User-agent التابعة للذكاء الاصطناعي، فتمنع معها زواحف البحث المسؤولة عن الاستشهاد بموقعك. وهكذا، بينما تظن أنك تحمي محتواك، تكون قد انسحبت فعليًا من بحث ChatGPT ومراجع Perplexity وقائمة مصادر Claude. وبالنسبة إلى علامات B2B التجارية التي تريد أن يستشهد بها الذكاء الاصطناعي، تأتي النتيجة في الغالب عكس المطلوب. قبل نشر أي قالب، تحقق مما إذا كان يحظر التدريب أم الاسترجاع.
كيف تتحقق من أن الإعدادات دخلت حيز التنفيذ؟
- الفحص المباشر: افتح نطاقك في المتصفح وأضف /robots.txt، ثم تأكد من وجود الملف في الدليل الجذري ومن خلو اسم المجموعة من الأخطاء الإملائية.
- راجع سجل الخادم: ابحث عن GPTBot وClaudeBot وPerplexityBot في حقل User-agent، وتحقق من أن الزواحف المحظورة تتلقى الاستجابة 403، وأن الزواحف المسموح لها تجلب الصفحة بصورة طبيعية.
- تحقق من الهوية: يمكن تزوير User-agent الخاص بزاحف الذكاء الاصطناعي. تنشر OpenAI وAnthropic نطاقات IP الرسمية، ويمكن استخدام المطابقة المتقاطعة بين reverse DNS وforward DNS لتجنب الانخداع بزواحف مزيفة.
- حاكِ الطلب: استخدم curl لجلب الصفحة باستخدام User-agent المعني، ثم تحقق من أن قواعد robots.txt تسمح بالوصول أو تحظره كما هو متوقع.
- راجع الإعدادات دوريًا: قد تضيف كل شركة أسماء User-agent جديدة أو تعيد تسميتها — مثل فصل OAI-SearchBot لاحقًا عن GPTBot — لذلك افحص الإعدادات كل ربع سنة ولا تتركها تصبح قديمة.
robots.txt ليس خزنة، بل لافتة عند الباب. فهو يحدد أنواع الذكاء الاصطناعي التي ترحب بها وتلك التي تمنعها؛ وفي عالم GEO، إغلاق الباب أمام زواحف البحث يعادل إغلاقه أمام فرص الأعمال.— Tenten GEO Consulting Team
إعداد robots.txt ليس سوى الخطوة الأولى في البنية التقنية لاستراتيجية GEO. أما ظهور موقعك كمصدر في إجابات الذكاء الاصطناعي فيعتمد فعليًا على عوامل تشمل البيانات المنظمة، وllms.txt، وقابلية استخراج المحتوى بوضوح، ومدى ظهور العلامة التجارية في المحركات المختلفة. إذا أردت معرفة ما إذا كان الذكاء الاصطناعي يستشهد بموقعك أم أن robots.txt لديك يحظره، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة. سنستخدم نطاقك الفعلي لاختبار وصول الزواحف وحالة الاستشهاد، ونوضح لك موضع الفجوة مباشرةً.



