Tenten AIGEO
العودة إلى المدونة
التنفيذ التقني لـ AEOالتنفيذ

التحكم في GPTBot وClaudeBot وPerplexityBot عبر robots.txt: الإعدادات الكاملة للسماح لبرامج زحف الذكاء الاصطناعي أو حظرها

هل تريد التحكم في GPTBot وClaudeBot وPerplexityBot باستخدام robots.txt؟ يوضح هذا الدليل الفرق بين برامج الزحف المخصصة لتدريب الذكاء الاصطناعي وبرامج زحف البحث، ويقدم إعدادين جاهزين: «السماح بالاستشهاد ورفض التدريب» و«الحظر الكامل». كما يشرح كيفية التحقق من فاعلية الإعدادات وتجنب استبعاد موقعك من إجابات الذكاء الاصطناعي عن طريق الخطأ.

فريق Tenten GEOنُشر في 2025-06-225 دقيقة قراءة
تصور مفاهيمي داكن: نقاط تفتيش مضيئة تفرز برامج زحف الذكاء الاصطناعي، فتسمح لبعضها بالعبور نحو الضوء وتحجب بعضها الآخر في الظلال.

عندما يحظر معظم الناس برامج زحف الذكاء الاصطناعي في robots.txt، فهم لا يحمون المحتوى بقدر ما يستبعدون مواقعهم من إجابات ChatGPT وPerplexity وClaude. فالسبب أن OpenAI وAnthropic وPerplexity لا ترسل كل منها زاحفًا واحدًا، بل اثنين أو ثلاثة: أحدها يجمع محتواك لتدريب النموذج، وآخر يسترجع صفحتك لحظيًا ويضيف رابط المصدر إلى الإجابة. غالبًا ما تريد حظر الأول، بينما ينبغي لك بالتأكيد إبقاء الثاني. لكن قاعدة عامة مثل User-agent: * مع Disallow: / ستغلق الباب أمام الاثنين معًا.

زواحف التدريب وزواحف الاسترجاع تؤدي وظائف مختلفة

لنأخذ OpenAI مثالًا: يتولى GPTBot جمع المحتوى وإضافته إلى corpus لاستخدامه لاحقًا في تدريب النماذج، بينما يضيف OAI-SearchBot صفحتك إلى فهرس بحث ChatGPT كي تظهر كمصدر مع رابط في الإجابات الفورية. أما ChatGPT-User فلا يعمل إلا عندما يطلب المستخدم زيارة عنوان URL محدد أثناء المحادثة. لذلك، يؤثر حظر GPTBot في «استخدام المحتوى للتدريب» فقط، ولا يمنع ChatGPT من الاستشهاد بك في الوقت الحالي. تتبع Anthropic وPerplexity المنطق نفسه في توزيع المهام، لكن بأسماء مختلفة. وإذا لم تميز بين هذه الطبقات، فقد تحظر ما يجب السماح له وتترك ما كنت تريد منعه.

  • "GPTBot" ‏(OpenAI): يجلب المحتوى لتدريب النماذج الأساسية؛ ولن يؤدي حظره إلى إخفاء موقعك من نتائج بحث ChatGPT.
  • "OAI-SearchBot" ‏(OpenAI): يفهرس المحتوى لبحث ChatGPT وإجاباته الفورية، ويجلب استشهادات المصادر؛ فإذا أردت الاستشهاد بموقعك، فعليك السماح له.
  • "ChatGPT-User" ‏(OpenAI): يُفعّل عندما يطلب المستخدم صراحةً زيارة عنوان URL محدد أثناء المحادثة.
  • "ClaudeBot" ‏(Anthropic): يجمع المحتوى لأغراض التدريب واستخدام النماذج.
  • "Claude-SearchBot" و"Claude-User" ‏(Anthropic): يتولى الأول فهرسة البحث، بينما يتولى الثاني عمليات الاسترجاع التي يطلبها المستخدم.
  • "PerplexityBot" ‏(Perplexity): يفهرس المحتوى لمحرك إجابات Perplexity؛ وحظره يعني انسحاب موقعك من قائمة مراجع Perplexity.
  • "Perplexity-User" ‏(Perplexity): يجلب المحتوى فور طرح المستخدم للسؤال. وقد وُجهت إليه اتهامات بعدم الالتزام الكامل بتعليمات robots.txt.
  • أسماء أخرى شائعة: "Google-Extended" (ليس زاحفًا فعليًا، بل أداة تحكم تحدد ما إذا كان المحتوى سيُستخدم في تدريب Gemini وإسناد إجاباته إلى المصادر)، و"CCBot" (التابع لـ Common Crawl، وهو مصدر بيانات تدريب لعدد كبير من النماذج)، و"Bytespider" (التابع لـ ByteDance، ويُعرف بكثافة الزحف).

أساسيات robots.txt: لا تتعجل في نشر الإعدادات

يجب وضع robots.txt في الدليل الجذري للنطاق، ويكون عنوانه ثابتًا: اسم نطاقك متبوعًا بـ /robots.txt. ولكل مضيف نسخته المستقلة؛ فـ blog.example.com وwww.example.com مضيفان مختلفان، ولا تتحكم قواعد الأول في الثاني. كذلك تُعد بروتوكولات http وhttps والمنافذ المختلفة مصادر منفصلة. تعتمد الصياغة على ثلاث كلمات مفتاحية: تحدد User-agent الجهة المعنية، وتحظر Disallow المسار، بينما تنشئ Allow استثناءات. وعند تعارض Allow مع Disallow، تطبق محركات البحث الرئيسية قاعدة «المسار الأطول أولًا»، ما يتيح لك استخدام Allow لفتح مسار محدود داخل نطاق حظر واسع.

  • robots.txt هو «طلب» وليس «جدار حماية»: تلتزم به برامج الزحف المنضبطة مثل GPTBot وClaudeBot وGooglebot، لكن يمكن للزواحف الخبيثة أو غير المنضبطة تجاهله. وإذا أردت فرض الحظر فعليًا، فعليك الاعتماد على WAF أو قواعد جدار الحماية أو آليات التحقق على مستوى الخادم.
  • منع الزحف لا يعني حذف البيانات الموجودة: لا يؤثر robots.txt إلا في «إمكانية الزحف إلى المحتوى لاحقًا»، ولن يزيل المحتوى الذي أُدرج بالفعل ضمن بيانات التدريب.
  • يجب كتابة اسم User-agent بدقة: المطابقة غير حساسة لحالة الأحرف، لكن الخطأ الإملائي — مثل كتابة GPT-Bot أو Perplexity Bot — يعني عمليًا أن الإعداد غير موجود. كما لا تسري كل مجموعة من القواعد إلا على User-agent المطابق لها.

السيناريو 1: السماح بالاستشهاد ورفض التدريب (الخيار الافتراضي لمعظم شركات B2B SaaS)

إذا أردت الظهور في إجابات الذكاء الاصطناعي مع الإشارة إلى موقعك كمصدر، من دون إتاحة محتواك مجانًا لتدريب الجيل التالي من النماذج، فاسمح لزواحف البحث واحظر زواحف التدريب. هذا هو الإعداد الافتراضي الذي نستخدمه لمعظم عملائنا في قطاع B2B: الأولوية للظهور، أما السماح بالتدريب فقرار اختياري. عمليًا، اكتب كل زاحف ضمن مجموعة User-agent مستقلة بقواعدها الخاصة. كما أن إضافة Allow: / بوضوح إلى زاحف البحث تعبّر عن الغرض مباشرةً ويمكنها تجاوز أي إعداد قديم يحظر الموقع بالكامل.

  • User-agent: GPTBot → Disallow: / (زاحف تدريب، يُحظر)
  • User-agent: ClaudeBot → Disallow: / (زاحف تدريب، يُحظر)
  • User-agent: CCBot → Disallow: / (مصدر بيانات تدريب Common Crawl، يُحظر)
  • User-agent: OAI-SearchBot → Allow: / (مراجع بحث ChatGPT، يُسمح له)
  • User-agent: PerplexityBot → Allow: / (مراجع Perplexity، يُسمح له)
  • User-agent: Claude-SearchBot → Allow: / (البحث عن المراجع في Claude، يُسمح له)
  • إذا لم ترد إدراج محتواك ضمن تدريب Gemini، يمكنك إضافة User-agent: Google-Extended → Disallow: / (لا يؤثر ذلك في ترتيب نتائج بحث Google)
مخطط يوضح آلية الفرز عبر robots.txt: حظر زواحف التدريب، والسماح بزواحف البحث، والحفاظ على ظهور الموقع ضمن استشهادات الذكاء الاصطناعي.
يمكن لملف robots.txt نفسه حظر زواحف التدريب والسماح لزواحف البحث المسؤولة عن الاستشهاد بموقعك.

السيناريو 2: حظر وصول الذكاء الاصطناعي بالكامل، بما في ذلك الاستشهادات

قد يستدعي المحتوى المحمي بجدار دفع، أو المعلومات الحساسة للامتثال، أو المواد التي لا تزال قيد التفاوض على الترخيص، منع عمليات الاسترجاع أيضًا. والطريقة هي إدراج جميع أسماء User-agent المعروفة للذكاء الاصطناعي واحدًا تلو الآخر وتعيين Disallow: / لكل منها. لكن انتبه إلى التكلفة: بعد الحظر، ستتراجع إشارات المصادر إلى موقعك في إجابات الذكاء الاصطناعي إلى الصفر، وكأنك تنسحب طوعًا من قناة زيارات متنامية. لذلك يكون هذا عادةً إجراءً دفاعيًا مؤقتًا، ولا ينبغي اعتماده إعدادًا افتراضيًا لمواقع التسويق الموجهة إلى B2B.

  • OpenAI: عيّن Disallow: / لكل من GPTBot وOAI-SearchBot وChatGPT-User على حدة.
  • Anthropic: عيّن Disallow: / لكل من ClaudeBot وClaude-SearchBot وClaude-User على حدة.
  • Perplexity: عيّن Disallow: / لكل من PerplexityBot وPerplexity-User على حدة.
  • خيارات حظر إضافية: عيّن Disallow: / لكل من Google-Extended وApplebot-Extended وBytespider وCCBot على حدة.

لا تدع قالب «حظر كل أدوات الذكاء الاصطناعي بنقرة واحدة» يضر باستراتيجية GEO

تنتشر على الإنترنت قوالب كثيرة تعدك بأن «تلصق هذه الفقرة في robots.txt لحظر الذكاء الاصطناعي». المشكلة أنها تضبط Disallow: / لجميع أسماء User-agent التابعة للذكاء الاصطناعي، فتمنع معها زواحف البحث المسؤولة عن الاستشهاد بموقعك. وهكذا، بينما تظن أنك تحمي محتواك، تكون قد انسحبت فعليًا من بحث ChatGPT ومراجع Perplexity وقائمة مصادر Claude. وبالنسبة إلى علامات B2B التجارية التي تريد أن يستشهد بها الذكاء الاصطناعي، تأتي النتيجة في الغالب عكس المطلوب. قبل نشر أي قالب، تحقق مما إذا كان يحظر التدريب أم الاسترجاع.

كيف تتحقق من أن الإعدادات دخلت حيز التنفيذ؟

  • الفحص المباشر: افتح نطاقك في المتصفح وأضف /robots.txt، ثم تأكد من وجود الملف في الدليل الجذري ومن خلو اسم المجموعة من الأخطاء الإملائية.
  • راجع سجل الخادم: ابحث عن GPTBot وClaudeBot وPerplexityBot في حقل User-agent، وتحقق من أن الزواحف المحظورة تتلقى الاستجابة 403، وأن الزواحف المسموح لها تجلب الصفحة بصورة طبيعية.
  • تحقق من الهوية: يمكن تزوير User-agent الخاص بزاحف الذكاء الاصطناعي. تنشر OpenAI وAnthropic نطاقات IP الرسمية، ويمكن استخدام المطابقة المتقاطعة بين reverse DNS وforward DNS لتجنب الانخداع بزواحف مزيفة.
  • حاكِ الطلب: استخدم curl لجلب الصفحة باستخدام User-agent المعني، ثم تحقق من أن قواعد robots.txt تسمح بالوصول أو تحظره كما هو متوقع.
  • راجع الإعدادات دوريًا: قد تضيف كل شركة أسماء User-agent جديدة أو تعيد تسميتها — مثل فصل OAI-SearchBot لاحقًا عن GPTBot — لذلك افحص الإعدادات كل ربع سنة ولا تتركها تصبح قديمة.
robots.txt ليس خزنة، بل لافتة عند الباب. فهو يحدد أنواع الذكاء الاصطناعي التي ترحب بها وتلك التي تمنعها؛ وفي عالم GEO، إغلاق الباب أمام زواحف البحث يعادل إغلاقه أمام فرص الأعمال.Tenten GEO Consulting Team

إعداد robots.txt ليس سوى الخطوة الأولى في البنية التقنية لاستراتيجية GEO. أما ظهور موقعك كمصدر في إجابات الذكاء الاصطناعي فيعتمد فعليًا على عوامل تشمل البيانات المنظمة، وllms.txt، وقابلية استخراج المحتوى بوضوح، ومدى ظهور العلامة التجارية في المحركات المختلفة. إذا أردت معرفة ما إذا كان الذكاء الاصطناعي يستشهد بموقعك أم أن robots.txt لديك يحظره، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة. سنستخدم نطاقك الفعلي لاختبار وصول الزواحف وحالة الاستشهاد، ونوضح لك موضع الفجوة مباشرةً.

الأسئلة الشائعة

هل يؤدي حظر GPTBot إلى اختفاء موقعي من ChatGPT؟
لا. تقتصر مهمة GPTBot على جمع المحتوى لتدريب النماذج، بينما يتولى OAI-SearchBot وChatGPT-User البحث الفوري والاستشهاد بالمصادر في ChatGPT. وما دمت لا تحظر هذين الاثنين، فقد يظل ChatGPT يستشهد بصفحتك ويُرفق رابط المصدر.
هل يستطيع robots.txt إيقاف برامج زحف الذكاء الاصطناعي غير المنضبطة؟
لا يمكنه فرض ذلك. robots.txt إشعار قائم على الالتزام الطوعي؛ إذ تمتثل له برامج مثل GPTBot وClaudeBot وGooglebot، لكن الزواحف الخبيثة أو غير المنضبطة تستطيع تجاهله ببساطة. ولإنفاذ الحظر، استخدم WAF أو قواعد جدار الحماية أو آليات المصادقة على مستوى الخادم.
كيف تضبط robots.txt إذا أردت أن يستشهد الذكاء الاصطناعي بموقعك من دون استخدام محتواك للتدريب؟
احظر زواحف التدريب (GPTBot وClaudeBot وCCBot)، واسمح لزواحف البحث (OAI-SearchBot وPerplexityBot وClaude-SearchBot). تتعامل المجموعة الأولى مع بيانات التدريب فقط، بينما تحدد الثانية إمكانية الاستشهاد بموقعك في إجابات الذكاء الاصطناعي.

مقالات ذات صلة

شعاع ضوئي بنفسجي بلون الخزامى يشق مشهدًا مظلمًا نحو ملف llms.txt في المجلد الجذري للموقع، في إشارة إلى مسار القراءة الممهّد للذكاء الاصطناعي.التنفيذ

التنفيذ التقني لـ AEO

الدليل العملي الشامل لتطبيق llms.txt: الصياغة، والموقع، وآلية قراءة زواحف الذكاء الاصطناعي

لن يجعل llms.txt أنظمة الذكاء الاصطناعي تستشهد بك تلقائيًا. إنه خريطة بصيغة Markdown توضع في المجلد الجذري للنطاق. يشرح هذا الدليل صيغته، وموقعه الصحيح، وآلية قراءة زواحف الذكاء الاصطناعي له.

5 دقيقة قراءة
تصور تجريدي لشعاع ناعم بلون الخزامى يمر عبر طبقات شجرة البنية، في إشارة إلى أن الوسم الدلالي نفسه تقرؤه قارئات الشاشة ووكلاء الذكاء الاصطناعي معاً.التنفيذ

التنفيذ التقني لـ AEO

ترميز إمكانية الوصول (ARIA) وقابلية القراءة بالذكاء الاصطناعي: إعداد واحد يخدم قارئات الشاشة ووكلاء الذكاء الاصطناعي

ترميز ARIA الذي تضيفه لتحسين إمكانية الوصول هو، في الواقع، أنظف مصدر يمكن تقديمه لمحرك الذكاء الاصطناعي؛ إعداد واحد وفائدة للطرفين.

4 دقيقة قراءة
غلاف بتكوين تجريدي من الضوء والظل يجسّد صفحة ركيزة تتصل بعدة صفحات عنقودية لتشكّل مركز محتوى.التنفيذ

التنفيذ التقني لـ AEO

تطبيق الصفحات الركيزة والصفحات العنقودية: كيف تبني مركز محتوى بالصينية التقليدية يسهل على محركات الذكاء الاصطناعي استخراجه

بنية الركيزة والعناقيد ليست لعبة روابط داخلية لتمرير الأهمية، بل طريقة لتقسيم الموضوع إلى صفحات مستقلة يسهل على محركات الذكاء الاصطناعي استخراجها، مع ترابط مرجعي واضح بينها. تقدم المقالة تسلسلًا عمليًا لبناء مركز محتوى بالصينية التقليدية.

5 دقيقة قراءة

الخطوة التالية

ما مدى ظهور علامتك التجارية في إجابات الذكاء الاصطناعي؟

خلال تشخيص GEO لمدة 30 دقيقة، نحدد فجوات الظهور في أهم محركات الذكاء الاصطناعي وما ينبغي تحسينه أولاً.

احجز التشخيص