Tenten AIGEO
العودة إلى المدونة
التنفيذ التقني لـ AEOالتقييم

قائمة User-Agent لزواحف الذكاء الاصطناعي في 2026: دليل GPTBot وGoogle-Extended وPerplexityBot وAmazonbot في مكان واحد

دليل شامل لأسماء User-Agent ورموز robots.txt الخاصة بأبرز زواحف الذكاء الاصطناعي في 2026، ومنها GPTBot وOAI-SearchBot وGoogle-Extended وPerplexityBot وAmazonbot وClaudeBot، مع توضيح كيفية السماح لها أو حظرها وفق وظيفتها: التدريب أو الاسترجاع أو التشغيل بطلب المستخدم.

فريق Tenten GEOنُشر في 2026-01-125 دقيقة قراءة
تصوّر تجريدي لعدة زواحف ذكاء اصطناعي تتجه عبر مسارات ضوئية مختلفة إلى عقدة واحدة تمثل موقعًا إلكترونيًا.

يضيف كثيرون سطر Disallow إلى robots.txt لحظر GPTBot، ظنًا منهم أن ذلك سيمنع ظهور محتواهم كمصدر في ChatGPT. لكن النتيجة لا تكون كذلك. فمهمة GPTBot تقتصر على جمع البيانات المستخدمة في تدريب النموذج، بينما يتولى زاحف آخر باسم OAI-SearchBot تحديد إمكانية ظهور صفحاتك ضمن إجابات ChatGPT. إنها زواحف تابعة للشركة نفسها، لكن لكل منها مهمة وUser-Agent مختلفان. لذلك ابدأ بفهم وظيفة كل اسم في القائمة، حتى لا تؤدي إعدادات السماح والحظر في robots.txt إلى عكس ما تريده تمامًا.

لنبدأ بالفارق الأساسي: زواحف الذكاء الاصطناعي تنقسم فعليًا إلى ثلاثة أنواع

  • زاحف التدريب: يجمع محتواك لإدراجه في مجموعة البيانات المستخدمة لتدريب النموذج. تجري هذه العملية عادةً بلا اتصال مباشر بالإنترنت، ولا ترتبط مباشرة بالإجابة التي يراها المستخدم في لحظتها. من أمثلته GPTBot (OpenAI) وClaudeBot (Anthropic) وCCBot (Common Crawl) وMeta-ExternalAgent وBytespider (ByteDance).
  • زاحف البحث والفهرسة: ينشئ فهرسًا قابلًا للبحث الفوري تستخدمه محركات إجابات الذكاء الاصطناعي، ولذلك يؤثر مباشرة في إمكانية اعتماد صفحتك كمصدر مرجعي. من أمثلته OAI-SearchBot (بحث ChatGPT) وPerplexityBot وGooglebot (تعتمد AI Overviews على فهرسه الحالي) وApplebot (لخدمات Siri وApple Intelligence).
  • الزاحف الذي يعمل بطلب المستخدم: يبدأ الزحف عندما يلصق المستخدم عنوان URL الخاص بك داخل المحادثة أو يطلب التحقق منه فورًا. يقرأ عادةً صفحة واحدة في كل مرة، ولا يضيفها إلى بيانات التدريب. من أمثلته ChatGPT-User وPerplexity-User وClaude-User.

إذا كان هدفك أن يستشهد الذكاء الاصطناعي بمحتواك، فلا تحظر النوعين الأخيرين. فعندما تعجز زواحف البحث عن الوصول إلى موقعك، لن تدخل صفحاتك قائمة المصادر المرشحة. وإذا حظرت الزواحف التي تعمل بطلب المستخدم، فلن يتمكن الذكاء الاصطناعي من قراءة المحتوى حتى عندما يرسل إليه أحدهم رابطك مباشرة. أما زواحف التدريب، فيمكن تقرير موقفك منها وفق استراتيجية العلامة التجارية: احظرها إن كنت لا تريد استخدام محتواك مجانًا في التدريب، واسمح لها إن كنت ترغب في زيادة احتمال دخوله ضمن البيانات الأساسية للنموذج. الخلط بين هذه الوظائف الثلاث هو السبب الجذري وراء ضبط معظم ملفات robots.txt في الاتجاه الخطأ.

OpenAI: ‏GPTBot وOAI-SearchBot وChatGPT-User

  • GPTBot: مخصص لأغراض التدريب. يتضمن User-Agent القيمة "GPTBot/1.2"، أما الرمز المستخدم في robots.txt فهو "GPTBot". وتنشر OpenAI أيضًا نطاقات IP الخاصة بالزاحف في ملف JSON، ما يتيح التحقق من أن الزيارة أصلية.
  • OAI-SearchBot: مسؤول عن إدراج صفحتك ضمن نتائج بحث ChatGPT ومصادره التي يستشهد بها، والرمز الخاص به هو "OAI-SearchBot". حظره يعادل الانسحاب طوعًا من فرص الظهور في ChatGPT، ومع ذلك فهو الزاحف الذي يحظره كثيرون عن طريق الخطأ.
  • ChatGPT-User: يعمل عندما يطلب المستخدم تصفح عنوان URL الخاص بك أو التحقق منه داخل المحادثة. رمزه هو "ChatGPT-User". ينفذ زحفًا فوريًا لصفحة واحدة، ولا يضيف محتواها إلى بيانات التدريب.

Google-Extended ليس زاحفًا، بل مفتاح تحكم

غالبًا ما يرد Google-Extended ضمن «قوائم زواحف الذكاء الاصطناعي»، لكنه ليس زاحفًا سيظهر في سجلات خادمك أصلًا، بل رمز منتج داخل robots.txt. السماح له أو حظره يؤثر فقط في إمكانية استخدام Google لمحتواك في تدريب Gemini وبعض عمليات التوليد، ولا يؤثر إطلاقًا في الفهرسة العامة التي ينفذها Googlebot. لذلك لن يؤدي حظر Google-Extended إلى إخراج موقعك من بحث Google، وغالبًا لن يزيله من AI Overviews أيضًا، لأن هذه الميزة تعتمد أساسًا على بيانات فهرس Googlebot الحالي. ويتبع Applebot-Extended من Apple التصميم نفسه؛ فهو مفتاح التحكم في تدريب Apple Intelligence، ويختلف عن Applebot المسؤول عن الفهرسة العامة.

PerplexityBot والزواحف التي لا تلتزم بالقواعد

لكي يستشهد Perplexity بمحتواك، يجب السماح لكل من PerplexityBot المخصص للفهرسة وPerplexity-User المخصص لطلبات المستخدم الفورية. لكن ينبغي الانتباه إلى واقع عملي: robots.txt ليس سوى اتفاق طوعي ولا يملك قوة إنفاذ. ففي 2025، اتهمت Cloudflare شركة Perplexity علنًا بأنها واصلت الزحف بعد حظرها عبر robots.txt، مستخدمةً User-Agent غير معلن يحاكي متصفحًا عاديًا. كما اشتهر Bytespider سابقًا بزحفه عالي التردد مع مراعاة محدودة جدًا لمعدل الطلبات. وهكذا تصح حقيقتان في الوقت نفسه: قد لا تنجح في إيقاف الزاحف الذي تريد حظره، كما أن السماح لزاحف مرغوب فيه يتطلب وسيلة تؤكد أنه الزاحف الأصلي فعلًا.

Amazonbot وClaudeBot وأسماء أخرى ستصادفها في السجلات

  • ClaudeBot: زاحف التدريب التابع لـAnthropic. وقد تظهر في السجلات أيضًا رموز Claude-User المخصص لطلبات المستخدم، إلى جانب الرمزين الأقدم anthropotic-ai وClaude-Web.
  • Amazonbot: تستخدمه Alexa وخدمات الذكاء الاصطناعي من Amazon، ويتضمن User-Agent القيمة "Amazonbot/0.1".
  • CCBot: الزاحف التابع لـCommon Crawl. ليست Common Crawl شركة ذكاء اصطناعي، لكن مجموعتها العامة من البيانات تُستخدم في تدريب عدد كبير من النماذج. لذلك تمثل مسارًا غير مباشر للتدريب يسهل إغفاله عند ضبط سياسات الوصول.
  • أسماء شائعة أخرى: Meta-ExternalAgent (لتدريب Meta) وMeta-ExternalFetcher (يعمل بطلب المستخدم) وYouBot (You.com) وDuckAssistBot (DuckDuckGo) وcohere-ai (Cohere) وMistralAI-User وDiffbot وTimpibot.
رسم تخطيطي للأنواع الثلاثة الرئيسية من زواحف الذكاء الاصطناعي: زواحف التدريب والاسترجاع والتشغيل بطلب المستخدم، مع أمثلة ممثلة لكل نوع.
تصنيف زواحف الذكاء الاصطناعي إلى زواحف تدريب واسترجاع وتشغيل بطلب المستخدم هو الأساس لاتخاذ قرار السماح أو الحظر في robots.txt.

كيف تكتب robots.txt في 2026

لا توجد سياسة واحدة تناسب الجميع. لكن الإعداد الافتراضي المنطقي لمعظم مواقع B2B الساعية إلى تحسين GEO هو السماح لزواحف البحث والزواحف التي تعمل بطلب المستخدم، حتى تتمكن محركات الذكاء الاصطناعي من قراءة المحتوى والاستشهاد به. أما زواحف التدريب، فيُتخذ القرار بشأن كل منها وفق قيمة المحتوى واستراتيجية العلامة التجارية. وفيما يلي مثال يعطي الأولوية للظهور.

  • User-agent: OAI-SearchBot → Allow: / (للحفاظ على الظهور في ChatGPT)
  • User-agent: PerplexityBot → Allow: / (للدخول إلى مجموعة مصادر Perplexity)
  • User-agent: ChatGPT-User وPerplexity-User → Allow: / (لا تحظر عملية التحقق التي يطلبها المستخدم مباشرة)
  • User-agent: Googlebot → Allow: / (تعتمد AI Overviews والنتائج العامة على الفهرس نفسه، لذا يجب السماح له)
  • User-agent: GPTBot وCCBot وGoogle-Extended → يُحدد القرار وفق السياسة (استخدم Disallow: / إذا كنت لا تريد استخدام المحتوى في التدريب، ولن يؤثر ذلك في فرص الظهور المذكورة أعلاه)

لا تعتمد على robots.txt وحده

يستطيع robots.txt إيقاف الزواحف الملتزمة بالقواعد، لكنه لن يردع زاحفًا مصممًا على تجاوزها. وإذا أردت تحكمًا فعليًا، فعليك الانتقال إلى مستوى آخر: استخدم البحث العكسي في DNS مع التحقق الأمامي، وقارن عناوين IP بنطاقات العناوين التي تعلنها كل شركة رسميًا للتحقق من هوية الزاحف. وعند مواجهة انتحال الهوية أو الزحف عالي التردد، استخدم WAF أو أدوات Cloudflare لإدارة زواحف الذكاء الاصطناعي أو تقييد معدل الطلبات، بدل الاكتفاء بإضافة سطر آخر إلى robots.txt. ولا تقل المراقبة أهمية عن الحظر: راجع سجلات وصول الخادم بانتظام لمعرفة زواحف الذكاء الاصطناعي التي زارت موقعك فعلًا ومدى تكرار زياراتها. هذه إشارتك المباشرة لقياس ظهورك في GEO، وهي أدق من أي توقع.

تتغير قائمة زواحف الذكاء الاصطناعي كل موسم؛ تظهر أسماء جديدة وتتبدل الرموز المستخدمة. وبدل حفظ كل اسم، تذكّر منطق التصنيف: التدريب والاسترجاع والتشغيل بطلب المستخدم، فلكل فئة أثر استراتيجي مختلف. وإذا لم تكن متأكدًا من محركات الذكاء الاصطناعي التي تزحف إلى موقعك حاليًا، أو من الصفحات الغائبة عن المصادر المرجعية، فإن تدقيق GEO من Tenten يعرض سجلات وصول الزواحف وحالة الاستشهاد بالمحتوى في صورة واضحة. ولتحديد الفجوات أولًا، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة عبر (/contact).

الأسئلة الشائعة

هل سيؤدي حظر GPTBot إلى اختفاء موقعي من ChatGPT؟
لا. تقتصر مهمة GPTBot على جمع البيانات المستخدمة في تدريب النموذج، بينما يتولى OAI-SearchBot تحديد إمكانية ظهور صفحاتك في إجابات ChatGPT. وللحفاظ على ظهورك في ChatGPT، اسمح لـOAI-SearchBot وChatGPT-User بالوصول، واتخذ قرارًا منفصلًا بشأن GPTBot.
هل Google-Extended زاحف؟
لا. إنه رمز منتج داخل robots.txt، ولا يتحكم إلا في إمكانية استخدام Google لمحتواك لتدريب Gemini. ولا يؤثر في الفهرسة العامة التي ينفذها Googlebot، كما أن حظره لن يُخفي موقعك من نتائج بحث Google أو من معظم نتائج AI Overviews.
ماذا أفعل إذا عجز robots.txt عن إيقاف زواحف الذكاء الاصطناعي غير الملتزمة؟
robots.txt ليس سوى اتفاق طوعي. وعند مواجهة زحف ينتحل هوية المتصفح أو يرسل الطلبات بوتيرة مرتفعة، يكون استخدام WAF أو أدوات Cloudflare لإدارة زواحف الذكاء الاصطناعي وتقييد معدل الطلبات أكثر فاعلية من إضافة سطر آخر إلى robots.txt. ويجب أيضًا التحقق من المصدر عبر البحث العكسي في DNS ومقارنة العنوان بنطاقات IP المعلنة رسميًا.

مقالات ذات صلة

شعاع ضوئي بنفسجي بلون الخزامى يشق مشهدًا مظلمًا نحو ملف llms.txt في المجلد الجذري للموقع، في إشارة إلى مسار القراءة الممهّد للذكاء الاصطناعي.التنفيذ

التنفيذ التقني لـ AEO

الدليل العملي الشامل لتطبيق llms.txt: الصياغة، والموقع، وآلية قراءة زواحف الذكاء الاصطناعي

لن يجعل llms.txt أنظمة الذكاء الاصطناعي تستشهد بك تلقائيًا. إنه خريطة بصيغة Markdown توضع في المجلد الجذري للنطاق. يشرح هذا الدليل صيغته، وموقعه الصحيح، وآلية قراءة زواحف الذكاء الاصطناعي له.

5 دقيقة قراءة
تصور تجريدي لشعاع ناعم بلون الخزامى يمر عبر طبقات شجرة البنية، في إشارة إلى أن الوسم الدلالي نفسه تقرؤه قارئات الشاشة ووكلاء الذكاء الاصطناعي معاً.التنفيذ

التنفيذ التقني لـ AEO

ترميز إمكانية الوصول (ARIA) وقابلية القراءة بالذكاء الاصطناعي: إعداد واحد يخدم قارئات الشاشة ووكلاء الذكاء الاصطناعي

ترميز ARIA الذي تضيفه لتحسين إمكانية الوصول هو، في الواقع، أنظف مصدر يمكن تقديمه لمحرك الذكاء الاصطناعي؛ إعداد واحد وفائدة للطرفين.

4 دقيقة قراءة
غلاف بتكوين تجريدي من الضوء والظل يجسّد صفحة ركيزة تتصل بعدة صفحات عنقودية لتشكّل مركز محتوى.التنفيذ

التنفيذ التقني لـ AEO

تطبيق الصفحات الركيزة والصفحات العنقودية: كيف تبني مركز محتوى بالصينية التقليدية يسهل على محركات الذكاء الاصطناعي استخراجه

بنية الركيزة والعناقيد ليست لعبة روابط داخلية لتمرير الأهمية، بل طريقة لتقسيم الموضوع إلى صفحات مستقلة يسهل على محركات الذكاء الاصطناعي استخراجها، مع ترابط مرجعي واضح بينها. تقدم المقالة تسلسلًا عمليًا لبناء مركز محتوى بالصينية التقليدية.

5 دقيقة قراءة

الخطوة التالية

ما مدى ظهور علامتك التجارية في إجابات الذكاء الاصطناعي؟

خلال تشخيص GEO لمدة 30 دقيقة، نحدد فجوات الظهور في أهم محركات الذكاء الاصطناعي وما ينبغي تحسينه أولاً.

احجز التشخيص