Tenten AIGEO
العودة إلى المدونة
التنفيذ التقني لـ AEOالتنفيذ

إدارة زواحف الذكاء الاصطناعي عبر Cloudflare: حظر غير المصرّح به والسماح للروبوتات التي تريد الاستشهاد بمحتواك

هل تريد حظر زواحف الذكاء الاصطناعي عبر Cloudflare من دون أن تختفي من إجابات محركات الذكاء الاصطناعي؟ يوضح هذا الدليل الفروق بين زواحف التدريب والاسترجاع وفهرسة البحث، ويشرح كيفية استخدام AI Crawl Control وقواعد WAF المخصصة لحظر الروبوتات غير المرغوب فيها بدقة، مع إبقاء محتواك متاحًا للاستشهاد به في ChatGPT وPerplexity.

فريق Tenten GEOنُشر في 2024-12-025 دقيقة قراءة
تصميم مفاهيمي لدرع Cloudflare يفرز حركة زواحف الذكاء الاصطناعي ويسمح بمرور بعض الروبوتات

يبدو حظر جميع زواحف الذكاء الاصطناعي بنقرة واحدة خيارًا مثاليًا، لكنه قد يُخرج موقعك من إجابات الذكاء الاصطناعي. فالروبوت الذي يتيح لـ ChatGPT وPerplexity الاستشهاد بمحتواك يختلف غالبًا عن الروبوت الذي يجمعه لتدريب النماذج، بينما يعطّل مفتاح «Block AI Bots» في Cloudflare النوعين معًا.

تكتشف فرق كثيرة أن الذكاء الاصطناعي يزحف إلى مواقعها عندما ترتفع حركة الخادم بلا تفسير، أو حين يسأل المستشار القانوني: «هل استُخدم محتوانا في التدريب؟». يكون رد الفعل المعتاد هو فتح Cloudflare والبحث عن خيار يحظر جميع زواحف الذكاء الاصطناعي. والخيار موجود فعلًا ولا يستغرق تفعيله سوى ثوانٍ، لكن استخدامه في شركة B2B SaaS تريد الظهور ضمن توصيات محركات الذكاء الاصطناعي يشبه إغلاق مدخل مهم لتدفق الإيرادات. لذلك يشرح هذا المقال نهجًا أدق: احظر ما لا تريده، واترك الطريق مفتوحًا أمام الروبوتات التي تريدها أن تستشهد بمحتواك.

لنبدأ بتمييز أساسي: زواحف الذكاء الاصطناعي ثلاثة أنواع، ولا يصح التعامل معها بسياسة واحدة.

ما نطلق عليه عمومًا «زواحف الذكاء الاصطناعي» يؤدي في الواقع ثلاث وظائف مختلفة. وفهم هذه الفئات هو ما يحدد الروبوت الذي ينبغي حجبه، والروبوت الذي يجب ألّا تعيق وصوله.

  • زواحف التدريب: تجمع محتواك لتغذية عمليات تدريب النماذج. ومن أبرزها GPTBot من OpenAI وClaudeBot من Anthropic وBytespider وCCBot التابع لـ Common Crawl. حظر هذه الزواحف لا يؤثر في الاستشهاد بمحتواك.
  • زواحف الاسترجاع: عندما يطرح المستخدم سؤالًا في ChatGPT أو Perplexity، تصل هذه الروبوتات إلى صفحتك في حينه، ثم تستخدم محتواها في صياغة الإجابة مع إرفاق المصدر. ومن أمثلتها OAI-SearchBot وChatGPT-User وPerplexityBot وPerplexity-User وClaude-User. هذه الفئة هي بوابتك إلى إجابات الذكاء الاصطناعي؛ فإذا حجبتها، اختفى محتواك منها.
  • زواحف فهرسة البحث: وأبرزها Googlebot وBingbot. لا يقتصر دورهما على البحث التقليدي؛ إذ تعتمد Google AI Overviews على Googlebot، بينما يعتمد ChatGPT وCopilot على فهرس Bing في بعض النتائج. وإذا حظرتهما بالخطأ، ستتراجع نتائج SEO وظهور علامتك في الذكاء الاصطناعي معًا.

المفارقة الأهم هنا أن حظر زواحف التدريب لا يعني اختفاءك من إجابات الذكاء الاصطناعي. فالاستشهاد بمحتواك يعتمد على ما تستطيع زواحف الاسترجاع وفهرسة البحث الوصول إليه الآن، لا على استخدام المحتوى في تدريب نموذج قبل أشهر. وبذلك يمكنك رفض استخدام محتواك في التدريب، مع مواصلة العمل على ظهوره والاستشهاد به فورًا، شرط أن تميّز الروبوتات بدقة.

الخطوة 1: اعرف من يزحف إلى موقعك عبر Cloudflare

قبل تطبيق أي حظر، ابدأ بقراءة البيانات. تعرض أداة «AI Crawl Control» في لوحة Cloudflare، التي كانت تُعرف سابقًا باسم AI Audit، حجم عمليات الزحف الأخيرة لكل روبوت، والمسارات التي وصل إليها، وما إذا كان مسموحًا به أو محظورًا حاليًا. وغالبًا ما تكشف المراجعة الأولى مفاجآت؛ فقد يتجاوز حجم طلبات Bytespider أو GPTBot طلبات Googlebot. هذه القائمة هي أساس قراراتك التالية: حدّد الروبوتات التي تستهلك موارد الخادم فعلًا، وتحقق أيضًا من زواحف الاسترجاع التي لم تزُر الموقع أصلًا، لأن غيابها يعني أن محركها لم يرَ محتواك بعد.

مخطط يقارن أنواع زواحف الذكاء الاصطناعي الثلاثة واستراتيجيات السماح أو الحظر المناسبة لكل نوع
يمكن حظر زواحف التدريب، بينما ينبغي السماح بزواحف الاسترجاع وفهرسة البحث؛ فالتصنيف الصحيح يحدد إمكانية استشهاد الذكاء الاصطناعي بمحتواك.

الخطوة 2: طبّق السماح والحظر حسب الفئة، ولا تستخدم المفتاح الشامل

توفر Cloudflare ثلاث أدوات تختلف في مستوى التحكم، ويعطي الجمع بينها أفضل نتيجة. أبسطها مفتاح «Block AI Bots» بنقرة واحدة ضمن إعدادات الأمان. هو مريح، لكنه خيار شامل قد يحظر زواحف الاسترجاع أيضًا؛ لذلك تجنّبه ما لم يكن ظهورك في إجابات الذكاء الاصطناعي غير مهم إطلاقًا. أما robots.txt المُدار، فيناسب زواحف التدريب المنضبطة التي تحترم التعليمات. وتبقى قواعد WAF المخصصة الأداة الأدق، لأنها تتيح السماح لروبوت بعينه أو حجبه، ولهذا ينبغي أن تكون محور الاستراتيجية.

  1. أنشئ قاعدة حظر ضمن قواعد WAF المخصصة، وطابق وكلاء المستخدم لزواحف التدريب مثل Bytespider وCCBot وGPTBot وClaudeBot، ثم اضبط الإجراء على الحظر أو إعادة الرمز 403.
  2. أنشئ قاعدة Skip أخرى تسمح بوضوح لكل من OAI-SearchBot وPerplexityBot وPerplexity-User وChatGPT-User وGooglebot وBingbot. ضعها قبل قواعد الحظر لضمان استمرار الاسترجاع من دون عوائق.
  3. اعتمد حقل «verified bot» في Cloudflare للمطابقة بدلًا من الاكتفاء بسلسلة وكيل المستخدم، لأن هذه السلسلة قابلة للتزوير ويمكن لجهة ما انتحال Googlebot. تتحقق Cloudflare من الروبوتات الموثقة باستخدام DNS العكسي والتوقيعات، ما يساعد على حظر المنتحلين.
  4. أما مفهوم Pay Per Crawl من Cloudflare، فيتيح إعادة HTTP 402 إلى زاحف التدريب واشتراط الدفع قبل السماح له بجمع المحتوى، بحيث يتحول الاستخدام المجاني لمحتواك إلى إيراد أو ورقة تفاوض.

ما الذي ينبغي السماح به، وما الذي يستحق الحظر؟

إذا كان هدفك أن توصي محركات الذكاء الاصطناعي بمنتجك، كما هي الحال لدى معظم شركات B2B SaaS، فالسياسة الافتراضية واضحة: اسمح لجميع زواحف الاسترجاع وفهرسة البحث، واحظر زواحف التدريب بصورة انتقائية. انتبه إلى فخين شائعين. أولًا، Google-Extended ليس هو Googlebot؛ فالأول يتحكم فقط في استخدام محتواك لتدريب Gemini وتأصيل إجاباته. حجبه لا يزيلك من AI Overviews، لكن حظر Googlebot يعني أن منظومة Google بأكملها لن تتمكن من رؤية موقعك. ثانيًا، لا تحظر Bing، لأن بعض نتائج ChatGPT وCopilot تعتمد على فهرسه، وبالتالي سيؤثر حظر Bingbot فيها أيضًا.

الخطوة 3: تحقّق من النتائج لتفادي الحظر غير المقصود

بعد تفعيل القاعدة، لا تفترض أنها ستعمل كما أردت. ارجع إلى AI Crawl Control وسجلات أحداث WAF، ثم تحقق من كل فئة: هل تلقى زاحف التدريب الرمز 403؟ وهل ما زالت زواحف الاسترجاع وGooglebot تتلقى الرمز 200 باستمرار؟ أكثر الأخطاء شيوعًا هو أن تكون قاعدة الحظر واسعة إلى حد يشمل Googlebot. تظن أنك تحظر الذكاء الاصطناعي فقط، ثم تبدأ نتائج البحث العضوي في الانهيار بعد أسبوعين. افحص عنوان URL عبر Google Search Console أو راجع رمز استجابة الخادم مباشرة، وراقب النتائج على مدار أسبوع للتأكد من أن قائمة السماح تعمل بسلاسة قبل إنهاء المهمة.

حظر زواحف الذكاء الاصطناعي سهل؛ التحدي الحقيقي هو حظر ما يستحق الحظر فقط، وفتح الطريق أمام الروبوتات التي تحمل محتواك إلى الإجابات.Tenten GEO

الحظر مجرد دفاع؛ أما الهدف فهو أن يُستشهد بمحتواك.

الإدارة الجيدة لحركة الزواحف تحمي موارد الخادم من الاستهلاك المجاني أو الضغط الذي قد يؤدي إلى تعطله. لكن السماح لزواحف الاسترجاع لا يضمن أن يستشهد الذكاء الاصطناعي بك؛ إذ يجب أن تتمكن من الوصول إلى محتواك وفهمه وتقييمه بوصفه مصدرًا جديرًا بالاستشهاد. هنا تبدأ المنافسة الحقيقية في GEO: بنية المحتوى، وترميز الكيانات، واتساق العلامة التجارية عبر المنصات. ضبط Cloudflare يفتح الباب، أما الوصول إلى الإجابة نفسها فمعركة أخرى. وإذا أردت معرفة سبب غيابك عن الاستشهادات في محركات الذكاء الاصطناعي الستة، أو ما إذا كان السماح للزواحف لا يحقق نتيجة، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة. سنستخدم أسئلتك الفعلية لنوضح مواضع الفجوات.

الأسئلة الشائعة

هل يؤدي حظر زواحف الذكاء الاصطناعي عبر Cloudflare إلى اختفائي من ChatGPT أو Perplexity؟
يعتمد ذلك على الزاحف الذي تحظره. فحظر زواحف التدريب مثل GPTBot وClaudeBot لا يؤثر في الاستشهادات، بينما يؤدي حظر زواحف الاسترجاع مثل OAI-SearchBot وPerplexityBot إلى اختفائك من إجابات الذكاء الاصطناعي. الحل هو تطبيق سياسة مختلفة لكل فئة، لا حظر الجميع بنقرة واحدة.
ما الفرق بين robots.txt وCloudflare WAF عند حظر زواحف الذكاء الاصطناعي؟
يمثل robots.txt طلبًا يعتمد على التزام الزاحف؛ فالروبوت المنضبط يمتثل، والخبيث قد يتجاهله تمامًا. أما WAF فيفرض الحظر بإيقاف الطلبات مباشرة عند حافة شبكة Cloudflare، بصرف النظر عن التزام الطرف الآخر. لذلك تحتاج إلى WAF إذا أردت منع الزواحف غير الممتثلة فعليًا.
ما زواحف الذكاء الاصطناعي التي ينبغي السماح لها حتى يُستشهد بمحتواي؟
اسمح على الأقل لكل من OAI-SearchBot وChatGPT-User وPerplexityBot وPerplexity-User وClaude-User، إلى جانب Googlebot وBingbot. تحدد المجموعة الأولى ظهورك في إجابات ChatGPT وPerplexity، بينما يؤثر الروبوتان الأخيران في Google AI Overviews وCopilot.

مقالات ذات صلة

شعاع ضوئي بنفسجي بلون الخزامى يشق مشهدًا مظلمًا نحو ملف llms.txt في المجلد الجذري للموقع، في إشارة إلى مسار القراءة الممهّد للذكاء الاصطناعي.التنفيذ

التنفيذ التقني لـ AEO

الدليل العملي الشامل لتطبيق llms.txt: الصياغة، والموقع، وآلية قراءة زواحف الذكاء الاصطناعي

لن يجعل llms.txt أنظمة الذكاء الاصطناعي تستشهد بك تلقائيًا. إنه خريطة بصيغة Markdown توضع في المجلد الجذري للنطاق. يشرح هذا الدليل صيغته، وموقعه الصحيح، وآلية قراءة زواحف الذكاء الاصطناعي له.

5 دقيقة قراءة
تصور تجريدي لشعاع ناعم بلون الخزامى يمر عبر طبقات شجرة البنية، في إشارة إلى أن الوسم الدلالي نفسه تقرؤه قارئات الشاشة ووكلاء الذكاء الاصطناعي معاً.التنفيذ

التنفيذ التقني لـ AEO

ترميز إمكانية الوصول (ARIA) وقابلية القراءة بالذكاء الاصطناعي: إعداد واحد يخدم قارئات الشاشة ووكلاء الذكاء الاصطناعي

ترميز ARIA الذي تضيفه لتحسين إمكانية الوصول هو، في الواقع، أنظف مصدر يمكن تقديمه لمحرك الذكاء الاصطناعي؛ إعداد واحد وفائدة للطرفين.

4 دقيقة قراءة
غلاف بتكوين تجريدي من الضوء والظل يجسّد صفحة ركيزة تتصل بعدة صفحات عنقودية لتشكّل مركز محتوى.التنفيذ

التنفيذ التقني لـ AEO

تطبيق الصفحات الركيزة والصفحات العنقودية: كيف تبني مركز محتوى بالصينية التقليدية يسهل على محركات الذكاء الاصطناعي استخراجه

بنية الركيزة والعناقيد ليست لعبة روابط داخلية لتمرير الأهمية، بل طريقة لتقسيم الموضوع إلى صفحات مستقلة يسهل على محركات الذكاء الاصطناعي استخراجها، مع ترابط مرجعي واضح بينها. تقدم المقالة تسلسلًا عمليًا لبناء مركز محتوى بالصينية التقليدية.

5 دقيقة قراءة

الخطوة التالية

ما مدى ظهور علامتك التجارية في إجابات الذكاء الاصطناعي؟

خلال تشخيص GEO لمدة 30 دقيقة، نحدد فجوات الظهور في أهم محركات الذكاء الاصطناعي وما ينبغي تحسينه أولاً.

احجز التشخيص