يبدو حظر جميع زواحف الذكاء الاصطناعي بنقرة واحدة خيارًا مثاليًا، لكنه قد يُخرج موقعك من إجابات الذكاء الاصطناعي. فالروبوت الذي يتيح لـ ChatGPT وPerplexity الاستشهاد بمحتواك يختلف غالبًا عن الروبوت الذي يجمعه لتدريب النماذج، بينما يعطّل مفتاح «Block AI Bots» في Cloudflare النوعين معًا.
تكتشف فرق كثيرة أن الذكاء الاصطناعي يزحف إلى مواقعها عندما ترتفع حركة الخادم بلا تفسير، أو حين يسأل المستشار القانوني: «هل استُخدم محتوانا في التدريب؟». يكون رد الفعل المعتاد هو فتح Cloudflare والبحث عن خيار يحظر جميع زواحف الذكاء الاصطناعي. والخيار موجود فعلًا ولا يستغرق تفعيله سوى ثوانٍ، لكن استخدامه في شركة B2B SaaS تريد الظهور ضمن توصيات محركات الذكاء الاصطناعي يشبه إغلاق مدخل مهم لتدفق الإيرادات. لذلك يشرح هذا المقال نهجًا أدق: احظر ما لا تريده، واترك الطريق مفتوحًا أمام الروبوتات التي تريدها أن تستشهد بمحتواك.
لنبدأ بتمييز أساسي: زواحف الذكاء الاصطناعي ثلاثة أنواع، ولا يصح التعامل معها بسياسة واحدة.
ما نطلق عليه عمومًا «زواحف الذكاء الاصطناعي» يؤدي في الواقع ثلاث وظائف مختلفة. وفهم هذه الفئات هو ما يحدد الروبوت الذي ينبغي حجبه، والروبوت الذي يجب ألّا تعيق وصوله.
- زواحف التدريب: تجمع محتواك لتغذية عمليات تدريب النماذج. ومن أبرزها GPTBot من OpenAI وClaudeBot من Anthropic وBytespider وCCBot التابع لـ Common Crawl. حظر هذه الزواحف لا يؤثر في الاستشهاد بمحتواك.
- زواحف الاسترجاع: عندما يطرح المستخدم سؤالًا في ChatGPT أو Perplexity، تصل هذه الروبوتات إلى صفحتك في حينه، ثم تستخدم محتواها في صياغة الإجابة مع إرفاق المصدر. ومن أمثلتها OAI-SearchBot وChatGPT-User وPerplexityBot وPerplexity-User وClaude-User. هذه الفئة هي بوابتك إلى إجابات الذكاء الاصطناعي؛ فإذا حجبتها، اختفى محتواك منها.
- زواحف فهرسة البحث: وأبرزها Googlebot وBingbot. لا يقتصر دورهما على البحث التقليدي؛ إذ تعتمد Google AI Overviews على Googlebot، بينما يعتمد ChatGPT وCopilot على فهرس Bing في بعض النتائج. وإذا حظرتهما بالخطأ، ستتراجع نتائج SEO وظهور علامتك في الذكاء الاصطناعي معًا.
المفارقة الأهم هنا أن حظر زواحف التدريب لا يعني اختفاءك من إجابات الذكاء الاصطناعي. فالاستشهاد بمحتواك يعتمد على ما تستطيع زواحف الاسترجاع وفهرسة البحث الوصول إليه الآن، لا على استخدام المحتوى في تدريب نموذج قبل أشهر. وبذلك يمكنك رفض استخدام محتواك في التدريب، مع مواصلة العمل على ظهوره والاستشهاد به فورًا، شرط أن تميّز الروبوتات بدقة.
الخطوة 1: اعرف من يزحف إلى موقعك عبر Cloudflare
قبل تطبيق أي حظر، ابدأ بقراءة البيانات. تعرض أداة «AI Crawl Control» في لوحة Cloudflare، التي كانت تُعرف سابقًا باسم AI Audit، حجم عمليات الزحف الأخيرة لكل روبوت، والمسارات التي وصل إليها، وما إذا كان مسموحًا به أو محظورًا حاليًا. وغالبًا ما تكشف المراجعة الأولى مفاجآت؛ فقد يتجاوز حجم طلبات Bytespider أو GPTBot طلبات Googlebot. هذه القائمة هي أساس قراراتك التالية: حدّد الروبوتات التي تستهلك موارد الخادم فعلًا، وتحقق أيضًا من زواحف الاسترجاع التي لم تزُر الموقع أصلًا، لأن غيابها يعني أن محركها لم يرَ محتواك بعد.

الخطوة 2: طبّق السماح والحظر حسب الفئة، ولا تستخدم المفتاح الشامل
توفر Cloudflare ثلاث أدوات تختلف في مستوى التحكم، ويعطي الجمع بينها أفضل نتيجة. أبسطها مفتاح «Block AI Bots» بنقرة واحدة ضمن إعدادات الأمان. هو مريح، لكنه خيار شامل قد يحظر زواحف الاسترجاع أيضًا؛ لذلك تجنّبه ما لم يكن ظهورك في إجابات الذكاء الاصطناعي غير مهم إطلاقًا. أما robots.txt المُدار، فيناسب زواحف التدريب المنضبطة التي تحترم التعليمات. وتبقى قواعد WAF المخصصة الأداة الأدق، لأنها تتيح السماح لروبوت بعينه أو حجبه، ولهذا ينبغي أن تكون محور الاستراتيجية.
- أنشئ قاعدة حظر ضمن قواعد WAF المخصصة، وطابق وكلاء المستخدم لزواحف التدريب مثل Bytespider وCCBot وGPTBot وClaudeBot، ثم اضبط الإجراء على الحظر أو إعادة الرمز 403.
- أنشئ قاعدة Skip أخرى تسمح بوضوح لكل من OAI-SearchBot وPerplexityBot وPerplexity-User وChatGPT-User وGooglebot وBingbot. ضعها قبل قواعد الحظر لضمان استمرار الاسترجاع من دون عوائق.
- اعتمد حقل «verified bot» في Cloudflare للمطابقة بدلًا من الاكتفاء بسلسلة وكيل المستخدم، لأن هذه السلسلة قابلة للتزوير ويمكن لجهة ما انتحال Googlebot. تتحقق Cloudflare من الروبوتات الموثقة باستخدام DNS العكسي والتوقيعات، ما يساعد على حظر المنتحلين.
- أما مفهوم Pay Per Crawl من Cloudflare، فيتيح إعادة HTTP 402 إلى زاحف التدريب واشتراط الدفع قبل السماح له بجمع المحتوى، بحيث يتحول الاستخدام المجاني لمحتواك إلى إيراد أو ورقة تفاوض.
ما الذي ينبغي السماح به، وما الذي يستحق الحظر؟
إذا كان هدفك أن توصي محركات الذكاء الاصطناعي بمنتجك، كما هي الحال لدى معظم شركات B2B SaaS، فالسياسة الافتراضية واضحة: اسمح لجميع زواحف الاسترجاع وفهرسة البحث، واحظر زواحف التدريب بصورة انتقائية. انتبه إلى فخين شائعين. أولًا، Google-Extended ليس هو Googlebot؛ فالأول يتحكم فقط في استخدام محتواك لتدريب Gemini وتأصيل إجاباته. حجبه لا يزيلك من AI Overviews، لكن حظر Googlebot يعني أن منظومة Google بأكملها لن تتمكن من رؤية موقعك. ثانيًا، لا تحظر Bing، لأن بعض نتائج ChatGPT وCopilot تعتمد على فهرسه، وبالتالي سيؤثر حظر Bingbot فيها أيضًا.
الخطوة 3: تحقّق من النتائج لتفادي الحظر غير المقصود
بعد تفعيل القاعدة، لا تفترض أنها ستعمل كما أردت. ارجع إلى AI Crawl Control وسجلات أحداث WAF، ثم تحقق من كل فئة: هل تلقى زاحف التدريب الرمز 403؟ وهل ما زالت زواحف الاسترجاع وGooglebot تتلقى الرمز 200 باستمرار؟ أكثر الأخطاء شيوعًا هو أن تكون قاعدة الحظر واسعة إلى حد يشمل Googlebot. تظن أنك تحظر الذكاء الاصطناعي فقط، ثم تبدأ نتائج البحث العضوي في الانهيار بعد أسبوعين. افحص عنوان URL عبر Google Search Console أو راجع رمز استجابة الخادم مباشرة، وراقب النتائج على مدار أسبوع للتأكد من أن قائمة السماح تعمل بسلاسة قبل إنهاء المهمة.
حظر زواحف الذكاء الاصطناعي سهل؛ التحدي الحقيقي هو حظر ما يستحق الحظر فقط، وفتح الطريق أمام الروبوتات التي تحمل محتواك إلى الإجابات.— Tenten GEO
الحظر مجرد دفاع؛ أما الهدف فهو أن يُستشهد بمحتواك.
الإدارة الجيدة لحركة الزواحف تحمي موارد الخادم من الاستهلاك المجاني أو الضغط الذي قد يؤدي إلى تعطله. لكن السماح لزواحف الاسترجاع لا يضمن أن يستشهد الذكاء الاصطناعي بك؛ إذ يجب أن تتمكن من الوصول إلى محتواك وفهمه وتقييمه بوصفه مصدرًا جديرًا بالاستشهاد. هنا تبدأ المنافسة الحقيقية في GEO: بنية المحتوى، وترميز الكيانات، واتساق العلامة التجارية عبر المنصات. ضبط Cloudflare يفتح الباب، أما الوصول إلى الإجابة نفسها فمعركة أخرى. وإذا أردت معرفة سبب غيابك عن الاستشهادات في محركات الذكاء الاصطناعي الستة، أو ما إذا كان السماح للزواحف لا يحقق نتيجة، يمكنك حجز جلسة تشخيص GEO مدتها 30 دقيقة. سنستخدم أسئلتك الفعلية لنوضح مواضع الفجوات.



