انتقل إلى المحتوى
SEO Madmanby Adam Hafez

من يحظر برامج زحف الذكاء الاصطناعي؟

قرأنا ملفات robots.txt لـ 60 ناشرًا ومورّد SEO. مواقع الأخبار تحظر برامج زحف الذكاء الاصطناعي تقريبًا بلا استثناء، وصناعة SEO لا تفعل.

نُشر في  · قراءة في دقيقتين

كتبهAdam Hafez
شارك
Markdown
مراوح تبريد الخوادم داخل مركز بيانات

أهم النقاط

  • من بين 57 موقعًا أمكن قراءة robots.txt فيها، يسمّي 33 موقعًا برنامج زحف واحدًا على الأقل للذكاء الاصطناعي، ويحظر 29 منها واحدًا على الأقل حظرًا كاملًا.
  • يحظر ناشرو الأخبار بشبه قاعدة ثابتة: 24 من 28 موقعًا أمكن الوصول إليه يمنعون وكيل ذكاء اصطناعي مسمّى من الموقع كله.
  • تتصرف المواقع المتخصصة في SEO بعكس ذلك، إذ يحظر موقعان فقط من 15 أي برنامج زحف للذكاء الاصطناعي بالاسم.
  • أكثر الوكلاء حظرًا ClaudeBot وBytespider عند 27 موقعًا لكل منهما، ثم CCBot عند 25 وApplebot-Extended عند 24.
  • لا يكاد أحد يفصل بين التدريب والاسترجاع: يحظر 9 مواقع GPTBot وOAI-SearchBot معًا، وموقع Forbes وحده يحظر وكيل التدريب ويترك وكيل البحث.

أمام كل ناشر في هذه العيّنة عامان ليقرر ما يفعله مع برامج زحف الذكاء الاصطناعي. وفي 10 سبتمبر 2026 سألنا الستين موقعًا السؤال نفسه، في المكان الوحيد الذي تُكتب فيه الإجابة: robots.txt.

كيف أجرينا القياس؟

طلب واحد لكل موقع، يُحلَّل بالقواعد. جلبنا /robots.txt بطلب GET واحد، وجمعناه في مجموعات كما يحددها RFC 9309. ثم سألنا عن كل وكيل: هل تمنع مجموعة تسمّيه الموقع كله؟ وفحصنا 15 وكيلًا، من GPTBot وClaudeBot إلى Bytespider وApplebot-Extended.

أمكن قراءة 57 ملفًا من 60. استبعدنا Politico (403) وNPR (فشل اتصال) وStack Overflow (418) من المقامات، ولم نعدّها مفتوحة. والنتيجة الكاملة لكل موقع منشورة بصيغة JSON، فيمكن مطابقة كل رقم أدناه بالملف الذي خرج منه.

ماذا تقول الملفات؟

يحظر 29 موقعًا من 57 برنامج زحف واحدًا على الأقل حظرًا كاملًا. ويسمّي 33 موقعًا واحدًا على الأقل، أي أن بعضها يذكر وكلاء ليسمح لهم أو ليقيّدهم بجزء من الموقع.

الوكلاء الأكثر حظرًا متقاربون في القمة. يحظر ClaudeBot وBytespider 27 موقعًا لكل منهما، وCCBot 25، وApplebot-Extended 24، وPerplexityBot 22. أما GPTBot، الاسم الأكثر تداولًا، فأقل: 17 حظرًا من 24 موقعًا تسمّيه.

Google-Extended يُحظر أقل. تسمّيه 20 موقعًا وتحظره 16، أي 80%، مقابل 96% لـ ClaudeBot وApplebot-Extended و93% لـ CCBot.

ما الذي يستحق الجدل؟

إذا قسّمنا المواقع بحسب من يديرها، يختفي الطيف. من بين 28 ناشر أخبار أمكن الوصول إليهم، يحظر 24 منهم برنامج زحف واحدًا على الأقل، ومنهم New York Times وWashington Post وGuardian وBBC وAP وBloomberg وFT وCNN وWired وArs Technica وEconomist وNature.

ومن بين 15 موقعًا متخصصًا في SEO، يحظر موقعان فقط. منها Search Engine Land وSearch Engine Journal وSearch Engine Roundtable وMoz وAhrefs وSemrush وYoast وSEOPress وScreaming Frog وSistrix وConductor وBrightEdge.

وتترك هذه المواقع كل وكلاء الذكاء الاصطناعي المسمّين أحرارًا في أخذ الموقع كله.

والصناعة الأكثر كتابة عن بحث الذكاء الاصطناعي هي الأقل حجبًا لنصوصها عنه.

وهذه استراتيجية مفهومة لمورّد يبيع برمجيات، لكن يصعب الدفاع عنها لصناعة تنصح الناشرين بصفقة لم تعقدها هي.

هل يفصل أحد بين الاثنين؟

تفصل OpenAI بين التدريب والاسترجاع، ويكاد لا أحد يستفيد من ذلك. يجمع GPTBot بيانات التدريب، ويتولى OAI-SearchBot استرجاع نتائج البحث، ويجلب ChatGPT-User ما طلبه شخص. فيمكن للناشر رفض التدريب وإبقاء موقعه قابلًا للاستشهاد في الإجابات.

ومع ذلك يحظر 9 مواقع في العيّنة الاثنين معًا. وموقع واحد، هو Forbes، يحظر GPTBot ويمرّر OAI-SearchBot. ولا يسمّي OAI-SearchBot سوى 13 موقعًا، مقابل 24 لـ GPTBot.

ما الذي يعنيه ذلك لك؟

إذا كان robots.txt عندك يحظر وكيل تدريب ووكيل الاسترجاع المقابل له، فتأكد أن هذا ما تقصده.

فكلفة ذلك لا تُدفع في مجموعات التدريب، فهي مجمّعة في الحالتين. بل تُدفع في طبقة الاسترجاع التي تقرر أي المصادر تستشهد بها الإجابة هذا الأسبوع، وهذه مسألة زيارات حيّة في بحث الذكاء الاصطناعي.

اقرأ ملفك الفعلي لا ما تتذكره عنه، وقرر مسألتي التدريب والاسترجاع كلًّا على حدة، ودوّن القرار في مكان يجده زميل بعد عامين.

الأدلة

العيّنة
60 موقعًا، منها 57 بملف robots.txt متاح

الفرضية: لو كان الناشرون يتخذون قرارًا تجاريًا مدروسًا بشأن برامج زحف الذكاء الاصطناعي لا يقلّد بعضهم بعضًا، لاختلف الحظر باختلاف نموذج العمل، ولكانت المواقع التي تبيع الانتباه لصناعة SEO تحمي نصوصها بقدر ما تحمي الصحف نصوصها على الأقل.

الطريقة: أرسلنا طلب GET واحدًا إلى robots.txt وآخر إلى llms.txt لكل موقع، مع اتباع إعادة التوجيه ومهلة 15 ثانية، من عنوان IP منزلي واحد في 10 سبتمبر 2026. وحلّلنا robots.txt إلى مجموعات وفق المعيار، حيث تتشارك أسطر user-agent المتتالية القواعد التي تليها. ويُعدّ الوكيل محظورًا فقط حين تمنع مجموعة تسمّيه المسار / دون قاعدة allow: / مطابقة بجانبها. ولا نعدّ حظر مسارات جزئية حظرًا.

المواقع التي تحظر كل برنامج زحف، من بين المواقع التي تسمّيه
ClaudeBot27/28
Bytespider27/28
CCBot25/27
PerplexityBot22/24
meta-externalagent19/19
Amazonbot17/21
GPTBot17/24
Google-Extended16/20

النتائج

  • يحظر 29 موقعًا من 57 موقعًا أمكن قراءة robots.txt فيها برنامج زحف واحدًا على الأقل من برامج الذكاء الاصطناعي المسمّاة حظرًا كاملًا على الموقع كله.
  • يتبع الانقسام القطاع لا الحجم: يحظر 24 من 28 ناشر أخبار، مقابل موقعين من 15 موقعًا متخصصًا في SEO.
  • تسمّي 28 موقعًا ClaudeBot وتحظره 27 منها، وهي أكثر عدد حظر بين الوكلاء المقيسين، بالتساوي مع Bytespider.
  • تسمّي 20 موقعًا Google-Extended وتحظره 16 منها، أي 80%، دون ClaudeBot وCCBot وApplebot-Extended عند 93 إلى 96%.
  • يكاد التمييز بين التدريب والاسترجاع لا يُستخدم: موقع واحد فقط من 60 يحظر GPTBot ويسمح بـ OAI-SearchBot.

الحدود: يعبّر robots.txt عن نيّة لا أكثر، وليس دليلًا على أن أي برنامج زحف التزم به، وقد يحظر الموقع وكيلًا على مستوى الحافة دون أن يكتب ذلك في الملف. وأعادت ثلاثة مواقع ملفًا غير مقروء (403 و418 وفشل اتصال)، فاستُبعدت من المقامات ولم تُحتسب مسموحة. وقد ثبتت قائمة المواقع الـ 60 قبل الزحف لكنها ليست عينة عشوائية من الويب، ولا تقول جولة واحدة شيئًا عن سرعة تغيّر هذه الملفات.

المصادر

  1. 1.Dataset: AI crawler policies across 60 sites (this study)، SEO Madman، 10 سبتمبر 2026مصدر أساسي
  2. 2.RFC 9309: Robots Exclusion Protocol، IETFمصدر أساسي
  3. 3.Google-Extended and Search crawler documentation، Google Search Centralمصدر أساسي

أسئلة شائعة

هل يزيل حظر GPTBot موقعي من ChatGPT؟

ليس وحده. GPTBot هو برنامج الزحف المرتبط بجمع بيانات التدريب، أما OAI-SearchBot وChatGPT-User فيتعلقان باسترجاع نتائج البحث وبما يطلبه المستخدم. في عيّنتنا يحظر 9 مواقع الاثنين معًا.

لماذا قسنا الحظر على مستوى الموقع كله فقط؟

لأن القاعدة الجزئية حكم تقديري، أما حظر الموقع كله فليس كذلك. وعدّ Disallow: / تحت وكيل مسمّى يعطي رقمًا يمكن لأي شخص إعادة إنتاجه من الملف نفسه.

هل يمكنني التحقق من أرقامكم؟

نعم. نشرنا مجموعة البيانات الكاملة لكل موقع بصيغة JSON، وفيها القرار الخام لكل وكيل على كل مضيف، مع طابع زمني لوقت الجمع.

عن الكاتب

Adam Hafez
Adam Hafez

مؤسس UpgradIQ FZC LLC

يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.

  • SEO التقني
  • القياس بـ Search Console وGA4
  • تحسين الظهور في محركات الإجابة
  • البيانات المنظَّمة

النشرة

ما تغيّر فعلًا في البحث فقط، كاملًا عبر خلاصات RSS وAtom وJSON.

تابِعنا