
أهم النقاط
- من بين 57 موقعًا أمكن قراءة robots.txt فيها، يسمّي 33 موقعًا برنامج زحف واحدًا على الأقل للذكاء الاصطناعي، ويحظر 29 منها واحدًا على الأقل حظرًا كاملًا.
- يحظر ناشرو الأخبار بشبه قاعدة ثابتة: 24 من 28 موقعًا أمكن الوصول إليه يمنعون وكيل ذكاء اصطناعي مسمّى من الموقع كله.
- تتصرف المواقع المتخصصة في SEO بعكس ذلك، إذ يحظر موقعان فقط من 15 أي برنامج زحف للذكاء الاصطناعي بالاسم.
- أكثر الوكلاء حظرًا ClaudeBot وBytespider عند 27 موقعًا لكل منهما، ثم CCBot عند 25 وApplebot-Extended عند 24.
- لا يكاد أحد يفصل بين التدريب والاسترجاع: يحظر 9 مواقع GPTBot وOAI-SearchBot معًا، وموقع Forbes وحده يحظر وكيل التدريب ويترك وكيل البحث.
أمام كل ناشر في هذه العيّنة عامان ليقرر ما يفعله مع برامج زحف الذكاء الاصطناعي. وفي 10 سبتمبر 2026 سألنا الستين موقعًا السؤال نفسه، في المكان الوحيد الذي تُكتب فيه الإجابة: robots.txt.
كيف أجرينا القياس؟
طلب واحد لكل موقع، يُحلَّل بالقواعد. جلبنا /robots.txt بطلب GET واحد، وجمعناه في مجموعات كما يحددها RFC 9309. ثم سألنا عن كل وكيل: هل تمنع مجموعة تسمّيه الموقع كله؟ وفحصنا 15 وكيلًا، من GPTBot وClaudeBot إلى Bytespider وApplebot-Extended.
أمكن قراءة 57 ملفًا من 60. استبعدنا Politico (403) وNPR (فشل اتصال) وStack Overflow (418) من المقامات، ولم نعدّها مفتوحة. والنتيجة الكاملة لكل موقع منشورة بصيغة JSON، فيمكن مطابقة كل رقم أدناه بالملف الذي خرج منه.
ماذا تقول الملفات؟
يحظر 29 موقعًا من 57 برنامج زحف واحدًا على الأقل حظرًا كاملًا. ويسمّي 33 موقعًا واحدًا على الأقل، أي أن بعضها يذكر وكلاء ليسمح لهم أو ليقيّدهم بجزء من الموقع.
الوكلاء الأكثر حظرًا متقاربون في القمة. يحظر ClaudeBot وBytespider 27 موقعًا لكل منهما، وCCBot 25، وApplebot-Extended 24، وPerplexityBot 22. أما GPTBot، الاسم الأكثر تداولًا، فأقل: 17 حظرًا من 24 موقعًا تسمّيه.
Google-Extended يُحظر أقل. تسمّيه 20 موقعًا وتحظره 16، أي 80%، مقابل 96% لـ ClaudeBot وApplebot-Extended و93% لـ CCBot.
ما الذي يستحق الجدل؟
إذا قسّمنا المواقع بحسب من يديرها، يختفي الطيف. من بين 28 ناشر أخبار أمكن الوصول إليهم، يحظر 24 منهم برنامج زحف واحدًا على الأقل، ومنهم New York Times وWashington Post وGuardian وBBC وAP وBloomberg وFT وCNN وWired وArs Technica وEconomist وNature.
ومن بين 15 موقعًا متخصصًا في SEO، يحظر موقعان فقط. منها Search Engine Land وSearch Engine Journal وSearch Engine Roundtable وMoz وAhrefs وSemrush وYoast وSEOPress وScreaming Frog وSistrix وConductor وBrightEdge.
وتترك هذه المواقع كل وكلاء الذكاء الاصطناعي المسمّين أحرارًا في أخذ الموقع كله.
والصناعة الأكثر كتابة عن بحث الذكاء الاصطناعي هي الأقل حجبًا لنصوصها عنه.
وهذه استراتيجية مفهومة لمورّد يبيع برمجيات، لكن يصعب الدفاع عنها لصناعة تنصح الناشرين بصفقة لم تعقدها هي.
هل يفصل أحد بين الاثنين؟
تفصل OpenAI بين التدريب والاسترجاع، ويكاد لا أحد يستفيد من ذلك. يجمع GPTBot بيانات التدريب، ويتولى OAI-SearchBot استرجاع نتائج البحث، ويجلب ChatGPT-User ما طلبه شخص. فيمكن للناشر رفض التدريب وإبقاء موقعه قابلًا للاستشهاد في الإجابات.
ومع ذلك يحظر 9 مواقع في العيّنة الاثنين معًا. وموقع واحد، هو Forbes، يحظر GPTBot ويمرّر OAI-SearchBot. ولا يسمّي OAI-SearchBot سوى 13 موقعًا، مقابل 24 لـ GPTBot.
ما الذي يعنيه ذلك لك؟
إذا كان robots.txt عندك يحظر وكيل تدريب ووكيل الاسترجاع المقابل له، فتأكد أن هذا ما تقصده.
فكلفة ذلك لا تُدفع في مجموعات التدريب، فهي مجمّعة في الحالتين. بل تُدفع في طبقة الاسترجاع التي تقرر أي المصادر تستشهد بها الإجابة هذا الأسبوع، وهذه مسألة زيارات حيّة في بحث الذكاء الاصطناعي.
اقرأ ملفك الفعلي لا ما تتذكره عنه، وقرر مسألتي التدريب والاسترجاع كلًّا على حدة، ودوّن القرار في مكان يجده زميل بعد عامين.
الأدلة
- العيّنة
- 60 موقعًا، منها 57 بملف robots.txt متاح
الفرضية: لو كان الناشرون يتخذون قرارًا تجاريًا مدروسًا بشأن برامج زحف الذكاء الاصطناعي لا يقلّد بعضهم بعضًا، لاختلف الحظر باختلاف نموذج العمل، ولكانت المواقع التي تبيع الانتباه لصناعة SEO تحمي نصوصها بقدر ما تحمي الصحف نصوصها على الأقل.
الطريقة: أرسلنا طلب GET واحدًا إلى robots.txt وآخر إلى llms.txt لكل موقع، مع اتباع إعادة التوجيه ومهلة 15 ثانية، من عنوان IP منزلي واحد في 10 سبتمبر 2026. وحلّلنا robots.txt إلى مجموعات وفق المعيار، حيث تتشارك أسطر user-agent المتتالية القواعد التي تليها. ويُعدّ الوكيل محظورًا فقط حين تمنع مجموعة تسمّيه المسار / دون قاعدة allow: / مطابقة بجانبها. ولا نعدّ حظر مسارات جزئية حظرًا.
النتائج
- يحظر 29 موقعًا من 57 موقعًا أمكن قراءة robots.txt فيها برنامج زحف واحدًا على الأقل من برامج الذكاء الاصطناعي المسمّاة حظرًا كاملًا على الموقع كله.
- يتبع الانقسام القطاع لا الحجم: يحظر 24 من 28 ناشر أخبار، مقابل موقعين من 15 موقعًا متخصصًا في SEO.
- تسمّي 28 موقعًا ClaudeBot وتحظره 27 منها، وهي أكثر عدد حظر بين الوكلاء المقيسين، بالتساوي مع Bytespider.
- تسمّي 20 موقعًا Google-Extended وتحظره 16 منها، أي 80%، دون ClaudeBot وCCBot وApplebot-Extended عند 93 إلى 96%.
- يكاد التمييز بين التدريب والاسترجاع لا يُستخدم: موقع واحد فقط من 60 يحظر GPTBot ويسمح بـ OAI-SearchBot.
الحدود: يعبّر robots.txt عن نيّة لا أكثر، وليس دليلًا على أن أي برنامج زحف التزم به، وقد يحظر الموقع وكيلًا على مستوى الحافة دون أن يكتب ذلك في الملف. وأعادت ثلاثة مواقع ملفًا غير مقروء (403 و418 وفشل اتصال)، فاستُبعدت من المقامات ولم تُحتسب مسموحة. وقد ثبتت قائمة المواقع الـ 60 قبل الزحف لكنها ليست عينة عشوائية من الويب، ولا تقول جولة واحدة شيئًا عن سرعة تغيّر هذه الملفات.
المصادر
- 1.Dataset: AI crawler policies across 60 sites (this study)، SEO Madman، 10 سبتمبر 2026مصدر أساسي
- 2.RFC 9309: Robots Exclusion Protocol، IETFمصدر أساسي
- 3.Google-Extended and Search crawler documentation، Google Search Centralمصدر أساسي
أسئلة شائعة
هل يزيل حظر GPTBot موقعي من ChatGPT؟
ليس وحده. GPTBot هو برنامج الزحف المرتبط بجمع بيانات التدريب، أما OAI-SearchBot وChatGPT-User فيتعلقان باسترجاع نتائج البحث وبما يطلبه المستخدم. في عيّنتنا يحظر 9 مواقع الاثنين معًا.
لماذا قسنا الحظر على مستوى الموقع كله فقط؟
لأن القاعدة الجزئية حكم تقديري، أما حظر الموقع كله فليس كذلك. وعدّ Disallow: / تحت وكيل مسمّى يعطي رقمًا يمكن لأي شخص إعادة إنتاجه من الملف نفسه.
هل يمكنني التحقق من أرقامكم؟
نعم. نشرنا مجموعة البيانات الكاملة لكل موقع بصيغة JSON، وفيها القرار الخام لكل وكيل على كل مضيف، مع طابع زمني لوقت الجمع.
عن الكاتب

مؤسس UpgradIQ FZC LLC
يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.
- SEO التقني
- القياس بـ Search Console وGA4
- تحسين الظهور في محركات الإجابة
- البيانات المنظَّمة
قراءات ذات صلة
الروبوتات تتجاوز البشر على شبكة Cloudflare
يقول رئيس Cloudflare التنفيذي إن طلبات صفحات HTML الآلية صارت أكثر من البشرية، قبل توقعه الشخصي لعام 2027.
Google تشدد حظر أدوات تتبع الترتيب
منذ نحو 13 سبتمبر 2026 تفيد أدوات تتبع الترتيب بأن Google تحظر جزءًا أكبر من عمليات جمع بياناتها، وتقول Nozzle إن بياناتها انخفضت 80 في المئة.
مجموعة IETF لتفضيلات الذكاء الاصطناعي
تعمل مجموعة AI Preferences في IETF على توحيد إشارات تدريب الذكاء الاصطناعي والبحث امتدادًا لـ robots.txt. ما زالت مسودات، لا معيارًا منشورًا.
مستغلو NotebookLM ينشرون محتوى مزعجًا
ينشر مخالفو سياسات البحث محتوى غير مرغوب فيه عبر دفاتر NotebookLM العامة، وفهرست Google أكثر من 12,000 صفحة ثم أزالتها في اليوم التالي.


