انتقل إلى المحتوى
SEO Madmanby Adam Hafez
أداة مجانية

مولّد robots.txt وllms.txt لبرامج زحف AI

اسمح لـ GPTBot وClaudeBot وGoogle-Extended و11 برنامجًا آخر أو احظرها حسب الغرض، واكتب ملفي robots.txt وllms.txt. مجاني ويعمل في متصفحك.

تعمل بالكامل في متصفحك. لا يُرفع ما تُدخله، ولا يُسجَّل، ولا يُحفظ.

من يحق له أخذ محتواك

حظر برنامج زحف للتدريب لا يُخرجك من محرك الإجابات الذي يحمل الاسم نفسه، والسماح لبرنامج زحف للبحث لا يعني الموافقة على التدريب. إنها برامج منفصلة، ولذلك تظهر كل منها وحدها.

robots.txt

llms.txt

أهم النقاط

  • تشغّل الشركة الواحدة عادة عدة برامج زحف لأغراض مختلفة، ورفض أحدها لا يقول شيئًا عن الأخرى.
  • حظر برنامج زحف للتدريب لا يُخرجك من محرك الإجابات الذي يحمل الاسم نفسه، لأن هذا المحرك يقرأ ببرنامج آخر.
  • يتحكم Google-Extended في تدريب Gemini فقط، ورفضه لا يؤثر في ترتيب الصفحة في بحث Google.
  • يعبّر robots.txt عن نية فقط، لذلك قد تتجاوز قاعدة للبرامج الآلية في شبكة CDN كل ما يقوله الملف دون أن تلاحظ.

ما تحتاج إليه

  • عنوان URL لموقعك
  • المسارات التي تريد إبعادها عن النتائج
  • نعم أو لا لكل برنامج زحف

أدوات أخرى

كلها مجانية، وكلها تعمل في المتصفح.

تصفّح الأدوات

طريقة الاستخدام

  1. 1اضبط عنوان الموقع والمسارات المستبعدةصفحات البحث وكل ما يأتي بعد سلسلة استعلام هي المرشحة عادة، لأنها تولّد عددًا لا ينتهي تقريبًا من العناوين قليلة القيمة.
  2. 2اختر نقطة البدايةثلاثة إعدادات جاهزة: اسمح بكل شيء، أو اسمح بالبحث وارفض التدريب، أو ارفض برامج زحف الذكاء الاصطناعي كليًا. ثم عدّل كل برنامج وحده.
  3. 3اقرأ غرض كل برنامجالبحث والتدريب والجلب المباشر تبادلات مختلفة فعلًا. وحين تُقرَّر كمجموعة واحدة تختفي المواقع من إجابات كانت تريد الظهور فيها.
  4. 4انشر الملفين في الجذريوضع robots.txt في /robots.txt، وllms.txt في /llms.txt. ثم تحقق من السياسة بطلب حقيقي بدل الافتراض.

تُقرَّر أغلب سياسات برامج زحف الذكاء الاصطناعي بخانة اختيار واحدة، وهذا هو الخطأ. تسرد هذه الأداة 14 برنامجًا حسب ما يفعله كل منها، وتتيح لك السماح لكل واحد أو رفضه، ثم تكتب الملفين من هذا القرار في متصفحك.

ماذا تفعل الأداة؟

يحمل كل برنامج تصنيفًا بغرضه:

  • بحث: يفهرس الصفحات ليُستشهد بها في إجابات الذكاء الاصطناعي. وهي OAI-SearchBot وClaude-SearchBot وPerplexityBot وAmazonbot وDuckAssistBot.
  • تدريب: يجمع محتوى قد يُستخدم لتدريب النماذج. وهي GPTBot وClaudeBot وGoogle-Extended وApplebot-Extended وmeta-externalagent وBytespider.
  • جلب مباشر: يجلب صفحة لأن شخصًا سأل عنها. وهي ChatGPT-User وClaude-User وPerplexity-User.

هذا الفصل موثّق لا مفترض. تصف OpenAI ثلاثة برامج منفصلة، وتقول إن كل إعداد مستقل عن الآخر.

وتقول Google إن Google-Extended يتحكم في تدريب Gemini والتأسيس، ولا يؤثر في الظهور أو الترتيب في بحث Google، وليس له وكيل مستخدم خاص: هو رمز في robots.txt فقط.

تضع ثلاثة إعدادات جاهزة نقطة البداية: اسمح بكل شيء، أو اسمح بالبحث وارفض التدريب (فتُرفض كل البرامج المصنّفة تدريبًا ويُسمح للباقي)، أو احظر الـ 14 كلها. ثم غيّر أي برنامج يدويًا.

وتُدخل أيضًا عنوان الموقع، الذي يُستخدم في سطر Sitemap وروابط llms.txt، وقائمة بالمسارات المحظورة تفصل بينها فواصل.

كيف تقرأ الناتج؟

يبدأ robots.txt بمجموعة User-agent: * تسمح بكل شيء عدا المسارات التي حددتها. ثم تأتي برامج الذكاء الاصطناعي المسموحة في مجموعة مع Allow: /، والمرفوضة في مجموعة أخرى مع Disallow: /، كل مجموعة تحت سطر تعليق، وينتهي الملف بسطر Sitemap.

وهنا نتيجة مهمة. يقول RFC 9309 إن برنامج الزحف يلتزم بالمجموعة التي تسمّي وكيل المستخدم الخاص به، ولا يستخدم مجموعة * إلا إذا لم تطابقه أي مجموعة.

لذلك تنطبق المسارات المستبعدة على كل برنامج غير مسمّى في الملف، لا على برامج الذكاء الاصطناعي التي سمحت لها بالاسم. وإذا أردت أن يبقى /search مغلقًا أمامها أيضًا، فانسخ أسطر Disallow إلى مجموعتها.

يتبع llms.txt البنية المقترحة على llmstxt.org: عنوان H1 باسم المضيف، وملخص كاقتباس، وأقسام H2 تسرد الروابط، وقسم Optional لروابط يمكن تخطيها.

جملة الملخص والروابط الثلاثة عناصر نائبة. استبدل بها صفحاتك الحقيقية قبل النشر.

مثال عملي

مع القيم الافتراضية، https://example.com والمسارات /search, /cart, /*?، ينتج الإعداد الجاهز “البحث دون التدريب” ملف robots.txt هذا (بلا أسطر التعليق):

User-agent: *
Allow: /
Disallow: /search
Disallow: /cart
Disallow: /*?

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Amazonbot
User-agent: DuckAssistBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Bytespider
Disallow: /

Sitemap: https://example.com/sitemap.xml

لم يُذكر Googlebot بالاسم، لذلك يتبع المجموعة الأولى: كل شيء عدا المسارات الثلاثة المستبعدة. أما برامج البحث والجلب الثمانية المسمّاة فيمكنها الزحف إلى كل شيء، بما في ذلك /search.

أخطاء شائعة تمنعها

  • حظر برنامج البحث مع برنامج التدريب: رفض كل برامج شركة واحدة يُخرجك أيضًا من الإجابات التي يبنيها برنامج البحث لديها.
  • رفض Google-Extended لحماية الترتيب: توثّق Google أنه لا يؤثر في البحث، لا سلبًا ولا إيجابًا.
  • توقّع أن ينفّذ robots.txt أي شيء: يقول RFC 9309 إن القواعد ليست تصريحًا بالوصول. تلتزم بها برامج الزحف المنضبطة، وقد تتجاوز شبكة CDN أو جدار الحماية الملف.

تحقق من النتيجة بطلبات فعلية بدل قراءة الملف:

for ua in GPTBot OAI-SearchBot ClaudeBot PerplexityBot; do
  curl -sA "$ua" -o /dev/null -w "$ua %{http_code}\n" https://example.com/
done

الرمز 403 يعني أن شيئًا غير robots.txt يتخذ القرار. وتحتفظ برامج الزحف بنسخة مؤقتة من الملف، ويقول RFC 9309 إنها لا ينبغي أن تستخدم النسخة المخزّنة أكثر من 24 ساعة.

أدوات وقراءات ذات صلة

المصادر

  1. 1.RFC 9309: Robots Exclusion Protocol، IETFمصدر أساسي
  2. 2.Overview of Google crawlers and fetchers، Google Search Centralمصدر أساسي
  3. 3.OpenAI bots and how to control them، OpenAIمصدر أساسي
  4. 4.The llms.txt proposal، llmstxt.org
  5. 5.Google's common crawlers، Google Search Centralمصدر أساسي

أسئلة شائعة

إذا حظرت GPTBot، هل أختفي من ChatGPT؟

لا. تقول OpenAI إن GPTBot يزحف إلى محتوى قد يُستخدم في التدريب، وإن OAI-SearchBot يُظهر المواقع في بحث ChatGPT، وإن ChatGPT-User يزور الصفحات لتنفيذ طلبات المستخدمين. وتقول إن كل إعداد مستقل، فيمكنك السماح لـ OAI-SearchBot وحظر GPTBot.

هل يضر رفض Google-Extended بترتيبي؟

لا. توثّق Google أن Google-Extended يتحكم في استخدام المحتوى لتدريب نماذج Gemini المستقبلية وللتأسيس، وأنه لا يؤثر في ظهور الموقع في بحث Google ولا يُعد إشارة ترتيب. وليس له وكيل مستخدم خاص، فهو رمز في robots.txt فقط.

لماذا تتجاهل برامج الزحف التي سمحت لها مسارات Disallow؟

يقول RFC 9309 إن برنامج الزحف يلتزم بالمجموعة التي تسمّيه، ولا يعود إلى مجموعة * إلا إذا لم تسمّه أي مجموعة. وتعطي الأداة كل برنامج مسموح مجموعته مع Allow: /، فتنطبق مساراتك المستبعدة على البرامج غير المسمّاة فقط. انسخ أسطر Disallow إلى تلك المجموعة إن أردتها لها.

هل يلتزم ChatGPT-User بملف robots.txt؟

ليس بالضرورة. تقول OpenAI إن قواعد robots.txt قد لا تنطبق على ChatGPT-User لأن مستخدمًا يطلق إجراءاته. وتقول أيضًا إن أنظمتها قد تحتاج إلى نحو 24 ساعة لتعكس أي تغيير في robots.txt.

هل llms.txt معيار تلتزم به المحركات؟

هو مقترح منشور على llmstxt.org، لا معيار، ولا يُلزَم أي محرك بقراءته. وصيغته بسيطة: عنوان H1 باسم الموقع، وهو الجزء الوحيد المطلوب، وملخص قصير كاقتباس، وأقسام H2 تسرد الروابط، مع قسم Optional لروابط يمكن تخطيها.

يسمح ملف robots.txt لهذه البرامج لكنها ما زالت محظورة. لماذا؟

يقول RFC 9309 إن قواعد robots.txt ليست تصريحًا بالوصول، بل تعبير عن نية. وقد تحظر قاعدة لإدارة البرامج الآلية أو جدار حماية أو شبكة CDN الطلب قبل أن يهم robots.txt. اختبر بطلب حقيقي يرسل سلسلة وكيل المستخدم الخاصة بالبرنامج.