أداة AEO: جاهزية المقال لإجابات AI
أداة AEO تقيّم إجابة المقال الافتتاحية وعناوينه ومعرّفاتها وقوائمه ومصادره والبيانات المنظَّمة والتاريخ. مجانية وتعمل في متصفحك.
اسمح لـ GPTBot وClaudeBot وGoogle-Extended و11 برنامجًا آخر أو احظرها حسب الغرض، واكتب ملفي robots.txt وllms.txt. مجاني ويعمل في متصفحك.
تعمل بالكامل في متصفحك. لا يُرفع ما تُدخله، ولا يُسجَّل، ولا يُحفظ.
تُقرَّر أغلب سياسات برامج زحف الذكاء الاصطناعي بخانة اختيار واحدة، وهذا هو الخطأ. تسرد هذه الأداة 14 برنامجًا حسب ما يفعله كل منها، وتتيح لك السماح لكل واحد أو رفضه، ثم تكتب الملفين من هذا القرار في متصفحك.
يحمل كل برنامج تصنيفًا بغرضه:
هذا الفصل موثّق لا مفترض. تصف OpenAI ثلاثة برامج منفصلة، وتقول إن كل إعداد مستقل عن الآخر.
وتقول Google إن Google-Extended يتحكم في تدريب Gemini والتأسيس، ولا يؤثر في الظهور أو الترتيب في بحث Google، وليس له وكيل مستخدم خاص: هو رمز في robots.txt فقط.
تضع ثلاثة إعدادات جاهزة نقطة البداية: اسمح بكل شيء، أو اسمح بالبحث وارفض التدريب (فتُرفض كل البرامج المصنّفة تدريبًا ويُسمح للباقي)، أو احظر الـ 14 كلها. ثم غيّر أي برنامج يدويًا.
وتُدخل أيضًا عنوان الموقع، الذي يُستخدم في سطر Sitemap وروابط llms.txt، وقائمة بالمسارات المحظورة تفصل بينها فواصل.
يبدأ robots.txt بمجموعة User-agent: * تسمح بكل شيء عدا المسارات التي حددتها. ثم تأتي برامج
الذكاء الاصطناعي المسموحة في مجموعة مع Allow: /، والمرفوضة في مجموعة أخرى مع Disallow: /، كل
مجموعة تحت سطر تعليق، وينتهي الملف بسطر Sitemap.
وهنا نتيجة مهمة. يقول RFC 9309 إن برنامج الزحف
يلتزم بالمجموعة التي تسمّي وكيل المستخدم الخاص به، ولا يستخدم مجموعة * إلا إذا لم تطابقه أي
مجموعة.
لذلك تنطبق المسارات المستبعدة على كل برنامج غير مسمّى في الملف، لا على برامج الذكاء الاصطناعي التي
سمحت لها بالاسم. وإذا أردت أن يبقى /search مغلقًا أمامها أيضًا، فانسخ أسطر Disallow إلى مجموعتها.
يتبع llms.txt البنية المقترحة على llmstxt.org: عنوان H1 باسم المضيف، وملخص كاقتباس، وأقسام H2 تسرد الروابط، وقسم Optional لروابط يمكن تخطيها.
جملة الملخص والروابط الثلاثة عناصر نائبة. استبدل بها صفحاتك الحقيقية قبل النشر.
مع القيم الافتراضية، https://example.com والمسارات /search, /cart, /*?، ينتج الإعداد الجاهز
“البحث دون التدريب” ملف robots.txt هذا (بلا أسطر التعليق):
User-agent: *
Allow: /
Disallow: /search
Disallow: /cart
Disallow: /*?
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Amazonbot
User-agent: DuckAssistBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Bytespider
Disallow: /
Sitemap: https://example.com/sitemap.xml
لم يُذكر Googlebot بالاسم، لذلك يتبع المجموعة الأولى: كل شيء عدا المسارات الثلاثة المستبعدة. أما
برامج البحث والجلب الثمانية المسمّاة فيمكنها الزحف إلى كل شيء، بما في ذلك /search.
تحقق من النتيجة بطلبات فعلية بدل قراءة الملف:
for ua in GPTBot OAI-SearchBot ClaudeBot PerplexityBot; do
curl -sA "$ua" -o /dev/null -w "$ua %{http_code}\n" https://example.com/
done
الرمز 403 يعني أن شيئًا غير robots.txt يتخذ القرار. وتحتفظ برامج الزحف بنسخة مؤقتة من الملف، ويقول RFC 9309 إنها لا ينبغي أن تستخدم النسخة المخزّنة أكثر من 24 ساعة.
لا. تقول OpenAI إن GPTBot يزحف إلى محتوى قد يُستخدم في التدريب، وإن OAI-SearchBot يُظهر المواقع في بحث ChatGPT، وإن ChatGPT-User يزور الصفحات لتنفيذ طلبات المستخدمين. وتقول إن كل إعداد مستقل، فيمكنك السماح لـ OAI-SearchBot وحظر GPTBot.
لا. توثّق Google أن Google-Extended يتحكم في استخدام المحتوى لتدريب نماذج Gemini المستقبلية وللتأسيس، وأنه لا يؤثر في ظهور الموقع في بحث Google ولا يُعد إشارة ترتيب. وليس له وكيل مستخدم خاص، فهو رمز في robots.txt فقط.
يقول RFC 9309 إن برنامج الزحف يلتزم بالمجموعة التي تسمّيه، ولا يعود إلى مجموعة * إلا إذا لم تسمّه أي مجموعة. وتعطي الأداة كل برنامج مسموح مجموعته مع Allow: /، فتنطبق مساراتك المستبعدة على البرامج غير المسمّاة فقط. انسخ أسطر Disallow إلى تلك المجموعة إن أردتها لها.
ليس بالضرورة. تقول OpenAI إن قواعد robots.txt قد لا تنطبق على ChatGPT-User لأن مستخدمًا يطلق إجراءاته. وتقول أيضًا إن أنظمتها قد تحتاج إلى نحو 24 ساعة لتعكس أي تغيير في robots.txt.
هو مقترح منشور على llmstxt.org، لا معيار، ولا يُلزَم أي محرك بقراءته. وصيغته بسيطة: عنوان H1 باسم الموقع، وهو الجزء الوحيد المطلوب، وملخص قصير كاقتباس، وأقسام H2 تسرد الروابط، مع قسم Optional لروابط يمكن تخطيها.
يقول RFC 9309 إن قواعد robots.txt ليست تصريحًا بالوصول، بل تعبير عن نية. وقد تحظر قاعدة لإدارة البرامج الآلية أو جدار حماية أو شبكة CDN الطلب قبل أن يهم robots.txt. اختبر بطلب حقيقي يرسل سلسلة وكيل المستخدم الخاصة بالبرنامج.
أداة AEO تقيّم إجابة المقال الافتتاحية وعناوينه ومعرّفاتها وقوائمه ومصادره والبيانات المنظَّمة والتاريخ. مجانية وتعمل في متصفحك.
الصق صفحات كثيرة واعرف أي العناوين والأوصاف التعريفية ستُقتطع في نتائج البحث، مقيسة بالبكسل. أداة مجانية تعمل في متصفحك.
الصق أزواج url -> canonical، وتتبّع كل قفزة، واكشف الحلقات والسلاسل متعددة القفزات بين العناوين الأساسية. مجانية وتعمل في متصفحك.
افحص عنوان الصفحة ووسم rel=canonical فيها: العنوان المطلق، وHTTPS، والإشارة الذاتية أو لصفحة أخرى، والنطاق، ومعلمات التتبّع. مجانية في متصفحك.