انتقل إلى المحتوى
SEO Madmanby Adam Hafez
أداة مجانية

أداة التحقق من صياغة ملف robots.txt كاملًا

افحص كل سطر في robots.txt بحثًا عن أخطاء الصياغة والحقول غير المدعومة والمسارات الخاطئة وعناوين خريطة الموقع النسبية. مجانية وتعمل في متصفحك.

تعمل بالكامل في متصفحك. لا يُرفع ما تُدخله، ولا يُسجَّل، ولا يُحفظ.

لا يُرسل أي شيء تلصقه هنا إلى أي مكان، فالتحليل يجري سطرًا بسطر في متصفحك فقط.

    أهم النقاط

    • السطر الصالح في robots.txt حقل ثم نقطتان رأسيتان ثم قيمة، وتتجاهل Google الأسطر غير الصالحة بدل أن ترفض الملف كله.
    • تدعم Google أربعة حقول هي user-agent وallow وdisallow وsitemap، وتقول إن crawl-delay غير مدعوم.
    • يجب أن يبدأ مسار allow أو disallow بشرطة مائلة، ويجب أن تكون قيمة sitemap عنوان URL كاملًا.
    • تفرض Google حدًا لحجم robots.txt قدره 500 KiB، وتتجاهل المحتوى بعده.
    • تفحص هذه الأداة البنية فقط، أما معرفة هل تمنع قاعدة ما عنوان URL معيّنًا لبرنامج زحف معيّن فهي مهمة أداة اختبار robots.txt.

    ما تحتاج إليه

    • المحتوى الكامل لملف robots.txt

    أدوات أخرى

    كلها مجانية، وكلها تعمل في المتصفح.

    تصفّح الأدوات

    طريقة الاستخدام

    1. 1الصق ملف robots.txt كاملًاأدخِل كل الأسطر، لا المجموعة التي تهمك فقط، لأن أخطاء البنية مثل القاعدة في غير مكانها تعتمد على ما قبلها.
    2. 2اقرأ عدد الأخطاء والتحذيراتالخطأ سطر يخالف الصياغة الموثّقة صراحة، والتحذير سطر يُحلَّل لكن Google لا تدعمه، أو مشكلة تخص الملف كله.
    3. 3راجِع أخطاء النقطتين الرأسيتين أولًاغياب النقطتين الرأسيتين أكثر أخطاء النسخ واللصق شيوعًا، وغالبًا يأتي من سطر مثل Allow /path سقطت منه النقطتان.
    4. 4ابحث عن قواعد قبل أي سطر user-agentسطر allow أو disallow لا يسبقه سطر user-agent لا ينتمي إلى أي مجموعة، وفق بنية المجموعات في RFC 9309.
    5. 5تأكد أن أسطر sitemap عناوين كاملةمسار خريطة الموقع النسبي، مثل sitemap.xml بدل عنوان https:// كامل، يخالف شرط Google بأن يكون العنوان كاملًا.
    6. 6ابحث عن حقول لا تدعمها Googlecrawl-delay وما يشبهه توجيهات حقيقية لبعض برامج الزحف الأخرى، لكن الأداة تنبّه إليها لأن مستندات Google تقول إنها لا تستخدمها.

    الصق ملف robots.txt كاملًا، وستتحقق الأداة من سلامته: صياغة كل سطر، واسم كل حقل، وكل قيمة مسار أو عنوان URL، وهل لكل قاعدة user-agent تنتمي إليه. تعمل الأداة في متصفحك سطرًا بسطر، ولا يُرسل أي شيء تلصقه إلى أي مكان.

    ماذا تفحص الأداة؟

    يعرّف RFC 9309 سطر robots.txt بأنه حقل ثم نقطتان رأسيتان ثم قيمة، مع تجميع القواعد تحت أسطر user-agent التي تسبقها. وتضيف مستندات Google التفاصيل. وتطبّق الأداة هذه الفحوص:

    • غياب النقطتين الرأسيتين: السطر بلا نقطتين رأسيتين خطأ، لأنه ليس زوجًا من حقل وقيمة.
    • مسافة في اسم الحقل: كتابة Dis allow: /x خطأ، فلن يُعرف الحقل.
    • حقل غير مدعوم: تدعم Google الحقول user-agent وallow وdisallow وsitemap فقط. وأي حقل آخر تحذير.
    • ملاحظة خاصة: تضيف الأداة ملاحظة محددة لـ crawl-delay وhost وclean-param وrequest-rate وvisit-time وnoindex، لأن برامج زحف أخرى تستخدمها وGoogle لا تستخدمها.
    • user-agent فارغ: سطر user-agent بلا قيمة خطأ.
    • قاعدة قبل أي user-agent: سطر allow أو disallow فوق أول سطر user-agent لا ينتمي إلى مجموعة، لذلك فهو خطأ.
    • مسار بلا شرطة مائلة في بدايته: تقول Google إن قيمة المسار يجب أن تبدأ بشرطة مائلة لتشير إلى الجذر. وتُقبل النجمة * وحدها.
    • خريطة موقع بعنوان نسبي: يجب أن تكون قيمة sitemap عنوان URL كاملًا بالبروتوكول والمضيف.
    • فحوص الملف كله: الملف الذي لا يحتوي أي سطر user-agent يُعد تحذيرًا، وكذلك الملف الذي يزيد على 500 KiB، وهو حد الحجم الذي توثّقه Google.

    التعليقات بعد # والأسطر الفارغة صالحة دائمًا.

    كيف تقرأ النتائج؟

    يعرض سطر الملخص عدد المشكلات. تأتي الأخطاء أولًا: هي أسطر سيتجاهلها برنامج الزحف، فالقاعدة التي أردتها غير موجودة فعليًا. والتحذيرات أسطر تُحلَّل لكنها لا تفعل شيئًا لـ Google، أو مشكلات في الملف كله. وإذا لم يوجد أي منهما، يقول الملخص إنه لا توجد مشكلات.

    يعرض كل سطر مُنبَّه إليه رقمه، والسطر نفسه، والسبب. ولا تظهر الأسطر التي حُلّلت بلا مشكلات، لذلك فالقائمة القصيرة علامة جيدة.

    مثال عملي

    يحتوي الملف المعبأ مسبقًا ثلاثة أخطاء متعمدة. وتعرض الأداة: خطآن، تحذير واحد.

    • السطر 4: Allow /admin/public بلا نقطتين رأسيتين، فهو خطأ. وبصيغته الحالية يبقى /admin/public ممنوعًا بقاعدة Disallow التي فوقه.
    • السطر 5: Crawl-delay: 10 تحذير، فمستندات Google تقول إنها لا تدعمه.
    • السطر 10: Sitemap: sitemap.xml خطأ، لأنه يحتاج إلى العنوان الكامل، مثل https://example.com/sitemap.xml.

    لا تنبّه الأداة إلى السطر 7، Disallow: /search، مع أن سطرًا فارغًا يفصله عن المجموعة التي فوقه. فأسطر user-agent هي التي تحدد المجموعات لا الأسطر الفارغة، لذلك يبقى ضمن مجموعة *.

    أخطاء شائعة تكشفها

    • نقطتان رأسيتان سقطتا بعد النسخ واللصق: تتجاهل Google السطر دون أي رسالة خطأ، فلا تعود القاعدة موجودة.
    • crawl-delay مكتوب لـ Google: لا أثر له على Googlebot.
    • مسارات بلا شرطة مائلة: مثل Disallow: private/، وهذا لا يتبع الصيغة التي توثّقها Google.
    • سطر خريطة موقع نسبي: تقول مستندات Google إنه يجب أن يكون عنوان URL كاملًا.
    • قواعد ملصقة فوق أول سطر user-agent: لا تنتمي إلى أي مجموعة.

    ما لا تفحصه الأداة

    الصياغة نصف السؤال فقط. ينتهي الملف المعبأ مسبقًا بمجموعة Googlebot بلا أي قاعدة allow أو disallow. هذه صياغة صالحة، لذلك تُنجحها الأداة.

    لكنها تعني أن Googlebot يتبع مجموعة فارغة ويتجاهل كل قواعد * التي فوقها، وهذا ما يعامله RFC 9309 كسماح بكل عناوين URL. ولترى ما يسمح به الملف فعلًا لبرنامج زحف واحد ومسار واحد، استخدم أداة اختبار robots.txt.

    أدوات وقراءات ذات صلة

    المصادر

    1. 1.RFC 9309: Robots Exclusion Protocol، IETFمصدر أساسي
    2. 2.How Google interprets the robots.txt specification، Google Search Centralمصدر أساسي

    أسئلة شائعة

    كيف أتحقق من ملف robots.txt في موقعي؟

    افتح yoursite.com/robots.txt في المتصفح، وانسخ الملف كله، والصقه في الأداة. ستعرض كل سطر يخالف الصياغة أو يستخدم حقلًا لا تدعمه Google، مع رقم السطر والسبب.

    هل تدعم Google التوجيه crawl-delay في robots.txt؟

    لا. تدعم مستندات Google عن robots.txt الحقول user-agent وallow وdisallow وsitemap فقط، وتقول إن الحقول الأخرى مثل crawl-delay غير مدعومة. لذلك تعرض الأداة أسطر crawl-delay وhost وclean-param وrequest-rate وvisit-time وnoindex كتحذيرات.

    ماذا يحدث للسطر غير الصالح في robots.txt؟

    يُتخطى. يقول RFC 9309 إن برامج الزحف يجب أن تحاول تحليل كل سطر وأن تستخدم القواعد القابلة للتحليل، وتقول Google إنها تتجاهل الأسطر غير الصالحة. ويبقى باقي الملف فعّالًا، ولهذا قد تبقى قاعدة معطوبة دون أن يلاحظها أحد لأشهر.

    هل يوجد حد لحجم ملف robots.txt؟

    تفرض Google حدًا قدره 500 KiB وتتجاهل المحتوى بعده. ويلزم RFC 9309 برامج الزحف بتحليل 500 كيبيبايت على الأقل. وتنبّه الأداة عندما يزيد الملف الملصق على 500 KiB.

    هل مسارات robots.txt حساسة لحالة الأحرف؟

    تعامل Google أسماء الحقول مثل Disallow على أنها غير حساسة لحالة الأحرف، لكن قيم المسارات حساسة لها. لذلك فإن Disallow /Admin لا يمنع /admin.

    ما الفرق بين هذه الأداة وأداة اختبار robots.txt؟

    تتحقق هذه الأداة من سلامة صياغة كل سطر في الملف. أما أداة الاختبار فتأخذ برنامج زحف واحدًا ومسار URL واحدًا، وتخبرك هل المسار مسموح أم ممنوع، وبأي سطر.