انتقل إلى المحتوى
SEO Madmanby Adam Hafez
أداة مجانية

اختبار robots.txt: هل العنوان ممنوع؟

اختبر هل مسار URL ممنوع على Googlebot أو GPTBot أو أي برنامج زحف، واعرف القاعدة التي تحسم ذلك بالضبط. أداة مجانية تعمل في متصفحك.

تعمل بالكامل في متصفحك. لا يُرفع ما تُدخله، ولا يُسجَّل، ولا يُحفظ.

لا يُرسل أي شيء تلصقه هنا إلى أي مكان، فالتحليل يجري في متصفحك فقط.

    أهم النقاط

    • يتبع برنامج الزحف مجموعة User-agent الأكثر تحديدًا التي تسمّيه فقط، ولا يعود إلى مجموعة * إلا إذا لم تطابقه أي مجموعة.
    • داخل تلك المجموعة، يفوز أطول مسار Allow أو Disallow مطابق، أينما كان موضعه في الملف.
    • إذا تطابقت قاعدتا Allow وDisallow بالطول نفسه، يقول RFC 9309 إن قاعدة Allow هي التي تُستخدم.
    • المسار بلا قاعدة مطابقة، أو المجموعة بلا قواعد أصلًا، يعني أن العنوان مسموح.
    • يتحكم robots.txt في الزحف لا في الوصول أو الفهرسة، ويقول RFC 9309 إنه ليس وسيلة لتفويض الوصول.

    ما تحتاج إليه

    • محتوى robots.txt الحالي
    • برنامج الزحف (User-agent) المراد اختباره
    • مسار URL المراد اختباره

    أدوات أخرى

    كلها مجانية، وكلها تعمل في المتصفح.

    تصفّح الأدوات

    طريقة الاستخدام

    1. 1الصق ملف robots.txt الذي تريد فحصهاستخدم الملف المنشور على موقعك، أو مسودة توشك على نشرها. ويحتوي المثال الجاهز على مجموعة * ومجموعة Googlebot، لترى مسارَي المطابقة معًا.
    2. 2أدخِل User-agent لبرنامج الزحفاستخدم رمز المنتج الذي يعلنه برنامج الزحف، مثل Googlebot أو GPTBot، لا سلسلة User-agent الكاملة.
    3. 3أدخِل مسار URL المراد اختبارهمسار يبدأ بشرطة مائلة، مثل /private/page.html. وسلاسل الاستعلام مهمة أيضًا، لأن القاعدة قد تستهدفها مباشرة.
    4. 4اقرأ النتيجة والتتبّع تحتهاتسمّي الأداة المجموعة التي انطبقت والسطر الذي حسم النتيجة، مع أي قاعدة أقصر طابقت أيضًا لكنها خسرت.

    نشر ملف robots.txt سهل. أما معرفة ما يفعله فعلًا ببرنامج زحف واحد على عنوان واحد فهو ما يخطئ فيه أغلب الناس، لأن القاعدة الفائزة كثيرًا ما تكون غير التي يتوقعونها. وتشغّل هذه الأداة الملف على حالة واحدة، وتعرض خطوات الحل.

    ماذا تفحص الأداة؟

    تطبّق الأداة قواعد المطابقة في RFC 9309، ويتبعها توثيق Google لملف robots.txt في كل نقطة:

    • المجموعات. سطر User-agent واحد أو أكثر متتالية يبدأ مجموعة، وسطور Allow وDisallow بعدها تنتمي إليها.
    • اختيار المجموعة. يُطابَق User-agent مع رمز المنتج في كل مجموعة دون تمييز حالة الأحرف، وتفوز المطابقة الأكثر تحديدًا. وتُدمج المجموعات التي تسمّي الرمز نفسه، ولا تنطبق مجموعة * إلا إذا لم تطابق أي مجموعة مسمّاة.
    • أطول مطابقة. داخل المجموعة المختارة، تحسم القاعدة صاحبة أطول مسار مطابق. ويقول RFC 9309 إن المطابقة الأكثر تحديدًا، أي صاحبة أكبر عدد من الثُمانيات، هي التي يجب استخدامها.
    • التعادل. قاعدتا Allow وDisallow بطول متساوٍ تُحسمان لصالح Allow.
    • الرموز البديلة. العلامة * في المسار تطابق أي سلسلة أحرف، والعلامة $ في النهاية تربط القاعدة بنهاية العنوان.
    • الافتراضات. غياب قاعدة مطابقة يعني السماح، وDisallow الفارغة لا تمنع شيئًا.

    كيف تقرأ النتائج؟

    يقول سطر النتيجة مسموح أو ممنوع لبرنامج الزحف والمسار اللذين أدخلتهما. وتحته يشرح التتبّع السبب بالترتيب:

    1. أي مجموعة انطبقت، وهل هي مجموعة مسمّاة أم مجموعة * الاحتياطية.
    2. رقم السطر ونص القاعدة التي حسمت النتيجة، مع عدد أحرف مسارها.
    3. أي قاعدة أخرى طابقت أيضًا لكنها خسرت لأنها أقصر.

    إذا لم تطابق أي قاعدة في المجموعة، يقول التتبّع ذلك وتكون النتيجة مسموح. والمسار الذي لا يبدأ بشرطة مائلة يُرفض قبل أي تقييم.

    مثال عملي

    في الملف الجاهز مجموعة * ومجموعة Googlebot. ومع User-agent هو Googlebot والمسار /private/pricing.html، تعرض الأداة:

    • Googlebot يطابق المجموعة الأكثر تحديدًا، المعلنة لـ Googlebot.
    • السطر 11، Allow: /private/pricing.html، هو أطول قاعدة مطابقة بـ 21 حرفًا، لذلك يحسم النتيجة.
    • السطر 10، Disallow: /private/، يطابق أيضًا لكنه أقصر بـ 9 أحرف، لذلك يخسر.
    • النتيجة: مسموح.

    غيّر المسار إلى /admin وستبقى النتيجة مسموح لـ Googlebot. فمجموعة * تمنع /admin، لكن لـ Googlebot مجموعته الخاصة، وليس فيها قاعدة لـ /admin.

    غيّر User-agent إلى Bingbot فيصبح المسار نفسه ممنوعًا بالسطر 3، لأن Bingbot بلا مجموعة مسمّاة فيعود إلى *. وجرّب Bingbot مع /report.pdf، فيتغلب السطر 6، Disallow: /*.pdf$، على Allow: / ذات الحرف الواحد.

    أخطاء شائعة تكشفها

    • توقّع انطباق قواعد * على برنامج زحف مسمّى. بمجرد أن تصبح لبرنامج الزحف مجموعته، لا يقرأ غيرها. وهذه أكثر مفاجأة شائعة تكشفها الأداة.
    • الثقة بترتيب السطور. قاعدة Disallow واسعة في أعلى الملف لا تتغلب على Allow أطول في أسفله. الطول وحده هو ما يُحسب.
    • $ في موضع البادئة، أو العكس. القاعدة Disallow: /*.pdf$ تمنع /report.pdf لكنها لا تمنع /report.pdf?download=1، وتعرض الأداة الفرق مباشرة.
    • منع صفحة لحذفها من البحث. لا ترى Google علامة noindex في صفحة لا يُسمح لها بالزحف إليها، لذلك قد تمنع قاعدة Disallow قراءة noindex في الصفحة أبدًا.

    تذكّر أن robots.txt طلب يختار برنامج الزحف الملتزم احترامه. ويقول RFC 9309 إنه ليس وسيلة لتفويض الوصول، وإن إدراج مسار في الملف يجعله علنيًا. فنتيجة ممنوع تصف ما يقوله الملف، لا ما سيفعله كل برنامج زحف.

    أدوات وقراءات ذات صلة

    المصادر

    1. 1.RFC 9309: Robots Exclusion Protocol، IETFمصدر أساسي
    2. 2.How Google interprets the robots.txt specification، Google Search Centralمصدر أساسي
    3. 3.Robots meta tag, data-nosnippet, and X-Robots-Tag specifications، Google Search Central

    أسئلة شائعة

    كيف أعرف هل يمنع robots.txt عنوان URL؟

    الصق ملف robots.txt للموقع في الأداة، وأدخِل رمز User-agent لبرنامج الزحف ومسار URL الذي يبدأ بشرطة مائلة. تقول النتيجة مسموح أو ممنوع، ويسمّي التتبّع المجموعة التي انطبقت والسطر الذي حسم النتيجة.

    لماذا يتجاهل Googlebot قواعد User-agent *؟

    لأن برنامج الزحف يتبع المجموعة الأكثر تحديدًا التي تطابقه فقط. فإذا كان في الملف مجموعة Googlebot، يستخدمها Googlebot ولا يستخدم أي قاعدة من مجموعة *، لذلك كرّر في مجموعته كل قاعدة تريده أن يلتزم بها.

    أي قاعدة تفوز عندما تتطابق Allow وDisallow معًا؟

    صاحبة المسار الأطول، أيًا كان ترتيبها في الملف. ويسميها RFC 9309 المطابقة ذات أكبر عدد من الثُمانيات. وإذا تساوى الطول تُستخدم Allow، وتوثّق Google قاعدة الحسم نفسها لصالح الأقل تقييدًا.

    هل يبقى العنوان الممنوع خارج فهرس Google؟

    ليس بالضرورة. يوقف robots.txt الزحف لا الفهرسة. ويقول توثيق Google لعلامة robots meta إن الصفحة الممنوعة في robots.txt لن يُعثر على noindex فيها. ولإبقاء صفحة خارج الفهرس، اسمح بالزحف إليها واستخدم noindex.

    ما الفرق بينها وبين أداة التحقق من robots.txt؟

    تفحص أداة التحقق الملف كله بحثًا عن أخطاء الصياغة والحقول غير المدعومة والقواعد في غير موضعها. أما هذه الأداة فتفترض أن الملف سليم، وتجيب عن حالة واحدة في كل مرة، لبرنامج زحف واحد ومسار واحد.

    متى ترى Google تغييرًا في robots.txt؟

    تقول Google إنها تخزّن محتوى ملف robots.txt مؤقتًا لمدة تصل إلى 24 ساعة عادةً، لذلك قد يستغرق تطبيق التغيير يومًا.