انتقل إلى المحتوى
SEO Madmanby Adam Hafez
أداة مجانية

خريطة الموقع مقابل robots.txt: الممنوع

اكتشف عناوين خريطة الموقع التي تمنعها قاعدة Disallow في robots.txt على Googlebot أو أي برنامج زحف. أداة مجانية تعمل في متصفحك.

تعمل بالكامل في متصفحك. لا يُرفع ما تُدخله، ولا يُسجَّل، ولا يُحفظ.

لا يُرسل أي شيء تلصقه هنا إلى أي مكان، فالملفان يُحلَّلان في متصفحك فقط.

    أهم النقاط

    • قد يكون العنوان مدرجًا في خريطة الموقع بينما تمنع قاعدة Disallow في robots.txt برنامج الزحف نفسه من جلبه.
    • تطبّق الأداة قاعدة RFC 9309 بأن المطابقة الأكثر تحديدًا تفوز، وأن Allow تفوز عند تساوي الطول.
    • تقول Google أن تدرج العناوين التي تريدها في نتائج البحث، لذلك يرسل العنوان الممنوع في خريطة الموقع إشارة متناقضة.
    • تقول Google إن robots.txt ليس وسيلة لإبقاء صفحة خارج البحث، وإن العنوان الممنوع قد يُفهرس إذا وُجدت روابط إليه.
    • يُحل كل تعارض بإحدى طريقتين: حذف العنوان من خريطة الموقع، أو تضييق قاعدة Disallow.

    ما تحتاج إليه

    • محتوى XML لخريطة الموقع، ملصوقًا
    • محتوى robots.txt، ملصوقًا
    • برنامج الزحف (User-agent) المراد اختباره، والافتراضي هو *

    أدوات أخرى

    كلها مجانية، وكلها تعمل في المتصفح.

    تصفّح الأدوات

    طريقة الاستخدام

    1. 1الصق كود XML لخريطة الموقعانسخ المحتوى الخام لملف خريطة الموقع، لا رابطه. ومثل أداة فحص خريطة الموقع في الموقع، تحلّل هذه الأداة ما تلصقه فقط ولا تجلب أي عنوان URL.
    2. 2الصق محتوى robots.txtاستخدم الملف المنشور على الموقع، أو مسودة قبل نشرها، وهو المدخل نفسه الذي تقبله أداة اختبار robots.txt في الموقع.
    3. 3حدّد User-agent المراد اختبارهالافتراضي هو مجموعة * العامة، وأدخِل اسم برنامج زحف مثل Googlebot لتختبر مجموعته الأكثر تحديدًا بدلًا منها.
    4. 4اقرأ قائمة التعارضاتيُصنَّف كل عنوان في خريطة الموقع مسموحًا أو متعارضًا، وتُذكر بجانب التعارض قاعدة Disallow التي تمنعه بالضبط.
    5. 5أصلح التعارضاحذف العنوان من خريطة الموقع، أو ضيّق قاعدة Disallow حتى لا تطابق ذلك المسار، ثم أعِد الفحص.

    تدرج خريطة الموقع العناوين التي تريد أن يزحف إليها محرك البحث. وتطلب قاعدة Disallow في robots.txt من برنامج الزحف نفسه ألا يجلب مسارًا ما. وقد يكون الملفان صالحين كل على حدة، ومع ذلك يتناقضان بشأن عنوان واحد.

    تقرأ هذه الأداة الملفين، وتطبّق قواعد المطابقة الحقيقية في robots.txt، وتعرض كل عنوان في خريطة الموقع يقع في الجانب الممنوع.

    ماذا تفحص الأداة؟

    • كل loc في خريطة الموقع. تُحلَّل خريطة الموقع كـ XML. ويجب أن يكون جذرها urlset، وتُجمع كل قيم loc المطلقة داخل عناصر url. وخطأ التحليل أو غياب urlset يوقف الفحص مع ذكر السبب.
    • مجموعة robots.txt الصحيحة. تُقرأ المجموعات كما يعرّفها RFC 9309: سطور User-agent متتالية تتبعها قواعد Allow وDisallow الخاصة بها.
    • اختيار المجموعة. تختار الأداة المجموعة المطابقة لـ User-agent الذي أدخلته، وتعود إلى مجموعة * إن لم تطابق أي مجموعة، كما يشترط RFC 9309. وتدمج المجموعات التي تطابق برنامج الزحف نفسه، كما يشترط أيضًا.
    • القاعدة الفائزة لكل عنوان. يُختبر مسار كل عنوان مع سلسلة الاستعلام مقابل قواعد المجموعة. وتفوز المطابقة الأكثر تحديدًا، أي أطول مسار مطابق، وتتغلب Allow على Disallow بالطول نفسه.
    • الرموز البديلة والافتراضات. العلامة * تطابق أي سلسلة أحرف، و$ تربط القاعدة بنهاية المسار. والعنوان الذي لا تطابقه أي قاعدة مسموح، وتتخطى الأداة سطر Disallow: الفارغ.

    كيف تقرأ النتائج؟

    يعرض الملخص ثلاثة أعداد: العناوين المفحوصة، ومسموح، والتعارضات. وتحته سطر لكل عنوان. “مسموح” يعني أن لا قاعدة تمنعه لذلك User-agent. و”تعارض” يعني أن خريطة الموقع تدرجه بينما يمنعه robots.txt، مع اقتباس سطر robots.txt المسؤول لتعرف القاعدة التي يجب تغييرها.

    ويسمّي السطر الأخير المجموعة المستخدمة، إما المجموعة العامة وإما المجموعة المعلنة لبرنامج زحف محدد.

    يحتاج التعارض إلى قرار. تقول إرشادات Google لخرائط الموقع أن تدرج العناوين التي تريد رؤيتها في نتائج بحثها، لذلك يرسل العنوان الذي منعته أيضًا رسالتين متعاكستين.

    فإذا كان المنع مقصودًا، احذف العنوان من خريطة الموقع. وإذا كان يجب الزحف إلى الصفحة، ضيّق قاعدة Disallow أو احذفها. والمنع وحده لا يخفي العنوان: تقول Google إن الصفحة الممنوعة قد تُفهرس إذا أشارت إليها مواقع أخرى.

    مثال عملي

    تبدأ الأداة بهذا المثال. تدرج خريطة الموقع ثلاثة عناوين: https://example.com/ وhttps://example.com/blog/an-article وhttps://example.com/private/quarterly-report. وملف robots.txt هو:

    User-agent: *
    Allow: /
    Disallow: /private/
    Sitemap: https://example.com/sitemap.xml

    مع ترك User-agent على *، يعرض الملخص 3 عناوين مفحوصة، و2 مسموح، و1 تعارض. فالصفحة الرئيسية والمقال لا يطابقان إلا Allow: /، لذلك كلاهما مسموح.

    ومسار التقرير يطابق Allow: / (حرف واحد) وDisallow: /private/ (9 أحرف). وتفوز Disallow الأطول، فيظهر العنوان كتعارض تمنعه Disallow: /private/. أما سطر Sitemap: فليس قاعدة مجموعة، ويُتجاهل.

    أخطاء شائعة تكشفها

    • قسم مُنع بعد بناء خريطة الموقع. مسار تجريبي، أو نتائج بحث داخلي، أو مجلد خاص صار ممنوعًا، لكن مولّد خريطة الموقع ما زال يدرج كل صفحاته.
    • قاعدة واسعة تبتلع صفحات حقيقية. Disallow: /p تمنع /products/ و/pricing إلى جانب /p/، لأن القواعد تطابق بالبادئة. وتعرض قائمة التعارضات كل عنوان التقطته.
    • مجموعة خاصة ببرنامج زحف نسيتها. مجموعة User-agent: Googlebot تحل كليًا محل المجموعة العامة عند Googlebot. اختبر Googlebot إلى جانب * لترى ما يُقال له فعلًا.
    • المنع لإزالة الفهرسة. تقول Google إن robots.txt ليس وسيلة لإبقاء صفحة خارج البحث، لذلك يحتاج العنوان الذي تريد إزالته إلى noindex أو حماية بكلمة مرور.

    أدوات وقراءات ذات صلة

    المصادر

    1. 1.Robots.txt introduction and guide، Google Search Centralمصدر أساسي
    2. 2.Build and submit a sitemap، Google Search Central
    3. 3.RFC 9309: Robots Exclusion Protocol، IETF

    أسئلة شائعة

    لماذا يكون العنوان في خريطة الموقع وممنوعًا في robots.txt معًا؟

    يُدار الملفان عادةً كل على حدة. فنظام إدارة المحتوى أو خطوة البناء تعيد إنشاء خريطة الموقع من كل الصفحات الموجودة، بينما يُعدَّل robots.txt يدويًا. وعند إضافة قاعدة Disallow جديدة لا يخبر شيء مولّد خريطة الموقع، فيستمر في إدراج العناوين الممنوعة.

    هل يبقي منع العنوان في robots.txt الصفحة خارج Google؟

    لا. تقول Google إن robots.txt ليس وسيلة لإبقاء صفحة خارج Google، وإن العنوان الممنوع قد يُفهرس إذا أشارت إليه مواقع أخرى، وغالبًا يظهر بلا وصف. استخدم noindex أو الحماية بكلمة مرور لإبقاء الصفحة خارج النتائج.

    أي مجموعة في robots.txt تستخدمها الأداة؟

    تبحث عن مجموعة يطابق User-agent فيها الاسم الذي تدخله، مع تفضيل أطول رمز مطابق، وتدمج المجموعات المتساوية في المطابقة. وإن لم تطابق أي مجموعة تعود إلى مجموعة *، كما يشترط RFC 9309. وتسمّي الأداة المجموعة المستخدمة تحت النتائج.

    كيف تحسم الأداة بين قاعدتي Allow وDisallow؟

    تتبع RFC 9309: تفوز القاعدة صاحبة أطول مسار مطابق، وإذا تطابقت Allow وDisallow بطول متساوٍ تفوز Allow. وتدعم الأداة الرمز البديل * وعلامة النهاية $. والعنوان الذي لا تطابقه أي قاعدة مسموح.

    هل تجلب الأداة خريطة الموقع أو robots.txt الحي؟

    لا. تحلّل الأداة الملفين في متصفحك مما تلصقه، ولا يُرسل أي شيء إلى أي مكان. وهذا يعني أيضًا أنها لا ترى ملفًا لديك رابطه فقط، فانسخ محتواه والصقه.