انتقل إلى المحتوى
SEO Madmanby Adam Hafez

هل يوفر noindex ميزانية الزحف؟

علاج شائع لميزانية الزحف يعمل بالعكس. تقول وثائق Google إنها تطلب صفحة noindex كاملة ثم تسقطها من الفهرس، فيضيع وقت الزحف ولا يُوفَّر.

نُشر في  · قراءة في 3 دقائق

كتبهAdam Hafez
شارك
Markdown
لافتة قف حمراء وبيضاء على خلفية سماء زرقاء

أهم النقاط

  • تطلب وثائق Google عن ميزانية الزحف للمواقع الكبيرة ألا يُستخدم noindex لهذا الغرض، لأن Google تطلب الصفحة ثم لا تسقطها إلا بعد رؤية الوسم.
  • تقول الوثائق نفسها صراحة إن هذا النمط يضيّع وقت الزحف ولا يوفره، وهذا عكس ما يُنشر noindex لأجله عادة.
  • يؤكد مدخل Google إلى robots.txt البديل الموثق: المحتوى المحظور فيه لا يُجلب إطلاقًا، وهذه نتيجة مختلفة آليًا عن noindex.
  • تذكر وثائق robots.txt أن صفحة مفهرسة قد تبقى في النتائج بلا وصف بعد حظرها في robots.txt، لأن Google لم تعد تزحف إليها لتجد noindex.
  • توصي Google باستخدام robots.txt للصفحات التي لا تريد زحفها أصلًا، وبحصر noindex في الصفحات التي يجب أن تبقى قابلة للزحف لتتصرف Google بحسب الوسم.

يُلجأ إلى noindex كثيرًا علاجًا لميزانية الزحف: يوسم المرء الصفحات قليلة القيمة أو المرشحات أو تركيبات المعاملات الرقيقة بـ noindex، ويظن أن Google ستكف عن إهدار الطلبات عليها. وتقول وثائق Google نفسها إن هذا يفعل عكس ما يتوقعه أصحاب المواقع.

هل يظل noindex يكلف زحفًا؟

نعم. يتناول دليل مالكي المواقع الكبيرة لإدارة ميزانية الزحف هذا النمط مباشرة لا عرضًا.

وتوجيهه ألا يُستخدم noindex لإدارة ميزانية الزحف، وسببه أن Google تطلب الصفحة أولًا، ولا تسقطها من الفهرس إلا بعد أن تتلقى الاستجابة وتقرأ وسم noindex. فالزحف قد حدث قبل أن يسري الأمر.

وتقول الوثائق صراحة إن هذا يضيّع وقت الزحف ولا يوفره، وهذا عكس ما يدفع أصحاب المواقع إلى وضع noindex على أقسام كبيرة.

وهذه خاصية بنيوية في طريقة عمل الوسم لا تحفظًا يخص بعض الحالات. فوسم meta الخاص بـ noindex يقع داخل HTML الصفحة، وعنوان HTTP الخاص به يقع في عناوين الاستجابة. وفي الحالتين على برنامج الزحف أن يجلب الاستجابة كاملة قبل أن يظهر أي من الموضعين له.

ولا سبيل لـ Googlebot إلى معرفة أن صفحة تحمل noindex دون أن يطلبها. فتبقى كل صفحة noindex في مشكلة ميزانية الزحف مكلفة الزحف كما كانت قبل الوسم، بلا نهاية، لأن Google تعيد طلبها لتتأكد أن الوسم ما زال قائمًا.

وترسم الوثائق نفسها حدًا موازيًا حول robots.txt لسبب مختلف. فهي تنصح كذلك بعدم استخدامه لإعادة توجيه ميزانية الزحف مؤقتًا إلى صفحات أخرى، وتخصصه للعناوين التي لا يجب زحفها أصلًا.

والتحذيران ليسا تحذيرًا واحدًا. يفشل noindex في ميزانية الزحف لأن الزحف يحدث على أي حال. ولا يُنصح بـ robots.txt لإعادة التوزيع المؤقت لأنه حظر دائم لا مفتاح تشغيل وإيقاف.

ما البديل وما كلفته؟

يوثّق مدخل Google إلى robots.txt الآلية التي تمنع الزحف فعلًا: نمط عناوين URL محظور فيه لا يطلبه برنامج زحف Google في الحالة المعتادة، وهذه النتيجة المختلفة آليًا التي لا يحققها noindex.

وهذه الأداة التي يشير إليها إرشاد ميزانية الزحف لأقسام كبيرة من عناوين URL قليلة القيمة، ومنها النسخ المرتبة بشكل مختلف من الصفحة نفسها وصفحات infinite scroll المكررة في أمثلتها المذكورة، لأنها تلغي الطلب بدل أن تتركه يحدث ثم تتجاهل نتيجته.

وتحمل هذه الآلية كلفة موثقة خاصة بها، في الاتجاه المعاكس لمشكلة noindex. فصفحة مفهرسة قبل أن يبدأ robots.txt بحظرها قد تبقى في نتائج البحث بلا وصف، لأن Google لم تعد تزحف إلى هذا العنوان لتلاحظ أي شيء عنه، ومن ذلك وسم noindex أضيف بعد الحظر أو محتوى لم يعد موجودًا.

وتوضح وثائق robots.txt الحل: استخدم noindex، أو حظرًا آخر تستطيع Google قراءته، حين يكون الهدف إزالة صفحة من الفهرس. ولا تلجأ إلى robots.txt إلا بعد أن تتم الإزالة، أو للعناوين التي لم تُفهرس أصلًا.

والتسلسل أهم من أي من الآليتين وحدها. فالصفحة التي يجب أن تخرج من الفهرس عليها أن تبقى قابلة للزحف مدة كافية ليُقرأ noindex ويُنفَّذ. وحظرها في robots.txt أولًا يقطع هذا الطريق نهائيًا.

وقد تبقى صفحة محذوفة أو قديمة في النتائج بلا وصف ما دام الحظر قائمًا، لأن Google لا تملك وسيلة لإعادة فحصها. فالأداتان تحلان مشكلتين مختلفتين في نقطتين مختلفتين من عمر الصفحة، لا علاجين متنافسين لمشكلة واحدة.

لماذا يهمنا هذا؟

العلاج الذي يُلجأ إليه أكثر لميزانية الزحف هو الذي تقول وثائق Google نفسها إنه لا يفيد لهذا الغرض. والأداة التي تفيد لها خطر يشبه النجاح من الخارج: صفحة لم تعد تظهر على أنها مزحوفة حديثًا، وتبقى هادئة في الفهرس بلا وصف، ولا يلاحظ أحد لأن شيئًا لا يبدو معطلًا.

وللصواب في هذا التسلسل على موقع كبير ثلاث خطوات. أضف noindex إلى الصفحات التي يجب أن تغادر الفهرس وهي قابلة للزحف، وانتظر تأكيد الإزالة، ثم انقل نمط عناوين URL إلى robots.txt إن كان الهدف إيقاف الزحف نهائيًا.

وعكس هذا الترتيب، أو استخدام robots.txt اختصارًا يتجاوز noindex، ينتج حالة العالق إلى أجل غير مسمى التي تحذّر منها وثائق Google، في صفحات كان المقصود فقط أن تختفي.

الأدلة

العيّنة
لا ينطبق، فهذه مراجعة وثائق لا دراسة بيانات

الفرضية: يُساء استخدام noindex على نطاق واسع أداةً لتوفير ميزانية الزحف، لكن وثائق Google نفسها تذكر صراحة أن هذا لا ينجح، لأن Google يجب أن تزحف إلى الصفحة لتكتشف وسم noindex قبل أن تسقطها من الفهرس.

الطريقة: راجعنا وثائق Google الحالية الفعلية عن ميزانية الزحف وعن robots.txt مباشرة، فجلبناها وقرأناها بدل الاكتفاء بملخص من طرف ثانٍ. ويرجع كل ادعاء أدناه إلى صفحة محددة في Google Search Central لا إلى صياغة طرف ثالث لها.

النتائج

  • تطلب وثائق Google عن ميزانية الزحف للمواقع الكبيرة ألا يُستخدم noindex لإدارتها، وتشرح أن Google تطلب الصفحة ثم تسقطها عند رؤية وسم noindex، فيضيع وقت الزحف ولا يُوفَّر.
  • تحذّر الوثائق نفسها كذلك من استخدام robots.txt لإعادة توزيع ميزانية الزحف مؤقتًا، وتخصصه للصفحات التي لا يجب أن تزحف إليها Google أصلًا. وهذه توصية مختلفة عن تحذير noindex ولا تتبادل معها.
  • تذكر وثائق مدخل Google إلى robots.txt أن المحتوى المحظور فيه لا تزحف إليه Google ولا تفهرسه في الحالة المعتادة، وهذه النتيجة المختلفة آليًا عن noindex هي محور هذه المادة.
  • وتذكر الوثائق نفسها أن عنوان URL مفهرسًا قبل حظره قد يظل يظهر في النتائج بلا وصف، وتوصي بـ noindex أو بحماية كلمة المرور لا بـ robots.txt حين يكون الهدف إبقاء الصفحة خارج الفهرس.

الحدود: هذه مراجعة وثائق لا دراسة سجلات خادم ولا تدقيق ميزانية زحف لمواقع حقيقية، فلا تستطيع قياس ما يضيع عادة من ميزانية الزحف بسبب noindex عمليًا، بل تنقل الآلية والتوصية اللتين تذكرهما Google. وتتداول نقاشات SEO حالة دراسة لسوق إلكتروني بأكثر من 350,000 عنوان URL بمعاملات أهدر ميزانية الزحف بسبب noindex، لكن لم نصل في هذه المراجعة إلى أي مصدر حقيقي مسمّى يمكن فحصه، فلم نستخدمها. وأي رقم كهذا تجده في مكان آخر فهو غير موثّق حتى يظهر مصدر حقيقي. وميزانية الزحف مفهوم تقول Google إنه مهم أساسًا للمواقع الكبيرة جدًا أو كثيرة التغيّر، لا للموقع المتوسط، ولا نعيد هنا الجدل في هذا التمييز لكننا لا نريد أن يُفهم أننا نتجاهله.

المصادر

  1. 1.Large site owner's guide to managing your crawl budget، Google Search Centralمصدر أساسي
  2. 2.Introduction to robots.txt، Google Search Centralمصدر أساسي

أسئلة شائعة

هل تقلل إضافة noindex إلى صفحة عدد مرات زحف Google إليها؟

لا. تقول وثائق ميزانية الزحف إن Google تطلب الصفحة أولًا، ولا تسقطها من الفهرس إلا بعد قراءة وسم noindex في الاستجابة، فتُنفَق مدة الزحف ولا تُوفَّر.

ما البديل عن noindex لمنع Google فعلًا من زحف نمط من عناوين URL؟

تشير وثائق Google إلى robots.txt لهذا الغرض، بحظر النمط كي لا يُجلب إطلاقًا. وهذا إجراء مختلف آليًا عن noindex الذي يحتاج إلى زحف ناجح ليعمل.

هل يصلح robots.txt بديلًا آمنًا عن noindex لصفحة مفهرسة أصلًا؟

ليس وحده. تحذّر وثائق robots.txt من أن عنوانًا مفهرسًا قبل حظره قد يبقى في النتائج بلا وصف، لأن Google لم تعد تزحف إليه لترى noindex. ولإخراج صفحة مفهرسة يلزم noindex أو حظر آخر تقرؤه Google، قبل أن يقطع robots.txt الزحف.

عن الكاتب

Adam Hafez
Adam Hafez

مؤسس UpgradIQ FZC LLC

يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.

  • SEO التقني
  • القياس بـ Search Console وGA4
  • تحسين الظهور في محركات الإجابة
  • البيانات المنظَّمة

النشرة

ما تغيّر فعلًا في البحث فقط، كاملًا عبر خلاصات RSS وAtom وJSON.

تابِعنا