
أهم النقاط
- تذكر دراسة JetOctopus متجر مجوهرات إلكترونيًا فيه أكثر من 16 مليون صفحة، لكن زياراته الشهرية 342,000 فقط، وهذا اختلال كبير.
- ظلت صفحات مربحة في الموقع بلا فهرسة أشهرًا بينما أنفق Googlebot موارده على روابط التصفية وتقسيم الصفحات الموسومة بـ canonical.
- كانت التوصية إغلاق تركيبات الفئات والتصفية وتقسيم الصفحات والفرز، فتقلّص الموقع إلى 730,000 صفحة.
- تعرض المقالة نفسها موقعًا عقاريًا ذهب 23.5 مليون من 38 مليون طلب شهري من Googlebot فيه إلى محتوى AJAX.
- العميل بلا اسم وتبيع JetOctopus أداة تحليل السجلات المستخدمة، فتعامل مع الدراسة عرضًا من البائع نفسه لا نتيجة مدقَّقة.
تسجّل سجلات الخادم ما طلبه Googlebot فعلًا، لا ما تخمّنه محاكاة زاحف. ونشرت JetOctopus، مزوّد تحليل السجلات والزحف، ثلاث دراسات حالة قصيرة من هذه البيانات في مقالة واحدة كتبها Serge Bezborodov بتاريخ 27 مايو 2020.
تتناول هذه المادة الحالة الأكبر تغيّرًا مقيسًا، وتبيّن ما لا تقوله المقالة.
ماذا أظهرت السجلات؟
كان للموقع أكثر من 16 مليون صفحة و342,000 زيارة شهريًا. جزء منه يظهر في أعلى النتائج، وجزء آخر لم يُفهرس أشهرًا، وهي صفحات ذات صلة ومربحة لا قديمة.
زحفت JetOctopus 2 مليون صفحة ووجدت في كل منها نحو 900 رابط داخلي، وقدّرت العدد الكلي بنحو 16 مليون صفحة، ثم أوقفت الزحف لتفهم سبب ضخامة الموقع.
وحلّلت السجلات فوجدت Googlebot ينفق موارده على صفحات تحمل وسوم rel=canonical، لأن الموقع وضع canonical أو canonical ذاتيًا على كل عنصر في كل فئة وصفحة تصفية وتقسيم.
والدرس الذي تستخلصه المقالة أن وسم canonical لا يوقف الزحف. فعلى Googlebot أن يجلب عنوان URL ليقرأ الوسم، فتظل ملايين نسخ التصفية والفرز الموسومة بـ canonical تكلّف طلبات زحف.
ماذا تغيّر وبأي نتيجة؟
كانت التوصية إغلاق تركيبات الفئة والتصفية وتقسيم الصفحات والفرز التي ولّدت معًا معظم تلك الصفحات. ونتيجة المصدر المعلنة أن حجم الموقع تقلّص إلى 730,000 صفحة ليزحف البرنامج إلى الصفحات الأكثر ربحًا.
وهذا خفض في عدد الصفحات بنحو 95%. ولا تذكر المقالة أعداد طلبات الزحف ولا الصفحات المفهرسة ولا الزيارات بعد التغيير، ولا مدة زمنية، فنذكر تغيّر عدد الصفحات فقط.
هل كان robots.txt الحل؟
ليس لهذا الموقع. فالتوصية تقول “أغلق” التركيبات دون تسمية الآلية.
لكن خلاصة المقالة تناقش المقايضات: توصي Google بـ noindex بدل الحظر، لكن في متاجر التجارة الإلكترونية الضخمة يبقى الزاحف منفقًا ميزانية الزحف على جلب الصفحة ليقرأ التوجيه، بينما قد يوقف robots.txt زحف أقسام كاملة.
ماذا تقول وثائق Google؟
دليل ميزانية الزحف الحالي لدى Google موجّه للمواقع الكبيرة التي فيها مليون صفحة فريدة أو أكثر وتتغير أسبوعيًا تقريبًا، وللمواقع المتوسطة التي فيها 10,000 صفحة أو أكثر وتتغير يوميًا، وللمواقع التي تعلق فيها عناوين URL كثيرة بحالة “Discovered - currently not indexed”.
وكتالوج من 16 مليون صفحة داخل هذا النطاق تمامًا.
وفي مسألة noindex صار الدليل صريحًا. فهو يقول ألا تستخدمه لهذا الغرض، لأن Google ستطلب الصفحة ثم تسقطها، فيضيع وقت الزحف.
ويوصي بدمج المحتوى المكرر وحظر زحف عناوين URL غير المرغوب في زحفها بـ robots.txt، ويضيف ألا يُستخدم robots.txt لإعادة توزيع ميزانية الزحف مؤقتًا. وتغطي ملاحظتنا البحثية عن noindex وميزانية الزحف هذا التوجيه بالتفصيل.
ماذا في الحالتين الأخريين؟
في سوق فيه 226,000 صفحة و4 ملايين زيارة شهريًا، مُنعت عناوين التصفية بقاعدة Disallow: /*? ومع ذلك بقيت نسخ مكررة في فهرس Google. والسبب قاعدة Allow: /product متعارضة تطابق عناوين URL نفسها.
وتشرح وثائق robots.txt لدى Google المنطق: تستخدم برامج الزحف القاعدة الأكثر تحديدًا بطول المسار، وحين تتعارض القواعد تأخذ Google بالأقل تقييدًا. ونصحت JetOctopus باختبار التوجيهات بأداة تحقق قبل نشرها، لأن قواعد كل محرك بحث قد تختلف.
وفي موقع عقاري فيه أكثر من مليون صفحة و4.5 مليون زيارة شهريًا، أظهرت السجلات 38 مليون طلب من Googlebot في شهر، ذهب منها 23.5 مليونًا إلى محتوى AJAX، أي نحو 62% من الإجمالي.
وتلاحظ المقالة أن Google حين تعرض محتوى يُحمَّل بطلبات XHR POST يُحسب كل طلب فرعي من ميزانية الزحف. وكان الإصلاح الموصى به حظر AJAX عديم القيمة في robots.txt، مع تحذير من أن الحظر المتسرّع قد يحجب محتوى تحتاجه الصفحة. ولا تذكر أي من الحالتين رقمًا بعد التغيير.
ماذا تفحص في سجلاتك؟
- حصة طلبات Googlebot الذاهبة إلى عناوين المعاملات والتصفية والفرز والتقسيم مقابل الصفحات القابلة للفهرسة.
- هل ما زالت النسخ الموسومة بـ canonical تُجلب بكثافة، أي أن الوسم لا يوفر زحفًا.
- أي قاعدة Allow في robots.txt تتداخل مع نمط Disallow، واختبر عناوين نموذجية بـ أداة اختبار robots.txt.
- الطلبات إلى نقاط AJAX وAPI التي تعيد أجزاء لا صفحات.
تبيع JetOctopus أداة تحليل السجلات المستخدمة هنا ولا تسمّي عميلًا، فتعامل مع الحالات الثلاث كلها عرضًا من JetOctopus نفسها.
الأدلة
- الموضوع
- هدر الزحف في سجلات خادم متجر مجوهرات إلكتروني
- المدة
- لم يذكره المصدر
- التحقق
- نعم، مقابل بيانات الموقع نفسه
| المقياس | قبل | بعد |
|---|---|---|
| الصفحات القابلة للزحف في الموقع | 16000000صفحة | 730000صفحة |
المصادر
- 1.How Googlebot Crawls Your Pages. Logs Insights، JetOctopus، 27 مايو 2020مصدر أساسي
أسئلة شائعة
ما الذي أظهرته سجلات الخادم في موقع المجوهرات؟
أظهرت أن Googlebot ينفق موارده على صفحات تحمل وسوم rel=canonical، لأن الموقع وضع canonical أو canonical ذاتيًا على كل عنصر في كل فئة وصفحة تصفية وتقسيم، فبلغ عدد الصفحات نحو 16 مليونًا.
هل منع الزحف بـ robots.txt هو الحل هنا؟
لا يحدده المصدر. توصي المقالة بإغلاق التركيبات دون تسمية الآلية. وتناقش المقايضة: تفضّل Google noindex على الحظر، لكن في المتاجر الضخمة يبقى الزحف منفقًا على جلب الصفحة لقراءة التوجيه، بينما قد يوقف robots.txt زحف أقسام كاملة.
هل علامة canonical توقف الزحف؟
لا. يجب أن يجلب Googlebot عنوان URL ليقرأ العلامة، فتظل ملايين نسخ التصفية والفرز الموسومة بـ canonical تكلّف طلبات زحف. وهذا الدرس الذي تستخلصه المقالة.
عن الكاتب

مؤسس UpgradIQ FZC LLC
يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.
- SEO التقني
- القياس بـ Search Console وGA4
- تحسين الظهور في محركات الإجابة
- البيانات المنظَّمة
قراءات ذات صلة
من يحظر برامج زحف الذكاء الاصطناعي؟
قرأنا ملفات robots.txt لـ 60 ناشرًا ومورّد SEO. مواقع الأخبار تحظر برامج زحف الذكاء الاصطناعي تقريبًا بلا استثناء، وصناعة SEO لا تفعل.
ما دقة قيم lastmod في خرائط الموقع؟
وجدت دراسة Bing أن 18% من الخرائط التي فيها lastmod تضبطه خطأ، وغالبًا على تاريخ الإنشاء، وتقول Google إنها تعتمد الدقيق منه فقط.
هل تتطابق صفحات الجوال والحاسوب؟
قارن فصل SEO في Web Almanac لعام 2024 بين زحف الجوال والحاسوب. تتطابق العناوين والـ canonical وعدد الكلمات تقريبًا، وتبقى فجوات صغيرة.
canonical: كيف تحدد عنوان URL الأساسي؟
الطرق الثلاث لتحديد عنوان URL الأساسي بين الصفحات المكرّرة، وقوة كل إشارة، والأخطاء التي تحذّر منها Google، ومتى تفضّل HTTPS.



