---
title: "كيف يغيّر تقسيم الصفحة فرص استرجاعها؟"
url: https://seomadman.com/ar/research/chunking-strategy-rag-retrieval-accuracy-study
section: research
language: ar
published: 2026-10-01T00:00:00.000Z
modified: 2026-10-01T00:00:00.000Z
author: Adam Hafez
topics: ["SEO التقني", "البحث بالذكاء الاصطناعي"]
---

# كيف يغيّر تقسيم الصفحة فرص استرجاعها؟

## الإجابة المختصرة

يغيّر تقسيم المستند إلى مقاطع فرص العثور عليه في أنظمة الاسترجاع. اختبر معيار أكاديمي عام 2026 ست وثلاثين طريقة تقسيم على ستة مجالات معرفية وخمسة نماذج تضمين. وحقق التقسيم بحسب الفقرات دقة استرجاع تقارب ضعف دقة التقسيم الثابت بعدد الأحرف، وجاءت الطرق الواعية بالفقرات بين الثلاث الأولى في كل مجال.

## أهم النقاط

- قارن الباحثون 36 استراتيجية تقسيم بعضها ببعض في ستة مجالات معرفية وخمسة نماذج تضمين، ولم يختبروا طريقة واحدة بمعزل عن غيرها.
- بلغ متوسط nDCG@5 لتقسيم Paragraph Group Chunking نحو 0.459 ونسبة الإصابة في أول خمس نتائج نحو 59%، بينما سجّل التقسيم الثابت نحو 0.244 ودقة 2 إلى 3% في النتيجة الأولى.
- لم تفز طريقة واحدة في كل مكان، فتصدّر تحجيم المقاطع الديناميكي في الأحياء والفيزياء والصحة، وتصدّر تجميع الفقرات في المحتوى القانوني والرياضيات.
- حققت نماذج التضمين الأكبر نتائج أعلى عمومًا، لكنها تأثرت بالتقسيم السيئ، فالتقسيم وحجم النموذج عاملان منفصلان يتراكم أثرهما.
- اعتمدت الدراسة على نموذج لغوي بدل المحكّمين البشر في تقدير الصلة، وعلى مجموعة بيانات ثابتة من ستة مجالات، فقد لا تصح أرقامها بالضبط خارج هذا الإعداد.

يواجه كل محرك بحث بالذكاء الاصطناعي وكل روبوت محادثة يعتمد على الاسترجاع المهمة نفسها قبل أن يجيب من صفحة ويب: قصّ الصفحة إلى قطع صغيرة تصلح للتضمين والمقارنة مع طلب البحث.

نادرًا ما يُناقش أسلوب القصّ خارج دوائر هندسة RAG. لكن معيارًا أكاديميًا نُشر في مارس 2026 قاسه مباشرة، ووجد أن الفارق بين القصّ الجيد والقصّ الافتراضي كبير.

## ماذا اختبرت الدراسة؟

بنى Muhammad Arslan Shaukat وMuntasir Adnan وCarlos C. N. Kuhn ما يصفونه بأول تقييم واسع عابر للمجالات لاستراتيجيات تقسيم المستندات في الاسترجاع الكثيف.

لم يقترحوا طريقة جديدة ويقارنوها بخطَّي أساس، بل قارنوا 36 استراتيجية بعضها ببعض، ضمن عائلات: الثابت والدلالي والمراعي للبنية والهرمي والتكيّفي والمدعوم بنموذج لغوي.

شغّلوا كل استراتيجية على مجموعة UltraDomain، وتغطي الأحياء والفيزياء والصحة والقانون والرياضيات والزراعة. وضمّنوا مقاطع كل استراتيجية بخمسة نماذج تضمين، ليفصلوا جودة التقسيم عن جودة النموذج.

وقيست دقة الاسترجاع بمقياس nDCG@5 أساسًا، مدعومًا بـ Hit@5 وMRR. وقدّر نموذج لغوي كبير الصلة بدل مطابقة الكلمات حرفيًا.

## أي تقسيم أفضل؟

الرقم الرئيسي لافت. فقد بلغ متوسط nDCG@5 لـ Paragraph Group Chunking نحو 0.459، ونسبة Hit@5 نحو 59%. وهذه الطريقة تجمع فقرات كاملة في وحدة استرجاع بدل القصّ عند عدد ثابت من الأحرف.

أي أن المقطع الصحيح ظهر ضمن أول خمس نتائج قرابة ست مرات من كل عشر.

أما التقسيم الثابت بعدد الأحرف، وهو يقصّ النص كل N حرفًا دون اعتبار لحدود الجملة أو الفقرة، فسجّل نحو 0.244 على المقياس نفسه.

وبلغت دقته في النتيجة الأولى 2 إلى 3% فقط، أي احتمال أن يتصدر أفضل مقطع الترتيب. وهذا فارق يقارب عشرة أضعاف في المقياس الأهم لنظام لا يعرض إلا استشهادًا أو اثنين.

ووجدت الدراسة أيضًا أن طريقة واحدة لا تفوز في كل مكان. فتحجيم المقاطع الديناميكي، الذي يعدّل طول المقطع بحسب كثافة المحتوى، تفوق في الأحياء والفيزياء والصحة، بينما تفوق تجميع الفقرات في المحتوى القانوني والرياضيات.

ويرجع المؤلفون ذلك إلى اختلاف كتابة هذه المجالات، فالنثر العلمي التقني والحجة القانونية الكثيفة ينقسمان إلى وحدات متماسكة بأطوال طبيعية مختلفة.

## هل يعوّض النموذج الأكبر؟

لا. رفعت نماذج التضمين الأكبر درجات الاسترجاع المطلقة في كل استراتيجية اختُبرت، لكنها بقيت حساسة للتقسيم السيئ.

لم يسدّ النموذج الأفضل الفجوة بين استراتيجية جيدة وأخرى سيئة، بل رفع الاثنتين بالقدر نفسه تقريبًا. ويصف المؤلفون جودة التقسيم وحجم التضمين بأنهما عاملان مكمّلان لا بديلان.

ومعنى ذلك أن الموقع يخسر دقة الاسترجاع إن قُسّم محتواه تقسيمًا سيئًا في المرحلة الأولى، حتى لو اعتمد النظام اللاحق على نموذج تضمين متقدم. وسواء جرى التقسيم في أداة جمع الصفحات أو في طريقة تنظيم الصفحة نفسها إلى أقسام، فالأثر واحد.

## ما الذي يعنيه ذلك لك؟

تقيس الدراسة نظام استرجاع بناه الباحثون، لا أنظمة الفهرسة الحية في Google أو OpenAI أو Perplexity. فلا تقرأ أرقامها على أنها «أضف فواصل فقرات تُستشهد بك ضعف المرات».

لكنها تثبت بمقارنة مضبوطة بين 36 طريقة، لا بحالة واحدة، أن التقسيم متغيّر حقيقي يمكن قياسه في وصول المقطع الصحيح إلى طلب البحث، وليس تفصيلًا شكليًا.

وإذا كانت صفحتك تُقرأ بنظام استرجاع بقدر ما يقرؤها إنسان، فالمنطق يدعم تنظيمها في فقرات وأقسام مكتفية بذاتها، تفهم حين تُقتطع وحدها. فقد وجدت الدراسة أن أغلب استراتيجياتها الواعية بالمحتوى تفوقت على خطوط الأساس الثابتة الأبسط.

## ما الذي لا يزال مجهولًا؟

لا تختبر الورقة وسوم العناوين في HTML ولا عناصر `<article>` أو `<section>` ولا أي إشارة على مستوى الترميز مباشرة. فطرقها المراعية للبنية والهرمية تعمل على حدود الفقرات والجمل في النص نفسه، لا على ترميز المستند.

وهل يعطي ترميز الصفحة بتسلسل `h2` و`h3` سليم المكاسب نفسها التي قيست للفقرات المحكمة؟ سؤال مفتوح يحتاج دراسة مستقلة، ولا ينبغي قراءة أي شيء هنا على أنه جواب عنه.

## المصادر

1. [A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity](https://arxiv.org/abs/2603.06976) - arXiv (primary)