
أهم النقاط
- قارن الباحثون 36 استراتيجية تقسيم بعضها ببعض في ستة مجالات معرفية وخمسة نماذج تضمين، ولم يختبروا طريقة واحدة بمعزل عن غيرها.
- بلغ متوسط nDCG@5 لتقسيم Paragraph Group Chunking نحو 0.459 ونسبة الإصابة في أول خمس نتائج نحو 59%، بينما سجّل التقسيم الثابت نحو 0.244 ودقة 2 إلى 3% في النتيجة الأولى.
- لم تفز طريقة واحدة في كل مكان، فتصدّر تحجيم المقاطع الديناميكي في الأحياء والفيزياء والصحة، وتصدّر تجميع الفقرات في المحتوى القانوني والرياضيات.
- حققت نماذج التضمين الأكبر نتائج أعلى عمومًا، لكنها تأثرت بالتقسيم السيئ، فالتقسيم وحجم النموذج عاملان منفصلان يتراكم أثرهما.
- اعتمدت الدراسة على نموذج لغوي بدل المحكّمين البشر في تقدير الصلة، وعلى مجموعة بيانات ثابتة من ستة مجالات، فقد لا تصح أرقامها بالضبط خارج هذا الإعداد.
يواجه كل محرك بحث بالذكاء الاصطناعي وكل روبوت محادثة يعتمد على الاسترجاع المهمة نفسها قبل أن يجيب من صفحة ويب: قصّ الصفحة إلى قطع صغيرة تصلح للتضمين والمقارنة مع طلب البحث.
نادرًا ما يُناقش أسلوب القصّ خارج دوائر هندسة RAG. لكن معيارًا أكاديميًا نُشر في مارس 2026 قاسه مباشرة، ووجد أن الفارق بين القصّ الجيد والقصّ الافتراضي كبير.
ماذا اختبرت الدراسة؟
بنى Muhammad Arslan Shaukat وMuntasir Adnan وCarlos C. N. Kuhn ما يصفونه بأول تقييم واسع عابر للمجالات لاستراتيجيات تقسيم المستندات في الاسترجاع الكثيف.
لم يقترحوا طريقة جديدة ويقارنوها بخطَّي أساس، بل قارنوا 36 استراتيجية بعضها ببعض، ضمن عائلات: الثابت والدلالي والمراعي للبنية والهرمي والتكيّفي والمدعوم بنموذج لغوي.
شغّلوا كل استراتيجية على مجموعة UltraDomain، وتغطي الأحياء والفيزياء والصحة والقانون والرياضيات والزراعة. وضمّنوا مقاطع كل استراتيجية بخمسة نماذج تضمين، ليفصلوا جودة التقسيم عن جودة النموذج.
وقيست دقة الاسترجاع بمقياس nDCG@5 أساسًا، مدعومًا بـ Hit@5 وMRR. وقدّر نموذج لغوي كبير الصلة بدل مطابقة الكلمات حرفيًا.
أي تقسيم أفضل؟
الرقم الرئيسي لافت. فقد بلغ متوسط nDCG@5 لـ Paragraph Group Chunking نحو 0.459، ونسبة Hit@5 نحو 59%. وهذه الطريقة تجمع فقرات كاملة في وحدة استرجاع بدل القصّ عند عدد ثابت من الأحرف.
أي أن المقطع الصحيح ظهر ضمن أول خمس نتائج قرابة ست مرات من كل عشر.
أما التقسيم الثابت بعدد الأحرف، وهو يقصّ النص كل N حرفًا دون اعتبار لحدود الجملة أو الفقرة، فسجّل نحو 0.244 على المقياس نفسه.
وبلغت دقته في النتيجة الأولى 2 إلى 3% فقط، أي احتمال أن يتصدر أفضل مقطع الترتيب. وهذا فارق يقارب عشرة أضعاف في المقياس الأهم لنظام لا يعرض إلا استشهادًا أو اثنين.
ووجدت الدراسة أيضًا أن طريقة واحدة لا تفوز في كل مكان. فتحجيم المقاطع الديناميكي، الذي يعدّل طول المقطع بحسب كثافة المحتوى، تفوق في الأحياء والفيزياء والصحة، بينما تفوق تجميع الفقرات في المحتوى القانوني والرياضيات.
ويرجع المؤلفون ذلك إلى اختلاف كتابة هذه المجالات، فالنثر العلمي التقني والحجة القانونية الكثيفة ينقسمان إلى وحدات متماسكة بأطوال طبيعية مختلفة.
هل يعوّض النموذج الأكبر؟
لا. رفعت نماذج التضمين الأكبر درجات الاسترجاع المطلقة في كل استراتيجية اختُبرت، لكنها بقيت حساسة للتقسيم السيئ.
لم يسدّ النموذج الأفضل الفجوة بين استراتيجية جيدة وأخرى سيئة، بل رفع الاثنتين بالقدر نفسه تقريبًا. ويصف المؤلفون جودة التقسيم وحجم التضمين بأنهما عاملان مكمّلان لا بديلان.
ومعنى ذلك أن الموقع يخسر دقة الاسترجاع إن قُسّم محتواه تقسيمًا سيئًا في المرحلة الأولى، حتى لو اعتمد النظام اللاحق على نموذج تضمين متقدم. وسواء جرى التقسيم في أداة جمع الصفحات أو في طريقة تنظيم الصفحة نفسها إلى أقسام، فالأثر واحد.
ما الذي يعنيه ذلك لك؟
تقيس الدراسة نظام استرجاع بناه الباحثون، لا أنظمة الفهرسة الحية في Google أو OpenAI أو Perplexity. فلا تقرأ أرقامها على أنها «أضف فواصل فقرات تُستشهد بك ضعف المرات».
لكنها تثبت بمقارنة مضبوطة بين 36 طريقة، لا بحالة واحدة، أن التقسيم متغيّر حقيقي يمكن قياسه في وصول المقطع الصحيح إلى طلب البحث، وليس تفصيلًا شكليًا.
وإذا كانت صفحتك تُقرأ بنظام استرجاع بقدر ما يقرؤها إنسان، فالمنطق يدعم تنظيمها في فقرات وأقسام مكتفية بذاتها، تفهم حين تُقتطع وحدها. فقد وجدت الدراسة أن أغلب استراتيجياتها الواعية بالمحتوى تفوقت على خطوط الأساس الثابتة الأبسط.
ما الذي لا يزال مجهولًا؟
لا تختبر الورقة وسوم العناوين في HTML ولا عناصر <article> أو <section> ولا أي إشارة على مستوى الترميز مباشرة. فطرقها المراعية للبنية والهرمية تعمل على حدود الفقرات والجمل في النص نفسه، لا على ترميز المستند.
وهل يعطي ترميز الصفحة بتسلسل h2 وh3 سليم المكاسب نفسها التي قيست للفقرات المحكمة؟ سؤال مفتوح يحتاج دراسة مستقلة، ولا ينبغي قراءة أي شيء هنا على أنه جواب عنه.
الأدلة
- العيّنة
- 36 طريقة تقسيم؛ 6 مجالات؛ 5 نماذج تضمين
الفرضية: طريقة تقسيم المستند إلى مقاطع في أنظمة الاسترجاع الكثيف متغيّر لم يُدرس كفاية، ويغيّر بوضوح احتمال استرجاع المقطع الصحيح لطلب بحث معيّن، بمعزل عن نموذج التضمين الذي يجري المطابقة.
الطريقة: قارن Shaukat وAdnan وKuhn بين 36 استراتيجية تقسيم، منها التقسيم الثابت والدلالي والمراعي للبنية والهرمي والتكيّفي والمدعوم بنموذج لغوي، على مجموعة UltraDomain التي تغطي ستة مجالات: الأحياء والفيزياء والصحة والقانون والرياضيات والزراعة. وجرى تضمين مقاطع كل استراتيجية بخمسة نماذج تضمين مختلفة، وقيست جودة الاسترجاع بمقياس nDCG@5 أساسًا، مدعومًا بـ Hit@5 وMRR، وقدّر نموذج لغوي كبير الصلة بدل المطابقة الحرفية للكلمات.
النتائج
- كانت Paragraph Group Chunking أفضل استراتيجية إجمالًا، ببلوغ متوسط nDCG@5 نحو 0.459 ودقة في النتيجة الأولى نحو 24% ونسبة إصابة Hit@5 نحو 59% على مجموعة الاختبار كلها.
- سجّل التقسيم الثابت بعدد الأحرف، وهو أبسط خط أساس، نحو 0.244 في nDCG@5 ودقة 2 إلى 3% فقط في النتيجة الأولى، أي أضعف بنحو عشرة أضعاف في وضع أفضل مقطع أولًا.
- اختلفت الطريقة الفائزة باختلاف الموضوع، فتفوق تحجيم المقاطع الديناميكي في الأحياء والفيزياء والصحة، وتفوق تجميع الفقرات في القانون والرياضيات، فلم تهيمن استراتيجية واحدة على المجالات كلها.
- رفعت نماذج التضمين الأكبر الدرجات المطلقة في كل الحالات، لكنها بقيت حساسة للتقسيم السيئ، فالنموذج الأكبر لا يعوّض محتوى مقسّمًا بشكل رديء، والعاملان، جودة التقسيم وحجم التضمين، يعملان باستقلال.
الحدود: القيد الذي تذكره الورقة نفسها أن تقدير الصلة جاء من نموذج لغوي لا من محكّمين بشر، وأن النتائج مبنية على مجموعة ثابتة من مجالات UltraDomain، لذلك يحذّر المؤلفون من أنها قد لا تصح في كل إعدادات الاسترجاع. كما تقيس الدراسة الاسترجاع داخل نظام RAG مضبوط بناه الباحثون، ولا تبيّن كيف يقسّم أي محرك بحث تجاري بالذكاء الاصطناعي صفحات الويب الحية أو يرتّبها، فأرقامها تصف دقة الاسترجاع في هذا الإعداد التجريبي، ولا تَعِد بزيادة في الاستشهاد لأي موقع بعينه.
المصادر
- 1.A Systematic Investigation of Document Chunking Strategies and Embedding Sensitivity، arXiv، 7 مارس 2026مصدر أساسي
عن الكاتب

مؤسس UpgradIQ FZC LLC
يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.
- SEO التقني
- القياس بـ Search Console وGA4
- تحسين الظهور في محركات الإجابة
- البيانات المنظَّمة
قراءات ذات صلة
معيار llms.txt للشركات لا للناشرين
قدّم 14 موقعًا فقط من 60 موقعًا كبيرًا ملف llms.txt، نصفها يبيع برامج SEO أو استضافة، وواحد منها موقع أخبار. للملف مشكلة جمهور.
مولّد robots.txt وllms.txt لبرامج زحف AI
اسمح لـ GPTBot وClaudeBot وGoogle-Extended و11 برنامجًا آخر أو احظرها حسب الغرض، واكتب ملفي robots.txt وllms.txt. مجاني ويعمل في متصفحك.
دراسة Ahrefs لـ 75,000 علامة تجارية
ربطت Ahrefs 12 مقياسًا بذكر العلامات في ChatGPT وAI Mode وAI Overviews: الذكر على الويب يتفوق على الروابط، وتحذّر من أنه لا يثبت السببية.
معدلات هلوسة استشهادات الذكاء الاصطناعي
قاست GPTZero وTow Center ودراسة Cureus هلوسة الاستشهادات بطرق مختلفة، ولا تتفق أرقامها. نعرض ما وجدته كل دراسة ولماذا لا تُجمع.



