---
title: "معدلات هلوسة استشهادات الذكاء الاصطناعي"
url: https://seomadman.com/ar/research/ai-citation-hallucination-rates
section: research
language: ar
published: 2026-10-01T00:00:00.000Z
modified: 2026-10-01T00:00:00.000Z
author: Adam Hafez
topics: ["البحث بالذكاء الاصطناعي"]
---

# معدلات هلوسة استشهادات الذكاء الاصطناعي

## الإجابة المختصرة

تختلف نسب اختلاق الاستشهادات في أنظمة الذكاء الاصطناعي اختلافًا كبيرًا بين الدراسات. فقد وجد تدقيق GPTZero في يناير 2026 استشهادات مهلوسة في نحو 1% من أوراق NeurIPS 2025، ووجد Tow Center أخطاء استشهاد في أكثر من 60% من إجابات محركات البحث عن الأخبار، ووجدت دراسة Cureus أن ChatGPT-5 اختلق 7% من المراجع الطبية. ولا توجد نسبة واحدة صحيحة.

## أهم النقاط

- دقّق GPTZero في يناير 2026 أوراق NeurIPS 2025 وعددها 4,841 ورقة، وأكد 100 استشهاد مهلوس على الأقل في 53 ورقة، أي نحو 1% من الإجمالي.
- وجد مركز Tow Center للصحافة الرقمية أن أكثر من 60% من 1,600 إجابة لمحركات بحث الذكاء الاصطناعي عن مقالات إخبارية احتوت على خطأ في الاستشهاد.
- وجدت دراسة Cureus أن ChatGPT-5 اختلق 7.13% من 2,736 مرجعًا طبيًا ولّدها، ولم يصب في كل الحقول إلا في 8% من الأسئلة.
- تختبر الدراسات الثلاث أنظمة مختلفة وتعريفات مختلفة للهلوسة، فلا يمكن جمع أرقامها في نسبة واحدة.
- يجدر بالناشرين وخبراء SEO التعامل مع أي نسبة هلوسة منشورة على أنها رقم دراسة واحدة، لا حقيقة مستقرة في الصناعة.

يتكرر كل بضعة أشهر رقم جديد يزعم أنه يجيب عن سؤال «كم مرة يختلق الذكاء الاصطناعي الاستشهادات؟».
وقد يكون الرقم 1% أو 7% أو 40% أو 82%، بحسب المدونة التي تقرؤها.

كل هذه الأرقام تعود إلى أبحاث حقيقية، لكنها لا تجيب عن السؤال نفسه، وخلطها هو المشكلة الفعلية.
تحققنا من ثلاث دراسات في مصدرها بحجم عينة ومنهج معلنين، واستبعدنا الباقي لأنه لم يتجاوز مجمّعات تنقل عن مجمّعات.

## ماذا قاست الدراسات الثلاث؟

نشرت GPTZero، شركة كشف الانتحال والمحتوى المولَّد، تقريرًا في 21 يناير 2026. فحصت فيه هل الاستشهادات داخل 4,841 ورقة مقبولة في NeurIPS 2025 موجودة فعلًا وتطابق مصادرها.

وهذا سؤال عن أوراق أكاديمية كتبها بشر وتضم قوائم مراجع ولّدها الذكاء الاصطناعي، لا عن روبوت يجيب سؤالًا مباشرًا.

وأجرى Tow Center للصحافة الرقمية، عبر Columbia Journalism Review، اختبارًا مختلفًا في مارس 2025. طلب من ثماني أدوات بحث بالذكاء الاصطناعي تحديد 200 مقال إخباري حقيقي من 20 ناشرًا والاستشهاد بها، فكانت 1,600 استعلام.

وسؤاله: هل تحدد إجابة البحث المباشرة مصدرًا حقيقيًا بعينه وتربطه؟

وطرحت دراسة Cureus المنشورة في 30 يوليو 2026 سؤالًا ثالثًا: حين يجيب ChatGPT-5 عن سؤال سريري ويستشهد بإرشادات طبية، كم مرة يكون كل حقل في المرجع صحيحًا؟

وفحص الباحثون كل المراجع الـ 2,736 التي ولّدها في 350 استعلامًا مبنيًا على إرشادات AAOS.

## ماذا وجدت كل واحدة؟

أبلغت أداة Hallucination Check من GPTZero عن استشهادات لا يمكن التحقق منها في قواعد البيانات الأكاديمية وروابط DOI وURL، ثم أكد خبير بشري كل حالة قبل عدّها.

وأكدت العملية 100 استشهاد مهلوس على الأقل في 53 ورقة، أي نحو 1.1% من الأوراق المفحوصة.

وهذا أدق الأرقام الثلاثة وأقدرها على التحقق: مجتمع ثابت من أوراق منتهية، وأداة مسمّاة، ومراجعة بشرية قبل النشر.

وجد Tow Center أن أكثر من 60% من 1,600 إجابة احتوت على خطأ استشهاد، أي تحديد خاطئ للمقال أو نسبة خاطئة للناشر أو رابطًا مفقودًا أو معطلًا.

وتباينت الدقة كثيرًا بين الأدوات: أقل خطأ عند النسخة المجانية من Perplexity بنسبة 37%، وأعلى خطأ عند Grok 3 بنسبة 94%. وأحال أكثر من نصف إجابات Gemini وGrok 3 إلى روابط مختلقة أو معطلة تؤدي إلى صفحات خطأ.

ووجدت Cureus أن ChatGPT-5 اختلق 7.13% من مراجعه الـ 2,736 تمامًا. وهذا قريب من «7 إلى 8%» التي ظهرت في مقتطفات البحث، وهو الموضع الوحيد المتداول الذي يعود هذا النطاق فيه إلى دراسة حقيقية مؤرخة.

لكن الاختلاق لم يكن مصدر الخطأ الأكبر. فلم يصح كل حقل إلا في 49.34% من الاستشهادات، ولم تكن كل استشهادات السؤال الواحد دقيقة تمامًا إلا في 8% من الحالات. وكان PMID والعنوان أكثر الحقول خطأ.

## لماذا لا توجد نسبة واحدة؟

تبيّن ورقة arXiv لعام 2026 بعنوان «Source or It Didn't Happen» سبب استعصاء هذه الأرقام على المتوسط. تقترح الورقة نظام كشف متعدد الوكلاء اسمه CiteTracer.

ويسجل معيارها دقة كشف 97.1%، لكن الرقم يصف تصنيف كاشفها لاستشهادات في مجموعة بنتها الورقة بنفسها: 2,450 استشهادًا اصطناعيًا معدَّلًا و957 مختلقًا معروفًا.

فهو لا يصف معدل هلوسة أي نظام في الاستخدام العادي، ولا يصلح رقمًا رابعًا لعنوان رئيسي.

وإذا رتبت الأرقام الحقيقية الثلاثة، امتد المدى من نحو 1% إلى أكثر من 60% في الموضوع العام نفسه.

وهذا ليس تناقضًا في الأبحاث، بل ثلاثة تعريفات للهلوسة على ثلاث مهام: أن يوجد الاستشهاد أصلًا، وأن يشير إلى المقال الصحيح، وأن يصح كل حقل فيه.

وقد تنجح إجابة واحدة في أحد الاختبارات وتفشل في آخر. وأي رقم يُذكر دون تحديد أي سؤال يجيب عنه يُعامل على أنه غير قابل للتحقق.

## ما الذي يعنيه ذلك لك؟

إذا كنت ناشرًا، فرقم Tow Center هو الأهم يوميًا. فحتى حين تدفع اتفاقية ترخيص أو شراكة أداة بحث إلى ذكر موقعك، تبقى فرصة الخطأ قريبة من النصف: نسبة اقتباس إلى غير مصدره، أو ربط بنسخة منشورة في موقع آخر بدل الأصلية، أو رابط معطل.

وظهور اسم كاتب أو عنوان URL صحيحًا في إجابة روبوت لا يثبت أن النظام يستشهد بدقة في مواضع أخرى، والشراكة وحدها لا تعالج ذلك.

وإذا كنت تقيّم أداة لتتبع الاستشهادات، فدراستا GPTZero وCureus أنفع مرجعين. فهما تبيّنان أن «تم التحقق» و«مهلوس» لا يعنيان شيئًا ما لم تُعلن طريقة الفاحص.

الأداة التي تعطيك نسبة هلوسة واحدة دون أن توضح هل تفحص الوجود أم النسبة إلى المصدر أم دقة الحقول، تكرر خطأ المدونات المجمِّعة: ثلاثة قياسات في رقم يبدو أدق مما هو. اسأل أي سؤال من الثلاثة تجيب عنه قبل أن تثق بدرجتها.

## أسئلة شائعة

### ما معدل هلوسة الاستشهادات في الذكاء الاصطناعي؟

لا يوجد معدل واحد. تتراوح الأرقام الموثقة من نحو 1% عند GPTZero إلى أكثر من 60% عند Tow Center، لأن كل دراسة تقيس شيئًا مختلفًا: وجود الاستشهاد، أو صحة الربط بالمقال، أو دقة كل حقل.

### لماذا لا يصح حساب متوسط الدراسات الثلاث؟

لأنها تختلف في الأنظمة المختبرة وفي المهمة وفي تعريف الهلوسة. المتوسط يخلط ثلاثة أسئلة مختلفة في رقم يبدو أدق مما هو.

### ما الرقم الأهم للناشر؟

رقم Tow Center، لأنه يقيس هل يحدد محرك البحث مقالك ويربطه صحيحًا. وتظل نسبة الخطأ فيه عالية حتى حين تكون لك شراكة مع المنصة.

## المصادر

1. [GPTZero finds 100 new hallucinations in NeurIPS 2025 accepted papers](https://gptzero.me/news/neurips/) - GPTZero (primary)
2. [AI Search Has a Citation Problem](https://www.cjr.org/tow_center/we-compared-eight-ai-search-engines-theyre-all-bad-at-citing-news.php) - Columbia Journalism Review, Tow Center for Digital Journalism (primary)
3. [Evaluating the Citation Accuracy of ChatGPT-5 Using the American Academy of Orthopaedic Surgeons Clinical Practice Guidelines](https://pmc.ncbi.nlm.nih.gov/articles/PMC13525731/) - Cureus (primary)
4. [Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection](https://arxiv.org/abs/2605.08583) - arXiv