
أهم النقاط
- دقّق GPTZero في يناير 2026 أوراق NeurIPS 2025 وعددها 4,841 ورقة، وأكد 100 استشهاد مهلوس على الأقل في 53 ورقة، أي نحو 1% من الإجمالي.
- وجد مركز Tow Center للصحافة الرقمية أن أكثر من 60% من 1,600 إجابة لمحركات بحث الذكاء الاصطناعي عن مقالات إخبارية احتوت على خطأ في الاستشهاد.
- وجدت دراسة Cureus أن ChatGPT-5 اختلق 7.13% من 2,736 مرجعًا طبيًا ولّدها، ولم يصب في كل الحقول إلا في 8% من الأسئلة.
- تختبر الدراسات الثلاث أنظمة مختلفة وتعريفات مختلفة للهلوسة، فلا يمكن جمع أرقامها في نسبة واحدة.
- يجدر بالناشرين وخبراء SEO التعامل مع أي نسبة هلوسة منشورة على أنها رقم دراسة واحدة، لا حقيقة مستقرة في الصناعة.
يتكرر كل بضعة أشهر رقم جديد يزعم أنه يجيب عن سؤال «كم مرة يختلق الذكاء الاصطناعي الاستشهادات؟». وقد يكون الرقم 1% أو 7% أو 40% أو 82%، بحسب المدونة التي تقرؤها.
كل هذه الأرقام تعود إلى أبحاث حقيقية، لكنها لا تجيب عن السؤال نفسه، وخلطها هو المشكلة الفعلية. تحققنا من ثلاث دراسات في مصدرها بحجم عينة ومنهج معلنين، واستبعدنا الباقي لأنه لم يتجاوز مجمّعات تنقل عن مجمّعات.
ماذا قاست الدراسات الثلاث؟
نشرت GPTZero، شركة كشف الانتحال والمحتوى المولَّد، تقريرًا في 21 يناير 2026. فحصت فيه هل الاستشهادات داخل 4,841 ورقة مقبولة في NeurIPS 2025 موجودة فعلًا وتطابق مصادرها.
وهذا سؤال عن أوراق أكاديمية كتبها بشر وتضم قوائم مراجع ولّدها الذكاء الاصطناعي، لا عن روبوت يجيب سؤالًا مباشرًا.
وأجرى Tow Center للصحافة الرقمية، عبر Columbia Journalism Review، اختبارًا مختلفًا في مارس 2025. طلب من ثماني أدوات بحث بالذكاء الاصطناعي تحديد 200 مقال إخباري حقيقي من 20 ناشرًا والاستشهاد بها، فكانت 1,600 استعلام.
وسؤاله: هل تحدد إجابة البحث المباشرة مصدرًا حقيقيًا بعينه وتربطه؟
وطرحت دراسة Cureus المنشورة في 30 يوليو 2026 سؤالًا ثالثًا: حين يجيب ChatGPT-5 عن سؤال سريري ويستشهد بإرشادات طبية، كم مرة يكون كل حقل في المرجع صحيحًا؟
وفحص الباحثون كل المراجع الـ 2,736 التي ولّدها في 350 استعلامًا مبنيًا على إرشادات AAOS.
ماذا وجدت كل واحدة؟
أبلغت أداة Hallucination Check من GPTZero عن استشهادات لا يمكن التحقق منها في قواعد البيانات الأكاديمية وروابط DOI وURL، ثم أكد خبير بشري كل حالة قبل عدّها.
وأكدت العملية 100 استشهاد مهلوس على الأقل في 53 ورقة، أي نحو 1.1% من الأوراق المفحوصة.
وهذا أدق الأرقام الثلاثة وأقدرها على التحقق: مجتمع ثابت من أوراق منتهية، وأداة مسمّاة، ومراجعة بشرية قبل النشر.
وجد Tow Center أن أكثر من 60% من 1,600 إجابة احتوت على خطأ استشهاد، أي تحديد خاطئ للمقال أو نسبة خاطئة للناشر أو رابطًا مفقودًا أو معطلًا.
وتباينت الدقة كثيرًا بين الأدوات: أقل خطأ عند النسخة المجانية من Perplexity بنسبة 37%، وأعلى خطأ عند Grok 3 بنسبة 94%. وأحال أكثر من نصف إجابات Gemini وGrok 3 إلى روابط مختلقة أو معطلة تؤدي إلى صفحات خطأ.
ووجدت Cureus أن ChatGPT-5 اختلق 7.13% من مراجعه الـ 2,736 تمامًا. وهذا قريب من «7 إلى 8%» التي ظهرت في مقتطفات البحث، وهو الموضع الوحيد المتداول الذي يعود هذا النطاق فيه إلى دراسة حقيقية مؤرخة.
لكن الاختلاق لم يكن مصدر الخطأ الأكبر. فلم يصح كل حقل إلا في 49.34% من الاستشهادات، ولم تكن كل استشهادات السؤال الواحد دقيقة تمامًا إلا في 8% من الحالات. وكان PMID والعنوان أكثر الحقول خطأ.
لماذا لا توجد نسبة واحدة؟
تبيّن ورقة arXiv لعام 2026 بعنوان «Source or It Didn’t Happen» سبب استعصاء هذه الأرقام على المتوسط. تقترح الورقة نظام كشف متعدد الوكلاء اسمه CiteTracer.
ويسجل معيارها دقة كشف 97.1%، لكن الرقم يصف تصنيف كاشفها لاستشهادات في مجموعة بنتها الورقة بنفسها: 2,450 استشهادًا اصطناعيًا معدَّلًا و957 مختلقًا معروفًا.
فهو لا يصف معدل هلوسة أي نظام في الاستخدام العادي، ولا يصلح رقمًا رابعًا لعنوان رئيسي.
وإذا رتبت الأرقام الحقيقية الثلاثة، امتد المدى من نحو 1% إلى أكثر من 60% في الموضوع العام نفسه.
وهذا ليس تناقضًا في الأبحاث، بل ثلاثة تعريفات للهلوسة على ثلاث مهام: أن يوجد الاستشهاد أصلًا، وأن يشير إلى المقال الصحيح، وأن يصح كل حقل فيه.
وقد تنجح إجابة واحدة في أحد الاختبارات وتفشل في آخر. وأي رقم يُذكر دون تحديد أي سؤال يجيب عنه يُعامل على أنه غير قابل للتحقق.
ما الذي يعنيه ذلك لك؟
إذا كنت ناشرًا، فرقم Tow Center هو الأهم يوميًا. فحتى حين تدفع اتفاقية ترخيص أو شراكة أداة بحث إلى ذكر موقعك، تبقى فرصة الخطأ قريبة من النصف: نسبة اقتباس إلى غير مصدره، أو ربط بنسخة منشورة في موقع آخر بدل الأصلية، أو رابط معطل.
وظهور اسم كاتب أو عنوان URL صحيحًا في إجابة روبوت لا يثبت أن النظام يستشهد بدقة في مواضع أخرى، والشراكة وحدها لا تعالج ذلك.
وإذا كنت تقيّم أداة لتتبع الاستشهادات، فدراستا GPTZero وCureus أنفع مرجعين. فهما تبيّنان أن «تم التحقق» و«مهلوس» لا يعنيان شيئًا ما لم تُعلن طريقة الفاحص.
الأداة التي تعطيك نسبة هلوسة واحدة دون أن توضح هل تفحص الوجود أم النسبة إلى المصدر أم دقة الحقول، تكرر خطأ المدونات المجمِّعة: ثلاثة قياسات في رقم يبدو أدق مما هو. اسأل أي سؤال من الثلاثة تجيب عنه قبل أن تثق بدرجتها.
الأدلة
- العيّنة
- 3 دراسات: 4,841 ورقة؛ 1,600 استعلام؛ 2,736 استشهادًا
الفرضية: تحمل الاستشهادات التي تنتجها أنظمة الذكاء الاصطناعي خطر الاختلاق أو عدم الدقة، سواء أجاب روبوت محادثة مباشرة أو أحال محرك بحث إلى مصدر. لكن حجم هذا الخطر يتوقف على الدراسة، ولا توجد نسبة متفق عليها.
الطريقة: قارنّا ثلاث دراسات أُجريت باستقلال، ولم نعتمد على ملخص أي مجمّع. الأولى تقرير GPTZero لكشف الهلوسة في أوراق NeurIPS 2025 المقبولة. والثانية اختبار Tow Center للصحافة الرقمية على ثمانية محركات بحث بالذكاء الاصطناعي أمام مقالات إخبارية حقيقية. والثالثة دراسة محكَّمة في Cureus فحصت كل مرجع ولّده ChatGPT-5 مقابل إرشادات AAOS السريرية. وقرأنا كل دراسة في مصدرها لا في مدونة تعيد سردها، واستبعدنا كل رقم لا يعود إلى دراسة مسمّاة ومؤرخة بحجم عينة معلن بدل خلطه في متوسط.
النتائج
- دقّق GPTZero في يناير 2026 أوراق NeurIPS 2025 المقبولة وعددها 4,841، وأكد 100 استشهاد مهلوس أو مختلق على الأقل في 53 ورقة، أي نحو 1.1% من الأوراق المفحوصة، بعد أن تحقق خبير بشري من كل حالة مُبلَّغ عنها.
- شغّل Tow Center في 2025 نحو 1,600 استعلام على ثمانية محركات بحث بالذكاء الاصطناعي منها ChatGPT Search وGemini وPerplexity وGrok. وفي أكثر من 60% من الإجابات خطأ في الاستشهاد، من 37% عند Perplexity إلى 94% عند Grok 3.
- فحصت دراسة Cureus في يوليو 2026 كل المراجع الـ 2,736 التي ولّدها ChatGPT-5 في 350 سؤالًا سريريًا. فكان 7.13% منها مهلوسًا أو مختلقًا تمامًا، و49.34% فقط صحيحًا في كل حقل، ولم يخلُ من الأخطاء إلا 8% من الأسئلة.
الحدود: لا تقيس هذه الدراسات الشيء نفسه، ولا يصح مقارنة أرقامها أو حساب متوسطها. يفحص GPTZero وجود الاستشهاد ومطابقته لمصدره في ورقة محكَّمة منتهية. ويفحص Tow Center هل تحدد إجابة مباشرة مقالًا إخباريًا بعينه وتربطه. وتفحص Cureus صحة كل حقل في المرجع الطبي: المؤلف والعنوان والمجلة وأرقام الصفحات. وهي تختبر أنظمة ومهام وتعريفات مختلفة للهلوسة، فلا يصمد ادعاء من نوع «معدل الهلوسة هو كذا%». لذلك استبعدنا أرقامًا متداولة بلا دراسة مسمّاة أو منهجية معلنة، مثل «حتى 82%».
المصادر
- 1.GPTZero finds 100 new hallucinations in NeurIPS 2025 accepted papers، GPTZero، 21 يناير 2026مصدر أساسي
- 2.AI Search Has a Citation Problem، Columbia Journalism Review, Tow Center for Digital Journalism، 6 مارس 2025مصدر أساسي
- 3.Evaluating the Citation Accuracy of ChatGPT-5 Using the American Academy of Orthopaedic Surgeons Clinical Practice Guidelines، Cureus، 30 يوليو 2026مصدر أساسي
- 4.Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection، arXiv
أسئلة شائعة
ما معدل هلوسة الاستشهادات في الذكاء الاصطناعي؟
لا يوجد معدل واحد. تتراوح الأرقام الموثقة من نحو 1% عند GPTZero إلى أكثر من 60% عند Tow Center، لأن كل دراسة تقيس شيئًا مختلفًا: وجود الاستشهاد، أو صحة الربط بالمقال، أو دقة كل حقل.
لماذا لا يصح حساب متوسط الدراسات الثلاث؟
لأنها تختلف في الأنظمة المختبرة وفي المهمة وفي تعريف الهلوسة. المتوسط يخلط ثلاثة أسئلة مختلفة في رقم يبدو أدق مما هو.
ما الرقم الأهم للناشر؟
رقم Tow Center، لأنه يقيس هل يحدد محرك البحث مقالك ويربطه صحيحًا. وتظل نسبة الخطأ فيه عالية حتى حين تكون لك شراكة مع المنصة.
عن الكاتب

مؤسس UpgradIQ FZC LLC
يعمل Adam Hafez في SEO التقني وقياس البحث، من الزحف والفهرسة إلى استشهاد محركات الإجابة. أسّس UpgradIQ، التي تربط تغيّر الترتيب بسببه من بيانات Search Console وGA4. ينشر ما تدعمه البيانات، ويذكر حدودها.
- SEO التقني
- القياس بـ Search Console وGA4
- تحسين الظهور في محركات الإجابة
- البيانات المنظَّمة
قراءات ذات صلة
اختبار ChatGPT لوسوم ملونة للمنتجات
يختبر ChatGPT وسومًا مثل best all-rounder وbest for beginners على نتائج المنتجات بلونين أخضر ورمادي. ولم تعلّق OpenAI على الاختبار.
OpenAI تضع علامة مائية على نصوص ChatGPT
تضيف OpenAI علامة مائية غير مرئية لنصوص ChatGPT وCodex في الاتحاد الأوروبي، مع اشتراك اختياري عبر API عالميًا. التحرير يضعفها، ولا تستخدمها Google.
Search Console تنبّه إلى تجاوز خاصية AI
تقول صفحة مساعدة Google إن مالك خاصية النطاق الأعلى يرى إشعارًا حين تتجاوز خاصية فرعية إعداد الخاصية الأم في Search generative AI control.
كيف تحوّل Google الاستعلام إلى نتائج
ملخص حضور من ROAST لحديث Mueller وIllyes في برشلونة: توسيع المرادفات، واستعلامات fan-out التي لا تظهر في Search Console، والاسترجاع قبل الترتيب.



