الانتقال إلى المحتوى
Waseit
← كل المقالات
AEOGEO

134 إجابة خاطئة من 200 و15 مرة فقط أبدى شكًا: أن تُذكر ليس أن تُذكر بشكل صحيح

دراستان كبيرتان قاستا اقتباسات محركات الذكاء الاصطناعي. أكثر من 60% غير صحيحة، و31% تعاني مشكلة في المصدر، ونبرة الثقة لا تنخفض أبدًا. وما يغيّره ذلك لعلامتك.

أكثر من 60%

من الاقتباسات غير صحيحة في 1600 استعلام، وثمانية محركات مختبَرة (Tow Center، مارس 2025)

5 سبتمبر 20269 دقيقة قراءة
في هذا المقال
  1. ما الذي قاسته دراستان كبيرتان
  2. الأسوأ ليس الخطأ، بل الثقة
  3. روابط لا تؤدي إلى شيء
  4. ما الذي يغيّره ذلك لعلامة
  5. ما الذي يتغير

الجواب المختصر: قد يذكرك اقتباس الذكاء الاصطناعي ويخطئ في حقك. فالقياسات المنشورة لا تتناول الظهور، بل دقة ما يُنسب: أكثر من 60% من الاقتباسات غير صحيحة في دراسة شملت 1600 استعلام، و31% فيها مشكلة في المصدر في دراسة أخرى على أكثر من 3000 إجابة. فالسؤال المفيد ليس «هل أُذكر» فحسب، بل «هل ما يُنسب إليّ صحيح، وهل يقود الرابط إلى شيء».

31%

من الإجابات فيها مشكلة مصدر: نسبة غائبة أو مضللة أو خاطئة (EBU وBBC، أكتوبر 2025)

134 مقابل 15

مقالات أخطأ ChatGPT في تحديدها، مقابل عدد المرات التي أبدى فيها شكًا، من 200 إجابة

المحرك الذي يخطئ ويقولها يترك لك فرصة. أما الذي يخطئ بثقة فلا يترك شيئًا: لا سبب لدى القارئ كي يتحقق.

ما الذي قاسته دراستان كبيرتان

الأولى من Tow Center for Digital Journalism في كولومبيا، ونُشرت في 6 مارس 2025. المنهج بسيط وقابل للإعادة: عشرون ناشرًا، وعشر مقالات مسحوبة عشوائيًا من كل منهم، ومقتطفات منسوخة كما هي، وثمانية محركات إجابة يُطلب منها تحديد العنوان والناشر الأصلي والتاريخ والرابط. أي 1600 استعلام. وفي المجموع ردّت المحركات بإجابة غير صحيحة على أكثر من 60% منها.

اقتباسات غير صحيحة، ثمانية محركات إجابة، 1600 استعلام (Tow Center، 6 مارس 2025). الأرقام المذكورة هنا لكل محرك هي التي تنص عليها الدراسة صراحة.
القياسالنتيجة
مجموع المحركات الثمانيةأكثر من 60% إجابات غير صحيحة
Perplexity، الأفضل في المجموعة37% غير صحيحة
Grok-3، الأسوأ في المجموعة94% غير صحيحة
Grok-3، اقتباسات تنتهي إلى صفحة خطأ154 من 200

والثانية أوسع وتأتي من وسائل الإعلام العمومية. نشرها اتحاد الإذاعات الأوروبية مع BBC في 22 أكتوبر 2025، وفيها قيّم صحفيون محترفون أكثر من 3000 إجابة من ChatGPT وCopilot وGemini وPerplexity، عبر 22 مؤسسة و18 بلدًا و14 لغة. وخلاصتها المركزية أن الخلل بنيوي: لا يتعلق باللغة ولا بالسوق ولا بمساعد بعينه.

عيوب رصدها صحفيون في أكثر من 3000 إجابة، 22 مؤسسة إعلام عمومي، 18 بلدًا، 14 لغة (EBU وBBC، 22 أكتوبر 2025).
نوع العيبنسبة الإجابات
مشكلة جوهرية واحدة على الأقل45%
مشكلة مصدر: نسبة غائبة أو مضللة أو خاطئة31%
مشكلة دقة كبيرة: تفاصيل مختلقة، معلومات قديمة20%
Gemini، إجابات فيها مشكلة جوهرية76%

الأسوأ ليس الخطأ، بل الثقة

رقم واحد من Tow Center يستحق أن يُفرد، لأنه يحسم ما عداه. أخطأ ChatGPT في تحديد 134 مقالًا من 200، ولم يشر إلى نقص الثقة سوى خمس عشرة مرة. الخطأ والشك غير مترابطين: يخطئ في ثلثي الحالات ويقولها في حالة من كل ثلاث عشرة.

هذا هو الفرق بين مصدر قابل للخطأ ومصدر مضلِّل. المحرك الذي يتردد يترك للقارئ إشارة، ومن ثم فرصة للتحقق. والمحرك الذي يجزم لا يترك شيئًا. وهذا يعني لشركة أن اقتباسًا خاطئًا لا يصحح نفسه: ليس في الإجابة ما يدعو أحدًا إلى الشك فيه.

روابط لا تؤدي إلى شيء

أما الملاحظة الأخرى فأكثر عيانية. أكثر من نصف إجابات Gemini وGrok-3 كانت تحيل إلى روابط مختلقة أو ميتة. وفي Grok-3 انتهى 154 اقتباسًا من 200 إلى صفحة خطأ. فالمحرك لا يكتفي بالنسبة الخاطئة: بل يخترع عنوانًا يبدو كأنه دليل.

وتصف دراسة EBU الآلية نفسها من جهة المصدر: تصريحات تُنسب إلى غرف أخبار لم تدلِ بها قط، وروابط تقود إلى مقال في موضوع آخر أو إلى صفحة اختفت، وأحيانًا اقتباس كامل - اسم الوسيلة والعنوان والتاريخ - لمقال لم يُنشر أصلًا. والإحالة حسنة الصياغة ليست إحالة صحيحة.

ما الذي يغيّره ذلك لعلامة

ينتقل الاستدلال مباشرة. فإذا كان المحرك قادرًا على نسبة جملة إلى غرفة أخبار لم تكتبها، فهو قادر على نسبة حجتك أو سعرك أو تخصصك إلى منافس - أو العكس، أن يحمّلك وعدًا لم تقطعه قط. وفي الحالتين أنت «مذكور»، وفي الحالتين يعرض العدّاد الذي يكتفي بعدّ الاقتباسات خبرًا سارًا.

هذا هو حد درجة الظهور إذا أُخذت وحدها، ودرجتنا منها. فالظهور شرط لازم، وليس مقياس النتيجة. والاقتباس يُقرأ بثلاثة أسئلة: هل نُذكر، وهل ما يُنسب إلينا دقيق، وهل يقود الرابط المعروض إلى صفحة موجودة.

  • هاتان الدراستان عن الأخبار لا عن التوصيات التجارية.

    فمنهج Tow Center هو تتبع أصل مقتطف صحفي، ومنهج EBU يجعل صحفيين يقيّمون إجابات إخبارية. آلية النسبة واحدة، أما النقل إلى التوصيات التجارية فهو استدلالنا نحن ولم تقسه هاتان الدراستان.

  • تعودان إلى 2025، والنماذج تغيرت منذئذ.

    نشر Tow Center في مارس 2025، ونشر EBU وBBC في أكتوبر 2025. والنسخ المختبَرة لم تعد المقدَّمة اليوم، ولا يقول أي من القياسين ماذا سيعطي المنهج نفسه هذا الشهر. ونحن لم نُعِده.

  • متوسط ثمانية محركات يخفي فوارق هائلة.

    فبين 37% و94% من الأخطاء بحسب المحرك، يكون «أكثر من 60%» العام متوسطًا يرفعه الأسوأ. واقتباس هذا الرقم وحده للحديث عن محرك بعينه خطأ في القراءة.

  • لم نُعِد إنتاج أي منهما.

    فهما عملان نشرهما مركز بحثي جامعي واتحاد لوسائل إعلام عمومية، وقرأناهما في مصدرهما. وليسا قياسينا، ولا نقدمهما على هذا النحو.

ما الذي يتغير

اقرأ الاقتباس لا العدّاد وحده.

فأن تُذكر وأن تُوصف وصفًا صحيحًا نتيجتان مختلفتان. ولوحة تكتفي بعدّ الظهور لا تميّز خبرًا سارًا من خطأ في حقك.

تحقق من وجود الرابط.

فعنوان مختلق على نطاقك يشبه الدليل وليس دليلًا. انقر ما يعرضه المحرك: نصف إجابات محركين مختبَرين كانت تقود إلى صفحة ميتة.

راقب ما يُنسب إلى منافسيك.

فالخطأ يسير في الاتجاهين: قد تُحسب حجتك لاسم آخر، وهذا غير مرئي من متابعة لا تنظر إلا إلى اسمك.

لا تعوّل على شك المحرك.

فهو يخطئ أكثر بكثير مما يتردد: 134 خطأ مقابل 15 تحفظًا في 200 إجابة. وثقة النبرة لا تقول شيئًا عن دقة المضمون.

الأسئلة الشائعة

هل يمكن أن يضر اقتباس الذكاء الاصطناعي بشركتي؟
نعم، وهذا ما تفوته عدّادات الظهور. فالدراسات المنشورة ترصد تصريحات نُسبت إلى مصادر لم تدلِ بها قط، وروابط تقود إلى صفحات غير موجودة. ومنقولًا إلى علامة، يعني ذلك أن إجابة قد تحمّلك سعرًا أو تخصصًا أو وعدًا ليس لك، وتعدّك مع ذلك مذكورًا.
أي محرك يقتبس بدقة أكبر؟
في دراسة Tow Center في مارس 2025 كان Perplexity الأفضل في المجموعة بنسبة 37% من الإجابات غير الصحيحة، وGrok-3 الأسوأ بنسبة 94%. ويلزم تحفظان: هذه النسخ لم تعد المقدَّمة اليوم، و37% من الخطأ تبقى نسبة مرتفعة. ولم يكن أي محرك في المجموعة موثوقًا بالمعنى المتعارف عليه.
كيف نتحقق مما يقوله ذكاء اصطناعي عنا؟
اطرح السؤال كما يطرحه عميل، ثم اقرأ الإجابة على ثلاث مراحل: هل يظهر اسمك، وهل ما يُنسب إليك دقيق، وهل يقود الرابط المعروض إلى صفحة موجودة. وكرّر القياس عبر الزمن، لأن إجابة يوم لا تتنبأ بإجابة الغد. هذا ما تفعله متابعتنا، وهو أيضًا ما يمكنك فعله يدويًا.