هل تفسّر المصادر المستشهد بها التوصية فعلًا؟ 128 حالة تحقّقنا منها واحدة واحدة
قرأنا الصفحات التي يقول الذكاء الاصطناعي إنه اطّلع عليها، وبحثنا فيها عن العلامة الموصى بها. 128 من أصل 128، بوسيط ست صفحات تذكر كل واحدة.
في هذا المقال
الجواب المختصر: نعم. من بين 128 شركة أوصى بها Perplexity، ترد الـ128 جميعها في صفحة واحدة على الأقل من الصفحات التي يصرّح بأنه اطّلع عليها. والوسيط ست صفحات تذكرها من أصل اثنتي عشرة صفحة فحصناها. الاستشهادات ليست زينة: إنها تحمل الإجابة فعلًا.
هذا المقال موجود لأن مقال الأمس انتهى بتحفّظ كتبناه نحن أنفسنا: «نحن نقيس ما يُقرأ، لا ما أقنع». فالصفحة المستشهد بها ليست بالضرورة تلك التي أدخلت اسمًا إلى القائمة. وترك تحفّظك نائمًا يحوّله إلى محسّن أسلوبي. المسألة قابلة للحسم، فحسمناها.
لو لم تكن المصادر تفسّر التوصيات، لكان كل ما نشرناه منذ ثلاثة أيام عن «أين ينبغي أن يُستشهد بك» نصيحة بلا أساس. وهذا نوع من التحقق يُجرى على النفس أولًا.
ما الذي قِسناه بالضبط
ننطلق من الإجابات المجموعة في 24 أغسطس - خمسة قطاعات عالمية، دون ذكر أي بلد في السؤال. ولدينا من كل إجابة شيئان: النص، أي الشركات الموصى بها، والروابط المستشهد بها. ولا يبقى إلا أن نقرأ تلك الصفحات وننظر هل الاسم الموصى به موجود فيها.
ثمة فخّ يحسم كل شيء، وهو قاسٍ. فالصفحة التي نعجز عن قراءتها - رفض وصول، انتهاء مهلة، محتوى يُبنى بجافاسكريبت - ستجعل علامةً تبدو «غير مدعومة» وهي ربما مدعومة. وعندئذ نكون قد صنعنا أكثر نتائج المقال إثارة من إخفاقاتنا نحن في الجمع. لذلك صنّفنا إلى ثلاث حالات، لا حالتين:
| الحالة | المعنى |
|---|---|
| مدعومة | العلامة ترد في صفحة مستشهد بها واحدة على الأقل |
| غير مدعومة | قُرئت كل الصفحات المستشهد بها، والعلامة ليست فيها |
| غير محسومة | بقيت صفحة مستشهد بها واحدة على الأقل غير مقروءة |
تُحسب النسبة المنشورة على الحالات المحسومة وحدها، وتُنشر نسبة غير المحسومة إلى جانبها: أمكن قراءة 254 من أصل 300 صفحة مستشهد بها، أي 85 %. ونحن نُعرّف عن أنفسنا بوصفنا روبوتًا ولا ننتحل هيئة متصفح - فالموقع الذي يرفض الروبوتات من حقه أن يرفضنا، وذلك يُحتسب «غير مقروء»، لا حقيقة.
النتيجة
| الحكم | العدد |
|---|---|
| مدعومة بصفحة مستشهد بها واحدة على الأقل | 128 |
| غير مدعومة | 0 |
| غير محسومة (صفحة غير مقروءة) | 6 |
| النسبة في الحالات المحسومة | 100 % |
والدعم ليس هزيلًا. فالعلامة الموصى بها الوسيطة ترد في ست من الصفحات الاثنتي عشرة المفحوصة، بمتوسط 5.9. وليست هذه مصادفة في المفردات، بل تقاربًا.
التسعة في المئة المعلّقة بصفحة واحدة
11 علامة من أصل 128 مدعومة بصفحة مستشهد بها واحدة فقط. وهو أكثر أرقام القياس قابلية للتطبيق، ويُقرأ في اتجاهين.
بوصفه رافعة: في تلك الحالات كفت صفحة واحدة لإدخال اسم إلى الإجابة. موقع مقارنة وطني، أو مقال في صحافة تقنية، أو تدوينة على منصة محلية - صفحة واحدة، وتصبح الشركة موجودة بالنسبة إلى المساعد. وهذا يجعل استراتيجية المصادر ملموسة بدل أن تكون تعويذة.
وبوصفه هشاشة: إن كانت تستشهد بك صفحة واحدة، فحضورك معلّق بها. تتغير مرتبة تلك الصفحة، أو تختفي، أو يكفّ عن قراءتها - فتختفي أنت من الإجابة دون أن يتغير لديك شيء.
ما تسمح هذه النتيجة بقوله، وما لا تسمح به
إنها تسمح بالقول إن قائمة المصادر رافعة حقيقية. فما دامت التوصيات محمولة فعلًا على ما قرأه المحرك، وما دامت تلك الصفحات - وذلك كان قياس اليوم السابق - وطنيةً وقليلةً وقابلةً للتحديد بحسب القطاع واللغة، فإن العمل على الظهور فيها يعالج السبب لا العَرَض.
ولا تسمح بالقول إن الظهور في صفحة يكفي لتكون موصى بك. لقد أظهرنا أن كل توصية تستند إلى مصدر؛ ولم نُظهر أن كل مصدر يُنتج توصية. فالصفحات المستشهد بها تذكر شركات أكثر بكثير مما يبقيه المحرك. الوجود هناك شرط، لا جواز مرور.
كل توصية تستند إلى صفحة قُرئت. وليست كل صفحة قُرئت تُنتج توصية. والخلط بينهما بيعٌ للأوهام.
عيب وُجد عندنا، لا عندهم
كشف القياس نفسه عن مشكلة في أداتنا نحن. فمستخرِج الأسماء لدينا أعاد 200 مدخلة؛ 66 منها، أي الثلث، لم تكن أسماء شركات - بل عناوين تصنيف ملتصقة بعلامات الاستشهاد، مثل `Best overall: HubSpot CRM[2][3][4][6]`، أو مطالع نصائح («بالنسبة إلى معظم الناس»).
لذلك استبعدنا هذه الـ66 قبل الحساب، ولهذا يتحدث المقال عن 128 علامة لا عن 200. وثمة تفصيل مهم: الحالات الخمس الوحيدة «غير المدعومة» في القياس الخام كانت كلها من هذا النوع من الأخطاء - ولم تكن أي منها توصية بلا أساس. والتصحيح في قائمة الانتظار. ونقول ذلك هنا لأن رقمًا يُخفى تنظيفه ليس رقمًا.
الحدود
محرك واحد فقط.
فـPerplexity هو الوحيد من الثلاثة الذي يعيد روابط قابلة للاستعمال. أما Gemini فيخفي روابطه خلف إعادة توجيه، وChatGPT عبر الواجهة البرمجية لا يبحث أصلًا. هذه النتيجة تصحّ على محرك يبحث، لا على «الذكاء الاصطناعي» عمومًا.
خمس لغات.
الإنجليزية والفرنسية والبرتغالية والإسبانية والألمانية - وهي التي جرى التحقق فيها من مستخرِج الأسماء لدينا. أما في اليابانية والكورية والبولندية والعربية فما زال يعيد عناوين أقسام؛ وقياس دقة الاستشهاد بمستخرِج يخطئ الاسم يُنتج ضجيجًا يُقدَّم بوصفه نتيجة.
يوم واحد
، والمساعدون ليسوا حتميين: فتشغيلان للمطالبة الإنجليزية نفسها لا يتقاطعان إلا بنسبة 62-76 %.
الوجود ليس سببية.
الاسم موجود في الصفحة المستشهد بها - وهذا لا يثبت أن هذه الصفحة هي التي حسمت. لقد ضيّقنا سؤال الأمس، ولم نُذِبه.
نحن لا نعد أحدًا بمكان في إجابات ChatGPT - ولا أحد يستطيع ذلك بنزاهة. وما يمكن قياسه هو أين أنت، بحسب اللغة وبحسب المحرك، وعلى أي صفحات يقوم هذا الموقع.