# حين يصير المقياس هدفاً: لماذا تتآكل اختبارات النماذج؟

> **الرابط:** https://aiseza.com/286/goodhart-benchmarks/
> **الكاتب:** مصبر زهير
> **النشر:** 2026-08-20
> **آخر تحديث:** 2026-08-20

## الإجابة المختصرة

الاختبارات المعيارية تتآكل لأن الدرجة تصير هدفاً بذاتها، فينتقل الجهد من تحسين القدرة إلى تحسين الدرجة. تبقى المقارنات المنشورة مفيدة كحدّ أدنى لا كتقدير: الفشل فيها دليل، أمّا النجاح فلا يثبت شيئاً عن حالتك. البديل العملي مجموعة اختبار خاصّة بفريقك من عملك الحقيقي.

كل مقياس يُكافأ عليه أحد، يتوقّف عن كونه مقياساً. هذه صياغة مختصرة لما يُعرف بقانون غودهارت، وهو ملاحظة صاغها الاقتصادي تشارلز غودهارت في سياق السياسة النقدية. وهي اليوم أدقّ وصف لما يحدث في تقييم نماذج اللغة.

## المشكلة ليست في الاختبار بل في وظيفته

الاختبار المعياري يؤدّي وظيفتين لا تجتمعان بسلام: يقيس قدرة، ويحدّد فائزاً. وما دام الفوز مرئياً ومكافأً، فإن الجهد ينتقل تدريجياً من تحسين القدرة إلى تحسين الدرجة. لا يحتاج هذا الانتقال إلى سوء نيّة؛ يكفي أن يكون الفريق عقلانياً وأن تكون الدرجة هي ما يُنشر.

ولهذا فإن سؤال «هل تسرّبت بيانات الاختبار إلى التدريب؟» — على أهميّته — سؤال ضيّق. التسرّب حالة صارخة من ظاهرة أوسع: أن يصير الاختبار جزءاً من بيئة التطوير بدل أن يبقى خارجها.

## ثلاث طرق يتآكل بها المقياس

1. **التسرّب المباشر.** أمثلة الاختبار نفسها، أو صياغات قريبة منها، تدخل بيانات التدريب. أوضح الحالات وأسهلها اكتشافاً.
2. **التكيّف عبر التكرار.** لا تسرّب، لكن الفريق يجرّب عشرات الإعدادات ويحتفظ بأفضلها على مجموعة الاختبار. لم تُنسخ الإجابات، ومع ذلك انتقلت معلومات عن المجموعة إلى النموذج النهائي عبر قرارات المطوّرين.
3. **انحراف التمثيل.** الاختبار يمثّل شريحة من الاستعمال الحقيقي، وبمرور الوقت تتحسّن النماذج على تلك الشريحة وحدها. الدرجة ترتفع والقدرة العملية تراوح مكانها.

الثالثة هي الأخطر لأنها لا تترك أثراً. لا ملفّ مسرَّب يُكتشَف ولا سجلّ تجارب يُراجَع — فقط فجوة تتّسع بصمت بين ما يقيسه الاختبار وما يحتاجه المستخدم.

> الدرجة المرتفعة على اختبار قديم تخبرك عن عمر الاختبار أكثر ممّا تخبرك عن قدرة النموذج.

## ماذا يعني هذا عملياً لمن يختار نموذجاً؟

المقارنات المنشورة ليست عديمة الفائدة، لكن فائدتها من نوع محدّد: هي حدّ أدنى لا تقدير. النموذج الذي يفشل في اختبار بسيط يفشل فعلاً؛ أمّا الذي ينجح فقد نجح في الاختبار ولم يُثبت بعد شيئاً عن حالتك.

وثلاثة أسئلة تُغني عن كثير من الجدل:

- متى نُشر هذا الاختبار؟ كلّما طال عمره، ضعفت دلالته.
- هل يشبه ما سأطلبه فعلاً؟ اختبار رياضيات لا يخبرك عن تلخيص عربي.
- هل جرّبته على عيّنة من عملي؟ عشرون مثالاً من بياناتك أصدق من أي جدول منشور.

## البديل ليس إلغاء القياس

من السهل أن ينتهي هذا النقاش إلى عدميّة: «كل الاختبارات مضلّلة فلنتجاهلها». وهذه نتيجة خاطئة بقدر خطأ التعامل مع الدرجة كحقيقة نهائية.

الصياغة الأنفع أن القياس يبقى صالحاً ما دام غير مكافَأ. الاختبار الذي تبنيه لنفسك، ولا تنشر نتائجه، ولا يُحاسَب عليه أحد — يظلّ يقيس. وفي اللحظة التي يصير فيها ورقة تسويق، يبدأ عدّاده التنازلي.

ولهذا فإن أنفع ما يملكه فريق يبني على نماذج اللغة ليس متابعة الجداول المنشورة، بل مجموعة اختبار صغيرة خاصّة به: أمثلة من عمله الحقيقي، بإجابات يعرف صحّتها، لا يراها أحد خارج الفريق.

## المصادر

- [Goodhart’s Law — صياغة القانون ونشأته](https://en.wikipedia.org/wiki/Goodhart%27s_law)
- [Overfitting to test sets — ورقة حول تكرار التقييم](https://arxiv.org/abs/1806.00451)
