# تقييم النماذج: كيف تقيس بدل أن تخمّن

> **الرابط:** https://aiseza.com/81/%d8%aa%d9%82%d9%8a%d9%8a%d9%85-%d8%a7%d9%84%d9%86%d9%85%d8%a7%d8%b0%d8%ac-%d9%83%d9%8a%d9%81-%d8%aa%d9%82%d9%8a%d8%b3-%d8%a8%d8%af%d9%84-%d8%a3%d9%86-%d8%aa%d8%ae%d9%85%d9%91%d9%86/
> **الكاتب:** مصبر زهير
> **النشر:** 2026-08-06
> **آخر تحديث:** 2026-08-20

مجموعة اختبارات صغيرة تكشف الفرق بين نموذجين أكثر من أي معيار عام.

المشكلة مع المعايير العامّة ليست أنها خاطئة، بل أنها تقيس شيئاً آخر. النموذج المتفوّق في اختبار معرفة عامّة قد يكون الأسوأ في تلخيص تذاكر دعمك، ولا تناقض في ذلك — المهمّتان مختلفتان.

## ابدأ من الفشل لا من النجاح

أفضل مصدر لمجموعة اختبارك هو سجلّ ما فشل فعلاً. اجمع الحالات التي اشتكى منها المستخدمون أو التي اضطررت لتصحيحها يدوياً. هذه هي حدودك الحقيقية.

عشرون حالة فشل حقيقية أنفع من مئتي حالة مصطنعة. المصطنع يقيس ما تتخيّله صعباً؛ والحقيقي يقيس ما هو صعب فعلاً.

![مجموعة الاختبار تُبنى من سجلّ الفشل لا من الخيال](https://aiseza.com/wp-content/uploads/2026/08/taqyim-annamadhij-1.webp)

*مجموعة الاختبار تُبنى من سجلّ الفشل لا من الخيال*

## اكتب المعيار قبل أن تُشغّل

لكل حالة، اكتب ما تعتبره إجابة مقبولة وما تعتبره مرفوضة — قبل أن ترى مخرجات أي نموذج. هذه النقطة حاسمة: الحكم بعد رؤية المخرجات ينحاز دائماً.

- حدّد شرطاً واحداً حاسماً لكل حالة، لا قائمة انطباعات
- ميّز بين خطأ فادح وخطأ مقبول — ليست كل الأخطاء متساوية
- اكتب حالة واحدة على الأقلّ لا جواب لها، لاختبار الاعتراف بالجهل
- احتفظ بالمعيار في ملفّ مع الحالة نفسها، لا في رأسك

## ثلاث طبقات من القياس

الطبقة الأولى آلية بالكامل: تطابق نصّي، وجود حقل، صحّة صيغة JSON. رخيصة وسريعة وتلتقط الأعطال الصريحة.

الطبقة الثانية نموذج يحكم على نموذج، بمعيار مكتوب صراحةً. مفيدة للحجم، لكنها ترث تحيّزات الحاكم — فلا تستعملها وحدها لقرار مهمّ.

الطبقة الثالثة بشرية، على عيّنة صغيرة، دورياً. هذه هي المرجع الذي تعاير عليه الطبقتين الأخريين. بدونها لا تعرف إن كان حاكمك الآلي يقيس ما تظنّ.

## ما يجب أن يبقى ثابتاً

عند المقارنة، غيّر متغيّراً واحداً فقط. نفس الأمر، نفس درجة العشوائية، نفس ترتيب الحالات. أي تغيير مصاحب يجعل الفرق غير قابل للنسب إلى سببه.

وشغّل كل حالة أكثر من مرّة. النموذج غير حتمي بطبيعته، والفرق الذي يختفي في التشغيل الثاني لم يكن فرقاً.

![تغيير متغيّر واحد فقط هو ما يجعل الفرق قابلاً للتفسير](https://aiseza.com/wp-content/uploads/2026/08/taqyim-annamadhij-2.webp)

*تغيير متغيّر واحد فقط هو ما يجعل الفرق قابلاً للتفسير*

## كيف تقرأ النتيجة

لا تنظر إلى المتوسّط وحده. انظر إلى توزيع الفشل: هل يخفق النموذج قليلاً في كل شيء، أم يخفق إخفاقاً تامّاً في فئة واحدة؟ الحالتان تعطيان نفس المتوسّط وتتطلّبان علاجين مختلفين تماماً.

```
النموذج أ: 82% — إخفاق موزّع على كل الفئات
النموذج ب: 82% — إخفاق شبه كامل في فئة «الأرقام والتواريخ»

نفس الرقم. الثاني قابل للإصلاح بخطوة واحدة، والأول لا.
```

## اجعله جزءاً من العمل لا حدثاً

مجموعة الاختبار التي تُشغَّل مرّة عند الاختيار تتقادم فوراً. اربطها بخطّ التكامل لديك: كل تغيير في الأمر أو النموذج أو الإعدادات يشغّلها ويعرض الفرق.

وأضف إليها كل حالة فشل جديدة فور ظهورها. المجموعة التي تنمو من الاستعمال تصير خلال أشهر أفضل ما تملك.

> القياس الذي لا يتكرّر آلياً ليس قياساً، بل انطباعاً موثّقاً مرّة.

## الأخطاء الشائعة في القياس

- قياس على حالات صنعها من كتب الأمر — تحيّز مضمون
- مجموعة صغيرة جداً فيُقرأ الضجيج تقدّماً
- تغيير الأمر والنموذج معاً فلا يُنسب الفرق
- حكم بشري بعد رؤية اسم النموذج — القياس الأعمى ليس ترفاً
- حذف الحالات الصعبة لأنها «غير عادلة» — هي وحدها ما يميّز

الخطأ الأخير هو الأخطر لأنه يبدو معقولاً. الحالات التي تخفق فيها كل النماذج تبدو عديمة الفائدة، لكنها بالضبط ما سيميّز الجيل القادم — واحتفاظك بها يجعل مجموعتك تكبر في القيمة مع الزمن.

![الحالات التي تخفق فيها كل النماذج هي أثمن ما في مجموعتك](https://aiseza.com/wp-content/uploads/2026/08/taqyim-annamadhij-3.webp)

*الحالات التي تخفق فيها كل النماذج هي أثمن ما في مجموعتك*

راجع مجموعتك بحثاً عن هذه الأخطاء الخمسة قبل أن تراجع نتائجك. مجموعة معيبة تعطي أرقاماً واثقة وخاطئة.

ابدأ بعشرين حالة اليوم. المجموعة الناقصة التي تعمل تتفوّق على المجموعة الكاملة التي تنتظر وقتاً لن يأتي.
