Arabic benchmarks مهمة. تعطينا طريقة نقارن الأنظمة ونسأل إذا النماذج تتعامل مع العربي خارج التقييم الإنجليزي المعتاد. لكن رقم accuracy واحد ممكن يخبي مشاكل في واجهة القياس نفسها.
هذه ملاحظة قياس صغيرة على ArabicMMLU multiple-choice. السؤال مو: هل ArabicMMLU سيئ؟ السؤال: وش لازم نعرض مع رقم الدقة، خصوصاً لما نقيم نماذج decoder-only صغيرة ومحلية؟
أوضح مثال: Qwen3-0.6B سجل 0.680 لما كانت الإجابة الصحيحة تحت A، لكنه سجل 0.020 لما نفس الإعداد حط الإجابة الصحيحة تحت B. هذا ما يبطل ArabicMMLU. بس يوضح ليش raw accuracy لوحده ما يكفي.
هذه ملاحظة قياس، مو ranking للنماذج. العينة صغيرة، والنماذج صغيرة ومحلية، وتشغيل 3B هنا scale-check فقط، مو scaling study كاملة.
النتيجة الضيقة: في هالتشغيلات، صيغة الـ prompt، parsing، تفضيل وسوم الخيارات، وموضع الإجابة الصحيحة ارتبطوا بتغيرات كبيرة في الدقة المقاسة. الانتقال من 0.6B/1B إلى 3B حسّن الوضع، لكنه ما شال حساسية موضع الخيار.
في multiple-choice، النموذج ما يحل السؤال فقط. لازم يتبع صيغة الجواب، يختار label، وبعدها parser يحاول يفهم وش قال.
الشكل بسيط: سؤال، خيارات A/B/C/D، استخرج حرف، احسب accuracy. عملياً، واجهة القياس نفسها تدخل في النتيجة.
هذا مو سبب نرمي multiple-choice benchmarks. هو سبب نعرض diagnostics بجانب raw accuracy.
pilot 1 استخدم 50 سؤال من ArabicMMLU، و6 صيغ prompt لكل سؤال: 300 prompt لكل نموذج. النماذج: Qwen3-0.6B، Llama-3.2-1B، وLlama-3.2-3B. المقاييس كانت accuracy_all، accuracy_parseable، parse_failure_rate، semantic consistency، strict-output accuracy، strict-output parse failure، وتوزيع وسوم التنبؤ.
semantic consistency هنا يعني: كم سؤال بقيت إجاباته القابلة للتحليل راجعة لنفس الاختيار الأصلي عبر تغييرات الـ prompt أو تبديلات الخيارات.
| النموذج | acc all | acc parseable | parse fail | الثبات الدلالي | strict acc | strict parse fail |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.273 | 0.381 | 0.283 | 0.200 | 0.380 | 0.000 |
| Llama-3.2-1B | 0.303 | 0.313 | 0.030 | 0.080 | 0.300 | 0.000 |
| Llama-3.2-3B | 0.430 | 0.433 | 0.007 | 0.340 | 0.400 | 0.000 |
Qwen3-0.6B كان عنده parse failures كثيرة في الصيغ غير الصارمة. strict-output شال المشكلة في كل النماذج. لكن إصلاح parsing ما حل robustness بالكامل. Llama-3.2-3B حسّن الدقة، وقابلية التحليل، والثبات، وهذا يوحي إن الحجم يساعد هنا. مع ذلك، semantic consistency بقي 0.340، يعني أغلب الأسئلة ما أخذت نفس الإجابة الدلالية عبر كل الصيغ.
في تشغيل Llama-3.2-3B لـ pilot 1، كان توزيع التنبؤات الكلي A/B/C/D/E/PF = 59/87/92/58/2/2. التوزيع لا ينهار إلى وسم واحد، لكنه يظل سياقاً مهماً لتفسير الدقة.
pilot 2 استخدم 50 سؤال، و4 تبديلات لكل سؤال: 200 prompt لكل نموذج. التعليمات كانت صارمة فقط:
Answer with exactly one character: A, B, C, or D. Do not explain.
كل سؤال تبدل بحيث الإجابة الصحيحة تظهر مرة تحت A، مرة تحت B، مرة تحت C، ومرة تحت D. السؤال ونصوص الخيارات نفسها محفوظة. اللي يتغير هو label/order فقط. هذا يعزل أثر option-label وموضع الإجابة بعد ما ضبطنا parsing.
label-bias score = أكبر نسبة label تنبأ بها النموذج ناقص 0.25. الرقم 0.25 هو التوزيع المنتظم على A/B/C/D.
| النموذج | acc all | parse fail | label-bias | الثبات الدلالي | مدى الموضع |
|---|---|---|---|---|---|
| Qwen3-0.6B | 0.275 | 0.000 | 0.380 | 0.120 | 0.660 |
| Llama-3.2-1B | 0.300 | 0.000 | 0.120 | 0.160 | 0.220 |
| Llama-3.2-3B | 0.410 | 0.000 | 0.145 | 0.260 | 0.320 |
| النموذج | correct=A | correct=B | correct=C | correct=D |
|---|---|---|---|---|
| Qwen3-0.6B | 0.680 | 0.020 | 0.060 | 0.340 |
| Llama-3.2-1B | 0.200 | 0.380 | 0.200 | 0.420 |
| Llama-3.2-3B | 0.300 | 0.460 | 0.600 | 0.280 |
| النموذج | A | B | C | D | PF | other |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 126 | 4 | 9 | 61 | 0 | 0 |
| Llama-3.2-1B | 29 | 57 | 40 | 74 | 0 | 0 |
| Llama-3.2-3B | 25 | 62 | 79 | 34 | 0 | 0 |
strict-output شال parse failures في كل النماذج. ممتاز، لكنه خلى المشكلة الثانية أوضح. Qwen3-0.6B كان عنده تفضيل قوي لـ A: 126 من 200 تنبؤ كانت A. وaccuracy تغيرت بقوة حسب الموضع: 0.680 لما الصحيح تحت A مقابل 0.020 لما الصحيح تحت B.
Llama-3.2-1B أقل حدة، لكنه مو ثابت. Llama-3.2-3B حسّن الدقة وsemantic consistency، لكن بقي عنده label bias ومدى 0.320 في accuracy حسب موضع الإجابة. في هذا الـ pilot، الحجم يساعد، بس raw accuracy ما زال يحتاج سياق.
Llama-3.2-3B حسّن أكثر من شيء. في pilot 1، كانت accuracy أعلى، وparse failures أقل، وsemantic consistency أفضل من النماذج الأصغر. في pilot 2، كانت accuracy والثبات الدلالي أفضل من Llama-3.2-1B.
لكن هذا مو scaling study. هو حجم واحد أكبر تحت نفس إعداد القياس. ما يثبت كيف تتصرف النماذج الأكبر عموماً، ولا يغني عن تقييم نماذج عربية أقوى. هذا عمل لاحق.
القراءة العملية حذرة: scaling حسّن robustness هنا، لكن option-position sensitivity بقيت واضحة حتى بعد ما strict formatting أزال parse failures.
هذه الملاحظة تقول، بشكل محدود:
ولا تقول:
رقم benchmark يصير أصدق لما يجي معه تشخيص كافي لواجهة القياس.
لما أقيم نماذج decoder-only صغيرة أو محلية، ما أبغى أعرض دقة ArabicMMLU الخام وحدها. التقرير الأفضل يشمل:
الـ prompts، والمخرجات، وملفات التقييم، والملخصات موجودة
في مستودع Ember العام تحت
artifacts/benchmark-audit/arabicmmlu/.
التشغيل الفعلي صار في مجلد اختبار محلي خاص، ونسخة المستودع هي
artifact bundle منشورة لفحص الأرقام والجداول في هذه الملاحظة.
الخلاصة مو إن نموذج أفضل من الثاني. ranking مو هدف هذه الملاحظة. الهدف إن raw accuracy ممكن يخلط بين task competence وسلوك واجهة الاختبار.
التقييم العربي ما يكفي يسأل: هل النموذج جاب الإجابة الصحيحة؟ لازم يسأل أيضاً: هل نفس الإجابة تصمد بعد تغييرات شكلية في صيغة الـ prompt، وlabels، وترتيب الخيارات، وتطبيع النص العربي؟