تغيير مكان الإجابة الصحيحة غيّر الدقة بقوة في مراجعة ArabicMMLU هذي. Qwen3-0.6B جاب 0.680 لما الجواب تحت A، و0.020 لما صار تحت B. العينة الصغيرة تقيس حساسية الواجهة، وما ترتّب قدرات العربي عموماً.
هذي تجربة تشخيصية صغيرة على ArabicMMLU multiple-choice. أبغى أعرف إيش لازم أعرض جنب الدقة، خصوصاً مع نماذج decoder-only صغيرة تشتغل محلياً.
أوضح مثال عندي: Qwen3-0.6B سجل 0.680 لما كانت الإجابة الصحيحة تحت A، بس سجل 0.020 لما نفس الإعداد حط الإجابة الصحيحة تحت B. وهذا مو معناه إن ArabicMMLU خربان. بس يوضح ليش raw accuracy لوحده ما يكفي.
هذي ملاحظة قياس، مو ranking للنماذج. العينة صغيرة، والنماذج صغيرة ومحلية، وتشغيل 3B هنا scale-check فقط، مو scaling study كاملة.
الخلاصة الضيقة: في التشغيل هذاات، صيغة الـ prompt، parsing، تفضيل وسوم الخيارات، وموضع الإجابة الصحيحة ارتبطوا بتغيرات كبيرة في الدقة المقاسة. الانتقال من 0.6B/1B إلى 3B حسّن الوضع، بس ما شال حساسية موضع الخيار.
في multiple-choice، النموذج ما يحل السؤال فقط. لازم يتبع صيغة الجواب، يختار label، وبعدها parser يحاول يفهم إيش قال.
على الورق الشكل بسيط: سؤال، خيارات A/B/C/D، استخرج حرف، احسب accuracy. عملياً، واجهة القياس نفسها تدخل في النتيجة.
وهذا مو سبب نرمي multiple-choice benchmarks. هو سبب نعرض diagnostics بجانب raw accuracy.
pilot 1 استخدم 50 سؤال من ArabicMMLU، و6 صيغ prompt لكل سؤال: 300 prompt لكل نموذج. النماذج: Qwen3-0.6B، Llama-3.2-1B، وLlama-3.2-3B. وقست accuracy_all، accuracy_parseable، parse_failure_rate، semantic consistency، strict-output accuracy، strict-output parse failure، وتوزيع وسوم التنبؤ.
semantic consistency هنا يعني: كم سؤال بقيت إجاباته القابلة للتحليل راجعة لنفس الاختيار الأصلي عبر تغييرات الـ prompt أو تبديلات الخيارات.
| النموذج | acc all | acc parseable | parse fail | الثبات الدلالي | strict acc | strict parse fail |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 0.273 | 0.381 | 0.283 | 0.200 | 0.380 | 0.000 |
| Llama-3.2-1B | 0.303 | 0.313 | 0.030 | 0.080 | 0.300 | 0.000 |
| Llama-3.2-3B | 0.430 | 0.433 | 0.007 | 0.340 | 0.400 | 0.000 |
Qwen3-0.6B واجه parse failures كثيرة في الصيغ غير الصارمة. strict-output أزال المشكلة في كل النماذج. بس إصلاح parsing ما حل robustness بالكامل. Llama-3.2-3B حسّن الدقة، وقابلية التحليل، والثبات، وهذا يوحي إن الحجم يساعد هنا.
مع ذلك، semantic consistency بقي 0.340، يعني أغلب الأسئلة ما أخذت نفس الإجابة الدلالية عبر كل الصيغ.
في تشغيل Llama-3.2-3B لـ pilot 1، كان توزيع التنبؤات الكلي A/B/C/D/E/PF = 59/87/92/58/2/2. التوزيع لا ينهار إلى وسم واحد، بس يظل سياقاً مهماً لتفسير الدقة.
pilot 2 استخدم 50 سؤال، و4 تبديلات لكل سؤال: 200 prompt لكل نموذج. التعليمات كانت صارمة فقط:
Answer with exactly one character: A, B, C, or D. Do not explain.
كل سؤال تبدل بحيث الإجابة الصحيحة تظهر مرة تحت A، مرة تحت B، مرة تحت C، ومرة تحت D. السؤال ونصوص الخيارات نفسها محفوظة. اللي يتغير هو label/order فقط. هذا يعزل أثر option-label وموضع الإجابة بعد ما ضبطنا parsing.
label-bias score = أكبر نسبة label تنبأ بها النموذج ناقص 0.25. الرقم 0.25 هو التوزيع المنتظم على A/B/C/D.
| النموذج | acc all | parse fail | label-bias | الثبات الدلالي | مدى الموضع |
|---|---|---|---|---|---|
| Qwen3-0.6B | 0.275 | 0.000 | 0.380 | 0.120 | 0.660 |
| Llama-3.2-1B | 0.300 | 0.000 | 0.120 | 0.160 | 0.220 |
| Llama-3.2-3B | 0.410 | 0.000 | 0.145 | 0.260 | 0.320 |
| النموذج | correct=A | correct=B | correct=C | correct=D |
|---|---|---|---|---|
| Qwen3-0.6B | 0.680 | 0.020 | 0.060 | 0.340 |
| Llama-3.2-1B | 0.200 | 0.380 | 0.200 | 0.420 |
| Llama-3.2-3B | 0.300 | 0.460 | 0.600 | 0.280 |
| النموذج | A | B | C | D | PF | other |
|---|---|---|---|---|---|---|
| Qwen3-0.6B | 126 | 4 | 9 | 61 | 0 | 0 |
| Llama-3.2-1B | 29 | 57 | 40 | 74 | 0 | 0 |
| Llama-3.2-3B | 25 | 62 | 79 | 34 | 0 | 0 |
strict-output شال parse failures في كل النماذج. ممتاز، بس خلى المشكلة الثانية أوضح. Qwen3-0.6B كان عنده تفضيل قوي لـ A: 126 من 200 تنبؤ كانت A. وaccuracy تغيرت بقوة حسب الموضع: 0.680 لما الصحيح تحت A مقابل 0.020 لما الصحيح تحت B.
Llama-3.2-1B أقل حدة، بس مو ثابت. Llama-3.2-3B حسّن الدقة وsemantic consistency، بس بقي عنده label bias ومدى 0.320 في accuracy حسب موضع الإجابة. في هذا الـ pilot، الحجم يساعد، بس raw accuracy ما زال يحتاج سياق.
Llama-3.2-3B حسّن أكثر من جانب. في pilot 1، كانت accuracy أعلى، وparse failures أقل، وsemantic consistency أفضل من النماذج الأصغر. في pilot 2، كانت accuracy والثبات الدلالي أفضل من Llama-3.2-1B.
بس هذا مو scaling study. هو حجم واحد أكبر تحت نفس إعداد القياس. ما يثبت كيف تتصرف النماذج الأكبر عموماً، ولا يغني عن تقييم نماذج عربية أقوى. وهذا نخليه لشغل لاحق.
القراءة العملية هنا حذرة: scaling حسّن robustness هنا، بس option-position sensitivity بقيت واضحة حتى بعد ما strict formatting أزال parse failures.
هذي الملاحظة تقول، بشكل محدود:
وما تقول:
رقم benchmark يصير أصدق لما يجي معه تشخيص كافي لواجهة القياس.
لما أقيّم نماذج decoder-only صغيرة أو محلية، ما أبغى أعرض دقة ArabicMMLU الخام وحدها. التقرير الأفضل يشمل:
الـ prompts، والمخرجات، وملفات التقييم، والملخصات موجودة
في مستودع Ember العام تحت
artifacts/benchmark-audit/arabicmmlu/.
التشغيل الفعلي صار في مجلد اختبار محلي خاص، ونسخة المستودع هي
artifact bundle منشورة لفحص الأرقام والجداول في هذي الملاحظة.
الخلاصة مو إن نموذج أفضل من الثاني. ranking مو هدف هذي الملاحظة. الفكرة إن raw accuracy ممكن يخلط بين task competence وسلوك واجهة الاختبار.
التقييم العربي ما يكفي يسأل: هل النموذج جاب الإجابة الصحيحة؟ لازم يسأل بعد: هل نفس الإجابة تصمد بعد تغييرات شكلية في صيغة الـ prompt، وlabels، وترتيب الخيارات، وتطبيع النص العربي؟