← voidwest    research notes

ليش دقة ArabicMMLU تعتمد على موضع الإجابة؟

ملاحظة قياس صغيرة عن ArabicMMLU multiple-choice
محمد الثبيتي · 2026-07-04
Arabic NLP evaluation robustness ArabicMMLU Qwen LLaMA

Arabic benchmarks مهمة. تعطينا طريقة نقارن الأنظمة ونسأل إذا النماذج تتعامل مع العربي خارج التقييم الإنجليزي المعتاد. لكن رقم accuracy واحد ممكن يخبي مشاكل في واجهة القياس نفسها.

هذه ملاحظة قياس صغيرة على ArabicMMLU multiple-choice. السؤال مو: هل ArabicMMLU سيئ؟ السؤال: وش لازم نعرض مع رقم الدقة، خصوصاً لما نقيم نماذج decoder-only صغيرة ومحلية؟

أوضح مثال: Qwen3-0.6B سجل 0.680 لما كانت الإجابة الصحيحة تحت A، لكنه سجل 0.020 لما نفس الإعداد حط الإجابة الصحيحة تحت B. هذا ما يبطل ArabicMMLU. بس يوضح ليش raw accuracy لوحده ما يكفي.

status

هذه ملاحظة قياس، مو ranking للنماذج. العينة صغيرة، والنماذج صغيرة ومحلية، وتشغيل 3B هنا scale-check فقط، مو scaling study كاملة.

النتيجة الضيقة: في هالتشغيلات، صيغة الـ prompt، parsing، تفضيل وسوم الخيارات، وموضع الإجابة الصحيحة ارتبطوا بتغيرات كبيرة في الدقة المقاسة. الانتقال من 0.6B/1B إلى 3B حسّن الوضع، لكنه ما شال حساسية موضع الخيار.

في multiple-choice، النموذج ما يحل السؤال فقط. لازم يتبع صيغة الجواب، يختار label، وبعدها parser يحاول يفهم وش قال.

why multiple-choice evaluation can be fragile

الشكل بسيط: سؤال، خيارات A/B/C/D، استخرج حرف، احسب accuracy. عملياً، واجهة القياس نفسها تدخل في النتيجة.

هذا مو سبب نرمي multiple-choice benchmarks. هو سبب نعرض diagnostics بجانب raw accuracy.

pilot 1: prompt-format sensitivity

pilot 1 استخدم 50 سؤال من ArabicMMLU، و6 صيغ prompt لكل سؤال: 300 prompt لكل نموذج. النماذج: Qwen3-0.6B، Llama-3.2-1B، وLlama-3.2-3B. المقاييس كانت accuracy_all، accuracy_parseable، parse_failure_rate، semantic consistency، strict-output accuracy، strict-output parse failure، وتوزيع وسوم التنبؤ.

semantic consistency هنا يعني: كم سؤال بقيت إجاباته القابلة للتحليل راجعة لنفس الاختيار الأصلي عبر تغييرات الـ prompt أو تبديلات الخيارات.

النموذج acc all acc parseable parse fail الثبات الدلالي strict acc strict parse fail
Qwen3-0.6B0.2730.3810.2830.2000.3800.000
Llama-3.2-1B0.3030.3130.0300.0800.3000.000
Llama-3.2-3B0.4300.4330.0070.3400.4000.000

Qwen3-0.6B كان عنده parse failures كثيرة في الصيغ غير الصارمة. strict-output شال المشكلة في كل النماذج. لكن إصلاح parsing ما حل robustness بالكامل. Llama-3.2-3B حسّن الدقة، وقابلية التحليل، والثبات، وهذا يوحي إن الحجم يساعد هنا. مع ذلك، semantic consistency بقي 0.340، يعني أغلب الأسئلة ما أخذت نفس الإجابة الدلالية عبر كل الصيغ.

في تشغيل Llama-3.2-3B لـ pilot 1، كان توزيع التنبؤات الكلي A/B/C/D/E/PF = 59/87/92/58/2/2. التوزيع لا ينهار إلى وسم واحد، لكنه يظل سياقاً مهماً لتفسير الدقة.

pilot 2: label and position bias

pilot 2 استخدم 50 سؤال، و4 تبديلات لكل سؤال: 200 prompt لكل نموذج. التعليمات كانت صارمة فقط:

Answer with exactly one character: A, B, C, or D. Do not explain.

كل سؤال تبدل بحيث الإجابة الصحيحة تظهر مرة تحت A، مرة تحت B، مرة تحت C، ومرة تحت D. السؤال ونصوص الخيارات نفسها محفوظة. اللي يتغير هو label/order فقط. هذا يعزل أثر option-label وموضع الإجابة بعد ما ضبطنا parsing.

label-bias score = أكبر نسبة label تنبأ بها النموذج ناقص 0.25. الرقم 0.25 هو التوزيع المنتظم على A/B/C/D.

النموذج acc all parse fail label-bias الثبات الدلالي مدى الموضع
Qwen3-0.6B0.2750.0000.3800.1200.660
Llama-3.2-1B0.3000.0000.1200.1600.220
Llama-3.2-3B0.4100.0000.1450.2600.320

accuracy by correct-answer position

النموذج correct=A correct=B correct=C correct=D
Qwen3-0.6B0.6800.0200.0600.340
Llama-3.2-1B0.2000.3800.2000.420
Llama-3.2-3B0.3000.4600.6000.280

prediction distribution

النموذج A B C D PF other
Qwen3-0.6B126496100
Llama-3.2-1B2957407400
Llama-3.2-3B2562793400

strict-output شال parse failures في كل النماذج. ممتاز، لكنه خلى المشكلة الثانية أوضح. Qwen3-0.6B كان عنده تفضيل قوي لـ A: 126 من 200 تنبؤ كانت A. وaccuracy تغيرت بقوة حسب الموضع: 0.680 لما الصحيح تحت A مقابل 0.020 لما الصحيح تحت B.

Llama-3.2-1B أقل حدة، لكنه مو ثابت. Llama-3.2-3B حسّن الدقة وsemantic consistency، لكن بقي عنده label bias ومدى 0.320 في accuracy حسب موضع الإجابة. في هذا الـ pilot، الحجم يساعد، بس raw accuracy ما زال يحتاج سياق.

what changed with Llama-3.2-3B?

Llama-3.2-3B حسّن أكثر من شيء. في pilot 1، كانت accuracy أعلى، وparse failures أقل، وsemantic consistency أفضل من النماذج الأصغر. في pilot 2، كانت accuracy والثبات الدلالي أفضل من Llama-3.2-1B.

لكن هذا مو scaling study. هو حجم واحد أكبر تحت نفس إعداد القياس. ما يثبت كيف تتصرف النماذج الأكبر عموماً، ولا يغني عن تقييم نماذج عربية أقوى. هذا عمل لاحق.

القراءة العملية حذرة: scaling حسّن robustness هنا، لكن option-position sensitivity بقيت واضحة حتى بعد ما strict formatting أزال parse failures.

what this does and does not show

هذه الملاحظة تقول، بشكل محدود:

ولا تقول:

رقم benchmark يصير أصدق لما يجي معه تشخيص كافي لواجهة القياس.

proposed reporting checklist

لما أقيم نماذج decoder-only صغيرة أو محلية، ما أبغى أعرض دقة ArabicMMLU الخام وحدها. التقرير الأفضل يشمل:

artifacts

الـ prompts، والمخرجات، وملفات التقييم، والملخصات موجودة في مستودع Ember العام تحت artifacts/benchmark-audit/arabicmmlu/. التشغيل الفعلي صار في مجلد اختبار محلي خاص، ونسخة المستودع هي artifact bundle منشورة لفحص الأرقام والجداول في هذه الملاحظة.

closing

الخلاصة مو إن نموذج أفضل من الثاني. ranking مو هدف هذه الملاحظة. الهدف إن raw accuracy ممكن يخلط بين task competence وسلوك واجهة الاختبار.

التقييم العربي ما يكفي يسأل: هل النموذج جاب الإجابة الصحيحة؟ لازم يسأل أيضاً: هل نفس الإجابة تصمد بعد تغييرات شكلية في صيغة الـ prompt، وlabels، وترتيب الخيارات، وتطبيع النص العربي؟