← voidwest    research notes

من Jais 1 إلى Jais 2: وش تغيّر في اختبار الصرف العربي؟

مقارنة بين تشغيلين مجمّدين لتمثيلات الصرف العربي
محمد الثبيتي · 2026-08-30
Arabic NLP morphology probing evaluation reproducibility Jais

Jais 2 مو نسخة أفضل من Jais 1 في كل شيء في هذا الاختبار. هو أحسن بوضوح في العدد، وقريب منه في الجنس وPOS مع الواجهة الأساسية اللي فيها كل البيانات، لكن نتيجته تتغيّر أكثر لما نشيل البيانات المعجمية الصريحة. عشان كذا المقارنة المفيدة مو رقم واحد في leaderboard؛ المهم هو النمط عبر المهام والتقسيمات المعجمية وواجهات التمثيل.

التشغيلين يستخدمون نفس مجموعة الاختبار، فيها 4,701 مثال من العربية الفصحى الحديثة، مشتقة من Universal Dependencies Arabic-PADT ومعالجة بـCAMeL Tools. الاثنين استخدموا التقاط الحالات المخفية بـBF16، ونفس واجهات الميزات الأربع، وثلاث مهام، وتقسيمات random وlemma-heldout وroot-heldout، وخمس outer folds، ونفس الاختبار الخطي الثابت:

StandardScaler + RidgeClassifier(alpha=1.0)

هذولا تشغيلين مجمّدين بشكل منفصل، مو تدخّل مضبوط على نفس الـcheckpoint. مراجعة النموذج وبنيته والـtokenizer وعدد المعاملات وحالة التدريب base مقابل chat كلها تغيّرت مع بعض. الفروق أدناه تصف إعدادَي النموذج اللذين قارنّاهما؛ ما تقدر تعزل أثر “Jais 2” بشكل سببي.

النموذجين اللي قارنّاهم

النموذج | دور الـcheckpoint | المعاملات | حجم الحالة | الطبقات | السياق
Jais-13B base 13B 5,120 40 2,048
JAIS-2-8B-Chat chat 8B 3,328 32 8,192

تشغيل Jais-13B هنا يستخدم inceptionai/Jais-13B، وبادئة مراجعته 0d5eb87f؛ وتشغيل JAIS-2-8B-Chat يستخدم inception42/Jais-2-8B-Chat، وبادئة مراجعته da0e1639. الاثنين طُلبوا وانحفظوا بـBF16. وحتى إصدارات الـtokenizer مختلفة: Jais 1 عنده 5,149 توكن في target span عبر الأمثلة، وJais 2 عنده 5,118. نجحت محاذاة كل مثال في التشغيلين. وعشان كذا ما يصح نقارن أرقام الطبقات المطلقة كأن عمق الشبكتين واحد.

النتيجة الكبيرة تختلف حسب المهمة

الجدول يقارن الواجهة الأساسية full_prompt_final، ويحسب لكل مهمة المتوسط عبر تقسيمي lemma-heldout وroot-heldout. كل قيمة أصلية لكل تقسيم هي متوسط عبر خمس outer folds، والفرق هو Jais 2 ناقص Jais 1. أضفنا الدقة لأن مهمة العدد غير متوازنة بين الفئات، وقد تخفي الدقة تغيراً في استرجاع الفئات الأقل تمثيلاً.

المهمة | دقة Jais 1 | دقة Jais 2 | Δ الدقة | macro-F1 Jais 1 | macro-F1 Jais 2 | Δ macro-F1
الجنس0.93150.9289−0.00250.92590.9251−0.0008
العدد0.93620.9773+0.04120.71770.9245+0.2068
POS0.88180.8543−0.02760.86120.8358−0.0254
مقارنة macro-F1 في الاختبار المجمّع بين Jais 1 وJais 2 لمهام الجنس والعدد وPOS مع prompt الكامل مقارنة macro-F1 في الاختبار المجمّع بين Jais 1 وJais 2 لمهام الجنس والعدد وPOS مع prompt الكامل
macro-F1 في الاختبار المجمّع مع واجهة full_prompt_final، بعد المتوسط عبر lemma-heldout وroot-heldout. الفرق البصري الأكبر يطلع في العدد؛ كل شريط هو متوسط غير موزون عبر التقسيمين المجمّعين.

العدد هو الفرق الواضح. macro-F1 للعدد عند Jais 1 في التقسيمين المجمّعين منخفض رغم دقة 0.9362، وهذا غالباً يعني إن فئة الأغلبية تسوي جزء كبير من الشغل. Jais 2 رفع المقياسين، وزيادته في macro-F1 أكبر بكثير من زيادته في الدقة. الجنس تقريباً ما تغيّر في هذا المتوسط، بينما POS انخفض بشكل طفيف. لكن الخلاصة هذي تخفي أثر واجهة التمثيل.

الـmetadata يغيّر المقارنة

full_prompt_final يأخذ الحالة النهائية من prompt فيه السطح والهدف واللّمة والجذر والنمط الصرفي. الحقول اللي بعد الهدف تكون متاحة عند هالنهاية. أما metadata_free_prompt_final فيشيل الحقول المعجمية الصريحة، لكنه يظل تمثيلاً لنهاية الـprompt. والجدول اللي تحت يستخدم التقسيمين المجمّعين بس:

المهمة | كل البيانات: Jais 1 → Jais 2 | الفرق | بدون metadata: Jais 1 → Jais 2 | الفرق
الجنس0.9259 → 0.9251−0.00080.9349 → 0.8580−0.0768
العدد0.7177 → 0.9245+0.20680.8023 → 0.8647+0.0624
POS0.8612 → 0.8358−0.02540.8816 → 0.8408−0.0408

اللافت إن مكسب Jais 2 في العدد يبقى حتى بدون الـmetadata، لكنه يصير أصغر. الجنس يخسر تقريباً 0.077 في macro-F1 في الواجهة اللي بدون metadata صريحة، مع إنه ما تغيّر مع الـprompt الكامل. عشان كذا عبارة “Jais 2 أفضل في الصرف” واسعة زيادة: النتيجة تعتمد على المعلومات الموجودة عند نقطة استخراج الحالة.

مكان قراءة التمثيل يفرق برضه

واجهات الهدف المحلية عندنا تقرأ يا حالة آخر توكن متداخل مع الهدف، يا متوسط كل حالات التوكنات المتداخلة مع الهدف. وبعد ما أخذنا المتوسط عبر المهام والتقسيمين المجمّعين، مقارنة macro-F1 تطلع كذا:

الواجهة | Jais 1 | Jais 2 | Δ
full prompt-final0.83490.8951+0.0602
metadata-free prompt-final0.87290.8545−0.0184
target-final subtoken0.83870.9006+0.0619
target-mean span0.84210.8876+0.0455

Jais 2 أقوى هنا على واجهة target-final، بفارق بسيط عن full prompt-final. أفضل متوسط لـJais 1 في هذا الجدول هو metadata-free prompt-final. هذا مو دليل إن طريقة تجميع وحدة صحيحة دائماً؛ يوضح بس إن اللي نقيسه يشمل مكان قراءة الحالة، ومحتوى البادئة السببية، وطريقة تجميع الـspan متعدد التوكنات.

التقسيم المجمّع يسأل عن الانتقال، مو التداخل العشوائي

في واجهة البيانات الكاملة، هذي متوسطات macro-F1 عبر المهام الثلاث في التقسيم العشوائي وتقسيمي اللمات والجذور المحجوزة:

النموذج | random | lemma-heldout | root-heldout | random − lemma | random − root
Jais-13B0.90620.84570.8242+0.0605+0.0819
JAIS-2-8B-Chat0.96500.89970.8906+0.0653+0.0744

النموذجين يخسرون أداءً لما نخلي مجموعات اللمات أو الجذور المألوفة خارج التدريب. نتيجة العدد عند Jais 2 رفعت درجاته المجمّعة كثيراً، لكن الفجوة المعجمية ما اختفت. التقسيم العشوائي يظل مرجع متفائل للتداخل، مو مقياس للانتقال إلى مجموعات معجمية ما شافها التدريب.

الضوابط ونطاق النتيجة

في كل تشغيل اخترنا الطبقة باستخدام بيانات development بس، وبعدها أعدنا الملاءمة على train + development وقسنا test مرة واحدة في كل outer fold. نجحت محاذاة كل الأمثلة الـ4,701 للنموذجين. أرشيف Jais 2 فيه 180 خلية لتسميات ملخبطة؛ ولا خلية تعدّت خط أساس الأغلبية المحسوب من التدريب بس. أرشيف Jais 1 الأكبر فيه 360 خلية ملخبطة لنموذجيه الأساسيين المحددين (Qwen3-0.6B وLlama-3.2-1B)، مو لـJais-13B نفسه. هذي الضوابط تفحص الـpipeline بس؛ مو اختبار سببي لسلوك النموذج.

هذي النتيجة دقيقة لكنها ضيقة: تحت هذا الـprompt والتقسيم المعجمي وقاعدة المحاذاة وواجهة الهدف وطريقة التجميع والطبقة المختارة والمقدّر الخطي، أصبحت سمة العدد أكثر قابلية للاسترجاع خطياً عند Jais 2 من Jais 1 في هذه الالتقاطات المجمّدة. هذا ما يثبت توليداً عربياً أفضل، ولا كفاءة عامة في العربية، ولا أن أي نموذج يستخدم الميزة المسترجعة أثناء التوليد.

المصادر المجمّدة

المقارنة محسوبة من ملخصات النتائج غير القابلة للتغيير، مو من جداول المخطوطة. المصدرين:

freezes/bf16-analysis-20260826-v2/snapshot/analysis/results/summary.csv
freezes/bf16-analysis-jais2-20260829-v1/snapshot/analysis/results/summary.csv

قرارات التحليل تسجل بروتوكول الخمس طيات واختيار الطبقة من development بس، وعقد التحليل بعد الالتقاط من دون أوزان. وبيانات النموذج وbundle manifests المجمّدة تحفظ إصدارات الـcheckpoint والـtokenizer والمحاذاة الناجحة ودلالات تمثيل BF16. التجميدين الاثنين سجلات أدلة؛ لا تعيد توليدها ولا تستبدلها.

التوثيق الأوسع تلقاه في مستودع arabic-morphology-probing-lre. والورقة، “Lexical Split Design and Representation-Interface Validity in Decoder-Only Morphology Probing: An Arabic Evaluation Study”، حالياً تحت التعيين التحريري في Language Resources and Evaluation.