Jais 2 مو نسخة أفضل من Jais 1 في كل شيء في هذا الاختبار. هو أحسن بوضوح في العدد، وقريب منه في الجنس وPOS مع الواجهة الأساسية اللي فيها كل البيانات، لكن نتيجته تتغيّر أكثر لما نشيل البيانات المعجمية الصريحة. عشان كذا المقارنة المفيدة مو رقم واحد في leaderboard؛ المهم هو النمط عبر المهام والتقسيمات المعجمية وواجهات التمثيل.
التشغيلين يستخدمون نفس مجموعة الاختبار، فيها 4,701 مثال من العربية الفصحى الحديثة، مشتقة من Universal Dependencies Arabic-PADT ومعالجة بـCAMeL Tools. الاثنين استخدموا التقاط الحالات المخفية بـBF16، ونفس واجهات الميزات الأربع، وثلاث مهام، وتقسيمات random وlemma-heldout وroot-heldout، وخمس outer folds، ونفس الاختبار الخطي الثابت:
StandardScaler + RidgeClassifier(alpha=1.0)
هذولا تشغيلين مجمّدين بشكل منفصل، مو تدخّل مضبوط على نفس الـcheckpoint. مراجعة النموذج وبنيته والـtokenizer وعدد المعاملات وحالة التدريب base مقابل chat كلها تغيّرت مع بعض. الفروق أدناه تصف إعدادَي النموذج اللذين قارنّاهما؛ ما تقدر تعزل أثر “Jais 2” بشكل سببي.
| النموذج | | دور الـcheckpoint | | المعاملات | | حجم الحالة | | الطبقات | | السياق |
|---|---|---|---|---|---|
| Jais-13B | base | 13B | 5,120 | 40 | 2,048 |
| JAIS-2-8B-Chat | chat | 8B | 3,328 | 32 | 8,192 |
تشغيل Jais-13B هنا يستخدم inceptionai/Jais-13B،
وبادئة مراجعته 0d5eb87f؛ وتشغيل JAIS-2-8B-Chat
يستخدم inception42/Jais-2-8B-Chat، وبادئة مراجعته
da0e1639. الاثنين طُلبوا وانحفظوا بـBF16.
وحتى إصدارات الـtokenizer مختلفة: Jais 1 عنده 5,149 توكن
في target span عبر الأمثلة، وJais 2 عنده 5,118. نجحت
محاذاة كل مثال في التشغيلين. وعشان كذا ما يصح نقارن أرقام الطبقات
المطلقة كأن عمق الشبكتين واحد.
الجدول يقارن الواجهة الأساسية full_prompt_final، ويحسب
لكل مهمة المتوسط عبر تقسيمي lemma-heldout وroot-heldout.
كل قيمة أصلية لكل تقسيم هي متوسط عبر خمس outer folds،
والفرق هو Jais 2 ناقص Jais 1. أضفنا الدقة لأن مهمة العدد غير
متوازنة بين الفئات، وقد تخفي الدقة تغيراً في استرجاع الفئات الأقل
تمثيلاً.
| المهمة | | دقة Jais 1 | | دقة Jais 2 | | Δ الدقة | | macro-F1 Jais 1 | | macro-F1 Jais 2 | | Δ macro-F1 |
|---|---|---|---|---|---|---|
| الجنس | 0.9315 | 0.9289 | −0.0025 | 0.9259 | 0.9251 | −0.0008 |
| العدد | 0.9362 | 0.9773 | +0.0412 | 0.7177 | 0.9245 | +0.2068 |
| POS | 0.8818 | 0.8543 | −0.0276 | 0.8612 | 0.8358 | −0.0254 |
العدد هو الفرق الواضح. macro-F1 للعدد عند Jais 1 في التقسيمين المجمّعين منخفض رغم دقة 0.9362، وهذا غالباً يعني إن فئة الأغلبية تسوي جزء كبير من الشغل. Jais 2 رفع المقياسين، وزيادته في macro-F1 أكبر بكثير من زيادته في الدقة. الجنس تقريباً ما تغيّر في هذا المتوسط، بينما POS انخفض بشكل طفيف. لكن الخلاصة هذي تخفي أثر واجهة التمثيل.
full_prompt_final يأخذ الحالة النهائية من prompt
فيه السطح والهدف واللّمة والجذر والنمط الصرفي. الحقول اللي بعد الهدف
تكون متاحة عند هالنهاية. أما metadata_free_prompt_final
فيشيل الحقول المعجمية الصريحة، لكنه يظل تمثيلاً لنهاية الـprompt.
والجدول اللي تحت يستخدم التقسيمين المجمّعين بس:
| المهمة | | كل البيانات: Jais 1 → Jais 2 | | الفرق | | بدون metadata: Jais 1 → Jais 2 | | الفرق |
|---|---|---|---|---|
| الجنس | 0.9259 → 0.9251 | −0.0008 | 0.9349 → 0.8580 | −0.0768 |
| العدد | 0.7177 → 0.9245 | +0.2068 | 0.8023 → 0.8647 | +0.0624 |
| POS | 0.8612 → 0.8358 | −0.0254 | 0.8816 → 0.8408 | −0.0408 |
اللافت إن مكسب Jais 2 في العدد يبقى حتى بدون الـmetadata، لكنه يصير أصغر. الجنس يخسر تقريباً 0.077 في macro-F1 في الواجهة اللي بدون metadata صريحة، مع إنه ما تغيّر مع الـprompt الكامل. عشان كذا عبارة “Jais 2 أفضل في الصرف” واسعة زيادة: النتيجة تعتمد على المعلومات الموجودة عند نقطة استخراج الحالة.
واجهات الهدف المحلية عندنا تقرأ يا حالة آخر توكن متداخل مع الهدف، يا متوسط كل حالات التوكنات المتداخلة مع الهدف. وبعد ما أخذنا المتوسط عبر المهام والتقسيمين المجمّعين، مقارنة macro-F1 تطلع كذا:
| الواجهة | | Jais 1 | | Jais 2 | | Δ |
|---|---|---|---|
| full prompt-final | 0.8349 | 0.8951 | +0.0602 |
| metadata-free prompt-final | 0.8729 | 0.8545 | −0.0184 |
| target-final subtoken | 0.8387 | 0.9006 | +0.0619 |
| target-mean span | 0.8421 | 0.8876 | +0.0455 |
Jais 2 أقوى هنا على واجهة target-final، بفارق بسيط عن full prompt-final. أفضل متوسط لـJais 1 في هذا الجدول هو metadata-free prompt-final. هذا مو دليل إن طريقة تجميع وحدة صحيحة دائماً؛ يوضح بس إن اللي نقيسه يشمل مكان قراءة الحالة، ومحتوى البادئة السببية، وطريقة تجميع الـspan متعدد التوكنات.
في واجهة البيانات الكاملة، هذي متوسطات macro-F1 عبر المهام الثلاث في التقسيم العشوائي وتقسيمي اللمات والجذور المحجوزة:
| النموذج | | random | | lemma-heldout | | root-heldout | | random − lemma | | random − root |
|---|---|---|---|---|---|
| Jais-13B | 0.9062 | 0.8457 | 0.8242 | +0.0605 | +0.0819 |
| JAIS-2-8B-Chat | 0.9650 | 0.8997 | 0.8906 | +0.0653 | +0.0744 |
النموذجين يخسرون أداءً لما نخلي مجموعات اللمات أو الجذور المألوفة خارج التدريب. نتيجة العدد عند Jais 2 رفعت درجاته المجمّعة كثيراً، لكن الفجوة المعجمية ما اختفت. التقسيم العشوائي يظل مرجع متفائل للتداخل، مو مقياس للانتقال إلى مجموعات معجمية ما شافها التدريب.
في كل تشغيل اخترنا الطبقة باستخدام بيانات development بس، وبعدها أعدنا الملاءمة على train + development وقسنا test مرة واحدة في كل outer fold. نجحت محاذاة كل الأمثلة الـ4,701 للنموذجين. أرشيف Jais 2 فيه 180 خلية لتسميات ملخبطة؛ ولا خلية تعدّت خط أساس الأغلبية المحسوب من التدريب بس. أرشيف Jais 1 الأكبر فيه 360 خلية ملخبطة لنموذجيه الأساسيين المحددين (Qwen3-0.6B وLlama-3.2-1B)، مو لـJais-13B نفسه. هذي الضوابط تفحص الـpipeline بس؛ مو اختبار سببي لسلوك النموذج.
هذي النتيجة دقيقة لكنها ضيقة: تحت هذا الـprompt والتقسيم المعجمي وقاعدة المحاذاة وواجهة الهدف وطريقة التجميع والطبقة المختارة والمقدّر الخطي، أصبحت سمة العدد أكثر قابلية للاسترجاع خطياً عند Jais 2 من Jais 1 في هذه الالتقاطات المجمّدة. هذا ما يثبت توليداً عربياً أفضل، ولا كفاءة عامة في العربية، ولا أن أي نموذج يستخدم الميزة المسترجعة أثناء التوليد.
المقارنة محسوبة من ملخصات النتائج غير القابلة للتغيير، مو من جداول المخطوطة. المصدرين:
freezes/bf16-analysis-20260826-v2/snapshot/analysis/results/summary.csv
freezes/bf16-analysis-jais2-20260829-v1/snapshot/analysis/results/summary.csv
قرارات التحليل تسجل بروتوكول الخمس طيات واختيار الطبقة من development بس، وعقد التحليل بعد الالتقاط من دون أوزان. وبيانات النموذج وbundle manifests المجمّدة تحفظ إصدارات الـcheckpoint والـtokenizer والمحاذاة الناجحة ودلالات تمثيل BF16. التجميدين الاثنين سجلات أدلة؛ لا تعيد توليدها ولا تستبدلها.
التوثيق الأوسع تلقاه في مستودع arabic-morphology-probing-lre. والورقة، “Lexical Split Design and Representation-Interface Validity in Decoder-Only Morphology Probing: An Arabic Evaluation Study”، حالياً تحت التعيين التحريري في Language Resources and Evaluation.