محاذاة الـtokenizer مع الـmorpheme ما توقعت مين يولّد أفضل في المهام المنشورة. GPT-4o جاب 97% على الجذور المبتكرة مع boundary precision قدرها 17%. المقارنة تختبر العلاقة هذي؛ آلية الأداء لسه ما انحسمت.
الـ tokenizer اللي يقطّع الـ morphemes بشكل نظيف مو شرط يطلع توليد كويس، والـ tokenizer اللي يقطّع زيادة (GPT-4) مو شرط يعيقه.
العربي عنده نظام الجذر والوزن. الجذور الساكنة تندمج مع قوالب صوتية وتكوّن الكلمات.
مثلًا: الجذر ktb (كتب) + الوزن mafūl → maktūb (مكتوب). الجذر والوزن متداخلين؛ مو جايين وراء بعض زي prefix+stem+suffix في الإنجليزي. عشان كذا العربي stress test قوي للـ subword tokenizers (BPE، Unigram، WordPiece) المصممة للصرف المتسلسل.
قاسوا قد إيش تتطابق قطع الـ tokenizer مع حدود الـ morpheme المرجعية من محللات CAMEL و Farasa، على الفصحى (ATB3) واللهجات (BOLT). والمقاييس كانت:
ثلاث مهام probing باستخدام جذور حقيقية و nonce roots:
النماذج كانت ALLAM، FANAR، GPT-4، GPT-4o، LLaMA-3، Qwen-3، وCohere. FANAR يستخدم MorphBPE (morph-aware tokenization)؛ والباقي يستخدم BPE/Unigram/WordPiece عادي. اختبروها بـ zero-shot و one-shot، بالعربي والإنجليزي.
ما فيه علاقة بين محاذاة الـ tokenizer وأداء التوليد. GPT-4o جاب أعلى درجة في كل المهام (97% دقة nonce) رغم إن محاذاته من أسوأ المحاذاة (17% boundary precision). أما ALLAM فعنده أفضل MCR (83-86%)، لكنه نزل لـ 20% مع nonce words.
أداء ALLAM وFANAR نزل كثير على مهام الـnonce roots في الدراسة. هذا يوضح فجوة في التعميم تحت الإعدادات هذي، بس ما يثبت إن اللي يسووه من جوّا مجرد حفظ كلمات. والـtokenizer الصرفي عند FANAR ما ضمن له أداء قوي على الكلمات المبتكرة.
أغلب النماذج المقاسة أداؤها كان أحسن مع التعليمات بالإنجليزي. توزيع لغات التدريب ممكن يفسر جزء من الفرق، بس المقارنة هذي ما تعزل أثره.
الـ one-shot يفيد النماذج الأضعف، مو الأقوى. GPT-4 و GPT-4o ظلّوا ثابتين بين zero-shot و one-shot. أما LLaMA-3 وQwen-3 وCohere فتحسّنوا مع المثال. يحتاجوا scaffolding داخل السياق عشان يلقطوا التحويل.
خمسة أنماط من الأخطاء. تطبيق الوزن غلط (الجذر صحيح والقالب غلط)، تشويه الجذر (تغيّرت الحروف الساكنة)، استبدال بكلمة حقيقية (يطلع كلمة صحيحة بدل ما يطبّق الوزن)، ترتيب اللواحق غلط، واقتطاع جزئي.
الـtokenizers الصرفية تضيف اختيارات هندسية تحتاج تقييم حسب المهمة. GPT-4o سجل fertility أكبر من 3 وboundary precision قدرها 17%، ومع كذا وصل 97% في nonce. ضعف المحاذاة ما منعه ينجح هنا، بس هذي مو تجربة تغير الـtokenizer لحاله وتقيس فائدته.
المؤلفون يقترحوا الاستدلال التركيبي واتباع التعليمات كتفسير. النتائج السلوكية تدعم اختبار الفكرة، بس ما تعزل آلية داخل النموذج ولا تثبت إن التحليل الصرفي الصريح ما له فائدة في كل إعداد.
ALLAM وFANAR جابوا نتائج أقل من GPT-4 وGPT-4o في المهام المعروضة. بس البنية وبيانات التدريب والحجم والـtuning تتغير مع بعض، فما نقدر ننسب الفجوة لعامل واحد من المقارنة هذي.
ALLAM سجل 67% على الجذور الحقيقية و20% على المبتكرة: فرق 47 نقطة. شرط الـnonce أظهر فشلاً ما يبان لو اختبرنا كلمات حقيقية بس. هذا اختبار مفيد للتعميم، مو الطريقة الوحيدة لفحص الحفظ.