← voidwest    research notes

وحدات صرفية بلا حدود

Morphemes Without Borders: Evaluating Root-Pattern Morphology in Arabic Tokenizers and LLMs
Alakeel, Qwaider, Aldarmaki, Alqahtani · LREC 2026
Arabic NLP morphology tokenization LLM evaluation arXiv:2603.15773

النتيجة الأساسية

محاذاة الـtokenizer مع الـmorpheme ما توقعت مين يولّد أفضل في المهام المنشورة. GPT-4o جاب 97% على الجذور المبتكرة مع boundary precision قدرها 17%. المقارنة تختبر العلاقة هذي؛ آلية الأداء لسه ما انحسمت.

الـ tokenizer اللي يقطّع الـ morphemes بشكل نظيف مو شرط يطلع توليد كويس، والـ tokenizer اللي يقطّع زيادة (GPT-4) مو شرط يعيقه.

ليش نختبر الصرف العربي؟

العربي عنده نظام الجذر والوزن. الجذور الساكنة تندمج مع قوالب صوتية وتكوّن الكلمات.

مثلًا: الجذر ktb (كتب) + الوزن mafūl → maktūb (مكتوب). الجذر والوزن متداخلين؛ مو جايين وراء بعض زي prefix+stem+suffix في الإنجليزي. عشان كذا العربي stress test قوي للـ subword tokenizers (BPE، Unigram، WordPiece) المصممة للصرف المتسلسل.

إعداد التجربة

الجزء الأول: محاذاة التقطيع مع الصرف

قاسوا قد إيش تتطابق قطع الـ tokenizer مع حدود الـ morpheme المرجعية من محللات CAMEL و Farasa، على الفصحى (ATB3) واللهجات (BOLT). والمقاييس كانت:

الجزء الثاني: التوليد الصرفي

ثلاث مهام probing باستخدام جذور حقيقية و nonce roots:

النماذج المقاسة

النماذج كانت ALLAM، FANAR، GPT-4، GPT-4o، LLaMA-3، Qwen-3، وCohere. FANAR يستخدم MorphBPE (morph-aware tokenization)؛ والباقي يستخدم BPE/Unigram/WordPiece عادي. اختبروها بـ zero-shot و one-shot، بالعربي والإنجليزي.


النتائج الأساسية

Key Finding

ما فيه علاقة بين محاذاة الـ tokenizer وأداء التوليد. GPT-4o جاب أعلى درجة في كل المهام (97% دقة nonce) رغم إن محاذاته من أسوأ المحاذاة (17% boundary precision). أما ALLAM فعنده أفضل MCR (83-86%)، لكنه نزل لـ 20% مع nonce words.

Key Finding

أداء ALLAM وFANAR نزل كثير على مهام الـnonce roots في الدراسة. هذا يوضح فجوة في التعميم تحت الإعدادات هذي، بس ما يثبت إن اللي يسووه من جوّا مجرد حفظ كلمات. والـtokenizer الصرفي عند FANAR ما ضمن له أداء قوي على الكلمات المبتكرة.

Key Finding

أغلب النماذج المقاسة أداؤها كان أحسن مع التعليمات بالإنجليزي. توزيع لغات التدريب ممكن يفسر جزء من الفرق، بس المقارنة هذي ما تعزل أثره.

Key Finding

الـ one-shot يفيد النماذج الأضعف، مو الأقوى. GPT-4 و GPT-4o ظلّوا ثابتين بين zero-shot و one-shot. أما LLaMA-3 وQwen-3 وCohere فتحسّنوا مع المثال. يحتاجوا scaffolding داخل السياق عشان يلقطوا التحويل.

Observation

خمسة أنماط من الأخطاء. تطبيق الوزن غلط (الجذر صحيح والقالب غلط)، تشويه الجذر (تغيّرت الحروف الساكنة)، استبدال بكلمة حقيقية (يطلع كلمة صحيحة بدل ما يطبّق الوزن)، ترتيب اللواحق غلط، واقتطاع جزئي.


إيش يعني هذا لأبحاث العربي؟

1. نقيس تغيير الـtokenizer على المهمة نفسها

الـtokenizers الصرفية تضيف اختيارات هندسية تحتاج تقييم حسب المهمة. GPT-4o سجل fertility أكبر من 3 وboundary precision قدرها 17%، ومع كذا وصل 97% في nonce. ضعف المحاذاة ما منعه ينجح هنا، بس هذي مو تجربة تغير الـtokenizer لحاله وتقيس فائدته.

2. اتباع التعليمات تفسير يحتاج اختبار

المؤلفون يقترحوا الاستدلال التركيبي واتباع التعليمات كتفسير. النتائج السلوكية تدعم اختبار الفكرة، بس ما تعزل آلية داخل النموذج ولا تثبت إن التحليل الصرفي الصريح ما له فائدة في كل إعداد.

3. مقارنة النماذج ما تعزل اختيارات التدريب

ALLAM وFANAR جابوا نتائج أقل من GPT-4 وGPT-4o في المهام المعروضة. بس البنية وبيانات التدريب والحجم والـtuning تتغير مع بعض، فما نقدر ننسب الفجوة لعامل واحد من المقارنة هذي.

4. الكلمات المبتكرة تكشف فجوة التعميم

ALLAM سجل 67% على الجذور الحقيقية و20% على المبتكرة: فرق 47 نقطة. شرط الـnonce أظهر فشلاً ما يبان لو اختبرنا كلمات حقيقية بس. هذا اختبار مفيد للتعميم، مو الطريقة الوحيدة لفحص الحفظ.

5. أسئلة لتجربة متابعة مضبوطة


القيود