الدراسة تعرض تحسن مع tokens صرفية في Word2Vec وBERT. تذكر مفردات أصغر بـ60%، وتقيس NER والمشاعر وPOS tagging. التحسن يخص إعدادات التجارب هذي.
بدل الكلمات السطحية أو BPE، استخدموا tokens على مستوى الـ morpheme. جرّب المؤلفون الفكرة على Word2Vec وBERT، وقاسوا الأداء على NER وsentiment وPOS tagging.
الفكرة راجعة للنظام الصرفي العربي نفسه. عندك مجموعة صغيرة ومحدودة من الجذور والأوزان واللواصق، وتقريبًا كل الكلمات العربية تتكوّن منها.
الـ tokenizer المورفيمي يفكك الكلمة لهذي المكوّنات الأساسية، فتنزل المفردات الفعلية من حوالي مليون شكل سطحي إلى 20K morpheme بس. وطبقة الـ embedding في النماذج الصغيرة تاخذ جزءًا كبيرًا من الـ parameters؛ فتصغير جدول الـ embedding مع الحفاظ على التركيب الدلالي يعطي مكاسب واضحة.
ليش الموضوع هذا مهم جنب نتائج 2026؟
دراسة الـembeddings في 2020 ودراسة التوليد في 2026 تسأل أسئلة مختلفة. عادي إن إدخال الصرف يفيد مهام معينة، وفي نفس الوقت محاذاة الـtokenizer لحالها ما تتنبأ بجودة التوليد.
الحجم واحد من الاحتمالات اللي تستحق الاختبار، ومعاه اختلاف المهمة والبنية والتدريب. ما نقدر من المقارنة هذي نقول إن Word2Vec أو mBERT عاجز عن تعلم الصرف ضمنياً، ولا نحدد نقطة انتقال عند GPT-4. نحتاج تجربة تضبط العوامل قبل ما ننسب الفرق للحجم.