← voidwest    research notes

الـ tokenizer مو المشكلة

what i learned reading arabic nlp papers for a week
محمد الثبيتي · 2026-05-16

محاذاة الـtokenizer ما توقعت أداء التوليد في المهام العربية المنشورة. GPT-4o جاب 97% على الجذور المبتكرة مع boundary precision قدرها 17%. النتيجة لسه ما تحدد الحساب اللي أدى للأداء هذا.

دخلت الموضوع وأنا متوقع إن تحسين التقطيع الصرفي يفسر تحسن التوليد. الأوراق اللي قرأتها خلت العلاقة أقل بساطة.

ليش العربي اختبار صعب للتقطيع؟

العربي يستخدم نظام الجذر والوزن. جذر من 3 حروف زي k-t-b (كتب) يندمج مع قوالب صوتية ويطلع: kataba (هو كتب)، kitaab (كتاب)، maktab (مكتب)، maktūb (مكتوب)، yaktubu (هو يكتب). الجذر ما يطلع ككلمة مستقلة أبدًا؛ يكون دائمًا متداخلًا داخل الشكل السطحي.

كلمة عربية وحدة ممكن تحمل اللي يعادل 4 tokens بالإنجليزي. fasayaktubūnahā (فسيكتبونها) = "and they will write it": كلمة وحدة فيها proclitics وجذر و enclitic مدمجين.

BPE يدمج سلاسل حروف متجاورة حسب تكرارها، بينما الجذر والوزن ممكن يتداخلوا بشكل غير متصل. عشان كذا حدود الـtokens مو شرط تمشي مع حدود الصرف. هذا اختلاف في التمثيل، مو استحالة إن النموذج يتعلم منه.

وفوق هذا كله عندك الحركات الاختيارية، والمسافات اللي مو ثابتة، وتنوع العربي نفسه (فصحى، مصري، خليجي، شامي). يعني المشكلة فعلًا مو بسيطة.

الفرضية الأولى: نصلح الـtokenizer

المجال جرّب يصلّح الـ tokenizer بهذي الطرق كثير:

الفرضية منطقية: لو قطّعت الـ morphemes صح قبل ما توصل للنموذج، المفروض يتعلم الصرف أحسن.

ورقة 2026 اختبرت الفرضية

Morphemes Without Borders: Evaluating Root-Pattern Morphology in Arabic Tokenizers and LLMs
alakeel, qwaider, aldarmaki, alqahtani · LREC 2026, arXiv:2603.15773
من SDAIA، MBZUAI، و PNU

قيّموا 7 LLMs عربية (ALLAM، FANAR، GPT-4، GPT-4o، LLaMA-3، Qwen-3، Cohere) من ناحيتين: (1) قد إيش الـ tokenizers حقهم متوافقة مع حدود الـ morpheme المثالية، و(2) قد إيش النماذج تقدر تولّد أشكال الجذر والوزن، ومنها nonce roots؛ جذور مبتكرة ما مرّت عليهم قبل. وهذا يختبر التعميم الحقيقي، مو الحفظ.

Key Finding

المحاذاة ما تقول لك قد إيش النموذج شاطر.

ALLAM عنده أفضل محاذاة صرفية معروضة، MCR بين 83-86%، بس دقته على الـnonce words كانت 20%. المحاذاة الأفضل ما ضمنت التعميم في المهمة هذي؛ الرقم لحاله ما يثبت إن الآلية مجرد حفظ.

GPT-4 عنده أسوأ محاذاة (fertility أعلى بـ 4 مرات من المثالي، وboundary precision 17%)، لكنه جاب 92% على nonce roots. ثاني أفضل نتيجة.

GPT-4o جاب 97% على nonce words رغم إن محاذاته سيئة بنفس المستوى.

ما فيه أي ارتباط بين مقاييس محاذاة الـ tokenizer وأداء التوليد الصرفي. ارتباط morpheme F1 وMCR بدقة التوليد صفر أو سلبي.

FANAR، والـ tokenizer حقه واعي بالصرف (MorphBPE)، كان أداؤه ثابت بس ما سيطر. يمكن الثبات جاي من قدرته على اتباع التعليمات، مو من جودة الـ tokenizer.

الـprompts بالإنجليزي جابت نتائج أحسن عند أغلب النماذج في المقارنة. لغة الـinstruction tuning احتمال يساهم، بس التجربة ما تعزل توزيع لغات التدريب.

الورقة تدعو لاختبار التعميم مباشرة بدل ما نستخدم محاذاة التقطيع كبديل عنه. الاستدلال التركيبي واتباع التعليمات تفسير مقترح، مو آلية عزلتها الدرجات هذي.

كيف نقرأ النتيجة؟

نتيجة 2020 عن الـembeddings ونتيجة 2026 عن التوليد تقيس مهام ونماذج وتغييرات مختلفة. الحجم احتمال يفسر جزء من الفرق، بس مقارنة الورقتين ما تعزل أثره.

المجال ظل يسأل "أي tokenizer يفوز في مهام التصنيف؟" لسنين. وأوراق 2023 و2024 غالبًا تنتهي بـ "يعتمد على المهمة والـ dataset." ورقة 2026 تقلب السؤال كله: لا تسأل عن التقطيع السطحي، اسأل عن التعميم.

الفجوة الحقيقية يمكن مو في الـ tokenizer ولا حتى في طبقة الـ embedding، يمكن في internal representations اللي يبنيها النموذج من جوّا.

GPT-4 وGPT-4o يسوّوا شيء ALLAM ما يسويه، مع إن ALLAM عنده بيانات تدريب عربية أكثر وtokenizer أفضل. إيش هو هذا الشيء؟

الخطوة التالية وقتها

بروح أشوف زاوية الـ internal activation: كيف شكل التمثيلات فعلًا داخل نماذج تنجح، مقارنةً بنماذج تفشل مع Arabic nonce words؟

النماذج الصغيرة مفتوحة الأوزان تخلي دراسة الـactivations محلياً ممكنة. بس قياس الـlogits لسه يحتاج نموذج شغال أو endpoint للاستدلال؛ اختيار الـlogits كمقياس ما يلغي كلفة تشغيل النموذج. Ember يعطيني وصول لحالات الطبقات في النماذج المحلية المدعومة.

وفيه كمان مسارات ثانية أتابعها:

الموضوع بدأ بفضول من بوست LinkedIn. والحين صار عندي أسئلة بحثية حقيقية واتجاه لسه ما انبحث بالكامل. بتجي تحديثات أكثر مع الوقت.


الأوراق المذكورة

  1. alakeel, qwaider, aldarmaki, alqahtani, "morphemes without borders", LREC 2026, arXiv:2603.15773
  2. alkaoud & syed, "on the importance of tokenization in Arabic embedding models", WANLP 2020, ACL Anthology
  3. attia، "Arabic tokenization system"، ~2007 (قواعدي، finite-state)
  4. alrefaie et al., "exploring tokenization strategies and vocabulary sizes for enhanced Arabic language models", arXiv:2403.11130, 2024