← voidwest

research notes

ملاحظات على أوراق وتجارب وأفكار. كل ما أتعلم شيء يستحق التدوين أضيفه هنا.

research & direction

ليش جمّد Ember حالة KV في أثر قابل للتحقق، وأثبت إعادة تشغيل مطابقة داخل النموذج نفسه، وأضاف مقاييس إعادة بناء وتشخيصات سببية قبل أي ridge mapper بين نموذجين Qwen.
2026-08-09  ·  Ember KV cache reproducibility causal diagnostics Qwen
خط أساس مجمّد يوضح كيف يحوّل مسار K-quant loader الحالي في Ember ملفات Q6_K وQ4_K_M الأصغر إلى أوزان f32 مقيمة، فتستهلك ذاكرة أكثر وتكون أبطأ في decode من Q8_0.
2026-08-01  ·  Ember GGUF quantization CPU inference runtime systems
تجربة على ثلاثة أحجام من النماذج ومسح اصطناعي لنواة ضرب المصفوفات في Ember. نقطة الانتقال تقع حوالي 25 مليون FLOP لكل عملية.
2026-07-25  ·  أنظمة استدلال ember Qwen3 LLaMA
ضابط على hidden states مجمّدة قبل targeted LoRA: مجموعات K=4 المرتبة على التطوير حملت إشارة POS held-out أقوى من خمس مجموعات عشوائية غير متقاطعة في Qwen3-0.6B وLlama-3.2-1B.
2026-07-19  ·  Arabic NLP morphology probing LoRA Qwen LLaMA
ليش قابلية إعادة إنتاج التقييم تحتاج item manifests وقوالب prompts ونسخها النهائية وأنظمة parsing وملفات scoring، مو بس اسم النموذج والنتيجة.
2026-07-17  ·  evaluation reproducibility LLM evaluation Arabic NLP
من أول regex prototype إلى Atlas 1.0.0: ليش طبقة الاستخراج بقيت deterministic، قابلة للتتبع، وأضيق عمداً من ادعاءات research gaps المولّدة.
2026-07-11  ·  research tooling information extraction reproducibility Atlas
ملاحظة قياس صغيرة على ArabicMMLU: صيغة prompt وموضع الخيار الصحيح ممكن يغيرون دقة الاختيار من متعدد في نماذج decoder-only صغيرة.
2026-07-04  ·  Arabic NLP evaluation robustness ArabicMMLU Qwen LLaMA
هذا الأسبوع انتقل عمل Ember على الصرف العربي من استخراج hidden states إلى قياس أكثر وعياً بالتسرب. النتيجة أصبحت أضيق: POS يصمد تحت تقييم heldout أشد في Qwen3-0.6B وLlama-3.2-1B، بينما الجذر واللمّة والوزن تحتاج إطار تقييم مختلف.
2026-06-22  ·  Arabic NLP probing morphology ember Qwen LLaMA
نتائج layerwise probing أولية عبر LLaMA وQwen وGemma على محفزات صرف عربي افتراضية. الجذر يختلف بين الطبقات النهائية، لكن الوزن مشبع ولا يدعم مقارنات حجم أو عائلة في هذا التشغيل.
2026-06-14  ·  Arabic NLP probing morphology LLaMA Qwen Gemma preliminary
فحص LLaMA 3.2 بمقاييس 1B/3B/8B باستخدام مصنفات خطية وCCA وRSA. التمثيلات الداخلية موجودة — منظمة، منفصلة، تتغير بشكل غير رتيب مع الحجم — لكن كل نموذج ينتج “The”. نتائج، رسوم بيانية، وخطوات قادمة.
2026-05-26  ·  Arabic NLP probing morphology LLaMA scaling findings
خلاصة أسبوع من قراءة أوراق Arabic NLP. ورقة 2026 اللي قلبت الفرضية، وليش السؤال الحقيقي عن internal representations، مو عن tokenization.
2026-05-16  ·  Arabic NLP morphology tokenization writeup
خطة بحثية: استخدام ember في activation probing عشان نعرف أين وكيف تتعلم النماذج الصرف العربي (الجذر والوزن) داخلياً. مبنية على السؤال المفتوح من Alakeel et al. (2026).
2026-05-16  ·  Arabic NLP probing ember research plan

paper notes

alakeel, qwaider, aldarmaki, alqahtani · LREC 2026. جودة محاذاة الـ token مع الـ morpheme ما تتنبأ بقدرة النموذج على التوليد الصرفي في LLMs العربية. GPT-4o يوصل 97% على nonce roots مع أسوأ محاذاة tokenizer.
2026-05-15  ·  Arabic NLP morphology tokenization LLM evaluation
attia · ~2007. tokenizer عربي modular و finite-state مع clitic guesser ومحلل صرفي وفك غموض باستخدام الكشيدة. تصميم guess-and-filter.
2026-05-15  ·  Arabic NLP tokenization finite-state
alkaoud & syed · WANLP 2020. morph-aware tokenization في طبقة الـ embedding: مفردات أصغر بـ 60%، تعامل أفضل مع الكلمات الجديدة، SOTA من دون إعادة تدريب. نجح على مستوى Word2Vec/mBERT.
2026-05-16  ·  Arabic NLP embeddings tokenization morphology