ملاحظات على أوراق وتجارب وأفكار. كل ما أتعلم شيء
يستحق التدوين أضيفه هنا.
ليش جمّد Ember حالة KV في أثر قابل
للتحقق، وأثبت إعادة تشغيل مطابقة داخل النموذج نفسه، وأضاف
مقاييس إعادة بناء وتشخيصات سببية قبل أي ridge mapper
بين نموذجين Qwen.
2026-08-09
·
Ember
KV cache
reproducibility
causal diagnostics
Qwen
خط أساس مجمّد يوضح كيف يحوّل مسار K-quant loader
الحالي في Ember ملفات Q6_K وQ4_K_M
الأصغر إلى أوزان f32 مقيمة، فتستهلك ذاكرة أكثر
وتكون أبطأ في decode من Q8_0.
2026-08-01
·
Ember
GGUF
quantization
CPU inference
runtime systems
تجربة على ثلاثة أحجام من النماذج ومسح اصطناعي لنواة ضرب
المصفوفات في Ember. نقطة الانتقال تقع حوالي
25 مليون FLOP لكل عملية.
2026-07-25
·
أنظمة
استدلال
ember
Qwen3
LLaMA
ضابط على hidden states مجمّدة قبل targeted LoRA:
مجموعات K=4 المرتبة على التطوير حملت إشارة
POS held-out أقوى من خمس مجموعات عشوائية غير
متقاطعة في Qwen3-0.6B وLlama-3.2-1B.
2026-07-19
·
Arabic NLP
morphology
probing
LoRA
Qwen
LLaMA
ليش قابلية إعادة إنتاج التقييم تحتاج item manifests
وقوالب prompts ونسخها النهائية وأنظمة
parsing وملفات scoring، مو بس اسم
النموذج والنتيجة.
2026-07-17
·
evaluation
reproducibility
LLM evaluation
Arabic NLP
من أول regex prototype إلى Atlas 1.0.0:
ليش طبقة الاستخراج بقيت deterministic، قابلة
للتتبع، وأضيق عمداً من ادعاءات research gaps
المولّدة.
2026-07-11
·
research tooling
information extraction
reproducibility
Atlas
ملاحظة قياس صغيرة على ArabicMMLU: صيغة
prompt وموضع الخيار الصحيح ممكن يغيرون دقة
الاختيار من متعدد في نماذج decoder-only صغيرة.
2026-07-04
·
Arabic NLP
evaluation
robustness
ArabicMMLU
Qwen
LLaMA
هذا الأسبوع انتقل عمل Ember على الصرف العربي
من استخراج hidden states إلى قياس أكثر وعياً
بالتسرب. النتيجة أصبحت أضيق: POS يصمد تحت
تقييم heldout أشد في Qwen3-0.6B
وLlama-3.2-1B، بينما الجذر واللمّة والوزن
تحتاج إطار تقييم مختلف.
2026-06-22
·
Arabic NLP
probing
morphology
ember
Qwen
LLaMA
نتائج layerwise probing أولية عبر
LLaMA وQwen وGemma
على محفزات صرف عربي افتراضية. الجذر يختلف بين الطبقات
النهائية، لكن الوزن مشبع ولا يدعم مقارنات حجم أو عائلة
في هذا التشغيل.
2026-06-14
·
Arabic NLP
probing
morphology
LLaMA
Qwen
Gemma
preliminary
فحص LLaMA 3.2 بمقاييس 1B/3B/8B
باستخدام مصنفات خطية وCCA وRSA.
التمثيلات الداخلية موجودة — منظمة، منفصلة، تتغير
بشكل غير رتيب مع الحجم — لكن كل نموذج ينتج
“The”. نتائج، رسوم بيانية،
وخطوات قادمة.
2026-05-26
·
Arabic NLP
probing
morphology
LLaMA
scaling
findings
خلاصة أسبوع من قراءة أوراق Arabic NLP.
ورقة 2026 اللي قلبت الفرضية، وليش السؤال الحقيقي
عن internal representations، مو عن
tokenization.
2026-05-16
·
Arabic NLP
morphology
tokenization
writeup
خطة بحثية: استخدام ember في activation probing
عشان نعرف أين وكيف تتعلم النماذج الصرف العربي
(الجذر والوزن) داخلياً. مبنية على السؤال
المفتوح من Alakeel et al. (2026).
2026-05-16
·
Arabic NLP
probing
ember
research plan
alakeel, qwaider, aldarmaki, alqahtani ·
LREC 2026. جودة محاذاة الـ token
مع الـ morpheme ما تتنبأ بقدرة النموذج على
التوليد الصرفي في LLMs العربية.
GPT-4o يوصل 97% على nonce roots
مع أسوأ محاذاة tokenizer.
2026-05-15
·
Arabic NLP
morphology
tokenization
LLM evaluation
attia · ~2007. tokenizer عربي
modular و finite-state مع
clitic guesser ومحلل صرفي وفك غموض باستخدام
الكشيدة. تصميم guess-and-filter.
2026-05-15
·
Arabic NLP
tokenization
finite-state
alkaoud & syed · WANLP 2020.
morph-aware tokenization في طبقة الـ
embedding: مفردات أصغر بـ 60%، تعامل أفضل
مع الكلمات الجديدة، SOTA
من دون إعادة تدريب. نجح على مستوى
Word2Vec/mBERT.
2026-05-16
·
Arabic NLP
embeddings
tokenization
morphology