← voidwest

ملاحظات البحث

هذي ملاحظاتي على أوراق وتجارب وأفكار. أي شيء أتعلمه ويستاهل التدوين أحطه هنا.

البحث والاتجاه

الفرق بين استرجاع الهوية بالـprobe ونقلها فعلياً إلى receiver، وليش تحسن التدريب ما ضمن تحسن النقل. نتائج تشخيصية مكتملة على ثماني هويات.
2026-09-13 · probing transfer diagnostics
مقارنة بين تشغيلين مجمّدين تبيّن إن أغلب مكاسب Jais 2 كانت في العدد، وإن النتيجة تتغيّر مع واجهة التمثيل وتقسيم الكلمات.
2026-08-30  ·  Arabic NLP morphology probing Jais
تقييم عربي مدقّق يبيّن كيف تقسيم الكلمات، ومعلومات prompt، ومحاذاة التوكن، وطريقة التجميع تغيّر وش يقيسه المسبار الخطي فعلًا.
2026-08-27  ·  Arabic NLP morphology probing evaluation reproducibility
إيش علّمني fuzzing عن بنية GGUF كمدخل تحكم مو موثوق، وكيف خلّيت الانتقال من bytes حللناها إلى حالة تشغيل واضحة داخل Ember.
2026-08-16  ·  Ember GGUF Rust fuzzing systems security
ليش جمّد Ember حالة KV في artifact نقدر نتحقق منه، وأثبت إعادة تشغيل مطابقة داخل نفس النموذج، وأضاف مقاييس وتشخيصات سببية قبل لا نجرّب أي ridge mapper بين نموذجين Qwen.
2026-08-09  ·  Ember KV cache reproducibility causal diagnostics Qwen
خط أساس مجمّد يوضح كيف يحوّل مسار K-quant loader الحالي في Ember ملفات Q6_K وQ4_K_M الأصغر إلى أوزان f32 مقيمة، فتستهلك ذاكرة أكثر وتكون أبطأ في decode من Q8_0.
2026-08-01  ·  Ember GGUF quantization CPU inference runtime systems
تجربة على ثلاثة أحجام من النماذج ومسح اصطناعي لنواة ضرب المصفوفات في Ember. نقطة الانتقال تقع حوالي 25 مليون FLOP لكل عملية.
2026-07-25  ·  أنظمة استدلال ember Qwen3 LLaMA
ضابط على hidden states مجمّدة قبل targeted LoRA: مجموعات K=4 المرتبة على التطوير حملت إشارة POS held-out أقوى من خمس مجموعات عشوائية غير متقاطعة في Qwen3-0.6B وLlama-3.2-1B.
2026-07-19  ·  Arabic NLP morphology probing LoRA Qwen LLaMA
ليش قابلية إعادة إنتاج التقييم تحتاج item manifests وقوالب prompts ونسخها النهائية وأنظمة parsing وملفات scoring، مو بس اسم النموذج والنتيجة.
2026-07-17  ·  evaluation reproducibility LLM evaluation Arabic NLP
من أول regex prototype إلى Atlas 1.0.0: ليش طبقة الاستخراج بقيت deterministic، قابلة للتتبع، وأضيق عمداً من ادعاءات research gaps المولّدة.
2026-07-11  ·  research tooling information extraction reproducibility Atlas
ملاحظة قياس صغيرة على ArabicMMLU: صيغة prompt وموضع الخيار الصحيح ممكن يغيرون دقة الاختيار من متعدد في نماذج decoder-only صغيرة.
2026-07-04  ·  Arabic NLP evaluation robustness ArabicMMLU Qwen LLaMA
هذا الأسبوع انتقل عمل Ember على الصرف العربي من استخراج hidden states إلى قياس أكثر وعياً بالتسرب. النتيجة أصبحت أضيق: POS يصمد تحت تقييم heldout أشد في Qwen3-0.6B وLlama-3.2-1B، بينما الجذر واللمّة والوزن تحتاج إطار تقييم مختلف.
2026-06-22  ·  Arabic NLP probing morphology ember Qwen LLaMA
نتائج layerwise probing أولية عبر LLaMA وQwen وGemma على محفزات صرف عربي افتراضية. الجذر يختلف بين الطبقات النهائية، لكن الوزن مشبع ولا يدعم مقارنات حجم أو عائلة في هذا التشغيل.
2026-06-14  ·  Arabic NLP probing morphology LLaMA Qwen Gemma preliminary
فحص LLaMA 3.2 بمقاييس 1B/3B/8B باستخدام مصنفات خطية وCCA وRSA. التمثيلات الداخلية موجودة: منظمة، منفصلة، تتغير بشكل غير رتيب مع الحجم: لكن كل نموذج ينتج “The”. نتائج، رسوم بيانية، وخطوات قادمة.
2026-05-26  ·  Arabic NLP probing morphology LLaMA scaling findings
خلاصة أسبوع من قراءة أوراق Arabic NLP. ورقة 2026 اللي قلبت الفرضية، وليش السؤال الحقيقي عن internal representations، مو عن tokenization.
2026-05-16  ·  Arabic NLP morphology tokenization writeup
خطة بحثية: استخدام ember في activation probing عشان نعرف أين وكيف تتعلم النماذج الصرف العربي (الجذر والوزن) داخلياً. مبنية على السؤال المفتوح من Alakeel et al. (2026).
2026-05-16  ·  Arabic NLP probing ember research plan

paper notes

alakeel, qwaider, aldarmaki, alqahtani · LREC 2026. جودة محاذاة الـ token مع الـ morpheme ما تتنبأ بقدرة النموذج على التوليد الصرفي في LLMs العربية. GPT-4o يوصل 97% على nonce roots مع أسوأ محاذاة tokenizer.
2026-05-15  ·  Arabic NLP morphology tokenization LLM evaluation
attia · ~2007. tokenizer عربي modular و finite-state مع clitic guesser ومحلل صرفي وفك غموض باستخدام الكشيدة. تصميم guess-and-filter.
2026-05-15  ·  Arabic NLP tokenization finite-state
alkaoud & syed · WANLP 2020. morph-aware tokenization في طبقة الـ embedding: مفردات أصغر بـ 60%، تعامل أفضل مع الكلمات الجديدة، SOTA من دون إعادة تدريب. نجح على مستوى Word2Vec/mBERT.
2026-05-16  ·  Arabic NLP embeddings tokenization morphology