محمد الثبيتي

أبني أنظمة استدلال محلية، وأشوف كيف تتصرف النماذج اللغوية، وأراجع الأماكن اللي ممكن تخلي أنظمة التقييم تعطينا صورة غلط.

أغلب شغلي يدور حول Rust، والاستدلال المكمّم على CPU، وتصميم التجارب، والصرف العربي. أختبر الافتراضات، وأتبع العطل من ملف النموذج لين النواة، وبعدين أكتب وش صار وليه.

مساهماتي في GitHub

GitHub contribution calendar for voidwest

01 / من اللاب

حديثًا

أربع أشياء من الشغل اللي قاعد يصير، مو كل الأرشيف.

بحث

من Jais 1 إلى Jais 2: وش تغيّر في اختبار الصرف العربي؟

أغلب التحسن جاي من العدد، والنتيجة تغيّرت لما غيّرنا واجهة التمثيل أو تقسيم الكلمات. العنوان أقل حماس، بس فايدته أكبر.

اقرأ ←

إصدار

Ember v1.0.0: استدلال تقدر تفحصه، وتعيد تشغيله، وتستعيده.

حزم تجارب مُصدَّرة بإصدارات صارمة، وستة مواقع خطافات دلالية مع استعادة دقيقة، وواجهة GPUI Kit، وسلّم ذهبي قابل لإعادة الإنتاج مقابل مرجع llama.cpp المثبّت.

الإصدار ↗

نوع عطل

ملف النموذج مو بس أوزان

الـfuzzing على محمّلات GGUF ورّانا: البيانات الوصفية تتحكم في التنفيذ، يعني قراءتها قرار أمني، مو بس فتح ملف.

ملاحظات ←

تجربة

قبل ما نوصل ذاكرات KV بين النماذج، لازم أول نخليها قابلة للقياس

ثبّت اللقطات وإعادة التشغيل المطابقة داخل النموذج نفسه قبل ما أجرّب الربط بين النماذج، عشان ما نرمي كل عطل على الرابط.

اقرأ ←

02 / أنظمة

اللي أبنيه

أسوي أدوات لأسئلة مزعجة، بس تعطي نتائج نقدر نعيدها ونراجعها.

Ember

وقت تشغيل

وقت تشغيل للاستدلال المحلي على CPU، مكتوب بـ Rust ويشتغل فوق GGUF، مع مسارات Q4/Q6، وتجارب نقدر نعيدها، ودعم متعدد الوسائط، وتتبع واضح للأدوات.

Rust · GGUF · AVX2 · inference

Atlas

أدوات بحث

يلمّ قيود الأوراق، والتقييمات الناقصة، وكلام الشغل الجاي. حتمي ومبني على الأدلة، ويفرّق عن قصد بين الدليل والتخمين بدل ما يدّعي إن فيه «فجوات بحثية» من عنده.

Python · evidence · reports

mini-os

نواة

نواة x86_64 صغيرة فيها ذاكرة افتراضية، وheap، وتنفيذ غير متزامن، وramdisk، وصدفة. طبقات أقل، وأماكن أقل يقدر سبب المشكلة يستخبى فيها.

Rust · x86_64 · no_std

devdocs-v2

RAG محلي

نظام محلي أفتّش فيه داخل ملفات PDF، بفهرسة تدريجية، وتقسيم يحافظ على السياق، وembeddings، واستدلال محلي.

Python · FastAPI · ChromaDB · Ollama

03 / بحث

أسئلة أشتغل عليها

ثلاثة أسئلة هي اللي تحرّك الشغل هالفترة.

تدقيق 11 نموذج

وش يقيس اختبار الصرف العربي فعلًا؟

قد إيش من النتيجة جاية فعلًا من الصرف، وقد إيش جاية من تداخل الكلمات، أو تسريب السياق، أو موضع الرمز، أو طريقة تجميع تسهّل الموضوع زيادة؟

الجواب الحالي ←

تحديد سببي

إذا التكميم غيّر الإجابة، وين بدأ التغيير؟

قصة «العربية تتدهور مع Q4» ما صمدت في التجارب. اللي صمد فعلًا هو تبديل ناتج طبقة وحدة: أعطال نادرة قدرنا نحدد مكانها عند L7 في Qwen وL1 في Llama.

التجارب ←

فحص وقت التشغيل

هل وقت التشغيل يسوي فعلًا اللي يقوله ملف النموذج؟

ملف Q4 ممكن في النهاية يشتغل كـf32. اللي يهمني وش الموجود في الذاكرة، وأي مسار اشتغل، ومن فين جا: مو اسم الملف وبس.

الفحص ←

04 / ملاحظات ميدانية

من الدفتر

أكتبها كل ما طلع عندي قياس، أو عطل، أو تحفّظ منهجي مزعج لدرجة ما أقدر أتجاهله بدون ما أوثّقه.

حاليًا

أشتغل بـ: Rust وPython وperf وملفات JSON manifest أكثر من اللي أحسّه ضروري.

وش تحت المجهر: مسارات Q4/Q6 على CPU، وتقسيمات تقييم العربية، وأي نتيجة تصير أنظف بزيادة وبشكل يخلّيني أشك بعد التصفية.