← voidwest    engineering    internals
استدلال على CPU نقدر نفحصه لأبحاث أنظمة LLM قابلة للإعادة.
rust 1.92 ● mit ● cpu-first

ember محرك inference وprobing صغير وواضح. يشغّل نماذج GGUF مضغوطة على CPU، ويطلع hidden states لكل طبقة، ويخلّي artifacts حق الـ benchmarks والـ validation قريبة من الكود. مو جاي يستبدل llama.cpp؛ الفكرة إني أقدر أشوف التشغيل وأراجعه.

ابدأ من هنا

درجات التحقق

smokeتشغيل بنيوي فقط: الأمر حمّل artifacts وأنتج output.
golden logitsمقارنة logits مع reference موثوق لنفس prompt وtokenizer وmodel وquantization path.
activation checksمقارنة hidden states حسب prompt وtokenizer وmodel وlayer وtoken position.
probesdecodability أو recoverability، وليس causal model use.
interventionsclaims سلوكية تحتاج تغير downstream logits أو continuations.

الوضع الحالي

areastatusread
CPU runtimeيعمل محلياً عبر مسارات GGUF صغيرة ومتوسطةartifact هندسي، وليس production parity
Qwen3 0.6Bgeneration/probe paths تعمليحتاج trusted golden-logit reference
LLaMA 1B/3B/8Bتوجد smoke/probe artifacts محليةالاستنتاجات البحثية ما زالت preliminary
Gemma 4 E2Bdense text-only path يشغل smoke/benchmark محلياًexperimental حتى تغطيه golden checks
encoder benchmarksmBERT PADT smoke اكتمل؛ suite manifest موجودXLM-R/AraBERTv2 full suite ما زال pending

latest update

آخر تحديث هندسي أضاف thread-count benchmark في صفحة engineering. النتائج المحلية تقول إن النماذج الأكبر dense Q8_0 تستفيد من threaded runtime paths على هذا الجهاز، بينما Qwen3 0.6B الصغير لا يستفيد. هذا وصف محلي، وليس توقع سرعة على cloud.

deeper pages

مسار يتكوّن عن أسطح الهجوم في محركات الاستدلال، وحدود الثقة في ملفات النماذج، وأمان الذاكرة، وبحث أمني نقدر نعيده ونراجعه.
architecture، design decisions، math primitives، attention، KV cache، bugs، وأول output متماسك.
العمل الهندسي الحالي، benchmark plot، والصفحات الفرعية.
Arabic NLP، morphology probing، أوراق tokenization، واتجاه البحث الحالي.