
llama.cpp
Georgi Gerganov, Diego Devesa
نظرة عامة
في 10 مارس 2023، دفع جورجي غيرغانوف أول commit لمكتبة llama.cpp إلى GitHub. تهدف المكتبة، المكتوبة بلغة C و C++، إلى القيام بشيء واحد: تشغيل نماذج LLaMA من Meta على معالج حاسوب محمول بدون GPU. في غضون أسابيع، حصلت على آلاف النجوم ومجتمع متزايد من المطورين يدفعون بقدراتها إلى أبعد من ذلك.
الابتكار الأساسي هو التكميم. من خلال ضغط أوزان النموذج من 32 بت فاصلة عائمة إلى 4 بت أو 8 بت أعداد صحيحة باستخدام تنسيق GGUF، تقلل llama.cpp متطلبات الذاكرة بنسبة 75 في المئة أو أكثر. نموذج ذو 7 مليارات معلمة كان سيحتاج إلى 28 غيغابايت من VRAM على GPU يمكن تشغيله في أقل من 6 غيغابايت من ذاكرة النظام RAM. تنسيق GGUF أيضًا يضمّن المحلل اللغوي والمفردات وقالب الدردشة في ملف واحد، مما يجعل توزيع النموذج تافهًا.
تدعم llama.cpp نطاقًا واسعًا بشكل غير عادي من الأجهزة: معالجات x86 مع AVX2، Apple Silicon عبر Metal، NVIDIA GPUs مع CUDA، AMD GPUs مع hipBLAS، Intel GPUs مع SYCL، وحتى Vulkan. يوفر المشروع أدوات سطر أوامر للتوليد والقياس وتحويل النموذج، بالإضافة إلى خادم HTTP خفيف الوزن. اعتبارًا من 2025، لديها أكثر من 900 مساهم و69,000 نجمة على GitHub. أدوات مثل Ollama و LM Studio تُبنى مباشرة على llama.cpp، مما يجعل استنتاج LLM المحلي في متناول المستخدمين غير التقنيين. أصبحت المكتبة المعيار الفعلي لتشغيل نماذج اللغة الكبيرة على الأجهزة الاستهلاكية، مما يتيح تجربة ذكاء اصطناعي خاصة وفعالة من حيث التكلفة دون الاعتماد على السحابة.
كلمات مفتاحية
معلومات الكتاب
- المؤلف
- Georgi Gerganov, Diego Devesa
- تاريخ النشر
- 2023-03-10
- المؤلف
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
انضم إلى المجتمع
معجب يناقشون