Last updated
    llama.cpp
    كتاب

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023
    المجتمع

    نظرة عامة

    في 10 مارس 2023، دفع جورجي غيرغانوف أول commit لمكتبة llama.cpp إلى GitHub. تهدف المكتبة، المكتوبة بلغة C و C++، إلى القيام بشيء واحد: تشغيل نماذج LLaMA من Meta على معالج حاسوب محمول بدون GPU. في غضون أسابيع، حصلت على آلاف النجوم ومجتمع متزايد من المطورين يدفعون بقدراتها إلى أبعد من ذلك.

    الابتكار الأساسي هو التكميم. من خلال ضغط أوزان النموذج من 32 بت فاصلة عائمة إلى 4 بت أو 8 بت أعداد صحيحة باستخدام تنسيق GGUF، تقلل llama.cpp متطلبات الذاكرة بنسبة 75 في المئة أو أكثر. نموذج ذو 7 مليارات معلمة كان سيحتاج إلى 28 غيغابايت من VRAM على GPU يمكن تشغيله في أقل من 6 غيغابايت من ذاكرة النظام RAM. تنسيق GGUF أيضًا يضمّن المحلل اللغوي والمفردات وقالب الدردشة في ملف واحد، مما يجعل توزيع النموذج تافهًا.

    تدعم llama.cpp نطاقًا واسعًا بشكل غير عادي من الأجهزة: معالجات x86 مع AVX2، Apple Silicon عبر Metal، NVIDIA GPUs مع CUDA، AMD GPUs مع hipBLAS، Intel GPUs مع SYCL، وحتى Vulkan. يوفر المشروع أدوات سطر أوامر للتوليد والقياس وتحويل النموذج، بالإضافة إلى خادم HTTP خفيف الوزن. اعتبارًا من 2025، لديها أكثر من 900 مساهم و69,000 نجمة على GitHub. أدوات مثل Ollama و LM Studio تُبنى مباشرة على llama.cpp، مما يجعل استنتاج LLM المحلي في متناول المستخدمين غير التقنيين. أصبحت المكتبة المعيار الفعلي لتشغيل نماذج اللغة الكبيرة على الأجهزة الاستهلاكية، مما يتيح تجربة ذكاء اصطناعي خاصة وفعالة من حيث التكلفة دون الاعتماد على السحابة.

    كلمات مفتاحية

    llama.cppGGUFالتكميمLLM محليالاستنتاجمفتوح المصدرجورجي غيرغانوفاستنتاج على CPUالتعلم الآلي

    معلومات الكتاب

    المؤلف
    Georgi Gerganov, Diego Devesa
    تاريخ النشر
    2023-03-10
    المؤلف
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    روابط

    انضم إلى المجتمع

    معجب يناقشون