Last updated
    llama.cpp
    图书

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023
    社区

    概览

    2023年3月10日,Georgi Gerganov 在 GitHub 上提交了 llama.cpp 的第一个提交。这个用 C 和 C++ 编写的库旨在实现一个目标:在没有 GPU 的情况下,在笔记本电脑的 CPU 上运行 Meta 的 LLaMA 模型。几周内,它就获得了数千颗星,并且开发者社区不断壮大,进一步拓展了它的能力。

    核心创新在于量化。通过使用 GGUF 格式将模型权重从 32 位浮点数压缩为 4 位或 8 位整数,llama.cpp 将内存需求降低了 75% 或更多。一个需要 28 GB 显存(在 GPU 上)的 70 亿参数模型,现在可以在不到 6 GB 的系统内存中运行。GGUF 格式还将分词器、词汇表和聊天模板打包到单个文件中,使模型分发变得非常简单。

    llama.cpp 支持异常广泛的硬件:支持 AVX2 的 x86 CPU、通过 Metal 支持的 Apple Silicon、通过 CUDA 支持的 NVIDIA GPU、通过 hipBLAS 支持的 AMD GPU、通过 SYCL 支持的 Intel GPU,甚至支持 Vulkan。该项目提供了用于生成、基准测试和模型转换的命令行工具,以及一个轻量级的 HTTP 服务器。截至 2025 年,它拥有超过 900 名贡献者和 69,000 个 GitHub 星标。像 Ollama 和 LM Studio 这样的工具直接构建在 llama.cpp 之上,使非技术用户也能轻松进行本地 LLM 推理。该库已成为在消费级硬件上运行大型语言模型的事实标准,实现了无需云依赖的私密、经济高效的 AI 实验。

    关键词

    llama.cppGGUF量化本地 LLM推理开源Georgi GerganovCPU 推理机器学习

    图书信息

    作者
    Georgi Gerganov, Diego Devesa
    出版
    2023-03-10
    作者
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    链接

    加入社区

    位粉丝正在讨论