Last updated

图书
llama.cpp
Georgi Gerganov, Diego Devesa
2023
概览
2023年3月10日,Georgi Gerganov 在 GitHub 上提交了 llama.cpp 的第一个提交。这个用 C 和 C++ 编写的库旨在实现一个目标:在没有 GPU 的情况下,在笔记本电脑的 CPU 上运行 Meta 的 LLaMA 模型。几周内,它就获得了数千颗星,并且开发者社区不断壮大,进一步拓展了它的能力。
核心创新在于量化。通过使用 GGUF 格式将模型权重从 32 位浮点数压缩为 4 位或 8 位整数,llama.cpp 将内存需求降低了 75% 或更多。一个需要 28 GB 显存(在 GPU 上)的 70 亿参数模型,现在可以在不到 6 GB 的系统内存中运行。GGUF 格式还将分词器、词汇表和聊天模板打包到单个文件中,使模型分发变得非常简单。
llama.cpp 支持异常广泛的硬件:支持 AVX2 的 x86 CPU、通过 Metal 支持的 Apple Silicon、通过 CUDA 支持的 NVIDIA GPU、通过 hipBLAS 支持的 AMD GPU、通过 SYCL 支持的 Intel GPU,甚至支持 Vulkan。该项目提供了用于生成、基准测试和模型转换的命令行工具,以及一个轻量级的 HTTP 服务器。截至 2025 年,它拥有超过 900 名贡献者和 69,000 个 GitHub 星标。像 Ollama 和 LM Studio 这样的工具直接构建在 llama.cpp 之上,使非技术用户也能轻松进行本地 LLM 推理。该库已成为在消费级硬件上运行大型语言模型的事实标准,实现了无需云依赖的私密、经济高效的 AI 实验。
关键词
llama.cppGGUF量化本地 LLM推理开源Georgi GerganovCPU 推理机器学习
图书信息
- 作者
- Georgi Gerganov, Diego Devesa
- 出版
- 2023-03-10
- 作者
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
加入社区
位粉丝正在讨论