AI/智能体/模型工具 · C++
ggml-org/llama.cpp
用 C/C++ 在本地高效跑大模型推理的核心引擎
存量榜 #78
已读 README 并重写
累计排名
#78
Stars Top 100
累计 Stars
118,943
当前记录
Forks
20,144
榜单记录
Fork / Star
16.9%
社区复用强度
Open Issues
698
维护压力参考
最后提交
2026-07-01
Excel 记录
它是什么
llama.cpp 是一个用 C/C++ 实现的 LLM inference 项目,核心目标是把大模型推理做成可直接落地的底层能力。README 里能看到它同时覆盖库 API、服务器 API、WebUI 和浏览器端推理入口,说明它不是单一脚本,而是一套围绕模型运行的工具与接口集合。它主要面向要把模型接入应用、服务或开发工作流的开发者。
为什么值得关注
它在 Stars 榜单中排名靠前,说明它是大模型本地推理生态里的高关注项目。README 还持续列出 API 变更、WebUI、REST API、Hugging Face 缓存和 WebGPU 等更新,体现出项目在持续扩展入口和兼容性。
核心能力
- 用 C/C++ 提供 LLM 推理能力
- 提供 libllama API 供程序调用
- 提供 llama-server REST API 服务
- 支持新的 WebUI 操作界面
适合谁用
- 需要本地或嵌入式大模型推理的开发者
- 要把模型能力接到服务接口里的工程师
- 做 AI 辅助编码或 FIM 补全工具的人
- 使用 Hugging Face 模型生态的用户
使用前注意
- README 提到有 recent API changes,接入时要先看接口变更
- 模型用 -hf 下载后会进入标准 Hugging Face cache 目录
- 项目提供 llama-server REST API,部署时要按服务方式理解
- README 中有 WebUI、浏览器 WebGPU 等不同入口,选型前要分清使用场景
README 证据
- README 开头直接写明:LLM inference in C/C++
- 列出了 libllama API 和 llama-server REST API 的变更记录
- 提到模型下载会迁移到标准 Hugging Face cache 目录
- 提到有新的 WebUI 指南和运行 gpt-oss 的指南