AI/智能体/模型工具 · C++

ggml-org/llama.cpp

用 C/C++ 在本地高效跑大模型推理的核心引擎

存量榜 #78 已读 README 并重写
累计排名 #78 Stars Top 100
累计 Stars 118,943 当前记录
Forks 20,144 榜单记录
Fork / Star 16.9% 社区复用强度
Open Issues 698 维护压力参考
最后提交 2026-07-01 Excel 记录

它是什么

llama.cpp 是一个用 C/C++ 实现的 LLM inference 项目,核心目标是把大模型推理做成可直接落地的底层能力。README 里能看到它同时覆盖库 API、服务器 API、WebUI 和浏览器端推理入口,说明它不是单一脚本,而是一套围绕模型运行的工具与接口集合。它主要面向要把模型接入应用、服务或开发工作流的开发者。

为什么值得关注

它在 Stars 榜单中排名靠前,说明它是大模型本地推理生态里的高关注项目。README 还持续列出 API 变更、WebUI、REST API、Hugging Face 缓存和 WebGPU 等更新,体现出项目在持续扩展入口和兼容性。

核心能力

  • 用 C/C++ 提供 LLM 推理能力
  • 提供 libllama API 供程序调用
  • 提供 llama-server REST API 服务
  • 支持新的 WebUI 操作界面

适合谁用

  • 需要本地或嵌入式大模型推理的开发者
  • 要把模型能力接到服务接口里的工程师
  • 做 AI 辅助编码或 FIM 补全工具的人
  • 使用 Hugging Face 模型生态的用户

使用前注意

  • README 提到有 recent API changes,接入时要先看接口变更
  • 模型用 -hf 下载后会进入标准 Hugging Face cache 目录
  • 项目提供 llama-server REST API,部署时要按服务方式理解
  • README 中有 WebUI、浏览器 WebGPU 等不同入口,选型前要分清使用场景

README 证据

  • README 开头直接写明:LLM inference in C/C++
  • 列出了 libllama API 和 llama-server REST API 的变更记录
  • 提到模型下载会迁移到标准 Hugging Face cache 目录
  • 提到有新的 WebUI 指南和运行 gpt-oss 的指南