Windows下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-win-cuda-12.4-x64.zip)

1. llama.cpp 简介
llama.cpp 是使用纯 C/C++ 实现的大语言模型(LLM)推理引擎,由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建。最初是作为一个周末项目,目标是在 MacBook 上运行 Meta 的 LLaMA 模型,无需 Python、PyTorch 或 CUDA 依赖。如今,它已成为全球最受欢迎的本地 LLM 推理框架之一,截至 2026 年中,GitHub Stars 突破 11.7 万,拥有超过 700 位贡献者和近 2 万个 fork。
2026 年 2 月,Gerganov 与核心团队成员(Xuan-Son Nguyen、Aleksander Grygier)加入 Hugging Face 成为全职员工,llama.cpp 仓库也从 ggerganov/llama.cpp 迁移至 ggml-org/llama.cpp,但项目始终保持 100% 开源(MIT 许可证)和完全的技术自主权。llama.cpp 是 Ollama、LM Studio、GPT4All、LocalAI 等数十个知名本地 AI 工具的底层推理引擎,生态影响力极其广泛。
llama.cpp 的核心目标是以最低的设置成本在各种硬件上实现最先进的 LLM 推理性能——无论是在本地还是在云端。其核心特色包括:
- 零依赖:纯 C/C++ 实现,无需 Python、PyTorch 等环境,下载即可运行
- 广泛硬件支持:Apple Silicon(ARM NEON、Accelerate、Metal)、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Intel GPU(SYCL、OpenVINO)、Vulkan、WebGPU 等
- 灵活量化:支持 1.5 位至 8 位整数量化,显著降低内存占用和提升推理速度
- CPU+GPU 混合推理:支持超出显存容量的大模型部分加速
- OpenAI API 兼容服务:通过
llama-server一键启动与 OpenAI API 兼容的 HTTP 服务 - 庞大模型生态:支持 LLaMA、Mistral、Qwen、Deepseek、Gemma、Phi 等近百种模型架构的 GGUF 格式
2. b10068 版本亮点
llama.cpp 采用持续构建(build number)版本号体系,b10068 发布于 2026-07-18,主要包含以下更新:
- DFlash 注入 K/V 缓存旋转:修复了在使用 K/V 量化时,DFlash 注意力机制中注入的 K/V 缓存需要旋转的问题,提升了量化场景下的推理正确性。
本整合包选用 llama-b10068-bin-win-cuda-12.4-x64.zip,适用于 Windows x64 系统,使用 NVIDIA CUDA 12.4 后端进行 GPU 加速推理。
环境要求:需安装 NVIDIA CUDA Toolkit 12.4 或更新版本,并配备支持 CUDA 的 NVIDIA 显卡(计算能力 ≥ 5.0,推荐 GTX 10 系列及以上)。若未安装 CUDA 或使用非 NVIDIA 显卡,请改用 CPU 版本或 Vulkan 版本。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223T(内含 llama-b10068-bin-win-cuda-12.4-x64.zip、README 中英对照、发布说明中英对照和 LICENSE)。
Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).zip
├── llama-b10068-bin-win-cuda-12.4-x64.zip ← 官方预编译包(解压后为各工具 .exe)
├── Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE适用显卡:本整合包内为 CUDA 版本,仅适用于 NVIDIA 显卡(GTX 10 系列及以上,计算能力 ≥ 5.0)。若您使用 AMD 显卡,请选用 HIP(Radeon)版本;若使用 Intel 显卡,请选用 SYCL 或 OpenVINO 版本;若无独立显卡或使用其他品牌,请选用 CPU 或 Vulkan 版本。
4. 快速开始
将整合包根目录中的 llama-b10068-bin-win-cuda-12.4-x64.zip 解压到任意目录,即可得到以下命令行工具:
| 工具 | 用途 |
|---|---|
llama-cli.exe |
命令行对话推理 |
llama-server.exe |
OpenAI API 兼容 HTTP 服务 |
llama-perplexity.exe |
模型困惑度评测 |
llama-bench.exe |
推理性能基准测试 |
llama-simple.exe |
最小推理示例 |
解压后,打开命令提示符(cmd)或 PowerShell,进入解压目录,执行以下常用命令:
# 使用本地 GGUF 模型文件进行对话
llama-cli -m my_model.gguf
# 直接从 Hugging Face 下载并运行模型
llama-cli -hf ggml-org/gemma-3-1b-it-GGUF
# 启动 OpenAI 兼容 API 服务(默认端口 8080)
llama-server -m my_model.gguf --port 8080
# 启动服务并支持多用户并行请求
llama-server -m my_model.gguf -c 16384 -np 4
# 使用推测解码加速推理
llama-server -m model.gguf -md draft.gguf
# 运行性能基准测试
llama-bench -m my_model.gguf
# 使用自定义语法约束 JSON 输出
llama-cli -m my_model.gguf -n 256 --grammar-file grammars/json.gbnf提示:模型文件(.gguf 格式)可从 Hugging Face GGUF 模型库 获取。也可通过
-hf参数直接从 Hugging Face 下载。