macOS下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-macos-arm64.tar.gz)

1. llama.cpp 简介
llama.cpp 是 Georgi Gerganov 创建的开源项目,用纯 C/C++ 实现大语言模型(LLM)推理引擎,以最小配置和最优性能在本地及云端运行 AI 模型。Gerganov 同时也是 whisper.cpp(语音识别)、stable-diffusion.cpp 以及底层 ggml 张量计算库的作者,这一系列项目构成了当前最活跃的本地 AI 推理开源生态之一。
llama.cpp 的核心理念是"零依赖"——无需 Python 环境、无需复杂的深度学习框架,一个可执行文件即可运行主流大语言模型。这使得它在资源受限的设备上也能高效运行,极大降低了使用大语言模型的门槛。项目自发布以来获得广泛关注,已成为 GitHub 上最受欢迎的 AI 推理项目之一,吸引了大量社区贡献者参与开发,并催生了 ollama、LM Studio、gpt4all 等众多知名下游项目。
核心特点:
- 纯 C/C++ 实现,零外部依赖,编译后即可运行
- Apple Silicon 为第一优先级,通过 ARM NEON、Accelerate 和 Metal 框架深度优化
- 支持 1.5 位到 8 位整数量化,大幅降低内存占用,提升推理速度
- 多 GPU 后端支持:CUDA(NVIDIA)、HIP(AMD)、Vulkan、SYCL(Intel)
- CPU+GPU 混合推理,可运行超出 VRAM 容量的超大模型
- 兼容 OpenAI API 的 HTTP 服务器(llama-server),可替代云端推理服务
- 支持数百种模型架构,包括 LLaMA、Mistral、Qwen、Deepseek、Phi、Gemma 等
2. b10068 版本亮点
该版本为 llama.cpp 的最新构建版本(build b10068)。
本版本主要包含以下更新:
- DFlash K/V 缓存旋转优化(#25823):在使用 K/V 量化时,对注入的 K/V 缓存进行旋转处理,提升了 DFlash 注意力机制的推理质量。由 Georgi Gerganov 联合提交。
此外,该版本提供了覆盖 macOS(arm64/x64)、Linux(x64/arm64/s390x,含 CPU/Vulkan/ROCm/OpenVINO/SYCL 等多种后端)、Windows(CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP)、Android(arm64)以及 iOS(XCFramework)的全平台预编译二进制包。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223S(内含 llama-b10068-bin-macos-arm64.tar.gz、README 中英对照、发布说明中英对照和 LICENSE)。
macOS安装llama.cpp-b10068(llama-b10068-bin-macos-arm64).zip
├── llama-b10068-bin-macos-arm64.tar.gz
├── macOS安装llama.cpp-b10068(llama-b10068-bin-macos-arm64).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE适用硬件:搭载 Apple Silicon 芯片(M1/M2/M3/M4 等系列)的 Mac,运行 macOS。llama.cpp 对 Apple Silicon 进行了深度优化,利用 ARM NEON 指令集、Accelerate 框架和 Metal GPU 后端实现高性能本地推理。
4. 快速开始
解压 llama-b10068-bin-macos-arm64.tar.gz 后,在终端中进入解压目录,即可使用以下命令行工具。
llama.cpp需要 GGUF 格式的模型文件。可从 Hugging Face 下载兼容模型,或使用-hf参数直接下载。
常用命令
# 使用本地模型文件进行对话
llama-cli -m model.gguf
# 直接从 Hugging Face 下载并运行模型
llama-cli -hf ggml-org/gemma-3-1b-it-GGUF
# 启动兼容 OpenAI API 的本地服务器(默认端口 8080)
llama-server -m model.gguf --port 8080
# 启动服务器并支持多用户并行(最多 4 并发)
llama-server -m model.gguf -c 16384 -np 4
# 启用推测性解码加速推理
llama-server -m model.gguf -md draft.gguf
# 运行推理性能基准测试
llama-bench -m model.gguf
# 测量模型在文本上的困惑度
llama-perplexity -m model.gguf -f file.txt