Windows 下载、安装 Ollama v0.32.5(附安装包OllamaSetup.exe)

发布于 2026/8/5 · 1 阅读
Ollama大语言模型LLM本地部署AI工具开源Windows模型运行GemmaLlama
Ollama 是 GitHub 上最受欢迎的本地大模型运行工具,支持一键运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型。v0.32.5 修复了 MLX Metal 推理质量 bug,提升 NVFP4 模型的输出质量。

封面.png

1. Ollama 简介

Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 175,000 颗星标(Stars),是全球最受关注的 AI 开源项目之一。它于 2023 年推出,核心理念是让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型。凭借超过 5,000 万次的月下载量,Ollama 已成为本地 AI 推理的事实标准,被开发者称为"AI 推理领域的 Docker"。

Ollama 的核心优势:

  • 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
  • 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
  • REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都能直接接入
  • 智能体集成ollama launch 命令可一键启动 Claude Code、OpenClaw、Codex、Copilot 等编程智能体集成
  • 丰富的集成生态:与 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目深度集成
  • 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
  • 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器

2. v0.32.5 版本亮点

此版本为补丁更新,聚焦于 Apple Silicon(MLX)平台的推理质量修复。

2.1 Bug 修复

  • MLX Metal 推理质量修复:修复了一个 MLX Metal 上的 bug,该问题可能降低 NVFP4 量化模型的输出质量,尤其是 Laguna 模型。

3. 整合包内文件说明

本整合包内含安装程序,位于整合包根目录:

Windows安装ollama-v0.32.5(OllamaSetup).zip
├── OllamaSetup.exe   ← 双击运行即可安装
├── Windows安装ollama-v0.32.5(OllamaSetup).pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

4. 安装

双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。安装完成后,Ollama 会作为 Windows 服务在后台运行,系统托盘出现 Ollama 图标。

打开终端(PowerShell 或命令提示符),输入 ollama 验证安装并查看命令帮助:

ollama

4.1 关键环境变量配置

Ollama 的行为通过环境变量控制。Windows 配置方法:右键"此电脑"→ 属性 → 高级系统设置 → 环境变量 → 在"系统变量"中新建或编辑;配置完成后重启 Ollama 服务生效(管理员终端执行 net stop ollamanet start ollama,或从系统托盘退出 Ollama 后重新启动)。

以下是常用变量(参数说明参考主机配置 host/主机配置记录/debian-2/files/ollama/override.conf):

变量 说明 默认值 配置建议值
OLLAMA_HOST Ollama 服务监听地址和端口,决定哪些设备能访问 API。默认仅绑定本机(127.0.0.1),其他设备无法访问;配置 0.0.0.0:11434 后监听所有网卡,局域网内设备可通过服务器 IP 访问 127.0.0.1:11434 0.0.0.0:11434
OLLAMA_MODELS 模型文件的存储目录,决定模型下载到哪里。默认位于用户目录(通常在系统盘),模型动辄几十 GB,容易占满系统盘;建议配置到空间充足的数据盘,便于管理和备份 %USERPROFILE%\.ollama\models D:\ollama\models
OLLAMA_KEEP_ALIVE 模型在内存中保持加载的时长。默认 5 分钟即从内存释放,频繁调用时每次都要重新加载、响应变慢;调大(如 6h)可让模型常驻内存、响应更快,-1 为永不释放,代价是持续占用显存/内存 5m 6h
OLLAMA_NUM_PARALLEL 单个模型同时处理的并发请求数。默认 1(串行),多客户端并发时会排队等待;调为 4 可并行处理多个请求,但显存/内存占用随之上升 1 4
OLLAMA_ORIGINS 允许访问 API 的跨域来源(Origin)白名单,逗号分隔。默认仅放行本机来源,浏览器网页应用从其他域调用会被拦截;配置 * 放行所有来源(生产环境建议枚举具体域名) localhost、127.0.0.1 *
OLLAMA_CONTEXT_LENGTH 默认上下文长度(token 数),决定单次对话能记住多少内容。默认 4K 内存占用低,但长对话、长文档会被截断;调大(如 8K)可承载更长上下文,代价是显存占用和推理耗时上升 4096 8192

上下文长度换算参考:8192=8K、16384=16K、32768=32K、65536=64K、131072=128K、262144=256K token。参考主机(debian-2)配置了 OLLAMA_CONTEXT_LENGTH=8192 以平衡上下文能力与显存占用。

5. 使用

5.1 挑选模型

模型可从 Ollama 模型库挑选:https://ollama.com/library

网页支持搜索、按类别浏览,每个模型页面都提供对应的拉取命令;

也可在终端中直接搜索:

# 搜索模型库中的模型
ollama search qwen

# 查看本地已下载的模型
ollama list

以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:

# 拉取模型(首次使用需下载数 GB)
ollama pull qwen3.5:9b

# 运行模型并进入对话
ollama run qwen3.5:9b

对话中输入 /bye 退出,/help 查看对话内命令。其他常用命令:

# 启动 Claude Code 编程集成
ollama launch claude

# 查看本地模型列表
ollama list

5.2 查看 GPU 与模型运行状态

# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi

# 查看当前加载在内存/显存中的模型
ollama ps

nvidia-smi 实时显示显存占用、GPU 利用率与功耗,可确认模型是否用上 GPU 加速;ollama ps 列出当前驻留的模型及占用大小,便于结合 OLLAMA_KEEP_ALIVE 观察模型释放时机。

5.3 调用 REST API

Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.5:9b",
  "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
  "stream": false
}'