Windows 下载、安装 Ollama v0.32.5(附安装包OllamaSetup.exe)
文章目录

1. Ollama 简介
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 175,000 颗星标(Stars),是全球最受关注的 AI 开源项目之一。它于 2023 年推出,核心理念是让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型。凭借超过 5,000 万次的月下载量,Ollama 已成为本地 AI 推理的事实标准,被开发者称为"AI 推理领域的 Docker"。
Ollama 的核心优势:
- 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
- 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
- REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认
localhost:11434),任何支持 OpenAI 的客户端都能直接接入 - 智能体集成:
ollama launch命令可一键启动 Claude Code、OpenClaw、Codex、Copilot 等编程智能体集成 - 丰富的集成生态:与 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目深度集成
- 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
- 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器
2. v0.32.5 版本亮点
此版本为补丁更新,聚焦于 Apple Silicon(MLX)平台的推理质量修复。
2.1 Bug 修复
- MLX Metal 推理质量修复:修复了一个 MLX Metal 上的 bug,该问题可能降低 NVFP4 量化模型的输出质量,尤其是 Laguna 模型。
3. 整合包内文件说明
本整合包内含安装程序,位于整合包根目录:
Windows安装ollama-v0.32.5(OllamaSetup).zip
├── OllamaSetup.exe ← 双击运行即可安装
├── Windows安装ollama-v0.32.5(OllamaSetup).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE4. 安装
双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。安装完成后,Ollama 会作为 Windows 服务在后台运行,系统托盘出现 Ollama 图标。
打开终端(PowerShell 或命令提示符),输入 ollama 验证安装并查看命令帮助:
ollama4.1 关键环境变量配置
Ollama 的行为通过环境变量控制。Windows 配置方法:右键"此电脑"→ 属性 → 高级系统设置 → 环境变量 → 在"系统变量"中新建或编辑;配置完成后重启 Ollama 服务生效(管理员终端执行 net stop ollama 后 net start ollama,或从系统托盘退出 Ollama 后重新启动)。
以下是常用变量(参数说明参考主机配置 host/主机配置记录/debian-2/files/ollama/override.conf):
| 变量 | 说明 | 默认值 | 配置建议值 |
|---|---|---|---|
OLLAMA_HOST |
Ollama 服务监听地址和端口,决定哪些设备能访问 API。默认仅绑定本机(127.0.0.1),其他设备无法访问;配置 0.0.0.0:11434 后监听所有网卡,局域网内设备可通过服务器 IP 访问 |
127.0.0.1:11434 |
0.0.0.0:11434 |
OLLAMA_MODELS |
模型文件的存储目录,决定模型下载到哪里。默认位于用户目录(通常在系统盘),模型动辄几十 GB,容易占满系统盘;建议配置到空间充足的数据盘,便于管理和备份 | %USERPROFILE%\.ollama\models |
D:\ollama\models |
OLLAMA_KEEP_ALIVE |
模型在内存中保持加载的时长。默认 5 分钟即从内存释放,频繁调用时每次都要重新加载、响应变慢;调大(如 6h)可让模型常驻内存、响应更快,-1 为永不释放,代价是持续占用显存/内存 |
5m |
6h |
OLLAMA_NUM_PARALLEL |
单个模型同时处理的并发请求数。默认 1(串行),多客户端并发时会排队等待;调为 4 可并行处理多个请求,但显存/内存占用随之上升 |
1 |
4 |
OLLAMA_ORIGINS |
允许访问 API 的跨域来源(Origin)白名单,逗号分隔。默认仅放行本机来源,浏览器网页应用从其他域调用会被拦截;配置 * 放行所有来源(生产环境建议枚举具体域名) |
localhost、127.0.0.1 |
* |
OLLAMA_CONTEXT_LENGTH |
默认上下文长度(token 数),决定单次对话能记住多少内容。默认 4K 内存占用低,但长对话、长文档会被截断;调大(如 8K)可承载更长上下文,代价是显存占用和推理耗时上升 | 4096 |
8192 |
上下文长度换算参考:8192=8K、16384=16K、32768=32K、65536=64K、131072=128K、262144=256K token。参考主机(debian-2)配置了 OLLAMA_CONTEXT_LENGTH=8192 以平衡上下文能力与显存占用。
5. 使用
5.1 挑选模型
模型可从 Ollama 模型库挑选:https://ollama.com/library
网页支持搜索、按类别浏览,每个模型页面都提供对应的拉取命令;
也可在终端中直接搜索:
# 搜索模型库中的模型
ollama search qwen
# 查看本地已下载的模型
ollama list以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:
# 拉取模型(首次使用需下载数 GB)
ollama pull qwen3.5:9b
# 运行模型并进入对话
ollama run qwen3.5:9b对话中输入 /bye 退出,/help 查看对话内命令。其他常用命令:
# 启动 Claude Code 编程集成
ollama launch claude
# 查看本地模型列表
ollama list5.2 查看 GPU 与模型运行状态
# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi
# 查看当前加载在内存/显存中的模型
ollama psnvidia-smi 实时显示显存占用、GPU 利用率与功耗,可确认模型是否用上 GPU 加速;ollama ps 列出当前驻留的模型及占用大小,便于结合 OLLAMA_KEEP_ALIVE 观察模型释放时机。
5.3 调用 REST API
Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:
curl http://localhost:11434/api/chat -d '{
"model": "qwen3.5:9b",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"stream": false
}'