这个教程解决什么问题
读完这篇你能做到:装好 Ollama,解决”安装包下载慢、模型拉取慢”两个国内高频问题,跑起第一个本地模型,并用 API 方式调用——为后面接 Cherry Studio、Dify、n8n 打底。
先说清定位:Ollama 是”本地模型的运行器”,不生产模型,也不带好看界面——界面要靠 Open WebUI 或 Cherry Studio 补,它只负责把模型稳定跑起来、把 API 开出来。
环境与版本
# 待补你的实际环境
显卡与显存:【待补】
Ollama:【待补:版本号】
第一步:安装
官网 ollama.com 下载对应平台安装包,Windows 双击安装,macOS 拖进 Applications。Linux 用官方脚本一行装好:
curl -fsSL https://ollama.com/install.sh | sh
安装包本体不大,国内偶尔慢;真正的慢在第二步拉模型。Windows 装完任务栏会出现常驻的羊驼图标——它就是服务本体,关掉图标等于停服务。macOS 注意:M 系列芯片直接跑,Intel 机型已不被新版支持,别硬装。
第二步:跑第一个模型
ollama run qwen3:8b
首次运行会自动拉取模型权重,几 GB 起步——90% 的”Ollama 卡住”都发生在这一步(下载进度在终端实时显示,中断了重跑同一命令会自动续传)。加速两条路:
- 终端走代理:给 Ollama 服务设置
HTTP_PROXY/HTTPS_PROXY环境变量后重启服务(Windows 在系统环境变量里加,改完重启 Ollama 才生效;可用 PowerShell 的$env:HTTP_PROXY先临时测试); - 国内镜像源:在支持镜像的模型站下载 GGUF 权重,再用 Modelfile 导入。
还有个先跑通再说的小技巧:先拉个 0.5B~3B 的小模型(几百 MB)把全流程走通,确认显卡、API 都正常后,再去下大模型——排错时变量越少越好。
【待补:两种方案你实测的下载速度对比】
第三步:模型存哪与迁移(Windows 高频问题)
模型默认存在 C 盘用户目录。系统盘紧张的话,设置环境变量后重启 Ollama 服务即可迁移:
变量名:OLLAMA_MODELS
变量值:D:\ollama\models
用 ollama list 验证已有模型正常识别。
第四步:API 调用
Ollama 自带 REST API,同时提供 OpenAI 兼容端点,现有代码改 base_url 就能用:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen3:8b","messages":[{"role":"user","content":"你好"}]}'
Python 侧用 openai SDK 的写法:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
api_key 随便填,本地不校验。这个端点就是 Cherry Studio、Dify、n8n 接本地模型时的标准入口。
想要界面:五分钟接一个 Open WebUI
命令行聊天终究不便,最流行的搭档是 Open WebUI,一条 Docker 命令:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
浏览器开 http://localhost:3000,注册个本地账号就能像用网页版一样对话,还能管理多个模型。
跑什么模型:显存选型速查
| 模型档位 | 量化后显存(约) | 显卡参考 |
|---|---|---|
| 7B/8B | 5~8 GB | 入门独显 |
| 14B | 9~12 GB | 主流 12G 卡 |
| 32B | 20~24 GB | 高端 24G 卡 |
| 70B | 40 GB 以上 | 多卡/服务器 |
原则:宁可跑小一档的满速,不要跑大半档的龟速——出字速度低于每秒 10 个字会明显影响使用体验。选型前先 nvidia-smi 看一眼真实显存上限,别凭记忆猜。
日常命令速查
ollama list # 已有模型清单
ollama ps # 当前载入模型与显存占用
ollama stop <名> # 卸载模型释放显存
ollama rm <名> # 删除模型
多模型轮着用时,显存被占满最快的释放手段就是 ollama stop。
高频问答
- 和 vLLM、llama.cpp 什么关系:同一生态不同定位——Ollama 管理省心适合个人,vLLM 高并发性能强适合服务端,按场景选;
- 只支持 N 卡吗:AMD 与部分集成显卡也有支持,具体查官方支持矩阵;
- 驱动有什么要求:N 卡能跑新游戏就能跑 Ollama,拿不准就装最新驱动;
- 能完全离线吗:能。权重本地导入后运行全程不联网,这也是它做内网工具后端的原因。
离线搬运模型:从已有机器 ollama show 模型名 --modelfile 导出配置,把权重文件一起拷走,新机器上 Modelfile 的 FROM 指向本地文件再 ollama create,全程不需要外网。
常见坑与解法
坑 1:没走 GPU
ollama ps 看 PROCESSOR 列,显示 100% CPU 就没吃到显卡。先更新显卡驱动,再看启动日志有无 CUDA 相关报错。【待补:你的排查过程】
坑 2:显存不够被溢出
超出显存会部分落到内存,速度骤降。判断方法:跑模型时看 ollama ps 的 CPU/GPU 分配比例,出现明显 CPU 占比就是溢出——降一档量化或换小模型(零星的 CPU 调度属正常现象,别误判)。
坑 3:端口占用
11434 被其他程序占用会启动失败,改 OLLAMA_HOST 换端口即可。报错信息里通常会写明冲突,netstat -ano | findstr 11434 能查到占用进程。
坑 4:别的设备访问不到
Ollama 默认只监听本机。想给局域网用,设环境变量 OLLAMA_HOST=0.0.0.0 后重启服务;暴露到公网前务必套一层鉴权或反代。
最终效果与验证
ollama list 列出模型、对话流式输出、curl 调用返回 JSON——三项都过即部署完成。最后测一把速度:问一个长问题,观感不卡顿即达标;卡顿就回到显存选型那节降档处理。到这里,安装、加速、迁移、API、界面五件事全部闭环——本地大模型这套底座就算搭完了。

【待补:模型列表与对话截图】