这个教程解决什么问题

读完这篇你能做到:装好 Ollama,解决”安装包下载慢、模型拉取慢”两个国内高频问题,跑起第一个本地模型,并用 API 方式调用——为后面接 Cherry Studio、Dify、n8n 打底。

先说清定位:Ollama 是”本地模型的运行器”,不生产模型,也不带好看界面——界面要靠 Open WebUI 或 Cherry Studio 补,它只负责把模型稳定跑起来、把 API 开出来。

环境与版本

# 待补你的实际环境
显卡与显存:【待补】
Ollama:【待补:版本号】

第一步:安装

官网 ollama.com 下载对应平台安装包,Windows 双击安装,macOS 拖进 Applications。Linux 用官方脚本一行装好:

curl -fsSL https://ollama.com/install.sh | sh

安装包本体不大,国内偶尔慢;真正的慢在第二步拉模型。Windows 装完任务栏会出现常驻的羊驼图标——它就是服务本体,关掉图标等于停服务。macOS 注意:M 系列芯片直接跑,Intel 机型已不被新版支持,别硬装。

第二步:跑第一个模型

ollama run qwen3:8b

首次运行会自动拉取模型权重,几 GB 起步——90% 的”Ollama 卡住”都发生在这一步(下载进度在终端实时显示,中断了重跑同一命令会自动续传)。加速两条路:

  1. 终端走代理:给 Ollama 服务设置 HTTP_PROXY/HTTPS_PROXY 环境变量后重启服务(Windows 在系统环境变量里加,改完重启 Ollama 才生效;可用 PowerShell 的 $env:HTTP_PROXY 先临时测试);
  2. 国内镜像源:在支持镜像的模型站下载 GGUF 权重,再用 Modelfile 导入。

还有个先跑通再说的小技巧:先拉个 0.5B~3B 的小模型(几百 MB)把全流程走通,确认显卡、API 都正常后,再去下大模型——排错时变量越少越好。

【待补:两种方案你实测的下载速度对比】

第三步:模型存哪与迁移(Windows 高频问题)

模型默认存在 C 盘用户目录。系统盘紧张的话,设置环境变量后重启 Ollama 服务即可迁移:

变量名:OLLAMA_MODELS
变量值:D:\ollama\models

ollama list 验证已有模型正常识别。

第四步:API 调用

Ollama 自带 REST API,同时提供 OpenAI 兼容端点,现有代码改 base_url 就能用:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3:8b","messages":[{"role":"user","content":"你好"}]}'

Python 侧用 openai SDK 的写法:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
    model="qwen3:8b",
    messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)

api_key 随便填,本地不校验。这个端点就是 Cherry Studio、Dify、n8n 接本地模型时的标准入口。

想要界面:五分钟接一个 Open WebUI

命令行聊天终究不便,最流行的搭档是 Open WebUI,一条 Docker 命令:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

浏览器开 http://localhost:3000,注册个本地账号就能像用网页版一样对话,还能管理多个模型。

跑什么模型:显存选型速查

模型档位量化后显存(约)显卡参考
7B/8B5~8 GB入门独显
14B9~12 GB主流 12G 卡
32B20~24 GB高端 24G 卡
70B40 GB 以上多卡/服务器

原则:宁可跑小一档的满速,不要跑大半档的龟速——出字速度低于每秒 10 个字会明显影响使用体验。选型前先 nvidia-smi 看一眼真实显存上限,别凭记忆猜。

日常命令速查

ollama list        # 已有模型清单
ollama ps          # 当前载入模型与显存占用
ollama stop <>   # 卸载模型释放显存
ollama rm <>     # 删除模型

多模型轮着用时,显存被占满最快的释放手段就是 ollama stop

高频问答

  • 和 vLLM、llama.cpp 什么关系:同一生态不同定位——Ollama 管理省心适合个人,vLLM 高并发性能强适合服务端,按场景选;
  • 只支持 N 卡吗:AMD 与部分集成显卡也有支持,具体查官方支持矩阵;
  • 驱动有什么要求:N 卡能跑新游戏就能跑 Ollama,拿不准就装最新驱动;
  • 能完全离线吗:能。权重本地导入后运行全程不联网,这也是它做内网工具后端的原因。

离线搬运模型:从已有机器 ollama show 模型名 --modelfile 导出配置,把权重文件一起拷走,新机器上 Modelfile 的 FROM 指向本地文件再 ollama create,全程不需要外网。

常见坑与解法

坑 1:没走 GPU

ollama ps 看 PROCESSOR 列,显示 100% CPU 就没吃到显卡。先更新显卡驱动,再看启动日志有无 CUDA 相关报错。【待补:你的排查过程】

坑 2:显存不够被溢出

超出显存会部分落到内存,速度骤降。判断方法:跑模型时看 ollama ps 的 CPU/GPU 分配比例,出现明显 CPU 占比就是溢出——降一档量化或换小模型(零星的 CPU 调度属正常现象,别误判)。

坑 3:端口占用

11434 被其他程序占用会启动失败,改 OLLAMA_HOST 换端口即可。报错信息里通常会写明冲突,netstat -ano | findstr 11434 能查到占用进程。

坑 4:别的设备访问不到

Ollama 默认只监听本机。想给局域网用,设环境变量 OLLAMA_HOST=0.0.0.0 后重启服务;暴露到公网前务必套一层鉴权或反代。

最终效果与验证

ollama list 列出模型、对话流式输出、curl 调用返回 JSON——三项都过即部署完成。最后测一把速度:问一个长问题,观感不卡顿即达标;卡顿就回到显存选型那节降档处理。到这里,安装、加速、迁移、API、界面五件事全部闭环——本地大模型这套底座就算搭完了。

Ollama 本地模型对话效果

【待补:模型列表与对话截图】

相关阅读