ollama pull 一敲,几千个模型摆在面前,反而不知道拉哪个。选型其实只取决于两件事:你的显存能装下多大的模型,以及你拿它干什么。这篇把 Ollama 模型库里值得优先试的型号按显存分好档,给出一套可以直接照抄的选择流程,最后附几个高频追问的答案。
场景与需求
先对号入座,本地跑模型的高频需求就五类:
| 用途 | 典型场景 | 对模型的核心要求 |
|---|---|---|
| 日常问答 / 中文写作 | 整理资料、写初稿、翻译润色 | 中文能力强,回答稳定 |
| 推理 / 数学 | 解题、分析、需要思考链 | 带推理训练的模型 |
| 写代码 | 补全、解释、小工具脚本 | 代码语料占比高 |
| 看图 | 截图理解、图片描述 | 视觉多模态 |
| 向量检索(RAG) | 本地知识库的嵌入向量化 | 专用 embedding 模型 |
同一块显卡装不下所有能力——显存只够伺候一个主对话模型加一个 embedding 模型,这正是要按显存选型的原因。
候选方案
Ollama 官方库里口碑扎实、值得优先试的型号(括号内为可用的参数量档位):
| 模型 | 参数档位 | 上下文能力 | 长项 |
|---|---|---|---|
| qwen2.5 | 0.5b / 1.5b / 3b / 7b / 14b / 32b / 72b | 128K 级 | 中文、通用,中文场景第一梯队,档位全 |
| qwen2.5-coder | 1.5b / 7b / 14b / 32b | 128K 级 | 写代码专项,同尺寸下代码能力突出 |
| deepseek-r1 | 1.5b / 7b / 8b / 14b / 32b / 70b | 128K 级 | 蒸馏版,回答前先输出思考过程,数学与逻辑强 |
| llama3.1 | 8b / 70b | 128K 级 | Meta 系通用标杆,英文任务与工具调用稳 |
| llama3.2 | 1b / 3b | 128K 级 | 显存紧张时的选择,简单任务够用 |
| gemma3 | 1b / 4b / 12b / 27b | 128K 级 | Google 系,小尺寸质量好,多语言 |
| phi4 | 14b | 16K 级 | 微软出品,14B 档位质量不错 |
| mistral | 7b | 32K 级 | 老牌 7B,欧洲语系表现好 |
| llava | 7b / 13b / 34b | 32K 级 | 老牌看图模型 |
| llama3.2-vision | 11b / 90b | 128K 级 | 视觉多模态,11B 档 12GB 卡可跑 |
| nomic-embed-text / bge-m3 | 约 0.1~1GB 量级 | — | embedding 专用,RAG 知识库标配,bge-m3 对中文检索友好 |
注意”上下文能力”是模型原生支持的上限,不代表开箱即得:Ollama 默认上下文长度只有 2048,要显式调大才能吃满,显存账也要重算,见显存测算那篇。
测算模型与假设
选型表按下面的口径估算,三条假设先说清楚:
- 量化假设:Ollama 库默认分发 4bit 量化包(Q4_K_M 这一类),这是消费级硬件跑大模型的通行做法——用约四分之一的存储换轻微精度损失。模型文件体积的经验估算:
体积(GB) ≈ 参数量(B) × 0.55~0.6。1.5B 约 1.1GB,7B 级约 4.7GB,14B 约 9GB,32B 约 19~20GB,70B 约 40GB 出头。 - 显存假设:运行显存 ≈ 模型文件体积 + KV cache(随上下文长度增长)+ 约 1GB 的框架与系统开销。上下文不大时可以粗记三档:7B 级约 5
8GB 显存、14B 约 912GB、32B 约 20~24GB。 - 速度假设:模型全部装进显存才算”流畅”档;装不下时 Ollama 会自动把放不下的层卸载到 CPU 内存,能跑,但速度慢一个量级【待补:本机全显存与部分卸载的实测速度对比】。
测算结果表
按显存分档的选型速查(“流畅”= 全部进显存;“勉强”= 部分层卸载,明显变慢):
| 显存档 | 典型硬件 | 流畅跑 | 勉强跑 |
|---|---|---|---|
| 2~4GB | 核显、老独显 | qwen2.5:1.5b、llama3.2:1b、deepseek-r1:1.5b | qwen2.5:3b |
| 4~6GB | 入门独显 | qwen2.5:3b、llama3.2:3b、gemma3:4b | qwen2.5:7b(短上下文) |
| 8GB | 4060 级 8GB 卡 | qwen2.5:7b、llama3.1:8b、deepseek-r1:7b/8b、qwen2.5-coder:7b | gemma3:12b |
| 12GB | 3060 12G / 4070 级 | qwen2.5:14b、deepseek-r1:14b、phi4:14b、gemma3:12b、llama3.2-vision:11b | qwen2.5:32b(重度卸载,不建议) |
| 16GB | 4060Ti 16G / 4080 级 | 14B 全家 + 较长上下文 | gemma3:27b |
| 24GB | 3090 / 4090 级 | qwen2.5:32b、deepseek-r1:32b、qwen2.5-coder:32b、gemma3:27b | 70B 级(需更低量化或双卡) |
| 48GB+ | A6000、双卡 | llama3.1:70b、qwen2.5:72b、deepseek-r1:70b | — |
embedding 模型单独说:nomic-embed-text、bge-m3 只有几百 MB 到 1GB 出头,与对话模型并行部署不冲突,RAG 场景两个都要装。
决策框架
拿不准时按顺序问自己五个问题:
- 先定用途,再定参数量。 中文写作选 qwen2.5,代码选 qwen2.5-coder,要思考链选 deepseek-r1,这三个先锁死,参数量再按显存档挑。
- 显存能装多大就先试多大。 同用途下大参数量的收益是实打实的,12GB 卡没必要从 7b 起步,直接 14b。
- 降参数量,别降量化。 4bit 已是默认档,再往 Q3 压,质量下滑开始能被感知;宁可跑小一号模型的 Q4,不跑大一号的 Q3。
- 同家族先跑小尺寸验证管线。 命令、上下文、接口都调通后再换大尺寸,只改一个 tag。
- 对话模型与 embedding 模型分开考虑。 对话模型挑能力,embedding 模型挑语言匹配度,中文知识库直接上 bge-m3。
照抄的起步命令(12GB 显存档示例):
ollama pull qwen2.5:14b # 中文主力
ollama pull qwen2.5-coder:14b # 写代码
ollama pull deepseek-r1:14b # 要推理链时换它
ollama pull bge-m3 # RAG 向量化
ollama run qwen2.5:14b

三个高频追问
- deepseek-r1 的”思考”很费时间,能关吗? 思考过程是这类推理模型的行为模式,不是能一键关掉的开关;可选办法是换回普通指令模型(qwen2.5),或把 num_predict 调小限制输出预算——但注意思考文本本身也占这个预算,设太小会导致”想了没说”就停。
- 一块卡能同时驻留多个大模型吗? 显存不够时 Ollama 会自动卸载先前的模型给后来的腾位,来回切换有加载等待。模型默认在内存里驻留 5 分钟(OLLAMA_KEEP_ALIVE 可调),高频轮换场景把驻留时间拉长。
- 14B 和 32B 日常感知差距大吗? 复杂推理与长文写作上 32B 明显更稳,简单问答差距不大;12GB 卡硬上 32B 属于”重度卸载”,速度掉到无法日用,不如 14B 流畅。
我的最终选择
我的主力组合与实测数据:【待补:显卡型号与显存、常驻模型组合、各模型实测生成速度】。给不出显卡前的通用建议:12GB 卡用 qwen2.5:14b 当主力、deepseek-r1:14b 备用;24GB 卡直接 32b 三件套加 bge-m3,基本覆盖个人开发者的全部本地需求。
装好之后把模型接进代码或工作流,看Ollama API 调用与Dify 接 Ollama;下载太慢先看镜像与代理加速。