ollama pull 一敲,几千个模型摆在面前,反而不知道拉哪个。选型其实只取决于两件事:你的显存能装下多大的模型,以及你拿它干什么。这篇把 Ollama 模型库里值得优先试的型号按显存分好档,给出一套可以直接照抄的选择流程,最后附几个高频追问的答案。

场景与需求

先对号入座,本地跑模型的高频需求就五类:

用途典型场景对模型的核心要求
日常问答 / 中文写作整理资料、写初稿、翻译润色中文能力强,回答稳定
推理 / 数学解题、分析、需要思考链带推理训练的模型
写代码补全、解释、小工具脚本代码语料占比高
看图截图理解、图片描述视觉多模态
向量检索(RAG)本地知识库的嵌入向量化专用 embedding 模型

同一块显卡装不下所有能力——显存只够伺候一个主对话模型加一个 embedding 模型,这正是要按显存选型的原因。

候选方案

Ollama 官方库里口碑扎实、值得优先试的型号(括号内为可用的参数量档位):

模型参数档位上下文能力长项
qwen2.50.5b / 1.5b / 3b / 7b / 14b / 32b / 72b128K 级中文、通用,中文场景第一梯队,档位全
qwen2.5-coder1.5b / 7b / 14b / 32b128K 级写代码专项,同尺寸下代码能力突出
deepseek-r11.5b / 7b / 8b / 14b / 32b / 70b128K 级蒸馏版,回答前先输出思考过程,数学与逻辑强
llama3.18b / 70b128K 级Meta 系通用标杆,英文任务与工具调用稳
llama3.21b / 3b128K 级显存紧张时的选择,简单任务够用
gemma31b / 4b / 12b / 27b128K 级Google 系,小尺寸质量好,多语言
phi414b16K 级微软出品,14B 档位质量不错
mistral7b32K 级老牌 7B,欧洲语系表现好
llava7b / 13b / 34b32K 级老牌看图模型
llama3.2-vision11b / 90b128K 级视觉多模态,11B 档 12GB 卡可跑
nomic-embed-text / bge-m3约 0.1~1GB 量级embedding 专用,RAG 知识库标配,bge-m3 对中文检索友好

注意”上下文能力”是模型原生支持的上限,不代表开箱即得:Ollama 默认上下文长度只有 2048,要显式调大才能吃满,显存账也要重算,见显存测算那篇

测算模型与假设

选型表按下面的口径估算,三条假设先说清楚:

  1. 量化假设:Ollama 库默认分发 4bit 量化包(Q4_K_M 这一类),这是消费级硬件跑大模型的通行做法——用约四分之一的存储换轻微精度损失。模型文件体积的经验估算:体积(GB) ≈ 参数量(B) × 0.55~0.6。1.5B 约 1.1GB,7B 级约 4.7GB,14B 约 9GB,32B 约 19~20GB,70B 约 40GB 出头。
  2. 显存假设:运行显存 ≈ 模型文件体积 + KV cache(随上下文长度增长)+ 约 1GB 的框架与系统开销。上下文不大时可以粗记三档:7B 级约 58GB 显存、14B 约 912GB、32B 约 20~24GB。
  3. 速度假设:模型全部装进显存才算”流畅”档;装不下时 Ollama 会自动把放不下的层卸载到 CPU 内存,能跑,但速度慢一个量级【待补:本机全显存与部分卸载的实测速度对比】。

测算结果表

按显存分档的选型速查(“流畅”= 全部进显存;“勉强”= 部分层卸载,明显变慢):

显存档典型硬件流畅跑勉强跑
2~4GB核显、老独显qwen2.5:1.5b、llama3.2:1b、deepseek-r1:1.5bqwen2.5:3b
4~6GB入门独显qwen2.5:3b、llama3.2:3b、gemma3:4bqwen2.5:7b(短上下文)
8GB4060 级 8GB 卡qwen2.5:7b、llama3.1:8b、deepseek-r1:7b/8b、qwen2.5-coder:7bgemma3:12b
12GB3060 12G / 4070 级qwen2.5:14b、deepseek-r1:14b、phi4:14b、gemma3:12b、llama3.2-vision:11bqwen2.5:32b(重度卸载,不建议)
16GB4060Ti 16G / 4080 级14B 全家 + 较长上下文gemma3:27b
24GB3090 / 4090 级qwen2.5:32b、deepseek-r1:32b、qwen2.5-coder:32b、gemma3:27b70B 级(需更低量化或双卡)
48GB+A6000、双卡llama3.1:70b、qwen2.5:72b、deepseek-r1:70b

embedding 模型单独说:nomic-embed-text、bge-m3 只有几百 MB 到 1GB 出头,与对话模型并行部署不冲突,RAG 场景两个都要装。

决策框架

拿不准时按顺序问自己五个问题:

  1. 先定用途,再定参数量。 中文写作选 qwen2.5,代码选 qwen2.5-coder,要思考链选 deepseek-r1,这三个先锁死,参数量再按显存档挑。
  2. 显存能装多大就先试多大。 同用途下大参数量的收益是实打实的,12GB 卡没必要从 7b 起步,直接 14b。
  3. 降参数量,别降量化。 4bit 已是默认档,再往 Q3 压,质量下滑开始能被感知;宁可跑小一号模型的 Q4,不跑大一号的 Q3。
  4. 同家族先跑小尺寸验证管线。 命令、上下文、接口都调通后再换大尺寸,只改一个 tag。
  5. 对话模型与 embedding 模型分开考虑。 对话模型挑能力,embedding 模型挑语言匹配度,中文知识库直接上 bge-m3。

照抄的起步命令(12GB 显存档示例):

ollama pull qwen2.5:14b        # 中文主力
ollama pull qwen2.5-coder:14b  # 写代码
ollama pull deepseek-r1:14b    # 要推理链时换它
ollama pull bge-m3             # RAG 向量化
ollama run qwen2.5:14b

按显存分档的模型选型速查

三个高频追问

  • deepseek-r1 的”思考”很费时间,能关吗? 思考过程是这类推理模型的行为模式,不是能一键关掉的开关;可选办法是换回普通指令模型(qwen2.5),或把 num_predict 调小限制输出预算——但注意思考文本本身也占这个预算,设太小会导致”想了没说”就停。
  • 一块卡能同时驻留多个大模型吗? 显存不够时 Ollama 会自动卸载先前的模型给后来的腾位,来回切换有加载等待。模型默认在内存里驻留 5 分钟(OLLAMA_KEEP_ALIVE 可调),高频轮换场景把驻留时间拉长。
  • 14B 和 32B 日常感知差距大吗? 复杂推理与长文写作上 32B 明显更稳,简单问答差距不大;12GB 卡硬上 32B 属于”重度卸载”,速度掉到无法日用,不如 14B 流畅。

我的最终选择

我的主力组合与实测数据:【待补:显卡型号与显存、常驻模型组合、各模型实测生成速度】。给不出显卡前的通用建议:12GB 卡用 qwen2.5:14b 当主力、deepseek-r1:14b 备用;24GB 卡直接 32b 三件套加 bge-m3,基本覆盖个人开发者的全部本地需求。

装好之后把模型接进代码或工作流,看Ollama API 调用Dify 接 Ollama;下载太慢先看镜像与代理加速

相关阅读