个人 AI 的隐私账本
用云 AI 助手处理个人数据的隐忧是结构性的:你的邮件、日程、聊天、代码被读取后,去了哪里、存了多久、训练了什么——这些问题的答案都在厂商手里。OpenHuman 的架构把这份账本改写了:数据层全本地(SQLite 存储 + Obsidian 落盘,服务端不存任何工作流数据),模型层可本地(三种本地运行时 + 结构断云开关)。
这篇把「本地化」的三个等级讲透,帮你按自己的敏感度选对档位。
三个等级的数据流
| 等级 | 数据存储 | 模型调用 | 适合谁 |
|---|---|---|---|
| L1 默认模式 | 全本机 | 云端(自动路由) | 大多数人,通用场景 |
| L2 混合模式 | 全本机 | 敏感任务走本地,通用走云 | 有选择敏感度的用户 |
| L3 隐私模式 | 全本机 | 仅本地,结构上断云 | 高敏感数据用户 |
先强调一个常被忽略的事实:即使在 L1,你的原始数据也从不出本机——发出去的只是模型推理需要的上下文片段(经 TokenJuice 压缩后的内容)。真正的全本地诉求集中在两类人:处理敏感行业数据的专业人士,以及对数据主权有洁癖的极客。
L3:隐私模式——结构断云,不是承诺断云
隐私模式最值得展开的是它的实现方式:由 Rust 核心强制执行的单一开关,打开后结构上阻断所有云模型调用,只允许设备端运行。
「结构上」三个字是关键。对比两种实现:
- 配置级断云:软件界面上「不使用云服务」的勾选项——信任厂商的实现正确性,无法独立验证
- 结构级断云:代码路径层面不存在云调用通道,且开源可审计——GPL3 协议意味着任何人可以查验这段代码
OpenHuman 选的是后者。对隐私敏感用户,这是「可验证的承诺」和「口头承诺」的区别——也是本站写 AgentDock 安全实践时反复强调的思路:安全不靠自觉,靠结构。
本地运行时的三条路线
路线一:Ollama(推荐起步)
Ollama 是最省心的本地模型运行时(安装配置见本站 Ollama 教程):
# Agent 任务建议 30B 级别起步
ollama pull qwen3:32b
# 确认 OpenAI 兼容端点可用
curl http://127.0.0.1:11434/v1/models
OpenHuman 设置里选 Ollama 运行时,指向本地端点即可。硬件要求:32B 模型(4bit 量化)需要约 20~24GB 显存或统一内存;16GB 显存的机器跑 14B 模型是体验底线;Apple Silicon 凭统一内存可以跑更大的模型。
路线二:LM Studio(图形化玩家)
喜欢图形界面管理模型的用户选 LM Studio——下载模型、启动服务、复制端点地址,全程点击完成。适合不想碰命令行的本地化用户。
路线三:MLX(Apple Silicon 专属)
M 系列芯片用户可以走 MLX 运行时,对 Apple 统一内存的利用更高效。Mac 用户的三条路线按顺手程度选即可,能力差异不大。
任何 OpenAI 兼容端点都被支持——这意味着 vLLM、llama.cpp server 这类自建推理服务也能接入,折腾党自由度拉满。
本地模型的现实预期
上本地模型前把预期校准好,这是体验不翻车的关键:
能力差距是真实的。本地 32B 模型和云端前沿模型的推理质量有代差——简单摘要、分类、检索问答没问题;复杂的多步推理、长文写作、精细代码生成,差距明显。务实的用法是任务分级:记忆检索、简报生成、信息归类走本地;深度研究、方案写作切回云端。
速度与显存直接挂钩。本地推理的速度取决于显存带宽,笔记本级别的 GPU 跑大模型会明显感觉「慢」。日常简报类任务对延迟不敏感,可以接受;交互式对话对延迟敏感,低配机器慎选全本地。
20 分钟同步不受影响。auto-fetch、记忆树构建、TokenJuice 压缩这些数据管道全部在本机跑,与模型无关——本地化只影响「推理」这一层,不影响「认知积累」这一层。
硬件速查与避坑清单
硬件档位对照(显存数值按 4bit 量化的通行参考):
| 你的显存/统一内存 | 可跑档位 | 适合任务 |
|---|---|---|
| 8GB | 7~8B 模型 | 摘要、分类、简单问答 |
| 16GB | 14B 模型 | 日常 Agent 任务的体验底线 |
| 20~24GB | 32B 模型(如 qwen3:32b) | Agent 任务的舒适区 |
| Apple Silicon 大统一内存 | 更大模型 | 统一内存架构占优 |
上本地模型前的四个坑:
- 量化有代价:4bit 量化是显存换体验的通行做法,同档位硬件能跑更高精度就别凑合最低档——量化越深,推理质量的折扣越大
- 本地上下文窗口偏短:本地模型的有效上下文普遍短于云端前沿模型,超长线程问答在本地档位上体验会打折,做任务分级时把这一条算进去
- 别拿敏感任务当试验田:先拿无关紧要的任务验证本地模型效果,跑顺了再用于真实工作——第一天就用核心业务数据调试,隐私和能力两头不讨好
- vault 备份优先级升级:越彻底的本地化,本机数据越集中——隐私模式下没有「云端还有一份」的退路,记忆树和 vault 的备份要例行做
- 本地不等于零出域:走云端路由的任务,发出去的是压缩后的上下文片段——L2 混合模式的用户要清楚,每次云端调用发出的内容由当时任务决定,别把「数据存本地」和「什么都没发出去」混为一谈
推荐的落地方案
给不同人群的直接建议:
- 大多数用户:L1 默认模式起步,用一个月感受价值,隐私焦虑通常被「数据本来就没出过本机」的事实缓解大半
- 有敏感工作数据的:L2 混合——日常走云端路由,处理敏感材料时手动切本地模型;OpenHuman 的模型路由机制让这个切换成本很低
- 数据主权洁癖 / 合规硬要求:L3 隐私模式 + Ollama,接受能力折损换结构性安心;本地模型选型按显存测算来,别凭感觉
隐私这件事的最终判断标准很简单:你愿不愿意把这个 AI 看到的所有内容,想象成贴在办公室白板上? 愿意,L1 够用;不愿意,本文就是为你写的。