个人 AI 的隐私账本

用云 AI 助手处理个人数据的隐忧是结构性的:你的邮件、日程、聊天、代码被读取后,去了哪里、存了多久、训练了什么——这些问题的答案都在厂商手里。OpenHuman 的架构把这份账本改写了:数据层全本地(SQLite 存储 + Obsidian 落盘,服务端不存任何工作流数据),模型层可本地(三种本地运行时 + 结构断云开关)。

这篇把「本地化」的三个等级讲透,帮你按自己的敏感度选对档位。

三个等级的数据流

等级数据存储模型调用适合谁
L1 默认模式全本机云端(自动路由)大多数人,通用场景
L2 混合模式全本机敏感任务走本地,通用走云有选择敏感度的用户
L3 隐私模式全本机仅本地,结构上断云高敏感数据用户

先强调一个常被忽略的事实:即使在 L1,你的原始数据也从不出本机——发出去的只是模型推理需要的上下文片段(经 TokenJuice 压缩后的内容)。真正的全本地诉求集中在两类人:处理敏感行业数据的专业人士,以及对数据主权有洁癖的极客。

L3:隐私模式——结构断云,不是承诺断云

隐私模式最值得展开的是它的实现方式:由 Rust 核心强制执行的单一开关,打开后结构上阻断所有云模型调用,只允许设备端运行。

「结构上」三个字是关键。对比两种实现:

  • 配置级断云:软件界面上「不使用云服务」的勾选项——信任厂商的实现正确性,无法独立验证
  • 结构级断云:代码路径层面不存在云调用通道,且开源可审计——GPL3 协议意味着任何人可以查验这段代码

OpenHuman 选的是后者。对隐私敏感用户,这是「可验证的承诺」和「口头承诺」的区别——也是本站写 AgentDock 安全实践时反复强调的思路:安全不靠自觉,靠结构。

本地运行时的三条路线

路线一:Ollama(推荐起步)

Ollama 是最省心的本地模型运行时(安装配置见本站 Ollama 教程):

# Agent 任务建议 30B 级别起步
ollama pull qwen3:32b

# 确认 OpenAI 兼容端点可用
curl http://127.0.0.1:11434/v1/models

OpenHuman 设置里选 Ollama 运行时,指向本地端点即可。硬件要求:32B 模型(4bit 量化)需要约 20~24GB 显存或统一内存;16GB 显存的机器跑 14B 模型是体验底线;Apple Silicon 凭统一内存可以跑更大的模型。

路线二:LM Studio(图形化玩家)

喜欢图形界面管理模型的用户选 LM Studio——下载模型、启动服务、复制端点地址,全程点击完成。适合不想碰命令行的本地化用户。

路线三:MLX(Apple Silicon 专属)

M 系列芯片用户可以走 MLX 运行时,对 Apple 统一内存的利用更高效。Mac 用户的三条路线按顺手程度选即可,能力差异不大。

任何 OpenAI 兼容端点都被支持——这意味着 vLLM、llama.cpp server 这类自建推理服务也能接入,折腾党自由度拉满。

本地模型的现实预期

上本地模型前把预期校准好,这是体验不翻车的关键:

能力差距是真实的。本地 32B 模型和云端前沿模型的推理质量有代差——简单摘要、分类、检索问答没问题;复杂的多步推理、长文写作、精细代码生成,差距明显。务实的用法是任务分级:记忆检索、简报生成、信息归类走本地;深度研究、方案写作切回云端。

速度与显存直接挂钩。本地推理的速度取决于显存带宽,笔记本级别的 GPU 跑大模型会明显感觉「慢」。日常简报类任务对延迟不敏感,可以接受;交互式对话对延迟敏感,低配机器慎选全本地。

20 分钟同步不受影响。auto-fetch、记忆树构建、TokenJuice 压缩这些数据管道全部在本机跑,与模型无关——本地化只影响「推理」这一层,不影响「认知积累」这一层。

硬件速查与避坑清单

硬件档位对照(显存数值按 4bit 量化的通行参考):

你的显存/统一内存可跑档位适合任务
8GB7~8B 模型摘要、分类、简单问答
16GB14B 模型日常 Agent 任务的体验底线
20~24GB32B 模型(如 qwen3:32b)Agent 任务的舒适区
Apple Silicon 大统一内存更大模型统一内存架构占优

上本地模型前的四个坑

  1. 量化有代价:4bit 量化是显存换体验的通行做法,同档位硬件能跑更高精度就别凑合最低档——量化越深,推理质量的折扣越大
  2. 本地上下文窗口偏短:本地模型的有效上下文普遍短于云端前沿模型,超长线程问答在本地档位上体验会打折,做任务分级时把这一条算进去
  3. 别拿敏感任务当试验田:先拿无关紧要的任务验证本地模型效果,跑顺了再用于真实工作——第一天就用核心业务数据调试,隐私和能力两头不讨好
  4. vault 备份优先级升级:越彻底的本地化,本机数据越集中——隐私模式下没有「云端还有一份」的退路,记忆树和 vault 的备份要例行做
  5. 本地不等于零出域:走云端路由的任务,发出去的是压缩后的上下文片段——L2 混合模式的用户要清楚,每次云端调用发出的内容由当时任务决定,别把「数据存本地」和「什么都没发出去」混为一谈

推荐的落地方案

给不同人群的直接建议:

  • 大多数用户:L1 默认模式起步,用一个月感受价值,隐私焦虑通常被「数据本来就没出过本机」的事实缓解大半
  • 有敏感工作数据的:L2 混合——日常走云端路由,处理敏感材料时手动切本地模型;OpenHuman 的模型路由机制让这个切换成本很低
  • 数据主权洁癖 / 合规硬要求:L3 隐私模式 + Ollama,接受能力折损换结构性安心;本地模型选型按显存测算来,别凭感觉

隐私这件事的最终判断标准很简单:你愿不愿意把这个 AI 看到的所有内容,想象成贴在办公室白板上? 愿意,L1 够用;不愿意,本文就是为你写的。