「AI 操作电脑」的三条路线

让 AI 摸到你真实的机器,行业里已经跑出了三条代表性路线:

  • Claude Computer Use:Anthropic 的官方方案,AI 直接「看屏幕、动鼠标」操作你的本地电脑
  • OpenClaw 及同类开源项目:社区驱动的本地 Agent,常驻本机执行任务
  • AgentDock:自托管 MCP 运行时,AI 通过结构化接口操作你的机器群

三条路线解决同一个问题,但技术假设完全不同。选错路线不会「不好用」,而是「根本不适合你的场景」——这篇对比帮你选对。

架构对比:AI 是怎么「摸到」你电脑的

维度Claude Computer UseOpenClaw 类AgentDock
操作方式视觉 + 鼠标键盘(GUI 层)本地进程 + 文件系统结构化 MCP 工具调用
运行位置你的本地电脑你的本地电脑你的机器群(本机/VPS/容器)
界面依赖强依赖 GUI 渲染中等无——直接调接口
云依赖模型在 Anthropic 云模型在各家云仅 Embedding 可选,链路可全内网
数据主权操作数据流经模型厂商流经模型厂商工作区数据不出你的网络
多设备单机单机为主原生多节点 + NexusDock 中心

架构差异带来的体验差异很直接:

Computer Use 是「仿人路线」——AI 像人一样看屏幕截图、移动鼠标点击。优点是万能(人能点的它都能点),缺点是慢、贵(每步都要视觉推理)、脆弱(分辨率变化、弹窗干扰都会出错)。适合操作那些「只有界面没有接口」的老旧软件。

OpenClaw 是「驻场员工路线」——本地常驻一个 Agent,能力取决于项目社区生态。优点是本地化程度高,缺点是能力边界由项目决定、多机支持通常不是设计重点。

AgentDock 是「基础设施路线」——它不模仿人,而是把文件、命令、Git、浏览器封装成结构化的 MCP 工具。AI 调用接口而不是摆弄鼠标,快一个数量级,且每一步都有日志可审计。代价是它只操作「有接口的能力」,界面上才有的事物要走它的浏览器自动化模块。

安全模型对比

「AI 拿到电脑控制权」的安全账,三家算法不同:

Computer Use:权限即屏幕。AI 看到什么就能点什么,边界靠人工盯着。Anthropic 在提示词层做了不少约束,但「AI 误点了不该点的」这类风险由你的桌面环境承担。

OpenClaw 类:权限即进程。Agent 以本机用户身份运行,文件系统基本全开放。安全取决于项目本身的沙箱设计和你的信任度。

AgentDock:权限即工作区。文件操作锁在配置的工作区目录里,命令执行有进程管理边界,认证有 Bearer Token + 来源白名单,管理接口独立凭证(细节见安全实践篇)。爆炸半径是三者中最可控的。

对「把 AI 接入生产环境/存有敏感数据的机器」这个场景,安全模型应该是第一决策因子。

成本结构对比

  • Computer Use:按视觉推理的 token 计费,GUI 操作每步都是截图 + 推理,长任务成本线性膨胀
  • OpenClaw 类:模型 API 成本 + 本机资源,无额外基础设施
  • AgentDock:运行时本身开源免费(Apache 2.0),成本就是一台你自己已有的机器 + 模型 API。结构化调用比视觉操作省 token,NexusDock 的 Recall 还能减少重复交代背景的消耗

场景化选型

选 Computer Use,如果你:

  • 要操作的软件只有 GUI 没有接口(老 ERP、行业定制软件)
  • 低频、临时性的桌面操作
  • 全部数据本来就信任 Anthropic 云处理

选 OpenClaw 类,如果你:

  • 想要开箱即玩的社区生态,不介意跟随项目成熟度
  • 单机场景为主,对多设备和数据主权没有强需求

选 AgentDock,如果你:

  • 机器不止一台,想要统一入口调度(Mac + VPS + NAS + 容器)
  • 数据主权是硬需求——工作区数据不出你的网络
  • 要把「AI 干活」当长期基础设施运营:需要 Skills 管理、可恢复任务、审计日志
  • 已经在用 MCP 生态——它就是标准 MCP 服务器,客户端零学习成本

四个问题定方案

拿不定主意时,按顺序问自己四个问题,第一处命中就是答案:

  1. 要操作的目标只有 GUI、完全没接口吗? 是 → Computer Use。结构化接口路线碰不了纯界面软件,仿人操作是唯一解。
  2. 活要在多台机器之间发生吗? 是 → AgentDock。单机方案没有跨设备编排,多机正是它的主场。
  3. 数据必须留在自己网络里吗? 是 → AgentDock。工作区数据不出你的机器,这是三条路线里唯一把数据主权当设计前提的。
  4. 只想低成本玩玩单机自动化吗? 是 → OpenClaw 类。社区生态开箱即玩,试错成本最低。

四个都落空,说明你暂时需要的只是更强的对话模型,还不到引入执行层的时候。

三个常见误区

「选了一个就要卸掉其他。」 三条路线是分层的:界面长尾给 Computer Use,随手小活给本地 Agent,跨机器的长期自动化给 AgentDock——它们完全可以在同一台机器上共存。

「开源等于零成本。」 Apache 2.0 只保证运行时免费,模型 API、机器开销、调试时间都是账单的一部分。对比方案要算总账,不算单点。

「安全靠 AI 自觉。」 模型侧的约束是概率性的,配置侧的边界才是确定性的。AgentDock 把认证、白名单、工作区隔离做成默认项,就是因为边界不能建立在「它应该不会乱来」上。

我的判断

三条路线不是零和竞争,更像分层互补:Computer Use 处理「只有界面」的长尾,本地 Agent 处理「随手的小活」,AgentDock 这类自托管运行时承接「严肃的、长期的、跨机器的自动化」。

行业大方向上,本站在 Grok Bot 多智能体ADE 概念里都指出过同一个趋势:AI 正从「对话工具」变成「可调度的执行层」。在这个趋势里,谁掌握执行环境的所有权,谁就掌握 AI 时代的自主权——这大概是 AgentDock 们存在的最大意义。

如果你决定从 AgentDock 起步,按这个顺序读本系列:安装部署接入 AI 客户端多设备编排