先说结论

把一个任务交给终端里的编码代理自己跑:两个都能干,但风格不同。基于公开资料和我们的小样本实测(实测数据位见下文【待补】,方法公开,欢迎复核):要长链路自主执行、大型仓库重构、把代理塞进自己的终端工作流,Claude Code 目前更对味;要开源 CLI 本体、云端异步跑任务、手头已有 ChatGPT 订阅,Codex 上手更顺。两家都是”订阅或 API”双轨计费,切换的真实成本在记忆文件和操作习惯,不在钱。

Claude Code 与 Codex 实测对比示意(占位图,发布前替换为实测过程截图)

为什么把这两个放在一起比

因为它们是同一类工具:都是”给任务、自己干”的终端编码代理——读仓库、改文件、跑命令、交结果,不是行级补全。拿它们对比,才有可比性。

两边的基本盘:Claude Code 是 Anthropic 官方 CLI,npm 包 @anthropic-ai/claude-code,需要 Node.js 18+,闭源分发;Codex 是 OpenAI 的编码代理产品线,CLI 在 GitHub 开源(openai/codex 仓库,Rust 编写,Apache-2.0 许可),另有 IDE 扩展、ChatGPT 里的云端任务和 GitHub 代码评审入口。

计费结构同构:Claude Code 走 Claude 订阅(Pro / Max)或 Anthropic API key;Codex 走 ChatGPT 订阅(Plus / Pro 等)或 OpenAI API key(当前价格【待补:双方定价页】)。模型背景:Claude Code 的主力是 Sonnet 系列,Sonnet 4.5 一代起就是主力之一(当前默认【待补】),公开规格 20 万 token 上下文窗口;Codex 的模型线从 codex-1 到 GPT-5-Codex 一类编码特调版本(当前默认【待补】)。

实测环境

项目内容
测试机【待补:机型 / CPU / 内存 / 系统版本】
网络环境【待补:地区与代理情况】
Claude Code 版本【待补:claude —version 输出】
Codex CLI 版本【待补:codex —version 输出】
仓库与任务集【待补:几个仓库、几类任务(修 bug / 新功能 / 重构 / 写测试)、每类几题】
评分口径【待补:一次通过 / 多轮返工后通过 / 失败;计时与 token 记账方式】
计费方式【待补:双方各用订阅额度还是 API 计费】

对比总表

维度Claude CodeCodex
出品方AnthropicOpenAI
CLI 开源否(官方 npm 分发)是(GitHub 开源,Apache-2.0,Rust)
安装npm(@anthropic-ai/claude-code),Node.js 18+npm(@openai/codex)或 Homebrew,Rust 单二进制
登录与计费Claude 订阅或 Anthropic API key;企业可切 Bedrock / Vertex 后端ChatGPT 订阅登录或 OpenAI API key
权限与沙箱权限模式:default / plan / acceptEdits / bypassPermissions,可配 hooks 拦截沙箱三档:read-only / workspace-write / danger-full-access,另配审批策略
项目记忆CLAUDE.md,支持 @ 路径拆分引用AGENTS.md,已成跨工具通用约定
扩展机制MCP、子代理、hooks、skillsMCP(config.toml 配置)、云端任务
云端与异步网页形态曾以预览推出(当前状态【待补】)ChatGPT 内云端任务、GitHub 代码评审
实测:任务完成率【待补:实测数据】【待补:实测数据】
实测:平均耗时与 token 成本【待补:实测数据】【待补:实测数据】

逐项分析

安装与登录

两个都是一行命令装完。Claude Code 首次运行引导你选订阅登录或 API key;Codex 用 ChatGPT 账号登录即可——这里有个隐性差异:很多人的 ChatGPT 订阅已经在那儿了,用 Codex 不新增支出;反之,Claude 订阅用户装 Claude Code 也是零边际成本。先盘一眼自己已有的订阅,能省一轮决策。

权限与沙箱:谁来兜住代理的误操作

Codex 默认沙箱执行,档位写在明面上:read-only 只读、workspace-write 限工作区、danger-full-access 全放开,再叠加审批策略控制何时询问。Claude Code 用的是另一套组合拳:权限模式逐操作放行,plan 模式先出计划不动手,hooks 可以在工具调用前后插入自动检查。工程偏好上:想要”默认关笼子、边界清晰”选 Codex 的沙箱语义;想要”细粒度审批流加可编程钩子”选 Claude Code 的权限体系。两边都不建议在真实仓库里裸奔全权限。

项目记忆与规则文件

Claude Code 读 CLAUDE.md,支持用 @ 路径把规则拆成多个文件引用,大仓库能按目录分层维护。Codex 读 AGENTS.md——后者正在被多家编码工具采纳,几乎要成为行业默认约定,写一份 AGENTS.md 在多个工具间都能吃。实操建议两边通用:把构建命令、测试命令、代码规范写进去,代理质量立刻上一个台阶;不写,它每轮都在猜。

生态与扩展

双方都支持 MCP(Model Context Protocol,Anthropic 发起、OpenAI 与 Google 等相继跟进的开放协议),数据库、浏览器、issue 系统的接入方法可以互相迁移。Claude Code 多出子代理、hooks、skills 这些工程化零件,适合搭个人自动化流水线;Codex 的云端任务适合把不阻塞的活扔到后台跑,回头收 PR。扩展路径的分岔其实是产品哲学的分岔:一个往你的终端里钻,一个往云上飘。

成本结构

双轨计费下,低门槛都存在:订阅固定月费换额度窗口,API 按量适合脉冲式使用。具体数字【待补:双方定价页】,测算方法见性价比测算篇。结构性差异在沙箱外的部分:Codex 的云端任务烧的是订阅额度但省你的挂机时间;Claude Code 的 CI 用法建议走 API key 并设预算上限,账目更干净。

实测结果(核心数据位)

同一任务集下的完成率、平均轮次、耗时、token 成本:【待补:完整实测数据表】。先把方法放在这里:同仓库、同提示词、同评分口径,两个工具各跑同样数量的任务,记录一次通过率与返工次数,token 成本用 /cost 与双方后台账单核对。数据出来之前,别信任何”谁吊打谁”的结论,包括本文先说结论那一节——那里只对定性差异负责。

最终推荐

  • 重度终端党、大型重构专项、要搭自动化流水线:先试 Claude Code,权限体系与工程化零件更全。
  • ChatGPT 订阅在手、想要云端异步与开源 CLI:先试 Codex,边际成本接近零。
  • 想改工具本体、要审计实现:只有 Codex 开源给你看,Apache-2.0 许可随便研究。
  • 企业要求模型调用走自有云账号:Claude Code 有 Bedrock / Vertex 现成开关。
  • 拿不定主意:两个都装,一周内各跑三个真实任务,比读十篇对比文都管用——包括这篇。

相关阅读