jsonscraper

Claude Code 还是 Codex:比较的应是工作方式,而非品牌

根据自己的任务、运行环境和实际配额限制,在两款智能体之间做出选择。

一位 Reddit 用户在个人项目中改用 Codex,但在工作中继续使用 Claude Code。他主要不满的是 Claude Code 的 VS Code 扩展界面,尤其是工具调用和子智能体的显示方式。另一场讨论中,开发者分享了让一个智能体修改代码、另一个智能体检查的做法。这些只是不同用户的个人体验,并非测试结果:参与者的条件各不相同,这些经历也没有独立衡量交叉审查是否有用。不过,它们提出了一个实用的问题:哪款工具更适合你的工作流程,又该如何验证? 第一篇帖子的作者具体讨论的是 VS Code 扩展,而第二场讨论的参与者则分享了智能体协同工作的不同方式。

正在工作的男人
Sanni Sahil

这类评价可以提示你关注哪些方面:界面、变更检查、限额和用量。但它们无法证明哪款智能体更擅长编写代码。要做出选择,应将个人感受与更系统的数据区分开来,并比较你打算使用的工具及其运行条件。

比较的不只是工具,还有运行环境

Claude Code 和 Codex 经常被当作同类产品的两种选择来讨论。但比较结果不仅取决于模型:你是在终端、编辑器还是云环境中运行工具,也会影响结果。

2026 年 2 月 4 日,GitHub 宣布Claude 和 Codex 在 Agent HQ 开放公开预览。通过 GitHub,你可以给智能体分配任务,之后获取 pull request 进行检查。但共用一个界面,并不意味着这就是实验室式的对比:模型、设置和运行环境可能各不相同。这也不同于在本地运行 Claude Code 或 Codex。

根据 GitHub 最新的第三方智能体文档,会话会消耗 GitHub Actions 分钟数和 AI 积分;费用取决于所用模型及处理的令牌数量。因此,对某个特定扩展的抱怨未必适用于 Claude Code 的所有使用方式,而一次成功的云端会话也不能保证同一工具适合日常编辑器工作。

pull request 数据说明了什么

一项发表于 2026 年的研究分析了五款智能体提交的 7,156 个 pull request。研究发现,变更被接受的比例取决于任务类型:例如,Claude Code 在文档和新功能方面表现突出,而 Codex 在包括修复和重构在内的多个类别中表现出色。作者没有发现哪款智能体能在所有类别中持续领先。详情见这项关于 pull request 接受情况的研究。

这些结果并不能回答哪款产品更适合你的代码仓库。该研究基于较早时期创建的公开 PR,而非在相同条件下对当前版本进行的受控测试。Claude Code 的样本量远小于 Codex:139 个 PR,对比 2,002 个。此外,PR 被接受并不等于代码质量高:作者指出,代码仓库、用户经验和其他未受控因素都可能影响结果。

这项研究的意义不在于提供排名表,而在于提醒我们:结果可能因任务而异。要弄清哪款工具适合你,最好用它们处理你实际会做的工作。

限额不是单一指标

在一场 Reddit 限额讨论中,发帖者请大家比较不同套餐和模型能提供多少实际使用时间。回复各不相同:例如,一位参与者更喜欢较低档位的 Codex,而在更贵的档位则偏好 Claude。这些是个人评价,并非在相同任务和设置下进行的测量。这场关于限额的讨论无法证明哪项服务更划算。

而且,“限额”可能指几小时内的限制、每周配额,也可能只是主观感觉订阅额度是否够日常使用。2026 年 5 月 6 日,Anthropic 宣布提高部分套餐的 Claude Code 五小时限额,并取消 Pro 和 Max 套餐在高峰时段的限额下调。这是套餐条件的一项具体变化,并不能回答与 Codex 相比,每位用户实际能完成多少工作。

自行比较时,请记录套餐、模型、设置和运行方式。如果一款工具在本地运行,另一款则通过 GitHub Agent HQ 运行,使用量差异可能不仅与智能体有关,也与环境条件有关。

如何在自己的代码仓库中比较工具

选取几项与你日常工作相似的任务:修复 bug、小幅功能变更和更新文档。给每款工具相同的任务描述,并提供相当的代码仓库访问权限。记录所选模型和设置。

然后,不仅要评估结果,也要评估检查结果所需的成本:

  • 现有测试是否通过?你需要手动运行或添加哪些检查?
  • 你需要几次补充说明或介入修改?
  • diff 是否易于理解和检查?
  • 这项工作花了多少时间,使用了多少配额或积分?
  • 是否出现多余修改、遗漏要求或错误?

不要不加说明地把不同类型的任务合并成一个分数。如果你想尝试让一个智能体修改、另一个智能体检查的方式,请把它视为独立流程:记录额外耗时和用量,并自行核实审查者提出的问题。用户评价可以让你想到这种做法,但无法证明它更可靠或更省钱。

选择 Claude Code 还是 Codex,不应取决于投票结果,也不应只看某个人改用工具的经历。请在自己的任务和所需环境中测试两款工具,并考虑套餐的实际限制。这样的测试无法为所有团队给出普遍答案,但能帮助你判断哪种方案适合自己的工作流程。

相关文章

AI Research · Analysis

ART:功能仍待揭晓的独特 DNA 片段

研究人员在感染细菌的病毒 DNA 中发现了一种酶,旁边还有重复片段。Claude 帮助研究人员注意到它们,但 ART 系统的功能仍然未知。

将阅读内容转化为可用的集成

探索 jsonscraper 社交数据 API、测试请求并构建下一个工作流。

查看 API