Codex 中文站Codex 中文站
AI 编程2026-07-25 12:156 分钟阅读

Claude Opus 5 发布:基准成绩怎么看,Max 用户该不该立刻切换

根据发布材料,Claude Opus 5 在多项 Agent、搜索与推理基准中给出领先成绩,并被描述为全平台可用、Max 订阅默认模型。本文梳理图表数据、适用场景与切换前的验证方法。

Claude Opus 5 发布:基准成绩怎么看,Max 用户该不该立刻切换

大家好,我是 Codex 中文网的站长宇哥。

根据本次发布材料,Claude Opus 5 已上线。材料将它定位为面向复杂推理、Agent 编程、网页搜索和电脑操作的旗舰模型,并称其已在各平台提供;对于 Max 订阅用户,Opus 5 被设为默认模型。最值得关注的不是“新模型”这个名字,而是它声称在若干高难任务上的提升到底意味着什么,以及日常工作是否值得马上迁移。

本文的成绩和可用性描述均以读者提供的发布信息及配图为准,跑分仍应结合任务集版本、是否允许使用工具、成本和实际项目验证来判断,不能直接等同于所有真实场景的能力排名。

发布材料里有哪些重点

Claude Opus 5 与其他模型的基准对比

配图将 Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 放在同一表格中比较。按图中的数字,Opus 5 在下列项目中给出较高成绩:

  • Agentic terminal coding(Frontier-Bench v0.1)为 43.3%,高于图中 Fable 5 的 33.7% 和 GPT-5.6 Sol 的 34.4%。
  • 知识工作(GDPval-AA v2)为 1861,高于图中其他三个模型的 1747、1593 和 1736。
  • 新颖问题求解(ARC-AGI-3)为 30.2%,图中 Fable 5 没有对应分数,Opus 4.8 为 1.5%,GPT-5.6 Sol 为 7.8%。
  • Agent 搜索(BrowseComp)为 90.8%,略高于图中 GPT-5.6 Sol 的 90.4%。
  • 电脑操作(OSWorld 2.0)为 70.6%,高于图中 Fable 5 的 66.1%、Opus 4.8 的 55.7% 和 GPT-5.6 Sol 的 62.6%。
  • 自动化工作流(AutomationBench)为 26.0%,高于图中其他对比项。

图表并不意味着 Opus 5 在每一项中都是第一。例如 Agent 编程的 DeepSWE v1.1 一栏,图中 GPT-5.6 Sol 为 72.7%,Fable 5 为 69.7%,Opus 5 为 68.8%。Humanity's Last Exam 的无工具成绩也是 Fable 5 略高。这正是选模型时要先看任务类型、再看总分的原因。

ARC-AGI-3 的 SOTA 该怎么理解

发布材料称 Opus 5 在 ARC-AGI-3 达到 SOTA,图中对应数字是 30.2%。这类测试强调面对新规则时的抽象、归纳和迁移能力,不是记住已见题目的知识问答。对开发者而言,它更接近以下能力:

  • 在需求不完整时先找出隐含规则,再提出可验证方案。
  • 面对陌生代码库时,从少量样例推断数据流、约束和边界条件。
  • 遇到没有现成模板的问题时,拆分假设并通过工具调用逐步证伪。

但“某项基准 SOTA”不等于真实项目会自动完成。ARC-AGI-3 的题目、评分和工具条件都与生产环境不同。真实任务常常被权限、上下文缺失、第三方接口波动、测试数据质量和业务规则限制。把它当作能力信号是合理的,把它当作交付承诺则不够严谨。

哪些任务更值得先用 Opus 5 验证

如果你使用 Max,并且发布材料所述的默认设置已经生效,可以先挑一件高价值但可回滚的任务做对比。不要一上来让模型改整套生产系统。

推荐优先测试三类工作:

  • 跨文件修复:给出可复现的 Bug、失败测试和关联目录,观察它是否先定位根因,再做小范围修改。
  • 终端型 Agent 任务:例如补齐测试、升级依赖、迁移配置。重点检查它是否会在每一步读取实际输出,而不是凭假设连续执行。
  • 浏览器或电脑操作:例如后台录入、页面回归检查和跨系统信息核对。先使用测试账号,任何发送、删除、付款或发布动作都要人工确认。

对于简单的改文案、格式转换、单文件样式调整和固定模板生成,旗舰模型不一定带来成比例收益。更快或成本更低的模型通常已经足够,关键是把规则、输入和验收标准写清楚。

切换默认模型前,做一次自己的对照测试

同一个提示词跑一次并不能证明模型优劣。更可靠的做法是建立一个小型评测集,至少包含 5 到 10 个你日常重复出现的任务。每个任务固定输入、允许的工具和验收标准,再记录结果。

建议记录这些指标:

  • 首次完成率:不需要人工返工即可通过测试或验收的比例。
  • 返工成本:你为补充上下文、纠正方向和修复错误投入的时间。
  • 工具纪律:是否先读取文件、运行测试和核实输出,是否会跳过关键确认。
  • 延迟与额度:单个任务的耗时、消耗以及遇到限额时的表现。
  • 风险控制:是否正确识别删除数据、外发信息、覆盖配置等需要停下来确认的操作。

完成一轮后,再决定是否将 Opus 5 用作默认模型。对大多数团队,更实用的策略是把旗舰模型留给复杂规划、疑难排错和高价值审查,把高频明确任务交给更快的模型处理。

对 AI 编程用户的实际影响

若图中 Agent 终端编程、FrontierCode 和 OSWorld 数据能在你的环境中复现,Opus 5 的价值可能主要在“长链路任务的稳定性”:它需要连续读取状态、使用工具、根据结果修正计划,而不是只生成一段看起来合理的代码。

不过,模型再强也不能替代工程约束。把仓库说明、运行命令、测试命令、编码规范和禁止操作写进项目指引,依然是提升成功率最快的手段。对任何模型都应坚持:先看 diff,再跑测试,最后人工确认对外动作。

常见问题 FAQ

Max 用户需要手动选择 Opus 5 吗

按本次发布材料的说法,Opus 5 会作为 Max 订阅的默认模型。不同客户端的更新节奏和模型选择界面可能不同,实际以你账号内显示的模型名称、版本说明和可用额度为准。

Opus 5 是否在所有基准中都超过 Fable 5

不是。配图显示 Opus 5 在多项指标中领先或给出更高分数,但 DeepSWE v1.1、Humanity's Last Exam 无工具和部分专业领域项目中,图中其他模型仍有更高数字。基准必须逐项比较,并注意是否使用工具。

ARC-AGI-3 的 30.2% 能说明什么

它是发布材料中对新颖问题求解能力的一项成绩,说明模型在该测试设置下具备较强的模式归纳能力。它不能单独预测你项目中的成功率,建议用自己的真实任务集做验证。

能否直接让模型操作电脑或发布内容

不建议直接开放高风险权限。先使用测试环境和最小权限,涉及删除文件、发送消息、发布内容、支付和生产配置时,必须在动作执行前人工确认。

结论

Opus 5 的发布材料给出了一个明确方向:旗舰模型正在把竞争从单轮回答扩展到终端编程、搜索、电脑操作和复杂工作流。对 Max 用户而言,默认模型的变化值得关注;对团队而言,更重要的是用一组真实、可验收的任务验证它是否真的减少返工和失败,而不是只根据一张跑分表切换工作流。

原创文章,作者:Codex中文网,如若转载,请注明出处:https://codex-zh.com/posts/claude-opus-5-release/

相关文章

API 教程2026-07-25 12:459 分钟阅读

Codex 如何使用 DeepSeek?第三方模型接入教程

这篇文章是 Codex 中文网「API 教程」栏目里的完整教程,主题是 **Codex 如何使用 DeepSeek?第三方模型接入教程**。我会尽量用实战视角讲清楚:这个问题是什么、为什么会出现、应该怎么操作、遇到问题怎么排查,以及新手...

API 教程2026-07-25 12:453 分钟阅读

Codex 如何使用 Kimi?Moonshot API 接入教程

这篇文章主要聊「Codex 如何使用 Kimi?Moonshot API 接入教程」。很多新手刚开始使用 Codex 时,最容易卡在安装、登录、模型、API、MCP、cc-switch 和本地配置这些环节。其实大多数问题都有固定排查路径...

入门教程2026-07-24 12:508 分钟阅读

Codex 如何配置 API Key?新手完整教程

这篇文章是 Codex 中文网「配置教程」栏目里的完整教程,主题是 **Codex 如何配置 API Key?新手完整教程**。我会尽量用实战视角讲清楚:这个问题是什么、为什么会出现、应该怎么操作、遇到问题怎么排查,以及新手最容易踩哪些坑。