Claude Opus 5 测评

短的结论:本是同根生

基本情况:

Opus 距离上次更新,已过去了近 2 个月,这中间固然有被 Fable 禁用风波打乱发布节奏,也有为了应对日益强势的开源势力而做的额外努力。Anthropic 需要一款性能足够高,足够“安全”,又不能太贵的模型,不能给竞争对手留下可以填补的性价比空白区域。Opus 5 便是带着这样的任务发布的。

作为又一款 Fable 5 平替,Opus 5 表现足够亮眼,首先其基本功较前代明显更扎实,在诸多实用领域确实达到甚至超过了 Fable。不过定价虽然只有 Fable 的一半,但综合成本因任务不同,差异很大,复杂场景成本可能反在 Fable 之上,性价比并不突出。

逻辑成绩:

表格的排序切换为按中位分数降序。

Claude Opus 5 测评

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。

*2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-06 月榜,新增#70#71#72#73题

*3 完整榜单更新在 https://llm2014.github.io/llm_benchmark/

*4 红字模型代表工作在推理模式下(慢思考),黑色模型则是对应的非推理模式(快思考)

编程 Agent:

Claude Opus 5 测评

*1 测试方式参见:大模型编程应用测试-V3榜单

  • 编程:总体上,Opus 5 相比前代 Opus 4.8 有大幅提升,从交付最终成品来看,大幅靠近或部分超过了 Fable 曾经的表现。从行为来看,Opus 5 有着与 Opus 4.8 和 Fable 5 都不同的行为模式,更加注重网络检索和自测。
  • Opus 5 在近期热门的 3D 建模方向有特别训练,通过 H 项目可观测到 Opus 的建模能力并不在 Fable 之下,也好于国产新王 Kimi K3。部分简单构型和简单材质,其精度甚至超过一些免费模型资源网站的手工建模产物。这个方向笔者测试不多,仅作为一点观察,更多可参考其他人的报告。
  • 自测意识一贯是 Claude 系列的特长,随着 Sonnet/Opus 的迭代,其自测能力也持续提升,从最初简单的编写静态单元测试,但 Opus 5 这一代,已经会动用所有手段进行饱和式自测,做的甚至比 Fable 还要多。在前端、客户端这类能使用本地模拟器自测的项目中,Opus 5 会严格的对照原始需求每个功能点,逐一截图确认。甚至需求中提到某种交互会带来多种表现,也会逐一测试。而后端项目则会为每个功能点编写详细用例,整个工程测试点超过 1000 个,也是前所未见。这使得 Opus 交付的产物在大面上的问题几乎消失,但代价也是 Opus 完成一项任务的时间和 Token 消耗极大,综合成本反超 Fable。如果要求 Opus 不做自测,则能观察到 Opus 的直出代码质量并不高,反复涂改次数多,Bug 率也不低于前代。可见 Anthropic 认为与其让模型一次性写对代码,不如让模型具备真人一样的长程细致 Debug 能力。
  • 推理效率:在经历连续3 代推理效率走低之后,Opus 5 迎来了全面好转。同样档位,Token 消耗几乎只有前代 Opus 4.8 的60%,而且不分问题类型,全面更低。部分问题设计了干扰条件,之前有的模型会被干扰,额外消耗注意力处理这部分信息,而 Opus 则会直击问题核心。目前 Opus 5 的推理效率虽然还略输 GPT,但考虑到其他同级别模型,包括北美新锐 Grok 和 Meta Spark 平均还是 Opus 前一代水平,Opus 5 目前的推理效率也算十分领先。不过非推理模式就没有享受到同样的技术红利,依然大量存量超长思考来拉高分数的情况,开销较前代翻倍,基本来到了部分推理模型的 low 档区间。非推理模式一定不要思考,Opus 并不认账。
  • 长文幻觉:前代 Opus 4.8 在幻觉方面进步显著,Opus 5 则更进一步。在极致的长文注意力测试任务上,Opus 5 首次拿到了满分,此前仅有 GPT-5.6 Sol 接近满分,国产模型阵营则普遍还在低分区间。在难度稍低的任务上,Opus 5 则可以稳定拿到满分或高分,也好于GPT-5.6 Sol。
  • 拒答:Opus 也引入了 Fable 同款安全检测,对部分敏感问题会直接拒答。比如测试题中有涉及密码破译,就全部被拒答,这部分题目也按 0 分算。甚至经过伪装后依然有不小拒答概率。

赛博史官曰:

在年初 Anthropic 拿出断代领先的 Mythos 之时,一度出现过一条光明大道,Mythos 以极高溢价卖给顶级公司,带来超额利润,次一级的 Opus 继续领先全场,是所有追求极致的程序员的不二之选。但事与愿违,首先是北美阵地腹背受敌,OpenAI 的冲击迅速且猛烈,手握海量数据的老马团队死而复生,背水一战的 Meta 团队也异军突起。短短半年时间,风平浪静的北美大陆烽烟四起,硝烟和血腥气息萦绕不去。Fable 救不了场,处境更尴尬的 Opus 也无能为力。不可否认 Opus 依然是一款性能领先,宝刀未老的好模型,也是众多下位模型的好老师。但对身处大洋两岸的普通用户而言,Opus 早已不是白月光。

本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
评测组小编的头像评测组小编
半价干翻Fable 5?Opus 5实测炸场,网友:差点从椅子上摔下来
上一篇 2小时前
虚拟恋人带不动大模型?MiniMax改价惹众怒 | 风眼观察
下一篇 2026年6月8日 下午6:23



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论