
今天凌晨,Anthropic发布Claude Opus 5.5,这是Claude 5.5系列的首款模型。Anthropic称,新模型在多数任务上的表现与Claude Fable 5.1相当,默认设置下的典型任务成本较上一代Opus 5降低40%,输出速度提升超过30%。

在官方公布的9项测试中,Opus 5.5有7项成绩领先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.5在三项编程测试中均取得最高分,但在业务流程和科研Agent测试中仍落后于GPT-6 Astra。
在第三方评测机构Artificial Analysis的Intelligence榜单上,Claude Opus 5.5以58分位列第一,领先Claude Fable 5.1和GPT-6 Astra的53分。

具体任务中,Anthropic披露,Opus 5.5用9.5小时完成了将负载均衡软件HAProxy从C语言改写为Rust的任务,成本比Fable 5.1低51%;在要求逐一核对数字和引语的财报研究测试中,其生成的18份报告有16份达标,Fable 5.1和Opus 5则均未通过。此外,一名早期测试者使用Opus 5.5,不到一天完成了涉及68万行代码的迁移。
价格方面,Opus 5.5每百万输入、输出Token分别收费4美元(约合人民币26.8元)和20美元(约合人民币134元),较Opus 5下调20%;缓存读取价格较Opus 5下降60%。与此同时,Anthropic提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自行选择使用时间的额度重置机会。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台。不过,部分专业任务仍受安全机制限制,例如大多数网络安全任务会被转交Opus 4.8处理。Claude Sonnet 5.5和Claude Haiku 5.5计划在未来几周推出。
Claude Opus 5.5发布近2个小时后,OpenAI也推出了GPT-6 Sol和GPT-6 Luna,GPT-6“宇宙”加入新成员。

一、编程成绩超过Fable 5.1、GPT-6 Astra,输入输出价格下调20%
Anthropic公布了Opus 5.5与4款模型在9项测试中的成绩,对比对象包括Fable 5.1、Opus 5,以及OpenAI的GPT-6 Astra和GPT-5.6 Sol。9项测试中,Opus 5.5有7项得分最高。
智能体编程方面,Opus 5.5在Terminal-Bench 4.0、FrontierCode v1.1和CursorBench 4.0上分别得到66.4%、54.4%和57.8%,三项都是对比模型中最高。
在业务流程测试AutomationBench和科研Agent测试Terminal-Bench-Science 0.1中,其成绩低于GPT-6 Astra。

价格方面,Opus 5.5每百万输入Token收费4美元(约合人民币26.8元),每百万输出Token收费20美元(约合人民币134元),均较Opus 5下降20%。
Claude Code和Claude Platform还提供Opus 5.5快速模式,Anthropic称其速度最高可达普通模式的2.5倍。该模式每百万输入、输出Token分别收费8美元(约合人民币53.6元)和40美元(约合人民币268元)。
二、9.5小时完成代码改写,财报测试18份报告中16份达标
编程方面,Anthropic重点展示了代码迁移、代码库审查和性能优化等长时间任务。
Anthropic称,一名早期测试者使用Opus 5.5,在不到一天内完成了涉及68万行代码的迁移。另一名测试者对一个20万行代码库进行审查和修复,Opus 5.5用时不到3小时;Opus 5完成该任务则超过20小时,消耗的Token是前者的2.5倍。
在内部测试中,Anthropic要求Opus 5.5和Fable 5.1将负载均衡软件HAProxy从C语言改写为Rust。两者改写后的版本均通过了HAProxy自身几乎全部回归测试。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。
另一项网页性能优化测试要求模型降低一个Web应用所有页面的加载时间。Opus 5.5在40次测试中成功39次。Anthropic称,Opus 5的优化幅度较小,且改变了应用原有行为。
Anthropic还比较了不同推理强度下的任务成本。Anthropic称,在默认推理强度下,Opus 5.5在FrontierCode上的成绩超过GPT-6 Astra,单次任务成本约为后者的20%;在Terminal-Bench 4.0上达到相近成绩时,成本约为后者的40%。这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。

知识工作方面,Opus 5.5在覆盖44种职业任务的GDPval-AA v2.1中取得1846分,高于Fable 5.1的1735分和Opus 5的1708分。

Anthropic还设计了一项财报研究测试:模型只能在一个财报公告较难找到的网页副本环境中检索资料,并据此撰写公司季度业绩报告。自动评分程序会逐一核对报告中的数字和引语,任何编造都会导致不达标。
在不同推理强度下,Opus 5.5生成的18份报告中有16份通过质量门槛,Fable 5.1和Opus 5则未有报告通过。
另一项测试中,Anthropic要求模型分析两家虚构人力资源软件公司的并购交易,先用Excel建立财务模型,再生成面向管理层的演示文稿。Opus 5.5与Opus 5得出了相同的交易判断,但前者用时63分钟,后者用时93分钟,前者成本低50%。Anthropic认为,Opus 5.5的财务模型更完整,演示文稿更易读,Opus 5的结果则存在少量错误。
三、回答更简洁,越界尝试降低85%
除了任务执行能力,Anthropic还调整了Opus 5.5的写作与沟通方式,包括优先呈现关键信息、减少术语和不常见表达,以及更好地遵循用户指定的写作规则。
在官方展示案例中,两个模型被要求解释同一个问题,某客户8月的账单金额为什么出现了额外的下降。Opus 5.5在第一句话中能够直接给出结论,“计费系统重构导致月末账单出现漏计”,再解释代码边界条件如何产生错误。从篇幅来看,Opus 5.5的回答也更简洁。

安全方面,Anthropic称,Opus 5.5发布前接受了METR、Frontier Design等外部机构评估。在覆盖近2000个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期Claude模型。
在一项测试模型是否试图突破隔离边界的新评估中,Opus 5.5尝试绕过边界的频率,较Opus 5或Claude Mythos 5.1降低约85%。按照官方描述,Opus 5.5出现的相关尝试均被评为低严重程度,且模型自行报告了这些行为。
提示词注入方面,Anthropic称,Opus 5.5在编程、工具调用、计算机操作和网页浏览等受测场景中的防御表现不弱于Opus 5。在AI安全公司Gray Swan开展的一项测试中,Opus 5.5与Fable 5.1并列取得受测模型中最低的提示词注入攻击成功率。
不过,Anthropic同时承认,部署前评估仍无法可靠发现所有失效情况。测试中,Opus 5.5经常疑似意识到自己正接受评估,这会增加判断其真实部署行为的难度。
针对后续模型,Anthropic计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控和评估,减少对模型所写思维链的依赖。这些属于后续安全工作方向,并非已经验证有效的结果。
四、部分安全任务转交旧模型,订阅额度同步提高
Opus 5.5此次上线附带了与Fable 5.1类似的网络安全、生物学和反蒸馏防护机制。触发相关限制时,请求会转交其他模型处理。
网络安全方面,用户仍可在日常软件开发中查找和修复代码漏洞,但大多数网络安全任务会被转交Opus 4.8。Anthropic计划在未来几周扩大网络安全验证计划,将Opus 5.5纳入其中,并设置三个不同权限等级,部分等级可使用Claude Mythos模型。
生物研究方面,Anthropic称,Opus 5.5在多个任务上的能力达到或超过Claude Mythos 5.1,因此采用了与Fable 5.1相同的生物学防护措施。受相关限制影响的学术实验室、初创公司和药企,可申请生命科学验证计划,经审核后获得适用于更广泛生物研究工作的访问权限。
反蒸馏方面,Opus 5.5启用了“保留思考”(preserved thinking)机制,限制API用户通过修改Claude此前上下文来提取模型推理。该机制适用于2026年8月31日及之后创建的API账户,覆盖Fable 5.1和Opus 5.5。
数据处理方面,Opus 5.5继续提供零数据保留选项,并加入Anthropic所称用于满足欧盟《人工智能法案》要求的水印措施。同时,该模型不再提供关闭思考模式的选项。
Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台,开发者可通过模型标识claude-opus-5-5调用。
订阅方面,Anthropic提高了Pro、Max、Team及按席位计费的Enterprise套餐的五小时使用额度。订阅用户还将获得一次使用限额重置机会,可保留至需要时使用。
结语:长任务的效率与成本成为升级重点
Opus 5.5此次更新的主要变化,是在提高部分编程和知识工作测试成绩的同时,也着重降低了完成任务所需的时间和费用。对于需要持续运行的Agent,这些变化直接关系到实际使用成本。
不过,官方测试中的优势能否延续到真实业务中,还取决于任务复杂度、结果准确性,以及安全限制对任务执行的影响。
本文来自转载智东西 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

