
今日,Anthropic宣布推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。Fable 5.1和Mythos 5.1共用同一模型底座,差异只在于安全护栏配置。
Fable 5.1的优势集中在编程、知识工作与长周期任务场景。该模型在Anthropic放出的全部8项测试中霸榜第一,超过Fable 5、Opus 5、GPT-5.6 Sol。Artificial Analysis的数据显示,Fable 5.1在AI分析指数榜拿下66分,位列第一,超过Claude Opus 5的63分、Claude Fable 5的62分、GPT-5.6 Sol的61分以及Grok 4.6的61分。

Fable 5.1发布后几个小时,OpenAI联合创始人、CEO萨姆·奥尔特曼(Sam Altman)在社交平台X发长文剧透OpenAI很快也将推出下一款产品,称此前OpenAI一直专注于安全方面的优先事项。

价格方面,Anthropic称,无论使用哪种计费方式,Fable 5.1都将比Fable 5低25%。这是因为缓存读取资费下降75%,使得智能体类任务的价格最大降幅可至45%。
具体来看,Fable 5.1 API服务中的缓存读取操作成本为每百万Token 0.25美元(约合人民币1.68元)。对比Fable 5,常规业务负载的成本降幅约25%;复杂代码开发以及高智能体属性任务场景下,成本最高可节约45%。

除缓存读取资费之外,Fable 5.1其余定价与Fable 5保持一致:输入Token为每百万10美元(约合人民币67.21元),输出Token每百万50美元(约合人民币336.04元)。

▲Claude Fable 5.1价格(图源:Anthropic)
Artificial Analysis数据显示,尽管缓存读取资费下调75%,Fable 5.1单任务实际成本仍较Fable 5高出20%,根源在于其输出Token消耗量约为后者的1.7倍。

Claude Fable 5.1现已上线,兼容AWS、谷歌云、微软Azure;开发者可通过Claude API,使用模型名claude‑fable‑5‑1进行调用。
Anthropic内部高级个体贡献者Lance Martin透露了一个小tips,在CursorBench 3.2.0测试中,低推理档位(low‑effort)的Fable 5.1在性能表现上与Fable 5高版本相当,但成本却只有后者的1/3。

还有几位网友突然发现,Anthropic为自己重置了额度。
一、对比GPT‑5.6 Sol、Kimi K3生成效果更出色,但也更贵
在社交平台X上,网友已经玩疯了,纷纷放出自己的体验案例以及和GPT-5.6 Sol、Kimi K3的对比生成效果。
开发者对比Fable 5.1和GPT-5.6 Sol让其生成几个独立的3D场景,包括一座位于私人岛屿上的未来主义豪宅、带有钻石式枝形吊灯的宏伟大厅等。结果显示,Fable 5.1完成任务的价格是GPT‑5.6 Sol的6倍,但画面细节也更丰富。

还有开发者对比了Fable 5.1和Kimi K3生成游戏的能力。开发者体验发现,Fable 5.1在用户界面和游戏体验方面都优于Kimi K3,其机制更加流畅,交互体验也更出色。Kimi K3的成本为11美元,Fable 5.1为18美元。

开发者让Fable 5.1为自己设计了一座房屋,并制作了房屋的渲染图以及流畅的动画。可以看到视频里画面流畅,客厅桌椅反射到镜子上的影子都很逼真。有网友在评论区感慨,后悔做了设计师。

另一位开发者使用Fable 5.1制作出其最棒的《马里奥卡丁车》游戏,他称自己对这款游戏的开发非常满意。

二、8项测试霸榜,科学研究智能体测试性能几乎翻倍
Anthropic放出的基准测试显示,Fable 5.1的性能远高于其上一代Fable 5。当将其难度设置为低或中等时,Fable 5.1仍能取得与Fable 5相当甚至更好的效果,且成本更低。

▲主动性科学研究、终端编程(第一排从左到右)跨学科思维、自主编程(第二排从左到右)
Anthropic的基准测试中,Fable 5.1在全部8项基准中霸榜第一,尤其在科学研究和业务工作流两个“长程智能体”测试中,与其他模型拉开了很大差距。
尤其是科学研究智能体Terminal-Bench-Science测试中,Fable 5.1达到52.6%,其他三款得分均在22%–29%之间。

此外,Anthropic还提到,Fable 5.1不会采用会拉低输出质量的捷径,其具备定位软件问题根源的能力。例如,投资机构Millennium的测试显示,其内部系统存在一处罕见崩溃故障,历经数年排查,内部工程师以及其他大模型均未能找出诱因,而Fable 5.1定位到了该问题原因。
二、Mythos 5.1专搞科学研究,做分子设计、绘制金星地图
Anthropic举了几个例子说明Mythos 5.1在科学研究方面的能力。
分子设计:研究团队为模型接入开源蛋白质设计与折叠工具,结果表明,Mythos 5.1可以设计出亲和力更高的结合剂。针对3个靶点,其结合亲和力较竞赛最有成果Adaptyv Bio高出10倍,12个靶点测试整体命中率近50%,高于行业10‑15%的常规水平。

计算分析与建模:依托NASA三十多年前麦哲伦探测器任务获取的雷达影像,以及一份原有覆盖金星五分之一区域的高程地图,Claude Fable 5.1训练神经网络,生成了覆盖金星1/3地表的全新高分辨率高程图,分辨率由原先10‑20公里提升至2‑3公里,测高精度最高提升25%。
计算生物学:基于GPU运行任务专用机器学习模型属于常规做法,模型运算速度成为科研进展的主要瓶颈。Mythos 5.1的方案是自动编写定制GPU算子,并对中间计算结果做缓存处理,使七套开源深度学习模型获得最高2.5倍性能提升。


三、沿用Mythos 5管控,为企业提供零数据留存策略
Mythos 5.1将沿用Mythos 5的安全管控策略,对生物研究相关能力实施访问限制;暂未发现Fable 5.1的网络安全防护机制存在重大漏洞;针对恶意智能体编程、计算机操作类请求,模型的拒绝率与Mythos 5、Sonnet 5、Opus 5基本持平;自动化行为审计结果显示,在绝大多数指标上,Claude Mythos 5.1的对齐表现优于前代Mythos 5。
Anthropic还提到了在数据保留、安全机制方面的措施,其采用的全新企业安全防护体系(EFS),效果等同于零数据留存策略,将数据存储在完全由客户管控的云基础设施中,该功能将于今年秋末开始,分阶段面向企业客户推出。
安全方面,网络安全场景下,新版安全策略的误报数量较此前下降60%,部分得益于Fable 5.1已支持挖掘软件漏洞。其将我们联合美国政府搭建专项访问计划,开放Mythos 5.1的高阶生物能力,很快面向科研人员开启申请通道。
Mythos 5.1将通过两个可信计划进行开放:
生命科学验证计划(LSVP)面向生命科学领域专业人员开放,使用者可在其余安全防护机制保持生效的前提下,启用适配专业研发场景的防护策略来调用Claude Mythos 5.1。
网络安全验证计划(CVP)向防御性安全研究工作开放部分Opus、Sonnet系列模型,配套放宽网络安全相关防护限制。近期该计划将纳入Claude Mythos系列模型。
此外,Anthropic还提到,根据其此前签署的《欧盟人工智能法案》要求,8月2日之后发布的模型输出结果都会添加水印机制。这种水印不会对Claude输出的质量或内容产生影响,同时也不会包含有关用户、他们的组织以及他们与Claude之间的对话的任何信息。
结语:Fable 5.1把模型能力、成本的选择权,交给开发者
Fable 5.1此次更新跑分榜单全面领跑,但综合来看其输出token的消耗量仍在上涨,若无缓存读取价格下调的加持,其单任务成本反而抬升。与此同时,其通过下调缓存读取资费、并新增不同推理档位设定,可以将更多成本、模型能力的选择权交给开发者。
这也说明,对于Agent、自动化工作流这类生产业务,token标价已经不再是衡量成本的核心标尺,真实单任务开销、缓存命中率、推理档位调优更为重要。
本文来自转载智东西 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

