上周末,Anthropic CEO 阿莫迪带头发长文呼吁减速,奥特曼、马斯克和哈萨比斯等几大顶流也纷纷在 AI 刹车这件事上达成共识。
可倡议书刚发出来没几天,GPT-6 Sol 和 Claude Opus 5.2 的爆料信息却又在本周双双刷屏。不是说好要踩刹车了吗?怎么又卷起来了。
OpenAI 放出重磅预告,GPT-6 Sol 成猜测大热门
昨天,OpenAI 赛博义父 Tibo 在社交平台上神秘兮兮地表示,这周要端出一批分量堪比 DevDay 的重磅更新。

奥特曼随即顺水推舟转发,并抛出了经典的谜语人式预告。

根据部分测试用户反映,自己的日常请求似乎已经被悄悄分流到了 GPT-6 Sol。X 用户 Kiran Jd 昨天也晒出了详细体验:
新模型的普通模式速度至少提升了 50%,token 的响应时间改善了约 67%;他让两个任务线程连续跑了两个多小时,最后只花掉了大概 3% 的周额度。用 Kiran Jd 的话来说,新模型更像是一款「更便宜的 Astra」。

此外,各显神通的网友们,也找到了一些关于鉴定新模型的蛛丝马迹。

有网友尝试在不联网、不调用记忆的情况下,让模型回答竞品 Claude Opus 4.7 的发布时间,觉得只要能准确报出新事件,就证明后台换了更新的知识底座;

还有网友试图通过抓包看内部的「juice」数值来区分版本。
除了模型本身的传闻,OpenAI 联合创始人布罗克曼最近也吊足了胃口。他透露 OpenAI 在「另一个千禧年数学难题」上取得了显著进展。

而根据之前流出的网传消息,这次的突破方向几乎被锁定在了代数几何皇冠上的明珠——霍奇猜想(Hodge Conjecture)。
作为代数几何领域最著名的开放问题之一,霍奇猜想试图解答一个非常抽象的问题:那些通过拓扑和微积分分析观察到的某些几何结构,究竟能否全部对应到由代数方程定义出来的几何对象上?
此外,据网友 Leo 爆料, OpenAI 或 Anthropic 还同样在集中重兵,逼近另一道千禧难题——BSD 猜想(Birch and Swinnerton-Dyer 猜想)。

Claude Opus 5.2 被曝内测,AI 开始主动检查自己的工作
最近几天,几位 Claude Code 的重度用户表示自己疑似内测了未公开的 Opus 5.2,测试场景覆盖了写代码、操纵浏览器、调用插件和多 Agent 协同。

用户 Chetaslua 提到,界面上写的虽然还是 Opus 5,但后台可能已经切成了新版本。
在他放出的案例里,模型跑完用户交代的任务后并没有直接歇工,而是主动检查并优化了一遍产出结果。

另一位用户 Gegam 连续测了两天,发现这版模型处理残缺信息的能力明显变强,不需要用户来回确认细节。在 8 个复杂测试任务里,模型不仅一路推进到底,收尾时还会自我复核。
在调用能力方面,他观察到模型不会一股脑把 Skills、MCP 和插件全塞进上下文,而是按需索取,跑完大量重活后,会话只消耗了约 60% 的上下文。
更戏剧化的是,在多 Agent 协作测试里,一个疑似 Opus 5.2 的子 Agent 甚至挑出了另一个模型在任务分配上的毛病,并要求重新分工。据此,Gegam 认为它的能力已经够到了 Astra 和 Fable 的水平。

上下更多内容
在视觉生成上也有类似的反馈。
用户 SuSu 酥酥用一张「戴头盔的鹈鹕骑自行车」的 2D 线稿做测试,模型不仅把它扩充成包含了道路、灯塔和围巾的完整 3D 场景,还在初稿后主动进行了多轮细化。

另一位用户 Conor Dart 用一个耗时 51 分钟的项目测试后,也认为该模型在单次成功率和画质上提升明显。

还有网友就在 Microsoft Foundry 中翻出了疑似 claude-opus-5-2 的模型标识,暗示 Anthropic 已经在云平台侧做准备。
如果不出意外,我们在本周就能见到这两款新模型登场。至于 Codex 会不会顺手再重置一次额度,就看 Claude Opus 5.2 给不给力了。
回过头看,上周末那份言之凿凿的减速倡议,反倒更像是一场各怀心思的心理战: 人人都希望对手先踩刹车,好让自己在弯道上多超半个身位。
本文来自转载APPSO ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

