短的结论:最是一年春好处
基本情况:
DeepSeek 与众不同的是,他们热衷,并且擅长通过底层创新来提效,在这样持续不懈努力之下,即便会走一些弯路,但最终都会做出突破性的成绩。这次的 V4.1 看起来是小版本,但从模型结构到参数,都发生了很大的变化。
其中,逻辑能力相比自家 Pro 有显著跃升,来到国产第一梯队头部,底层架构创新带来的极致高速,也抹掉了部分思维长度劣势,平均耗时同梯队最低。而且如果使用 high 档,则思维长度显著减少,响应耗时会大幅降低,来到极高的可用区间。即便在世界范围,也具有竞争力。
Agent Coding 能力则提升幅度有限,略好于前代 Pro。但 V4.1 的 Agent 行为相比之前发生了较大变化,在不同任务上有较大差异,下文展开。
逻辑成绩:
表格的排序切换为按中位分数降序。

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。
*2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-08 月榜,增加#76、#77、#78。
*3 完整榜单更新在 https://llm2014.github.io/llm_benchmark/
Agent 成绩:

- 编程任务:V4.1 Flash 整体较 V4 Pro, V4 Flash Vision 等版本更优。单看测试分数不能完全体现。具体而言,V4.1 Flash 的综合审美能力比V4 各版本要显著更高,但离第一梯队还有差距,V4.1 Flash 可以利用视觉能力检查并修正诸多 UI 表现,一部分布局和样式问题,但对审美要求更高的间距、配色,以及更复杂的高级建模,动效,转场等任务,V4.1 Flash 则表现还不及预期。V4.1 Flash 的修复能力很强,对大部分的美学问题,如果人为干预,乃至提供范本,则模型可以完成的更好。
- V4.1 Flash 完成任务的步骤显著的多于前代 Pro 和 Flash。观测到增幅至少在 +20% 以上,极端情况是项目 J,增幅+700%。这其中绝大部分增幅来源于自测环节,前代 Pro 比前代 Flash 自测更多,但总体还在合理区间,甚至在不太熟悉的技术栈上基本不自测,只做简单静态编译检查就结束。而 V4.1 Flash 则会更加细致的展开全面广泛自测,对每个功能点编写用例,并截图视验。max 这种表现通常来自在强化学习环境中,模型为了追求极少量 reward 增益而进行的不计代价的尝试。如果使用 high 或者 low 档位,在中等难度任务上表现与 max 档位近似,而步骤则会少很多,实用性更高。
- V4.1 Flash 的 Bug 定位能力和前代 Pro 相当,远好于前代 Flash。表现为对于任意 Bug,都可以在无人工提醒情况下找到根因并正确修复。于 Pro 的差别只在于个别 Bug 存在多种改法,V4.1 第一遍改错了方向。但这也具有随机性。而且这仅限于测试任务,对于更广泛的真实任务则还需读者自行观察。
- 推理消耗:V4.1 Flash max 档位表现出前所未有的推理努力程度,在多个中等难度任务上甚至会消耗达到260~340K,远高于前代,以及其他所有模型。在简单指令遵循任务中也会消耗到 60K 级别。更关键是,V4.1 Flash 在消耗过量 Token 后,解题正确率并没有提升,反而前代 Pro 的平均正确率更高。而V4.1 Flash 真正得分更高的任务,消耗基本持平前代。这也再次印证了 max 档位并不适合日常使用。
- 幻觉表现:V4.1 Flash 的幻觉表现要比前代更低。不过前代的幻觉控制并不优秀,有些场景是低于同梯队模型的。V4.1 Flash 算是补上了短板,但相比国际领先模型,则差距依然明显。最大问题在于一旦文本本身迷惑性加大,则 V4.1 Flash 还是吃不消,表现很不稳定,最坏情况也没有高于前代。这在 Agent 任务上的表现就是面对复杂任务清单,可能会随机的丢弃部分信息。
赛博史官曰:
大模型的发展具有螺旋性,前一代的成功并不代表后继模型就会全面超越,而前代不足也不能说明团队江郎才尽,油尽灯枯。关键是看团队坚持什么方向,他们的动作在不在主路径上。而对于追求 AI 普惠的 DeepSeek 而言,极致的降本正是其持之以恒的信标。而 DeepSeek 的每次创新,都会给整个模型界带来新的可能性,最终反哺到全行业的进步,对此而言,如沐春风。
本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

