DeepSeek V4 Flash 测评

短的结论:不畏浮云遮望眼

基本情况:

对于 300b 尺寸的模型来说,上限究竟在哪里,不同团队都给出了自己的答案。最早交卷的 MiniMax 认为 300b 只能满足日常轻度需求,而混元则认为 300b 足以承担大部分不复杂的工程任务,OpenAI 则把小尺寸的 Luna 交给 AI 去自迭代训练,当做试验田,但结果尚不尽人意。但 DeepSeek 认为这都不是极限,300b 可以去到前人未至之境,既能进行高智力推理,也能满足复杂开发。

推理来看,新 Flash 极限打平自家 1.6T Pro preview,稳定性反超。不过代价是Token 消耗也增长 50%,这是后训练的代价。Agentic 编程能力上完全超过 Pro preview,基本来到高可用区间的下限。

逻辑成绩:

表格的排序切换为按中位分数降序。

DeepSeek V4 Flash 测评

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。

*2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜

*3 完整榜单更新在 https://llm2014.github.io/llm_benchmark/

*4 红字模型代表工作在推理模式下(慢思考),黑色模型则是对应的非推理模式(快思考)

编程 Agent:

DeepSeek V4 Flash 测评

*1 测试方式参见:大模型编程应用测试-V3榜单

  • 编程:Flash 的编程能力有较大的差异性,同时体现在语言的差异和 Harness 差异上。Flash 同许多国产模型一样,在训练语料和训练方法更成熟的前端领域效果显著,最终成品可以和参数大近 3 倍的 GLM-5.2 互有胜负。但在 Rust、swift 这类非热门领域,效果则断崖下跌,Flash 大体上知道需要做什么,但对细节的掌握程度还是不如前端高。而 Pro/Flash preview 版本则连需要做什么,如何推进都不太清楚。
  • Harness 差异主要在 Claude Code 与 Codex 的默认设置和工具链不同。其中 Claude Code 默认的单次输出长度限制了 Flash 的发挥。Flash 和先前preview 一样,喜欢在动手前想清楚,在复杂项目的规划阶段,Flash 一次思考有可能达到 50K Token。而 Codex 则是因为自身迭代频繁,Flash 对其中的工具使用效率偏低,同样任务可能会多 30~40% 步数。不过从最终效果来看,两种 Harness 差异不大。而即将发布的自家 Harness 能同时解决默认配置和工具熟悉问题,至少不会在这方面拖后腿。
  • 尽管 Flash 依然没有视觉能力,但其前端审美能力也显著高于前代 preview。之前 preview 直出 UI 处于 Demo 级别,无法投入生产环境。而正式版的 UI 精度,配色,尺寸,交互细节等基本达到准生产级。甚至会主动增加转场效果,icon 动效这类小巧思,这在部分更高阶的模型中也很罕见。不过也需要强调,Flash 的 UI 能力仍弱于第一梯队头部模型,尤其是 web 端以外的 UI 构建场景。涉及到建模、动画场景,则 Flash 劣势凸显,显露出训练不充分的状态,而这是大尺寸前沿模型的优势方向。
  • Flash 的自测和验证手段丰富多样,除了传统的测试用例,Flash 还会将截图转为 ASCII 字符图来间接理解画面状态。也会编写自动化序列操作来模拟复现一个复杂的动画场景,再通过读取逐帧的状态数值来判断动画是否有问题。这类手段大都行之有效,例如在 F 项目 Godot 场景里,Flash 依靠自测发现并修复了几乎所有功能 Bug,剩余问题主要是交互和性能。
  • 推理能力:与 Pro preview 相比,Flash 并不能做到完胜。Flash 主要强在受编程和写作训练而泛化出来的诸多元能力,比如指令遵循和文字处理等。比如在 7 月新题中有对文字处理要求极高的题目,Pro preview 与多数国模类似,得分极低。而 Flash 则跃升到国模第一,与 GPT-5.6 Luna 相当。约束求解类型,Flash 与 Pro preview 互有胜败,极限相当。
  • 幻觉:上下文幻觉也得到有效抑制,Flash 在处理超长文本时,细节注意力强过 Pro preview,处于第一梯队水平,但不算顶尖。在编程方面,注意到 Flash 在上下文超过约 400K 才开始出现丢失原始指令要求的情况,高于先前 Pro/Flash preview。
  • 任务效率:虽然 Flash 的单轮平均 Token 高于 Pro preview 约24%,但分布并不均匀。其中指令遵循类,Flash 的效率更高,Token 可低至 Pro 的 50%。部分简单编程任务,Flash 的原始直觉也更好,用量略低。除此之外的任务场景 Flash 都高于 Pro。而且Flash 在复杂Agentic 任务上迭代轮次更多,也导致相同任务下,Flash 消耗的 Cache Read 显著高于 Pro 2.7~5 倍。这部分差异按 API 计价,使得 Flash 成本仅比 Pro preview 略低约 30%。而如果第三方 API 做不到 DeepSeek 原厂的 Cache 效率和成本,会导致 Flash 失去成本优势。

赛博史官曰:

对于自己能掌控迭代节奏的团队而言,什么时候发布不是问题,有没有做到理想状态才是问题。DeepSeek 想要成为所有大模型公司中执牛耳者,那自然就不能跟在别人后面,拾人牙慧,亦步亦趋。北美的前沿实验室在无人区开拓了 3 年,他们没有老师,唯有相信自己。而 DeepSeek 也是这一理念的践行者,在他们眼中,没有对手,只有终末之地。

本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
评测组小编的头像评测组小编
李飞飞教机器人摸麻将挤牙膏,AI 终于有「手感」 了
上一篇 4小时前
AI有嘴了,OpenAI连发三语音模型
下一篇 2026年5月8日 下午1:36



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论