DeepSeek V4 Pro 0813 测评

短的结论:君子藏器于身

基本情况:

7 月末的 Flash 斩杀风暴带来了过大的震撼,给了速胜论者一种 Pro 将要毁灭一切的幻觉。然而现实终究不是速胜或速败的,在波折中进步,在螺旋中上升才是常态。

当然,就跟自身对比来看,这一次 DeepSeek Pro 要显著好于 Preview 版本,性能不再被 Flash 倒挂,性价比也基本能维持(涨价前)。编程方面也优于 Flash一些,各方面问题要更少。不过漫长的推理耗时也将 DeepSeek 原厂的孱弱算力储备暴露无遗。

逻辑成绩:

表格的排序切换为按中位分数降序。

DeepSeek V4 Pro 0813 测评

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。

*2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜

*3 完整榜单更新在 https://llm2014.github.io/llm_benchmark/

*4 红字模型代表工作在推理模式下(慢思考),黑色模型则是对应的非推理模式(快思考)

编程 Agent:

DeepSeek V4 Pro 0813 测评

*1 测试方式参见:大模型编程应用测试-V3榜单

  • 编程:总体上,Pro 与 Flash 在同一水平线,Pro 在任务初始阶段的深度推理,能带来更完善的规划,更低的直出错误率。同位 max 档位状态,Pro 花在规划上的 Token 比 Flash 有时会多出 20K。这使得 Pro 在结束规划后可以大规模的连续输出,而不必停下来重新思考。这种表现与 Pro preview 是如出一辙。而在开发完成后,Pro preview 不太注重测试的问题,在 Pro 正式版也得到改善。Pro 现在与 Flash 一样,都是自测的能手,甚至 Pro 掌握的自测手段比 Flash 更多,测试也更深入。相同任务上,Pro 花费的步骤要比 Flash 更多 20%~50%,其中很大比例都是自测引入的。
  • 同样的训练材料,得益于更大的 Size,Pro 可以学会并掌握的材料也更多,像在考察相对偏门知识的 K和 I 项目上,Pro 就基本能做到 Bug 一遍过,而 Flash 则要挣扎很久。不过 Pro 又是也会被过多的知识干扰,采用大量手段去校验同一个病因,带来步骤浪费。
  • Pro 在审美方面也与 Flash 一样,强的地方一样强,有过之。弱的地方也同样弱,并没有因为 Size 提升而自然改善。所以显而易见的是 DeepSeek V4 这一代在原始数据上有先天不足,这是无法靠训练技巧来弥补的。
  • 推理表现:Pro 的推理能力大致也与 Flash 相当,没有明显更强的任务类型。像归纳,洞察等通常属于大尺寸模型的优势领域,Flash 本就有良好表现,Pro 也只是能更稳定拿到高分,没有显著提升。在需要充分展开,枚举可能性的任务中,Pro 能分析的更深入一些,这也与二者在编程任务上的差异是相符的。Pro 和 Flash 在复杂多步推理主导的任务上 Token 效率基本相当,各有高低。在文本分析类任务上效率略低,少 15%。总体上可认为二者表现一致。
  • 死循环:江湖绝迹久已的死循环问题在 Pro 身上重现,在推理问题上,Pro 有小概率(<7%) 陷入死循环,其中有极少数情况,Pro 能自己意识到问题,在消耗上万 Token 后跳出循环。但多数情况还是一直输出单词“maybe” 到底。在没有死循环的任务中,也喜欢在推理时大量使用 maybe 句型,Pro 失掉自信力了吗?

赛博史官曰:

演员在台上沐浴聚光灯,激情演绎,收获掌声与鲜花。也会需要候场休息,调整状态,磨炼技艺。没有人永远是主角,曾经的鲜衣怒马也只是过眼云烟。一时成败,任由评头论足。要坚持走下去,成为最后还留在舞台上的人。这一身本领,还有的是施展的机会。

本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
评测组小编的头像评测组小编
DeepSeek官宣涨价:闲时五折?别被忽悠了
上一篇 3小时前
中国最大的AI包工头,要上市了
下一篇 2026年5月9日 下午8:36



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论