智谱 GLM-5.3-Flash 测评

短的结论:江山代有才人出

基本情况:

曾经的低价战神 DeepSeek 在涨价之后,同档位模型就再也没有明显的性价比之选。随后的 GLM-5.3 提质不提价,综合下来竟成了性价比先锋。

而要真正做高性能且低价的模型,在目前国内的算力成本之下,把模型做小是务实的选择,而且前面也有人证明过小模型一样可以堪大用。市场需要一款足够可用,又便宜到不必在意成本的模型,GLM-5.3-Flash 则正是这个选项。

推理能力上,GLM-5.3-Flash 和兄弟 GLM-5.3 师出同门,在多项能力上几乎没有差别,但推理消耗却可以做到更低。在一众推理消耗越来越高的国产模型中,Flash 蹚出了一条提升智力密度的新路。

逻辑成绩:

表格的排序切换为按中位分数降序。

智谱 GLM-5.3-Flash 测评

*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。

*2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-07 月榜 ,增加#74#75

*3 完整榜单更新在 https://llm2014.github.io/llm_benchmark/

下面对比 GLM-5.3-Flash(以下称 Flash) 与 GLM-5.3(以下称标准版)。

  • 继承性:在大部分中低难度的任务上,包括编程任务,Flash 的表现与标准版相同,仅偶尔幻觉失控,出现更低的下限表现。而在高难度任务上,Flash 依然可以保持与标准版相同或相近的极限表现,但无法稳定输出。作用在实际任务上,就是需要重试更多次才能得到最佳答案。虽然 Flash 的定价更低,重试花费不多,但 Flash 的输出速度没有提上来,还是会导致体验降级。
  • 幻觉问题:前面提到 Flash 偶尔幻觉失控问题,但实际情况是 Flash 的幻觉上下限差距更大,表现好的时候,可以比标准版幻觉更低,看到上下文中非常精细的文本。但表现差的时候甚至比标准版更坏,可能读不懂长文题,犯低级错误。在更长的文本中,Flash 更容易触发下限。
  • 推理效率:前面提到 Flash 的推理并没有像其他小尺寸模型那样靠拉长推理过程来换智力。具体而言,Flash 几乎在所有任务上,Token 使用都比标准版要低,最低的只有标准版的 40%,在大多数模型需要穷举来解决的问题上,Flash 几乎能只靠直觉快速缩小解空间。不过跟Token 效率标杆 GPT-5.6 系列相比,对手还是更胜一筹,一些难度的消耗依然要比 Flash 更低。部分任务要求穷举所有可能性,Flash 也会尽量考虑周全,消耗不比标准版低,但这带来另一个问题是会撞上 API 设置的最大 128K 输出,导致输出不完整。

赛博史官曰:

大模型虽然发展到了第四年,但没有用大模型做过日常办公,甚至没有用过大模型的人也多不胜数。而以此为根基的新业务,新产品也迫切需要一款足够低价的模型来磨掉 ROI 转正的关键的负系数。而随着旗舰模型纷纷迈进高可用门槛,甚至能力有些溢出,这些溢出的智力红利也理应由一款更平民化的模型来承接。市场需要低价模型,这款模型总要有一家来发布。

注:编程没有来得及测,因为接下来要赶几个其他模型。会在月榜里把 Coding 补上。

本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
评测组小编的头像评测组小编
突发:OpenAI首次公开入侵Hugging Face完整报告
上一篇 3小时前
Photoroom、Chub总榜双双飙升22位;Meshy上线原生8K纹理,双榜排名齐升 | AI产品周榜
下一篇 2026年7月30日 下午5:21



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论