#1 参赛选手
本次更新模型(按发布时间顺序),共 13 个:

*美元定价按1 USD = 6.9 RMB 汇率折算
本月出榜:
替换为后续型号
Gemini 3.5 Flash
Gemini 3.1 Flash Lite
Kimi-K2.6
GPT-5.4 Mini
Grok 4.3
Claude Sonnet 4.5/4.6
Claude Opus 4.6/4.8
Tencent Hy3 preview
不再追踪
MiMo-V2.5
所有出榜模型历史成绩可以在新网站:https://llm2014.github.io/llm_benchmark/ 中查看。
#2 评测说明
- 本评测是个人性质,结合自己需求和对大模型的理解,使用滚动更新的私有题库进行长期跟踪评测。题目侧重于对人类难度不高,但大模型尚无法稳定解决的边缘任务。题目不会包含已被大模型充分训练的题型,也不包含对人类过于复杂的前沿智力问题,不刻意利用模型机制缺陷刁难模型。
- 本评测的题库规模不大,长期维持在28题/270个用例以内,不使用任何互联网公开题目,题目全部使用中文。每月滚动更新,淘汰平均分率超过70%的题目。题目不公开,意图是分享一种评测思路,以及个人见解。每个人应该根据自己所需,对大模型进行考察。不可盲信任何评测。
- 因为题目会每月增减,每个模型的成绩在每个月榜单中会有正负3分以内的变化,属于正常现象。大致排序保持稳定。
#3 题目和打分
本月新增 4 题,淘汰 4 题。一共28题。
32、干支纪年:天干中删除部分,求历史某一年的干支
39、火车售票:多个车次,多人次操作购票退票,求最终售票情况
41、交织文本解读:从多段交织混合文本中寻找问题答案
45、编程问题:完成复杂约束下对三维数组做变换(Python)
48、字符处理:给定规则下,对英文文本进行逐字符计数和处理
49、激光布局:根据条件约束,在10×10空间中部署满足要求的激光器
50、日志解析:给出约300行某系统日志进行问题发现
51、复杂计算:综合考察K12范围内的数学公式和计算能力
52、观棋不语:从一场没有解说的对局中归纳游戏规则
53、管道疏通:使用一定手段使阻塞的管道通畅
54、高级拼图:从多块拼图中选择部分拼图完成图形
55、地形迷宫:没有唯一解的自由探索迷宫
56、年会抽奖:在多重规则下和复杂文本下找到年会中奖者
57、单词组合:从数百个单词中找到满足条件的N个词
58、规则推导:从给出的计算示范中推导计算规则
60、程序编写:完成有多个相互影响条件的程序编写
61、信息压缩:还原一段被压缩的信息
62、字符矩阵:按多条件约束填充一个字符矩阵
63、机器操作:按指令操作一台有大量状态的机器
64、三维重建:根据多个方向拍摄的X光片,重建三维物体
65、长文本总结:从文本中提炼关键数据进行统计汇总
66、深度关系:根据文字描述理解物体的位置关系
67、交点计算:复杂函数的交点计算
68、平面折叠:分析平面折叠后的位置关系
70、【New】目标穷举:穷举满足约束条件的所有组合
71 、【New】语义还原:从混乱的语序中还原有意义的原文
72、【New】多轮猜谜:有限轮数,反复试探,找到答案
73、【New】文字压缩:将指定文本压缩为指定格式
测试规则:
1、【New】模型优先使用官方推荐的超参,如果没有推荐,则使用默认参数,不做任何设置。从本月起,所有题目不再设置推理 Token 上限,模型按各自支持的最大 Token 推理,如果最终推理超过 80K(简单题)/128K(复杂题),会进行扣分惩罚,超过越多,惩罚越多。最高可扣到题目总分的一半。
2、【New】从本月开始,评测优先使用聚合中转站接口,并指定官方渠道供应商。保证在使用官方部署版本的前提下,降低被官方追踪的概率。
3、不同题目分数不同,按各自规则计分后进行归一化处理。最终满分区间是 0 到 100。
#4 成绩解析

本月更新模型的评测文章如下:
7月有 GPT-5.6、Kimi K3、Opus-5 等前沿模型冲击智力上限,因此笔者也加快换题速度,并尝试不同的题目类型,首次引入#72 动态多轮。
#70 目标穷举主要利用了不少模型在面临约束求解类型问题,有无法克服的穷举冲动,以前对这类行为并没有很好的约束手段。因此#70 故意利用这种特性,要求模型穷举出所有可能性,可以看到各模型在 Token 管够的情况下,到底能不能不遗漏的仔细处理所有边界情况。GPT-5.5/5.6 可以在较低的 Token 内充分考虑所有可能性,有概率列出超出标准答案的目标数量,国产 Kimi-K3 也跟随其后,Token 消耗也不算高。GPT-5.6 Luna 也基本可以举出半数答案,显示出于 Sol 师出同门的地位。而绝大部分国产第一梯队模型最好水平也仅能持平 Luna。而二三梯队模型大都只能找到少量或者根本找不到目标。实际上#70 题的题面仅仅是改造自某个早已饱和的题目,可以看到在改换描述后,泛化能力不足的模型有巨大退步。
#71 语义还原故意混入了很多相似字词,用来迷惑大模型,但对人类难度不算高。此题主要考察模型对抗幻觉能力。最高分依然被 GPT-5.5/5.6 拿到,但无法满分。连 GPT-5.6 Luna 也会断崖降到一半分数,Qwen3.7-Max 与之持平,其他第一梯队国模则普遍在幻觉中挣扎,只能还原部分用来兜底的最简单和明显的词句。二三梯队呈现大面积 0 分,未来改进提升空间巨大。
#72 多轮猜谜是本次引入的实验性题型,通过渐进式的条件披露让模型猜谜,模型即需要猜测技巧,也需要灵感或直觉,否则有限轮次里猜不出答案。这道题理论上拥有丰富知识并且能活用知识的模型有优势。果不其然是老模型 Gemini-3.1 Pro 稳定猜对,并且 Token 消耗也不高。GPT-5.5/5.6 兄弟各能猜对 1 次。Gemini 猜对主要是稳扎稳打,精准猜测试探,做到拿到足够多条件再一击必中。GPT 则是展现出极强的直觉,仅靠少量条件就开始盲猜,但几次尝试也能猜中。此外除了 Opus-5 和 GLM-5.2 各对 1 次,就没有模型能猜对了,普遍没有正确思路,盲目推进。
多轮题目的“副作用”是,在模型最终猜对之前,模型厂拿不到完整题目,理论上不能直接背最终答案,只能依赖模型泛化来间接提升正确率。这类题目也是未来主要题目升级方向。
#73 文字压缩可以看做#71 的反向命题,需要模型自己来构造类似#71 的题面,因此问题转化一个复杂约束求解问题,考察模型如何处理约束,找到最优路径。各模型解答情况相对不乐观,即便 GPT 兄弟也不再能拿满分,反而 Grok 4.5 这位秽土转生者智力爆发,拿到 2 次满分,体现出很好的规则遵守能力。可能是题目涉及中文活用的缘故,擅长中文的 Seed 2.1 Pro 也能有较好表现,甚至非推理模式也能拿分。DeepSeek V4 Pro preview 也有概率输出高分答案,但会因为消耗过多 Token 而被罚分,否则他会是国模最高分。
#5 编程能力
对于具备一定编程能力的模型,会加测实际工程项目,通过多轮交互,从零构建一个准生产级产品。包含桌面App,移动端App,后端,网页,游戏项目。每个项目涉及的语言和知识面不重叠。每个项目的每一轮根据对需求的实现程度进行扣分,没有实现的部分,补充提示进行交互,直到实现全部需求点,或者因为原地打转停止测试。详情可以参见:大模型编程应用测试-V3榜单
再次解释分档含义:A档是几乎不犯错,只犯微小的UI、交互类错误。B档是大概率会错,但只要描述错误,都可以在不超过2轮内修复。C档是大概率错,但需要交互更多轮,模型能自主推进修复,无需人工提供辅助。D档是必须有人工提供大量log,视觉描述,协助操作等才能修复问题。Failed是知识或方法论不够,即便有人帮助,也无法完成任务。同档位中,只有少数轮次出现问题,大部分情况表现良好时,会升半档,用 B+,C+ 来表示。
本月主要尝试优化测试效率。原先 C 到 G 5 个项目都是多轮项目,通过中途多次重启来,来观察模型面对存量代码,如何有效发起探索。随着模型能力提升,存量探索已大体不是问题。观察二三梯队模型的错误情况,通常也不是来自存量探索不充分,而是对新需求把握不好。所以得到一个洞察,轮次可以压缩,不必再把完成工程拆成 10 轮。
因此新的 H 和 I 项目实践了新的模式,只保留 2 轮,第一轮让模型从 0 开发完整需求。第二轮重启后修复所有 Bug。从结果来看,这样的模式也能很好拉开各个模型差距。尤其按档位来看,好的模型依然可以不错或少错,错误能一次改好。下位模型则也会反复出错,Debug 效率低下。
H 项目是考察模型的 3D 建模和审美为主,但建模复杂度不高,所以叫 Simple Model。Opus-5、Kimi K3 这类在建模方面有良好口碑的模型,在 H 项目上游刃有余,输出的美观度远超其他模型。尤其 Opus-5 输出的模型材质在精度方面达到了前所未有,甚至超过 Fable-5 的高度。当然最终成本也超过 Fable。而下位 C 档模型虽然整体更差,但也有一定可用性,如果是用户提供材质,不要让模型自绘,则无疑会极大提升这类模型的可用性。
I 项目是原先 D 项目的升级版本,更换了底层技术栈,但功能基本不变。各模型得分如果跟 D 对照则能看到非常明显的差异。头部模型基本不受影响,无论是拆功能还是完整功能一次性写,最终交付成品是基本相当。甚至Opus、Fable 这类模型,因为一次拿到了更多需求细节,反而有更多合理发挥空间,能充分考虑用户真实诉求,做出更好的成品,UI 设计,服务端设计等可以做的更妥善。国产 Kimi K3 也完全不弱。而下位模型则普遍差于 D 项目,内容合并后,反而无法细致遵守每一条规则和约束。这也说明,随着模型能力提升,一次性讲清楚需求更为重要。
现有的 C 和 D 项目对头部模型已饱和,下月起将不再使用。其中 C 项目也会升级为 2 轮版本。D 项目已被 I 项目取代。
#6 后记
事情正在起变化。一方面国产模型正在大举侵入北美模型腹地,另一边北美则在价格下探。原本处于上下位的两类模型正在交汇。一时间,低价模型不再等于低质,高价模型也未必好用,定价贵的模型也许任务成本并不高。但对用户来说,这或许并不会带来困扰。随着模型逐步从可用,易用,来到好用,普通用户已经越来越难分辨头部模型的优劣,价格、速度开始成为主要考量。这也意味着接下来,中美模型都要真刀真枪的争夺用户了。
本文来自转载大模型观测员 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

