评测组小编
-
大白话速通 WorkBuddy,普通人拥抱 AI,先从干中学开始
在 AI 时代,只要你学得足够慢,你就可以不用学。 年初 OpenClaw 最火的时候,为了养一只「龙虾」,有人专门买 Mac mini,有人从命令行开始补课,装环境、配模型、研究…
-
1分钱9张图!DeepSeek视觉模型连夜实测
家人们,鲸鱼开眼了! 等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。 我也是第一时间赶到现场,连夜开始实测。 相比V…
-
实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。 有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro …
-
深度体验DeepSeek Harness,我原谅它涨价了
DeepSeek Harness,终于发布,并且将源代码开源了。 为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。 这段时间里,为了测试,我几乎把我所有Vibe…
-
首发体验 | DeepSeek Harness 来了,它不想做下一个Codex
就在刚刚,DeepSeek 正式发布了首款 Agent 产品,DeepSeek Harness。 早在 V4 Flash 正式版更新日志里,除了直接对标 Claude Opus 模…
-
DeepSeek V4 Pro 0813 测评
短的结论:君子藏器于身 基本情况: 7 月末的 Flash 斩杀风暴带来了过大的震撼,给了速胜论者一种 Pro 将要毁灭一切的幻觉。然而现实终究不是速胜或速败的,在波折中进步,在螺…
-
实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里
一夜之间,三款重磅模型罕见撞车。 Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。 看完 V4 Pro 正式版的跑分图,我只能说,这波提升还是肉眼可见的。…
-
Qwen3.8-Max 测评
短的结论:甲光向日金鳞开 基本情况: Qwen 半年来连续遭遇团队变故,多少会影响到研发节奏。前 4 个月几乎月更模型,但发布 Qwen3.7 之后,节奏却突然慢了下来,足足打磨了…
-
实测Qwen3.8-Max:国产模型开始从「会写代码」走向「能交付任务」
如果一个 AI 每 10 分钟就要你回来看一眼,它当然有用。但它还称不是上是真正的劳动力。 过去国产模型和海外顶级模型之间最明显的体验差距,其实不在“会不会写代码”。很多模型都能写…
-
给 Codex 和 Claude Code 接入 DeepSeek-V4-Flash,夯爆了!
大家好,我是程序员鱼皮。 这几天 DeepSeek-V4-Flash 正式发布 API 公测了,这个模型主打一个性价比高,输入 1 元 / 百万 token、输出 2 元 / 百万…
-
DeepSeek V4 Flash 测评
短的结论:不畏浮云遮望眼 基本情况: 对于 300b 尺寸的模型来说,上限究竟在哪里,不同团队都给出了自己的答案。最早交卷的 MiniMax 认为 300b 只能满足日常轻度需求,…
-
大语言模型-逻辑能力横评 26-07 月榜
#1 参赛选手 本次更新模型(按发布时间顺序),共 13 个: *美元定价按1 USD = 6.9 RMB 汇率折算 本月出榜: 替换为后续型号 Gemini 3.5 Flash …