一天,8 万亿 Token。
这是 DeepSeek V4 Flash 一款模型,在一个 AI 编程工具里的单日用量。

开源 AI Agent 工具 OpenCode 发文称,DeepSeek V4 Flash 正式版通过其平台消耗了 8 万亿 Token。其中,5 万亿来自免费额度,另外 3 万亿来自付费套餐 OpenCode Go。
作为对比,大模型路由平台 OpenRouter 接入了 400 多款模型,每月处理约 200 万亿 Token,平均每天约 6.6 万亿。
也就是说,DeepSeek 一款模型,仅仅在 OpenCode 一个入口里,一天消耗的 Token,就超过了 OpenRouter 全平台的日均规模。

OpenRouter 上 DeepSeek V4 Flash 是本周最热门模型
这和 DeepSeek V4 Flash 的低价有关,能力提升,价格不变,原本被压抑的使用需求会迅速释放。 但 8 万亿 Token 背后,还有一个更重要的变化:人们使用 AI 的方式已经变了。
过去,我们向模型问一个问题,得到一段回答,任务就结束了。现在的 Agent 会自己读文件、修改代码、运行程序、检查结果,失败后再重新尝试。一次任务可能持续几个小时,调用几十次工具,也可能让多个 Agent 同时工作。
模型写出的代码未必比过去多很多,消耗的 Token 却可能翻上几十倍、几百倍。
有人用 Claude Opus 5 制作一个单页 3D 游戏。模型需要不断生成页面、截图检查、继续修改。最后只是一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元。

Agent 任务的大量爆发,让模型要证明自己的价值,除了智能的程度,还有性价比的计算;衡量一款模型的单位,从「单次回答有多聪明」变成了「完成一项长任务要花多少钱、多久、失败几次」。
依据这套标准,DeepSeek V4 Flash 开始成了所有模型的斩杀线。
一百万个输出 Token,DeepSeek 收 2 元人民币。Anthropic 的 Claude Opus 4.8,标准价格是 25 美元,约 170 元,只看输出单价,二者相差约 85 倍。
7 月底,DeepSeek 推出 V4 Flash 正式版,保留了模型架构与规模,只是重新做了后训练,重点加强编码和 Agent 任务。

隔天,大模型竞技场 Arena 公布前端编码评测榜单,将 V4 Flash 列入「价格—性能」的前沿模型。截至 Arena 8 月 2 日的页面快照,V4 Flash 的初步排名暂列 Opus 4.8 Thinking 之前。
而在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 得到 50 分,Claude Opus 4.8 Max 得到 56 分。前者跑完整套评测产生的模型调用费约为 72.02 美元,后者则达到 3752.55 美元。
换句话说,Opus 多拿了 6 分,但跑完同一套评测的调用费高出了约 52 倍。
V4 Flash 当然还不能证明自己全面超过 Opus,但只要两者已经能被放进同一轮候选名单,85 倍的价差就足以改变默认选择。

当一款模型的价格高出几十倍,性能领先却只有几个百分点时,这笔账会越来越难算平。
最先受到冲击的,可能并不是最弱的小模型。便宜、快速的小模型仍然适合分类、提取和路由等简单工作。最强的旗舰模型也会仍然用来处理疑难任务,或者成为高失败成本场景里的保险。
真正尴尬的是中间一批模型:它们比 V4 Flash 强一些,却贵几十倍;又没有强到可以稳定解决 V4 Flash 做不了的问题。
这就是 DeepSeek 的斩杀线,它不需要成为最强模型,只要达到「大多数时候可以做完」,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。
V4 Flash 为什么能把茅台当矿泉水卖
一直以来,我们都觉得模型的价格大概就是和它的「聪明程度」相关,模型越聪明,自然它就要卖的越贵。
目前主流的几款大模型,Anthropic 家的 Opus 4.8 和 Opus 5 输出都是 25 美元/百万 Token,Fable 5 输出为 50 美元/百万 Token;OpenAI 的 GPT-5.6 在前几天降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 则保持不变,30 美元。
而几款国产大模型,依旧是讨论每百万输出的价格,DeepSeek V4 Flash 是 2 元,刚刚发布的 Qwen 3.8 Max 是 36 元,Kimi K3 是 100 元,GLM 5.2 是 28 元。

DeepSeek 几乎是以免费的价格提供大模型
国产模型之间的对比,还是与国外旗舰模型的对比,DeepSeek 的价格似乎都是一股「清流」,所以是什么造就了模型价格的不同。
最明显的是每生成一个 Token 的直接推理成本。
它受到激活参数量、数字精度、注意力机制、KV Cache 大小、输出长度、硬件利用率和并发量影响。同一款模型,如果能用更少的计算完成一次推理,或者能让更多请求共享缓存,成本就会下降。
V4 Flash 总参数量为 2840 亿,但每个 Token 只激活约 130 亿参数。它同时使用混合注意力结构、低精度权重和针对长上下文的缓存优化。

V4 系列模型架构图
根据 DeepSeek 在四月公开的 Preview 技术报告估算,在一百万 Token 上下文下,V4 Flash 的单 Token 推理计算量约为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。
这是与 V3.2 的内部架构对比,不代表它只需要其他所有模型十分之一的综合成本,但足以解释 DeepSeek 为什么能把长任务价格压低。
DeepSeek V4 系列结构,改造了一个 Transformer 模块里的三个关键部分,将注意力层改为先压缩再找重点的 CSA 机制和更极致的压缩但全部浏览的 HCA 机制,两种交错排列以平衡成本。
V4 的前馈层沿用 DeepSeekMoE:模型包含大量细分专家和少量共享专家,每个 Token 只被路由到其中一小部分专家。
因此 V4 Flash 虽然共有 2840 亿参数,每个 Token 实际激活的只有约 130 亿;V4 Pro 总参数达到 1.6 万亿,实际激活约 490 亿。它获得了大模型的知识和容量,但不需要每生成一个 Token 都运行全部参数。

其次是完成的服务成本,从模型训练、后训练到评测、安全,以及推理基础设施、空闲算力等服务,这些成本虽然不会出现在 Token 账单里,但是必须由模型厂商承担。
最后是商业定价,API 价格并不是简单的成本加成,厂商还需要考虑市场份额、用户迁移成本、品牌溢价、服务能力,以及客户愿意为可靠性支付多少钱。
所以,模型价格从来不是一张纯粹的成本表。它同时反映了模型需要多少算力,也反映了厂商认为自己的能力、品牌和可靠性值多少钱。
OpenAI 和 Anthropic 的高价格,可能同时包含更高的推理成本、产品生态、安全和服务溢价,以及它们在高难度任务上的定价权。
架构没变,Agent 能力为什么能大涨
目前,V4 Flash 正式版还没有发布新的技术报告,DeepSeek 在 7 月 31 日的更新日志中写:正式版 V4 Flash 与 Preview 的结构和尺寸相同,只重新进行了后训练。
此前预览版报告披露的后训练流程,已经把重点放在代码和 Agent 上:DeepSeek 分别训练数学、代码、Agent 和指令遵循专家,使用 SFT 和 GRPO 强化各自能力,再通过十多个教师模型的 On-Policy Distillation 合并回同一个模型。
工具调用也被当成单独的问题处理。
DeepSeek 设计了专门的调用格式,减少参数转义和格式错误;Interleaved Thinking 让模型在工具返回结果后继续保留前面的推理;DSec 则提供数十万个并发沙箱,让模型反复练习运行代码、读取报错和继续修改。

这些后训练并没有给模型增加新的参数,却可以减少 Agent 最常见的失败:选错工具、填错参数、忘记前面的状态,或者在任务还没完成时停下来。
正式版在 Terminal Bench 2.1 上的 82.7 分,还使用了尚未发布的 DeepSeek Harness 极简模式和 max 推理档。此外,DeepSeek 为 V4 Flash 加入原生 Responses API,并针对 Codex 做了适配。
预训练决定模型的能力底座,后训练主要改变模型如何调用这些能力。
当 V4 Flash 可以部署在「消费级」电脑上
V4 Flash 的另一个变化,是让前沿 Agent 模型离本地设备更近了一步。
虽然每次推理只激活 130 亿参数,但是完整的 2840 亿参数仍然需要存储和调度,官方仓库中的权重文件合计约 167 GB。

DeepSeek 给出的 vLLM 服务示例使用一台配备 4 张 GB300 的服务器。
社区项目 DwarfStar 则通过低比特量化,把 V4 Flash 的 q2 版本放进了 96GB 或128GB 统一内存设备,q4 版本建议使用至少 256GB 内存。在部分128GB Mac测试中,短上下文速度可以达到每秒二十多 Token。
q2 版本能运行,也不代表它能复现官方 API 的 Agent 成绩。极低比特量化可能损伤代码、长上下文和工具调用能力,社区运行时本身也仍处于早期阶段。
而且,换个角度看 V4 Flash 的出现,似乎又是 DeepSeek 斩杀线里的关键一刀。在本地部署上,DeepSeek 又斩掉了「高水平模型只能待在机房」的一部分门槛,它把门槛降到了高内存工作站。

一台高配 Mac 或 DGX Spark,已经可以用可交互的速度运行经过激进压缩的完整 V4 Flash。
最强模型也开始谈性价比
更低的价格不一定等于少赚钱。
单价下降,Token 总量却可能涨得更快。

Sam Altman 在 7 月底的播客节目曾提到,OpenAI 预计模型会产生极大的使用量,因此不需要依靠「极高毛利」来承担训练成本。他们和 DeepSeek 的梁文锋一样,相信 AI 的需求几乎是没有上限的,AI 智能使用量会持续爆发。
即使每次调用赚得不多,只要调用量足够大,累计利润依然可以覆盖下一代模型的训练成本。
这也是 V4 Flash 更值得注意的地方。
它没有用一个绝对领先的榜单成绩,证明自己是最聪明的模型;它做的,是把过去只有旗舰模型才能承担的任务,压进了一个可以被反复调用、持续试错,甚至可以让我们浪费一些 Token 的价格区间。
在聊天机器人的时代,用户会为了更好的回答,多付几倍的价格。但进入 Agent 时代,模型不再只回答一次。它要浏览文件、搜索资料、执行代码、截图检查,再根据结果重新开始。
一次任务中,在智力上几分的能力差距,可能只影响模型要不要多试两轮;但几十倍的价格差距,却会决定这个任务有没有资格真正跑起来。

运行 AA 所有测试花费的钱和智能得分对比,DeepSeek 拿下 50 分仅花了 72 美元,而 Fable 5 得到 60 分,花费 5600 美元。
未来模型之间的竞争,很难再只用一张能力榜单解释。
用户需要计算的,是完成率、调用次数、响应速度和最终账单;模型厂商出售的,也不再只是每一个 Token 的智能,而是每一美元最终能够完成多少工作。
从这个角度看,V4 Flash 真正斩掉的,是调用旗舰模型之前那种不需要计算成本的习惯。
当一个便宜 50 倍甚至 80 倍的模型,已经能够完成大多数编码和 Agent 任务,昂贵模型就必须反过来证明:剩下那几分能力,究竟值不值得多付几十倍的钱。
本文来自转载APPAPP ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

