DeepSeek给大模型划出的「斩杀线」,斩的到底是什么
一天,8 万亿 Token。
这是 DeepSeek V4 Flash 一款模型,在一个 AI 编程工具里的单日用量。
▲开源 AI Agent 工具 OpenCode 发文称,DeepSeek V4 Flash 正式版通过其平台消耗了 8 万亿 Token。其中,5 万亿来自免费额度,另外 3 万亿来自付费套餐 OpenCode Go。
作为对比,大模型路由平台 OpenRouter 接入了 400 多款模型,每月处理约 200 万亿 Token,平均每天约 6.6 万亿。
也就是说,DeepSeek 一款模型,仅仅在 OpenCode 一个入口里,一天消耗的 Token,就超过了 OpenRouter 全平台的日均规模。
▲ OpenRouter 上 DeepSeek V4 Flash 是本周最热门模型
这和 DeepSeek V4 Flash 的低价有关,能力提升,价格不变,原本被压抑的使用需求会迅速释放。 但 8 万亿 Token 背后,还有一个更重要的变化:人们使用 AI 的方式已经变了。
过去,我们向模型问一个问题,得到一段回答,任务就结束了。现在的 Agent 会自己读文件、修改代码、运行程序、检查结果,失败后再重新尝试。一次任务可能持续几个小时,调用几十次工具,也可能让多个 Agent 同时工作。
模型写出的代码未必比过去多很多,消耗的 Token 却可能翻上几十倍、几百倍。
有人用 Claude Opus 5 制作一个单页 3D 游戏。模型需要不断生成页面、截图检查、继续修改。最后只是一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元。
Agent 任务的大量爆发,让模型要证明自己的价值,除了智能的程度,还有性价比的计算;衡量一款模型的单位,从「单次回答有多聪明」变成了「完成一项长任务要花多少钱、多久、失败几次」。
依据这套标准,DeepSeek V4 Flash 开始成了所有模型的斩杀线。
一百万个输出 Token,DeepSeek 收 2 元人民币。Anthropic 的 Claude Opus 4.8,标准价格是 25 美元,约 170 元,只看输出单价,二者相差约 85 倍。
7 月底,DeepSeek 推出 V4 Flash 正式版,保留了模型架构与规模,只是重新做了后训练,重点加强编码和 Agent 任务。
隔天,大模型竞技场 Arena 公布前端编码评测榜单,将 V4 Flash 列入「价格—性能」的前沿模型。截至 Arena 8 月 2 日的页面快照,V4 Flash 的初步排名暂列 Opus 4.8 Thinking 之前。
而在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 得到 50 分,Claude Opus 4.8 Max 得到 56 分。前者跑完整套评测产生的模型调用费约为 72.02 美元,后者则达到 3752.55 美元。
换句话说,Opus 多拿了 6 分,但跑完同一套评测的调用费高出了约 52 倍。
V4 Flash 当然还不能证明自己全面超过 Opus,但只要两者已经能被放进同一轮候选名单,85 倍的价差就足以改变默认选择。
当一款模型的价格高出几十倍,性能领先却只有几个百分点时,这笔账会越来越难算平。
最先受到冲击的,可能并不是最弱的小模型。便宜、快速的小模型仍然适合分类、提取和路由等简单工作。最强的旗舰模型也会仍然用来处理疑难任务,或者成为高失败成本场景里的保险。
真正尴尬的是中间一批模型:它们比 V4 Flash 强一些,却贵几十倍;又没有强到可以稳定解决 V4 Flash 做不了的问题。
这就是 DeepSeek 的斩杀线,它不需要成为最强模型,只要达到「大多数时候可以做完」,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。
V4 Flash 为什么能把茅台当矿泉水卖
一直以来,我们都觉得模型的价格大概就是和它的「聪明程度」相关,模型越聪明,自然它就要卖的越贵。
目前主流的几款大模型,Anthropic 家的 Opus 4.8 和 Opus 5 输出都是 25 美元/百万 Token,Fable 5 输出为 50 美元/百万 Token;OpenAI 的 GPT-5.6 在前几天降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 则保持不变,30 美元。
而几款国产大模型,依旧是讨论每百万输出的价格,DeepSeek V4 Flash 是 2 元,刚刚发布的 Qwen 3.8 Max 是 36 元,Kimi K3 是 100 元,GLM 5.2 是 28 元。