登录

DeepSeek V 4.1 Flash硬刚智谱「牛来」,谁才是国模Flash之王?


速读:DeepSeekV4.1FlashGLM-5.3-Flash。
2026年09月11日 06:0

DeepSeek V4 Pro ,8 月 13 日正式发布,9 月 14 日即将下线。享年 32 天。

而干掉  V4 Pro  的,正是 DeepSeek 自家刚刚发布的  DeepSeek V4.1 Flash 。

「 V4.1 Flash  在性能、费用、速度、总用时等各项指标上已全面超越  V4 Pro ,9 月 14 日起所有 Pro 的 API 请求将自动切换到 Flash,并按 Flash 的价格计费。」

有意思的是,在  DeepSeek V4.1 Flash  之前,另一个 Flash 国模也曾一度爆火。

8 月 20 日,智谱悄悄在 OpenRouter 和 OpenCode 上线了一个匿名模型,代号  Ox-Alpha ,中文名「牛来」。 Ox-Alpha  首日就冲上了 OpenRouter 榜首,刷新了平台单日 token 调用量历史纪录,还终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录。8 月 26 日,智谱官宣认领了这头牛, Ox-Alpha  的真身是  GLM-5.3-Flash 。

Flash,已经不再是单纯的「小杯」了。

DeepSeek V4.1 Flash  vs  GLM-5.3-Flash

先来总结一波。

DeepSeek V4.1 Flash GLM-5.3-Flash

发布日期

2026-09-10

2026-08-26

总参数量

552B

320B

激活参数

输入 8B / 输出 16B

18B(输入输出对称)

架构

MoE + CED(因果编码-解码器)

MoE + 稀疏/线性注意力混合

上下文窗口

100 万 tokens

原生多模态

文本 + 图片

文本 + 图片 + 视频 + 文件

预训练数据

45 万亿 tokens

30 万亿 tokens

开源协议

MIT

推理力度调节

连续可调 1-100

三档(low / high / max)

DeepSeek V4.1 Flash  和  GLM-5.3-Flash ,太像了。

MoE 架构,100 万 tokens 上下文,原生多模态,MIT 协议开源,连推理力度都同样可调节。

但技术架构不同。 DeepSeek V4.1 Flash  走了一条非对称路线,输入端只激活 8B 参数,输出端激活 16B。读比写便宜,专为 Agent 场景设计,因为 Agent 要读大量上下文和工具调用结果,输入量远大于输出量。智谱走的是对称路线,输入输出都激活 18B,总参数从  GLM-5.3  的 753B 砍到了 320B。

GLM-5.3-Flash  的多模态更完整,文件和视频输入都支持。

不同的技术路线

DeepSeek V4.1 Flash  和  GLM-5.3-Flash  本质上都在解决同一个问题,「KV Cache 太贵。」

运行 Agent 时,模型每处理一个 token 都要在显存里存一组缓存数据,上下文越长这笔计算开销越大。Pro 模型的 KV Cache 成本可能比推理计算本身还高。所以,Flash 的核心任务就是尽可能降低这部分算力成本。

DeepSeek V4.1 Flash  采用了一个名为 CED 的新架构,全称 Causal Encoder-Decoder。它把 40 层 Transformer 拆分为上下两部分,前 20 层是编码器,负责读入上下文;后 20 层是解码器,负责生成输出。编码器处理输入时只激活 8B 参数,解码器生成输出时激活 16B。

重点在于如何压缩 KV Cache。解码器的全局缓存直接从编码器最后一层的输出里投影过来,不再自己逐层计算。再加上 FP4 量化和跨层共享索引,每个 token 的全局 KV Cache 从上一代的 3514 字节压缩到了 890 字节。

主题:DeepSeekV4.1Flash|Ox-Alpha|GLM-5.3-Flash|V4Pro