DeepSeek为什么把缓存涨了11倍?长上下文需求暴涨,得交点「存储税」了
缓存涨价背后,是大模型的存储与数据搬运困境。
作者丨 高允毅
编辑丨 岑 峰
一直以来,DeepSeek都是白菜价的代名词,这次它开始涨价了,而且还按时间段收钱。
8 月 17 日,DeepSeek V4 Pro API 的输入和输出价格涨幅如下图。其中, 最便宜的缓存命中价格在空闲时断直接涨了5倍,在高峰时期,它竟然涨了11倍 ,从0.025 元 / 百万Token 涨至 0.3 元/ 百万 Token。
很多人或许并不了解 “缓存命中” 是什么。简单理解,它就像大模型的“草稿纸”,AI 每次回答问题时,不必每次都去重新翻阅所有信息。只要它之前计算过一次,这段长文本就会以“KV单元”的形式沉淀在存储集群里,后续调用直接提取即可。
一直以来,极高的缓存命中率是DeepSeeek最出圈的“性价比杀器”,它依靠极致的 KV压缩技术和冷热记忆分层搬运架构 ,直接省掉了这部分海量的重复计算,把长文本的调用门槛控制到可以忽略不计。
正因如此,无数市面上的代码助手、知识库 Agent、长文档分析这样有着超长上下文的产品,通过薅DeepSeek的羊毛撑起了自己的盈利模型。 而过大的需求量也直接把低廉的缓存命中变成了厂商不堪重负的刚性开销。
大模型的成本结构,正在发生历史性的变化:“算力(FLOPs)”正变得日益廉价,而“状态”的保存、带宽和数据搬运,正在成为AGI时代最昂贵的成本。
01
缓存命中到底帮 GPU 省掉了什么?
在没有缓存命中之前,很多人是用不起长上下文大模型的。
我们可以算笔账,假设你要用DeepSeek V4 Pro搭建一个代码库智能 Agent,核心代码有 50 万 Token,开发者一天问 50 轮。
在没有缓存的情况下,每一轮对话 AI 都要把这 50 万 Token 从头到尾完整计算一遍,50 轮下来累计输入就是 2500 万 Token,仅输入成本就超过 75 元。长此以往,光是调用模型就能吃掉产品的大部分利润。
但有了 90% 的缓存命中率,只有第一轮需要全额支付预计算成本,后续 49 轮里 90% 的上下文可以直接复用已计算好的状态,输入成本直降 90% 以上,几乎可以忽略不计。
这种夸张的省钱效率,背后靠的是 DeepSeek的KV压缩技术先把长上下文压缩,再靠冷热记忆分层搬运架构把存储成本打下来。
具体而言,大模型每读一个字都会产生庞大的记忆矩阵(KV Cache)。上下文越长,记忆矩阵占用的内存也更多,也会更贵。 DeepSeek V4用了两种注意力架构交错配置,一个是压缩稀疏注意力技术(CSA),另一个是 重度压缩注意力技术(HCA)。 能把相邻的 4 个甚至 128 个Token合成一个记忆块,直接把长文本的记忆体积直接缩小 95% 以上。这样超长的上下文变成了轻薄的压缩包。
由于压缩包足够小,服务器内部可以轻松搬动。DeepSeek又按照访问频率,把这些压缩后的记忆做了 冷热分层存放 。 频繁被调用的 “热记忆” 留在昂贵但响应极快的 GPU 显存里,长期无人访问的 “冷记忆” 则被放到便宜、容量近乎无限的企业级 NVMe 固态硬盘中。这进一步节省了开支。
不过,缓存命中虽然省钱,不代表它免费。它帮 GPU省掉的是重复计算的算力的钱,但这又会在存储、搬运、调度三个环节中产生新的开销。
存储成本指的是海量 KV 状态要分层存储在 GPU 显存、CPU 内存和 NVMe 磁盘中;调度成本指的是每次请求要快速定位到对应缓存块、调度资源;IO 搬运成本指的是找到缓存后要从磁盘搬到内存、再加载到显存中。
这些成本之所以长期被开发者忽略,是因为它们一直很低廉。
DeepSeek V4 的 CSA+HCA 混合压缩技术,能把 100 万 Token 的 KV 记忆状态压缩到约 10GB 。在一块常用的均价为 6000 元的15.36TB 企业级 NVMe 硬盘计算,单份百万 Token 缓存的硬件分摊成本仅几分钱。
而单次磁盘到显存的搬运成本,算完电费与损耗,大约在几分钱量级。
这正是DeepSeek的缓存命中敢定价这么低的原因。