登录

Kimi K 3发布47页技术报告,最有价值的创新点是这些


速读:KimiK3的技术主线,是把原本会随着规模不断膨胀的计算和状态,改造成可以压缩、可以调度、可以暂停和恢复的结构。 KDA解决的是长上下文能否持续运行,而不是彻底消除长距离信息损失。 AttnRes则把这种选择机制从序列维度带到了网络深度。
2026年07月28日 14:37

它把架构、训练和 Agent infra连接成了一套完整系统。

    作者丨 郑佳美

    编辑丨 马晓宁

Kimi K3 发布开放权重,最抢眼的数字有三个: 2.8T 总参数、104B 激活参数,以及 100 万 token 上下文。

这些数字当然重要,但读完 47 页技术报告会发现,它们更多是技术改造后的结果,而不是这份报告真正值得关注的部分。

Kimi K3 想解决的是一个更实际的问题: 当模型继续变大、上下文继续变长,Agent 一次工作几个小时以后,原来的 Transformer 架构和训练系统还能不能撑住?

上下文变长,KV Cache 会持续膨胀;网络变深,前面几层的信息会被不断混合;专家数量增加,路由、通信和设备负载容易失控;Agent 轨迹越来越长,强化学习又会被少数慢任务拖住。

这些问题显然不能只靠增加 GPU 解决。

Kimi K3 的技术主线,是把原本会随着规模不断膨胀的计算和状态,改造成可以压缩、可以调度、可以暂停和恢复的结构。它不是简单把 Kimi K2 放大了接近 3 倍,而是在重新设计大模型怎样保存信息、怎样调用计算资源,以及怎样持续完成长任务。

01

撑住 2.8T 的,不是更多 GPU

Kimi K3 最核心的三项架构变化,分别处理 Transformer 在序列、深度和宽度上的扩展问题。

先看序列。传统注意力需要保存历史 token 的 Key 和 Value。上下文越长,KV Cache 越大。

这相当于阅读材料时,把看过的每一页都摊在桌面上。材料不多时,查找很准确;材料达到几十万页后,存储、搬运和读取成本都会迅速增加。

Kimi Delta Attention,也就是 KDA,采用固定大小的递归状态保存历史。 模型不会完整保留每个 token,而是在阅读过程中不断更新一份压缩记忆。序列继续增长,这份状态不会按照相同比例膨胀。

但压缩记忆一定会损失部分细节。全注意力保存的是原始档案,可以直接回看某个具体位置;KDA 保存的更像一份持续更新的摘要,信息在反复写入时可能被覆盖。

所以,Kimi K3 没有完全使用 KDA,而是在每个模块中安排 3 层 KDA 和 1 层 Gated MLA,并在模型末尾保留全局注意力。

两者的分工很明确: KDA 负责低成本地更新长期状态,MLA 定期重新检查完整上下文。一个负责压缩,一个负责查找,在效率和信息容量之间取平衡。

Kimi K3 还调整了 KDA 的衰减参数范围。此前某些衰减值可能变得过小,累计计算后容易超出 BF16 的安全范围,迫使部分计算采用效率较低的特殊 kernel。Kimi K3 给衰减设置了下界,使相关计算可以统一转换成 Tensor Core 擅长的稠密矩阵乘法。

这个改动没有提出新的注意力概念,却很能说明 Kimi K3 的技术思路:算法不能只在复杂度公式中更漂亮,还要真正适合 GPU。雷峰网

100 万 token 也不能简单理解成“模型能够准确记住 100 万 token”。 Kimi K3 使用了从 8K、64K、256K 到 1M 的渐进式训练,并专门构造关键信息分散在不同位置的长上下文数据。

上下文窗口代表模型能够处理多长的输入,不代表窗口内的信息都能被无损利用。KDA 解决的是长上下文能否持续运行,而不是彻底消除长距离信息损失。

序列变长以后,信息会被压进递归状态;网络变深以后,也存在类似的信息压缩问题。

标准残差连接会把每一层的输出不断加到同一个隐藏状态中。这种方式训练稳定,但随着网络加深,前面不同层的信息会逐渐混在一起。

到了后面的层,模型拿到的是几十次计算叠加后的结果,很难单独取回早期的词法信息、中间层的结构信息,或者某个阶段形成的局部特征。

Attention Residuals,也就是 AttnRes,让当前层能够对前面不同深度的表示进行加权选择。

普通残差连接像是把所有修改都覆盖到同一份文件里,只保留最终版本。AttnRes 则保留若干中间版本,后面的网络可以根据需要重新调用。

这个思路与 Transformer 取代 RNN 有些相似。RNN 把所有历史 token 压进一个状态,Transformer 允许当前 token 直接读取不同历史位置;AttnRes 则把这种选择机制从序列维度带到了网络深度。

为了控制显存和通信成本,Kimi K3 并没有保留全部 93 层的独立输出,而是按照约 12 层一个 Block 进行聚合,再对不同 Block 的表示进行选择。

主题:KimiK3|模型|问题