一台Mac也能跑Kimi K 3!128 GB内存硬塞1.6 TB权重
编辑|山辉
Kimi K3 开放 完整权重后,不少人都跃跃欲试。
2.8 万亿参数、官方 MXFP4 权重,拥有了这些,你就可以自己捣鼓这个规模巨大的模型,可以部署到本地。
现实情况真有这么简单吗?
有人总结,运行 Kimi K3 其实很容易, 只 需 要 1.5TB GPU 内存、大约 8 张 H100,以及一座小型变电站。

很快有人算了一笔账,按照这张粗略的成本表,如果将大容量 GPU 服务器和供电设施都算进去,整套配置可能触及百万美元。

这么一看,好像已经和我们这些「个人玩家」没什么关系了。

也有人不死心,开始认真研究能不能通过量化,把这个 2.8 万亿参数模型强行塞进个人设备。只不过,评论区对此普遍不太乐观。


但没想到,还真有人在一台Mac 上跑起来了。
128GB 的 Mac,真把 1.6TB 权重塞下了
一名开发者拿出一台 128GB 统一内存的 M5 Max ,直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。
这套权重足足有 1.56TB,体积超过设备内存十倍,显然无法一次性完整载入。
他的办法是让约 97GiB 的静态权重常驻内存,其余部分不一次性加载,而是在推理过程中从固态硬盘持续读取。模型运行到哪一层,对应的权重才被送入内存参与计算。
这样一来,128GB 内存不需要同时装下整个模型,只需要容纳 常驻权重和当前参与计算的部分 。
最终,Kimi K3 真的开口了。

开发者先问了一句「How are you」,模型正常回答「I am fine, thank you」。随后,他又让模型解释 Transformer 中的注意力机制,Kimi K3 也开始生成回答。
但输出速度相当缓慢。
测试中,模型处理输入的速度约为 0.98 token/s ,生成速度只有 0.32 token/s 。换算下来,每生成一个 token 大约需要三秒。一个正常长度的回答,可能要等上几分钟。
这至少证明了一件事:一台只有 128GB 内存的 Mac,确实能够以流式读取的方式运行 1.6TB 的 Kimi K3 官方权重。
不过,这只解决了容量问题。权重需要不断从硬盘搬进内存,模型每生成一个 token,都要等待大量数据完成读取和计算,推理速度自然很难提高。
开发者也表示,这套方案目前主要用来调通推理图。下一步,他准备把模型进一步压缩到 Q2,再使用两台各配备 512GB 统一内存的 Mac Studio,尝试把速度提升到可以正常聊天的水平。
显然,如果不想让 Kimi K3 的语速「快得像闪电」——《疯狂动物城》里的那只树懒,只用一台 128GB 的 Mac 是不行的。
80 张 5090,这是真能用
继续压缩是不太行了,还有人选择把显卡数量提上去。
Ning 团队使用 80 张 RTX 5090,完整运行了 2.8 万亿参数的 Kimi K3。
整套系统由 10 个节点组成,每个节点安装 8 张 RTX 5090,总显存达到 2.56TB。团队直接使用 Kimi 官方发布的 MXFP4 权重,没有进一步量化。
在首日测试中,Kimi K3 的单流推理速度达到了 20 token/s 。