1.5 TB压到214 GB:腾讯混元Hy 4 preview轻量版发布开源,异构设备可联合推理
IT之家 9 月 1 日消息,腾讯混元团队今日宣布推出 Hy4 preview 轻量版,将 Hy4 preview 的模型权重从接近 1.5TB 压缩至约 214GB。
IT之家注:Hy4 preview 是腾讯于 8 月 28 日发布并开源的新一代 MoE(混合专家)大语言模型,总参数量 770B(7700 亿),激活参数 49B,上下文长度达 100 万 Token。
此次压缩依托两项核心技术:其一是 Sherry 稀疏三值量化算法,将路由专家层权重压缩至平均 1.25 比特;其二是 MIX-STQ1_0 混合精度策略,依据校准数据逐层决定每层的量化位宽,敏感层保留较高精度(2.06 比特 IQ2_XXS),不敏感层采用更激进的 STQ1_0(1.31 比特)。
两种技术结合,使模型在主流任务上表现稳定 —— 长文理解几乎与原始 BF16 模型持平,多轮长上下文检索基本在同一水平,数学能力仅小幅回落。MCP Atlas 得分从 83.7 微降至 83.2,SWE-Bench multi 从 82.9 降至 81.3。
BF16 即 bfloat16 浮点格式,是 AI 训练中常用的低精度数值格式;bpw(bits per weight)指每个权重参数平均占用的比特数,数值越低压缩率越高。
在异构设备联合推理方面,腾讯混元与 prima.cpp 合作验证了一项新方案:在一台配备单张 4090 的笔记本与一台四卡 A4000 服务器(合计 80GB 显存、64GB 内存、分属两个局域网)上,通过 prima.cpp 的异构调度将 MoE 层拆分分配,使 214GB 的轻量版模型达到 1.02 token/s 的推理速度,比笔记本单机 offload 快约 6 倍。
轻量版模型已上线 Hugging Face 和 GitHub 平台,支持 llama.cpp 、vLLM、SGLang 等主流推理框架。




新浪科技公众号
“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

OpenAI抢后台,马斯克抢前台
陌陌母公司挚文季报图解:营收24亿净利降19% 唐岩刚获派息超8000万
我关了电脑让豆包干活,它居然真的没停
豆包出了个新东西叫「豆包工作」,连上飞书那一下是真狠
《重案六组:消失的警号》开播引吐槽 网友:还我季洁!
年销千辆暴跌90%,豪车玛莎拉蒂“诺基亚”了
华为公布2026半年报:上半年经营收入4678亿元 研发投入再创新高
Mate 90发布在即!华为Mate 80系列累计销量突破881万台
预售29.98万起比友商高出数万元 官方回应智界RX目标受众是谁
千禾味业“归0”
华为2026年上半年钱花哪了:净利润骤降36.77%至234.28亿 创下2021年以来新低
上市仅9个交易日!宇树科技股价近乎腰斩
尼泊尔一隧道救援准备直接进洞搜救!有工人抓着洞顶横档挪了6小时逃出
父亲跟爷爷吵架后离家18年未归!女儿寻父:爷爷奶奶均已去世,希望父亲平安回家丨红星寻人
享界G9亮相第二届世界人形机器人运动会
无人快递车顶上趴着俩人搭便车!厂商回应:绕过摄像头就识别不了
限时优惠价 7.68 万元起,极狐贝塔 T1 550km 长续航版上市
徐直军:华为用国产芯片、鸿蒙生态实现了国内市场出货份额的第一
《重案六组:消失的警号》开播引吐槽 网友:还我季洁!
官方回应取消ETC引热议 《人民日报》发文:对不同群体需求统筹兼顾
汉月销跌至3000来辆 比亚迪用25万D级车救场
特斯拉推出平价版Model 3!
主题:腾讯混元