登录

微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint


速读:
2026-07-24 09:1

微软于 7 月 23 日宣布推出两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已进入公开预览阶段。两款模型分别面向高质量图像生成与高并发语音交互场景,微软强调其训练数据经过清理和可追踪,不依赖第三方模型蒸馏,从底层设计就直接服务于微软产品用户。

image.png

图像模型精度 最高 ,GPU成本 最高 降84%

MAI-Image-2.5-Pro是微软目前精度 最高 的图像模型,面向主视觉图片生成、细节编辑及图像内文字渲染等高要求场景,支持自然语言编辑指令。该模型已在Bing Image Creator中成为默认图像生成模型,在PowerPoint中用于图像到图像编辑功能,与GPT-Image- 2 相比可降低 最高 84%的GPU成本。在OneDrive中部署后,相关场景保存成功率提升26%,P95 延迟降低约25%,中等负载生产环境效率提升2. 5 倍。

定价方面,文本输入每百万Token收费 5 美元,图像输出每百万Token收费 106 美元。

语音模型速度提升 2 倍,已服务T-Mobile等客户

image.png

MAI-Voice-2-Flash针对高频语音应用优化,相比上一代速度提升约 2 倍,成本降低32%,适用于客服中心和语音助手等快速响应场景。该模型已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务,GPU成本 最高 降低89%。微软还将其集成至Azure Voice Live服务,支持开发者构建语音到语音交互智能体。

此外,同系列的MAI-Transcribe-1. 5 已应用于医疗语音解决方案Dragon Copilot,被 17 万名医疗服务提供者使用,上季度处理 2800 万次患者问诊记录,支持 58 种语言,多数语言转录错误率相对下降50%。微软透露下一代GB200 计算集群已投入运行,MAI系列模型将持续扩展。

主题:微软|MAI-Image-2.5-Pro