登录

CUDA已不足为虑:AMD显卡AI神优化2周时间性能涨3倍


速读:SemiAnalysis日前发布了一份AMD与NVIDIA显卡在Qwen3.5397B及MiniMaxM3两款开源大模型上的性能及成本对比,出战的是两边当前最强的MI355X显卡与B300显卡。 在Qwen3.5大模型上,AMD在短短两周时间内就大幅提升了MI355X显卡的表现,8月12日时90TTFT(首字时间)大多在2.0秒至5.5秒之间; 别忘了,AMD的显卡在性价比上依然有优势的,MI355X的每小时Tco成本是1.5美元,B300是2.26美元,差距在1/3左右,折算下来MI355X的整体效益也很可观了。
2026年09月02日 15:48

快科技9月2日消息,NVIDIA的CUDA公认护城河能力极高,AMD的显卡跑实际应用往往要比NVIDIA吃亏很多,然而AMD最近说CUDA不足为虑也是真的,A卡在优化上也做到神速提升。

SemiAnalysis日前发布了一份AMD与NVIDIA显卡在Qwen3.5 397B及MiniMax M3两款开源大模型上的性能及成本对比,出战的是两边当前最强的MI355X显卡与B300显卡。

AMD这边对比了两个时间点,一个是8月12日,一个是最新的8月31日,因为NVIDIA的显卡性能一如既往保持水准,AMD则是在快速优化提升。

在Qwen3.5大模型上,AMD在短短两周时间内就大幅提升了MI355X显卡的表现,8月12日时90 TTFT(首字时间)大多在2.0秒至5.5秒之间; 8月31日时大部分工况的时延压缩到了0.9秒至3.5秒区间,响应速度提升近一倍。

此前MI355X的吞吐性价比天花板在50M tok/$左右;优化后在低时延段(如1.5s -2.5s)就突破了80M-110M tok/$, 并在TP2工况下最高达到了~140M tok/$,差不多三倍水平。

这个性能也非常接近NVIDIA当前的旗舰AI卡B300了,不过后者在低时延下的性能依然领先。

在MiniMax M3大模型上也有类似的结果,8月12日时MI3550X跟B300差距很大,但到了8月31日, 优化后的MI355X交互速度从之前大约55tok/s/user提升到了230tok/s/user,也是三倍左右的提升。

整体来说,AMD在过去两周时间内就大幅优化了MI355X的性能,两个开源大模型中各种工况下速度提升2倍到3倍是不成问题的,部分情况下提升超过3倍,尽管还不能说超越B300,但性能水平也是天差地别了。

别忘了,AMD的显卡在性价比上依然有优势的,MI355X的每小时Tco成本是1.5美元,B300是2.26美元,差距在1/3左右,折算下来MI355X的整体效益也很可观了。

AMD的这些提升基本上符合他们发布ROCm 10时的宣传, 在硬件不变的情况下各种优化就能把大模型的推理性能提升3倍以上。

有了这些基础,AMD真的可以不用仰视CUDA的生态优势了,今年还会有性能更强大的MI455X新一代AI平台上市,继续优化的话说不定可以赶超NVIDIA一次。

【本文结束】如需转载请务必注明出处:

新浪众测

新浪众测

新浪科技公众号

新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

OpenAI抢后台,马斯克抢前台

陌陌母公司挚文季报图解:营收24亿净利降19% 唐岩刚获派息超8000万

重磅政策落地!大消费冲刺60万亿新赛道

2000亿的IPO,有人回报360倍,有人本金亏掉一大半

宇树离职员工爆出猛料:内部只罚不奖,工资偏低

“手机等等党”彻底心碎了!华为小米等集体涨价 最高涨1000元:经销商高喊卖不动

宇树科技员工爆料公司管理细节:百元报销都需要 CEO 王兴兴批,小到螺丝钉长度都亲自过问

英伟达接近以 140 亿美元收购 Hugging Face,最快本周达成协议

苹果新任 CEO 特努斯微博头像太糊引网友吐槽,运营团队“光速”更换高清素材

苹果换帅,库克时代彻底落幕

新国标299元 安克发布55W自带线充电宝:苹果、华为、小米全快充

华为MatePad Air新款官宣:9月7日发布!搭载麒麟T93系列

主题:提升|性能|MI355X|显卡|MI355X显卡