DeepSeek和智谱接连更新模型,但都没能炸场
没有一家模型厂商最近能够放松警惕。前后大概不到48小时,DeepSeek和智谱相继更新了自己的模型进展。
先是DeepSeek于8月12日晚将API文档更新为DeepSeek-V4-Pro正式版,又于13日对官宣内容进行了回撤和重新发布,但调整期间保留API服务;再是8月14日,智谱GLM-5.3正式发布。
抛开DeepSeek回撤事件本身可能存在的问题暂且不谈(当时大量评测称第三方测试结果与官方声明不符,甚至反馈不如同模型的Flash版本),官方公告显示,正式版DeepSeek V4 Pro是一款针对Agent(智能体)能力进行增强的模型,尤其在生产环境任务中表现出更为明显的性能提升。
在Agent相关评测集中,其总体成绩与Kimi K3、Opus 4.8和Fable 5在同一水平线上。
智谱GLM-5.3则继续强调编程能力。该模型与前代GLM-5.2使用完全相同的基座模型,主要通过后训练提升性能,利用强化学习(基于IndexShare、SAO以及新一代Slime框架)扩展了长程任务环境和训练时长。
从评测集表现来看,GLM-5.3的部分能力接近Fable 5和GPT-5.6 Sol,并在展示出来的多个榜单中成绩超过了Kimi K3,但在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上仍然不及K3。
安全是GLM-5.3强调的另一个特性,此前Anthropic的Mythos 5曾引起模型安全性能的话题热度。
据其介绍,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分为84.5%,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%;在更考验深度推理能力的ExploitBench中,GLM-5.3得分为54.4%,低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。
在用户层面,或是由于DeepSeek-V4-Pro正式版受到初期问题的影响,多名完成测试的受访者对界面新闻记者表示,在编程任务上,GLM-5.3的体验比DeepSeek-V4-Pro正式版更好。
不过,其中一名开发者明确表示,这两者可能都不会作为工作流主力,“国产模型里面,目前还是只有K3在第一梯队。”他说,这不仅体现在能力提升全面上,在性价比层面也有意义。
这个结论的一个重要背景是DeepSeek对其API定价策略进行了调整。
其API将首次采用峰谷定价模式,其中闲时段的使用价格将降至高峰时段的一半。但从DeepSeek V4 Pro高峰期价格来看,其缓存命中输入和缓存未命中输入单价分别同比增长1100%及200%,输出价格同比增长350%。
细致到K3与DeepSeek-V4-Pro正式版之间,涨价前,前者缓存命中输入价格为后者约一千倍,目前则是十倍左右,缓存未命中输入价格则从6倍有余减少到约2倍(高峰期),输出价格也从过去的16倍左右降低到现在的约4倍。
曾经一度悬殊的性价比表现,如今再将任务的对话轮次、完成质量、整体时长考虑其中,不同诉求的开发者再作抉择时答案可能会发生变化。
事实上,无论是DeepSeek-V4-Pro正式版还是GLM-5.3,都是在上一代基座模型基础上进行后训练迭代,Kimi K3实现性能突破则源于对基座模型再度扩大规模训练。这两种选择说明了什么问题?
一名AI领域投资人表示,从模型技术层面来说,这至少说明两点,预训练Scale Up仍然有用、现有规模后训练也有极大提升空间——在这一点上,更好的证据是1.5T的Grok 4.6,几乎达到了GPT-5.6、Opus 5的同等水平。
对国产模型厂商而言,这意味着代际层面的性能跨越,或许仍然绕不开基座模型的Scale Up,而与此同时,在它们实现这一点之前,Kimi K3的潜能显然也还没有充分挖掘。