智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5
智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5
2026年08月14日 14:02

8月14日, 智谱 (2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。 智谱 表示,在多项主流基准测试中GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。
智谱 称,相比前代,GLM-5.3的新能力包括:更强的编程能力、 网络安全 能力、后训练Scaling以及开源。
根据智谱介绍,在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力。
在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5。“从任务链条看, 网络安全 能力大致包括代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的 网络安全 能力进行了全面评估,GLM-5.3当前优势主要集中在前半段。”智谱表示,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。
近期,大模型领域频频上新。
8月13日凌晨,DeepSeek V4 Pro正式推出,并已更新至API,模型版本为DeepSeek-V4-Pro-0813,新版本增强了Agent能力。根据DeepSeek给出的模式测试对比成绩,与此前V4-Pro-Preview版本相比,V4-Pro-0813已经全面提升,例如在AI编程智能体基准测试DeepSWE中,得分从Preview的7.3,大幅提升至62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试AutomationBench中甚至超越目前公认最强大的Claude Fable 5。
随后,DeepSeek首款智能体也开放测试,13日晚间,DeepSeek宣布,DeepSeek Harness的开发者预览版(v0.1 版本)面向全球 Harness开发者开放测试,并同步以 MIT 协议开放源代码。DeepSeek Harness 采取“一切皆插件”的设计思路。我们采用插件式开放架构来构建 Agent Harness:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。
与此同时, SpaceX AI发布Grok 4.6。 SpaceX AI表示,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现,以及处理更复杂的交互式、视觉和知识工作任务的能力。
截至发稿时,智谱跌超4%。
(文章来源:澎湃新闻)
主题:接近Fable5|基金|智谱发布GLM5.3|新股|美股