DeepSeek V 4 Pro编程测评夺亚:分数仅输Kimi K 3,成本却只有对手十四分之一
CLUE 团队 最新 发布的 SuperCLUE-Terminal 中文智能体终端编程测评榜单显示,DeepSeek-V4-Pro-0813 拿下 51.52 分,在所有参测模型中位列第二,仅落后于登顶的 Kimi K3。更值得注意的是,它在取得这一成绩的同时保持着极低的调用成本,性价比优势在一众高分模型中格外突出。该榜单专门面向国内开发者设计,全部采用本土真实编程任务,并统一以 Claude Code 作为运行框架,公平对比各大模型理解中文需求、规划任务、调用工具及排错改代码的完整能力。

评测的真实感来自其任务设定:每道考题需要模型完成 50 至 110 轮交互,单题完整运行耗时半小时到一小时半,能高度还原日常开发中的复杂工作流。本轮榜单中 Kimi K3 以 60.61 分排名 第一 ,DeepSeek-V4-Pro-0813 紧随其后,分数高于 GLM-5.2 的 48.48 分和老版 DeepSeek-V4-Flash 的 46.46 分,稳居 第一 梯队。
1.42 元单题成本,硬刚 顶级 算力
最亮眼的是 DeepSeek-V4-Pro-0813 的成本控制:单题调用成本仅约 1.42 元,大约是 Kimi K3 的十四分之一、GLM-5.2 的十六分之一。在头部模型比拼分数往往只差几分的当下,这种数量级的成本差距,意味着中小团队用得起"接近 顶级 "的代码能力,而不必为每一次交互支付高昂算力费。
从实测场景看,该模型覆盖了前端页面、3D 游戏和工程脚本修改等真实需求,能完整闭环游戏开发逻辑,碰撞、计分、结算功能均运转正常,页面配色与交互反馈也摆脱了模板化的 AI 风格。少数创意绘图类题目会出现结构小瑕疵,但整体完成度仍处于领先水平。对预算敏感的中小企业和独立开发者而言,DeepSeek-V4-Pro-0813 用"第二名的分数、十四分之一的价格"重新定义了编程模型的性价比基准——当 顶级 能力不再意味着 顶级 开销,AI 编程的普及门槛正在被真正拉低。