登录

AI大模型周榜:国产多模型扎堆入榜前端开发榜,阿里wan 3.0冲进视频榜前三


速读:本周有两款新模型首次入榜,Anthropicclaude-fable-5.1-max直接冲入前三,ELO得分1504分,位列第3; 本期Arena周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。 国产模型在智能体榜已有多款进入前30,其中多款新模型本周首次入榜:。
2026年09月07日 16:34

IT之家 9 月 7 日消息,Arena( arena.ai )平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。

整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。

IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。

本周有两款新模型首次入榜 ,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。

头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。

国产模型整体处于中上游位置,梯队相对稳定:

代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。

本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。

国产模型在代码榜已有多款进入前 30,具体排名如下:

前端开发榜本周迎来密集新模型入榜, OpenAI gpt-6-astra-max 首次登榜即拿下榜首 ,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。

国产模型此次扎堆入榜表现突出, 阿里 qwen3.8-max-0902 首次入榜即冲到第 4 ,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。

国产模型在前端开发榜已有多款进入前 20:

智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。

在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。

国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜:

AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。

国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。

AI 视频榜本周最大亮点是 阿里 wan3.0 首次入榜即冲进前三 ,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。

国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。

本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试, 其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名 ,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。

头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。

下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。

主题:新模型