登录

轻量反超旗舰,大模型史上第一次:AiPy发布DeepSeek


速读:轻量反超旗舰,大模型史上第一次:AiPy发布DeepSeek轻量反超旗舰,大模型史上第一次:AiPy发布DeepSeek-V4.1-Flash测评报告。 报告显示,该模型在63项真实办公与开发任务中成功交付59项,综合成功率达93.7%,不仅反超前代旗舰V4-Pro,其峰值输出速度更达到V4-Pro的7倍以上,标志着国产大模型在“智能体适配”这一关键赛道上实现代际跃升。
轻量反超旗舰,大模型史上第一次:AiPy 发布 DeepSeek-V4.1-Flash 测评报告

轻量反超旗舰,大模型史上第一次:AiPy 发布 DeepSeek-V4.1-Flash 测评报告

2026年09月10日 13:47

2026 年 9 月 10 日,国内领先的智能体平台 AiPy 正式发布《AiPy 适配度评测报告 · DeepSeek-V4.1-Flash(0910)》。这是全网首份针对 DeepSeek-V4.1-Flash 的适配度测评报告。报告显示,该模型在 63 项真实办公与开发任务中成功交付 59 项,综合成功率达 93.7%,不仅反超前代旗舰 V4-Pro,其峰值输出速度更达到 V4-Pro 的 7 倍以上,标志着国产大模型在“智能体适配”这一关键赛道上实现代际跃升。

一、从“对话”到“交付”:AiPy 重新定义智能体评测标尺

在全球人工智能产业加速从“模型竞赛”迈向“应用落地”的当下,如何衡量一个大模型是否真正“可用”,正成为行业关注的焦点。作为国内智能体领域的先行者,AiPy 长期深耕“模型—工具—交付”全链路适配评测,其发布的适配度报告以“真实客户端、真实任务、真实交付物”为方法论,已成为观察国产大模型工程化能力的重要窗口。

与业界常见的“刷榜式”基准测试不同,AiPy 的适配度评测聚焦一个朴素而严苛的问题:模型能否在真实客户端环境中,理解用户意图、正确调用本地工具与联网能力,并最终产出可交付的实体文件。本次评测基于 AiPy Pro 2.0.1 客户端,以 DeepSeek-V4.1-Flash(0910)为执行内核,跑通 63 项覆盖多模态理解、文档与数据处理、联网检索与调研、系统与桌面操控、代码与工具开发、内容创作与设计六大能力维度的端到端任务,每一道题都要求产出 HTML、Word、PPT、PDF、图片、音视频或可执行程序等真实交付物,而非简单的问答对话。

二、93.7% 反超 V4-Pro:轻量与旗舰的界限被重新定义

报告最引人注目的结论,是新一代 Flash 系列在成功率上完成了对上一代 Pro 旗舰的反超。数据显示,DeepSeek-V4.1-Flash(0910)在 63 项任务中成功交付 59 项,综合成功率达 93.7%,属于“高可用”水平;相较之下,前代旗舰 V4-Pro 的成功率为 88.4%,前代 V4-Flash 为 82.6%。这意味着,新一代 Flash 较 V4-Pro 提升 5.3 个百分点,较 V4-Flash 提升 11.1 个百分点,在成功率这一关键指标上实现了对“能力优先”路线旗舰的超越。

速度层面的优势同样显著。实测中,V4.1-Flash(0910)最高输出速度可达 500+ tokens/s,大部分回复稳定在高速区间,交互体验接近“秒回”。作为对比,前代 V4-Flash 此前测试最高约 218 tokens/s,V4-Pro 则不到 70 tokens/s——V4.1-Flash(0910)的峰值速度约为 V4-Flash 的 2.3 倍、V4-Pro 的 7 倍以上。

主题:V4.1-Flash|DeepSeek-V4.1-Flash|V4-Pro|大模型史上第一次|前代旗舰V4-Pro