刚刚,DeepSeek V 4.1 Flash正式上线!已适配Harness
太快了。
周四上午,DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线。
据官方披露,V4.1 Flash 在性能、响应速度、效率等核心指标上已全面超越 V4 Pro,且采用了新架构并原生支持多模态。
具体来讲,V4.1 Flash 是一款总参数规模达 552B 的 MoE 模型。它 采用全新的 Causal-Encoder-Decoder 架构 ,并对输入与输出采用非对称计算设计:输入侧仅激活 8B 参数,输出侧激活 16B 参数,因此在保持大模型容量的同时,大幅降低了实际推理成本。
除了架构上的调整,V4.1 Flash 还引入了新的预训练方法,并进行了更大规模的强化学习后训练。最终,它在多项基准测试中实现了性能提升, 整体智能水平超过大批当前旗舰模型 ,在性能、效率与成本之间取得了更好的平衡。
模型开源链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
从下图官方展示的基准结果来看, V4.1 Flash 在软件工程、网络安全环境和自动化任务等测试中表现较强 。
在 DeepSWE v1.1、CyberGym 和 Automation-Bench 上,它均取得图中最高分,其中 DeepSWE 仅以 0.2 分小幅领先 Opus 5;但在 Terminal-Bench 3.0 上,V4.1 Flash 的 30.0 分明显低于 Opus 5 的 43.3 分和 GPT-5.6 Sol 的 34.4 分。因此,整体来看,这组结果说明 V4.1 Flash 在部分 Coding 和 Agent 类任务上具备较强竞争力,但并非所有基准都占优。