说好「多模态不是主线」的梁文锋,怎么转头就发了个Vision模型?
梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,DeepSeek官方称,这是一个多模态视觉理解模型。
和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp没有技术报告,也没开源,官方只给了一张性能表和几个演示案例。
可DeepSeek V4 Flash Vision Exp怎么看都不像是个“组件”。
以往来看,DeepSeek OCR、DeepSeek OCR 2这样的模型才贴合梁文锋口中“组件”的定位。这些模型的作用,是把图片以像素形式存在的文字,转换成电脑可以识别的纯文本字符。
因此,相较DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一个“主线”模型。
难道梁文锋对多模态的看法改变了?事实可能并非如此。不过有一点可以肯定,那就是梁文锋学会了放低姿态,用产品和用户形成更密切的交流。
梁文锋此前曾说,“通往AGI要经过产品这个台阶,但不用花太多精力做C端、B端。”而随着DSH的爆火,发布后不到一个星期,DS就发布更新,提升了多模态能力。
过去的梁文锋对于产品有一种“偏执”,不完 美不发布。DeepSeek V3.2版本和DeepSeek V4预览版之间,相隔足足4个半月,如果从V3正式发布开始算,仅仅1个大版本,就用了1年零4个月。
现如今不仅更新变快了,还把DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,都是在说明梁文锋态度上发生了一些转变。
多模态是Agent和推理的入口
如果你是练跑步的,那么你应该给别人看的成绩你跑了多少米用了多少秒,这样别人才知道你到底是快还是慢。但如果你告诉别人的是三分球命中率是多少,那很显然,你想告诉别人的是你有多准。
DeepSeek V4 Flash Vision Exp也是如此,它想表达的事情,远非是一个展示DeepSeek现有的多模态能力那么简单。
明明是一个多模态模型,官方公布的测评里,放的却是一串Agent基准。比如Terminal Bench 2.1得83.9,DeepSWE 59.3。
其实在AI视觉模型圈里有一套默认的考卷。
一个新视觉模型发布,通常要放的是这几项:MMMU,跨30个学科、大学水平的图文理解与推理,考“看到图能不能做对题”;MathVista,考图片里的数学推理;DocVQA,考从扫描文档里找到答案;ChartQA,考读懂图表里的数字和趋势;OCRBench,考最基础的文字识别。
无论是Qwen-VL、Gemini 还是GPT-4o,发新版本的时候,展示的都是这套基准。
即便是DeepSeek V4 Flash Vision Exp也放了一些多模态侧的基准,然而这些基准也“不太正经”,充满了浓浓的Agent味。
Chartography考的是专业人士读专业图表做决策,ApexBench是多模态Agent基准,Agents’ Last Exam 是通用Agent评测。没有一项是“看图答题”,全是“看完图,把事做下去”。
这张跑分图,本身就是DeepSeek的一种暗示。
梁文锋自始至终都认为多模态不是AGI的主线,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent跟推理这条主线上的一个必然产物,只不过它刚好也是“多模态”罢了。
DeepSeek V4 Flash Vision Exp所展现出来的价值观是,多模态从来不是让你“看图聊天”,而是让Agent看懂网页截图、读懂图表数据、理解UI布局,然后把任务做下去。
多模态不是目的,是手段,是给主线用的插件。DeepSeek的主线仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所干的事,也不过是强化了产品的推理能力。
虽然DeepSeek V4 Flash Vision Exp这个很神秘,但它也并非是一个凭空出现的模型。
4月29日晚,DeepSeek多模态负责人陈小康(Xiaokang Chen)在X平台发文预告,配文 “Now, we see you”,宣布DeepSeek多模态识图功能开启灰度测试。
第二天,DeepSeek正式在GitHub发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包含DeepSeek、北京大学、清华大学,属于三方联合研究成果。
然而这篇论文在5月1日凌晨就被删除,相关官宣推文也消失不见,GitHub官方仓库直接变为404状态,项目彻底无法访问。DeepSeek全程未发布任何撤稿公告,也没有公开解释原因。
好在,社区留下了这篇论文的拷贝版本。
这篇论文没有去讲“我们模型看得多清楚”,而是提出一个问题:模型能看见,但不一定能想清楚。
传统多模态模型用自然语言描述图片里的对象,比如“左边那个男的”“右边那个高的”。可是在复杂场景里,这种描述非常模糊,模型很容易越推越乱,最后导致整个逻辑崩塌。
就拿集体照来说,左边一共好几个男的,那么哪个男的才是模型所描述的那个?
DeepSeek的解法,是把点坐标和边界框提升为“思维的最小单元”,直接嵌进推理链,让模型“边推理边指向”,就像人数东西时会伸出手指,一个一个点着数。
靠这套机制,模型在计数、空间推理、迷宫导航这类任务上,把抽象的判断精确锚定到图像坐标,从“左边那个男的”、“右边那个高的”,变成了“我手指的这个”、“我手指的那个”。
6月,经过DeepSeek官方确认,其在客户端和网页端上线的Vision模式,底层就是这套视觉原语机制。
而DeepSeek V4 Flash Vision Exp,是把同一套技术嫁接到了V4-Flash的API基座上,重点强化多模态Agent能力,核心推理逻辑完全沿用了论文的方案,没有跳出其技术框架。
不仅如此,论文当时的实验,就是基于DeepSeek-V4-Flash作为语言骨干所搭建的多模态方案。这次的DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。
除了DeepSeek V4 Flash Vision Exp这个模型,DeepSeek在多模态方面的进展还体现在DSH上,8月19日晚,作为DeepSeek目前的主力产品,DSH更新了rc.8版本,提升了Agent的多模态能力。
rc.8的核心,是DeepSeek在多模态这件事上,“两条腿”走路。
一条叫“原生直通”。rc.8给模型适配器加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如GLM、Qwen,或者刚上线的V4-Flash-Vision-Exp,Harness就把图片原封不动送进模型,不做任何中间加工。
另一条叫“工具层视觉”,服务的是纯文本模型。
比如用DeepSeek自己的V4-Flash,直接读图会失败。这时Harness不会报错退出,而是自动降级成一套工具链,先做OCR识别文字,再统计图片颜色比例、扫描部分像素行、读取尺寸和颜色模式,把这些信息拆成结构化证据,最后交给文本模型去推理整张图。
Cherry Studio的核心创始人Yinsen把这种方式称为“伪视觉”,对付PPT截图、流程图、界面这类结构清晰的图够用,面对真实照片和复杂的空间关系就很勉强。
但要说明的一点是,DSH在rc.8之前,甚至连“伪视觉”都没有,全靠社区的视觉插件,还有通过pi2dsh桥接进来的视觉方案。
它们的做法大同小异,先调一个外部的视觉模型(比如 GLM、Qwen)把图片识别成文字,再把结果塞回文本模型。
这些插件证明了DSH架构的开放性,也同时暴露了一件事,DeepSeek自己没有视觉模型,只能借别人的眼睛。
DSH还有哪些可以补足?
正如开头提到的,虽说梁文锋没有改变旧观点,但梁文锋也学会放低了姿态。
2025年,在DeepSeek R1惊艳全球之后,社区就开始等待DeepSeek发布V4。
2025年下半年,随着V3.1、V3.2等迭代版本陆续推出,无数媒体“独 家爆料”,称DeepSeek下一代旗舰大模型V4,计划于2025年7月、8月、9月……直至2025年年底发布。
结果自然是无一准确,堪称现代版狼来了。
2026年春节前,距离V3 发布已经过去400多天,所有人都在赌DeepSeek会复刻春节档R1的奇迹,把V4卡在农历新年这个节庆日子上线。
结果2月4日,外媒援引消息人士的话,称春节期间V4不会发布,DeepSeek官方也对此事保持沉默。
然后时间线一路后移。最后到了4月24日,V4才以预览版的形式登场,一次同时放出了V4-Pro和V4-Flash。
梁文锋的产品观是,宁可跳票,也不肯在产品没有完全做好的前提下发布。
可也就是在这段时间里,DeepSeek“掉队”了。
国际方面,2025年8月,OpenAI发布了GPT-5;11月,Anthropic发布Opus 4.5。这两款模型都是问 鼎全球的性能榜的产品。
而在国内,2025年4月Qwen 3,不到半年后,阿里一口气放出来了Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。还有Kimi的首 个原生多模态模型K2.5、智谱的GLM-4.7、MiniMax的M2.1、腾讯的hunyuan world等等,数不胜数。
与之相对的,DeepSeek发布的产品只有V3.1(8月V3.1,9月V3.1-terminus)和V3.2(12月)。
除了DeepSeek,全世界都在以月为单位发布模型,Anthropic更是以天为单位,在2026年2月1日到3月末,52天的时间里发布了73款功能和产品。
假如梁文锋是大厂的产品经理,以他发产品的效率,恐怕撑不过试用期就得被开除。只可惜DeepSeek是他的。
正式版更磨人。
6月29日,DeepSeek给全体API开发者发邮件,明确表示V4正式版7月中旬上线。7月21日,有消息表示正式版将要延期,目标挪到7月底。7月28日,又有消息说可能拖到8月10日至20日之间。
7月31日,V4-Flash正式版才千呼万唤始出来,而V4-Pro正式版,直到8月12日晚间才正式上线。
梁文锋对待产品,不做到自己满意,绝 对不放出来。
可到了DeepSeek V4 Flash Vision Exp这里,明显味道变了。
模型上线当晚,社区就开始对其进行检测。根据实测显示,DeepSeek V4 Flash Vision Exp连梁文锋本人最 具代表性的一张照片都无法识别。