终于来了!DeepSeek多模态视觉模型API全面开放
【TechWeb】8月21日消息,刚刚,DeepSeek官方正式宣布,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线DeepSeek API平台。这意味着,在纯文本模型V4-Flash奠定行业标杆之后,DeepSeek终于补齐了“视觉理解”这块重要拼图,向开发者正式开放了多模态API能力。
DeepSeek强调,作为一款“实验性模型”,DeepSeek-V4-Flash-Vision-Exp在纯文本能力(Agent、推理、世界知识等)方面与DeepSeek-V4-Flash正式版持平,后者此前已在Arena.ai前端编码排行榜上首次超越Opus 4.8,并以同级别最优的性价比备受开发者青睐。在需要视觉理解的Agent Benchmark测试中,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。
多模态Agent能力全面解锁
V4-Flash-Vision-Exp在各类Agent框架内展现出了出色的多模态适配能力,能够有效支持开发者借助多样化的Agent工具解锁更多实用工作场景。
DeepSeek官方同步展示了多个极具代表性的应用示例:
商业PPT生成:在Agent框架下生成商业定制西藏自驾游PPT,要求模型输出“野性、原始、探索感”的高端定制方案,包含三种真实定价方案,所有配图采用实拍质感风格。
网站二次创作:对DeepSeek Harness官网进行未来主义风格重构,运用黑蓝深海、玻璃UI和ASCII原子像素等视觉要素,经过长多轮交互完成创意设计。
前端动态特效:基于“一群可爱的3D黏土小怪物加入跃动复古舞池派对”的创意提示,制作黏土怪物风格动态特效的前端Mini Demo。
API服务正式开放,Files API同步上线,计费灵活透明
开发者可以通过设置 `model='deepseek-v4-flash-vision-exp'` 来访问该模型的API。在API服务中,图片会转换成token后按token计费,一张图片最多占384 tokens,计费价格与V4-Flash模型保持一致。
多模态API支持Chat Completions、Messages、Responses三种格式调用,可方便接入各类Agent工具,支持图文混合输入,并提供base64内联、外部URL、Files API三种图片传入方式。
伴随多模态API一同上线的还有Files API,该API不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,从而大幅节省请求带宽,同一张图片在多个请求中无需重复上传。
DeepSeek此次推出多模态视觉理解模型,标志着其从纯文本大模型向多模态AI全面进军的战略升级。在此之前,DeepSeek Harness已于8月19日发布v0.1.0-rc.8版本,带来14项更新,涵盖多模态输入、子Agent协作等能力。此次V4-Flash-Vision-Exp的正式上线,与此前Harness的更新形成了完整的“工具链+模型”闭环。
在定价方面,新模型延续了DeepSeek一贯的高性价比路线,考虑到V4-Flash此前以“价格低至竞品1%”著称,这一多模态API的定价策略无疑将进一步降低开发者接入多模态能力的门槛。
业内分析认为,DeepSeek此次推出的多模态视觉模型,在保持纯文本能力不妥协的前提下,将视觉理解Agent能力推至接近行业顶尖水平Opus-4.8。随着多模态API的全面开放,开发者生态有望迎来新一轮创新爆发。
主题:开发者|多模态API|V4-Flash-Vision-Exp|DeepSeek-V4-Flash-Vision-Exp