MiniMax,做视频领域的Claude Code的野心已经藏不住了
H3 已经足够强,为什么我们还需要 MiniMax Design?
7 月 31 日,MiniMax H3 发布当天,我们就做了实测。
屏幕上的进度指示走到尽头,一段最高 2K 分辨率的视频出现在屏幕:画面、运动、声音被协调地装在同一个结果里。无论流畅度、画面精细程度,还是后期的视频修改操作便捷度,这无疑都是当前行业的 SOTA 级模型。
榜单成果也验证了我们的猜想。截至 8 月中旬,Artificial Analysis 的视频编辑榜上,H3 位列第一;在文生视频与图生视频榜单中,它同样处于第一梯队,全球前三。模型发布的同一时间,MiniMax 还顺便官宣了 H3 加量不加价,定价仅为同级别产品的三分之一,每秒 8 毛,一杯奶茶钱,就能完成一轮视频素材的 A/B/C 测试。
然后,新的问题来了:模型生成质量越来越高,成本越来越低,老板们想要一周发它个七八十条视频的宏伟商业构想也开始变得势不可挡。
但老板们似乎忘记了,写一条视频片段的提示词,仍需要老师傅非遗式古法手敲几千字;要保证片段间的风格一致性,也依然需要手动抽卡,赛博祈愿模型能够稳定发挥。
这部分真正费时费力的地方,效率并没有提升。
于是,仅仅过了 4 天,8 月 3 日,贴心的 MiniMax 就宣布 MiniMax Hub 产品升级为 MiniMax Design,并开始小范围内测。
这下,左手是 SOTA 级视频模型,右手是与模型深度结合的 Agent 产品, MiniMax 想成为视频领域 Claude Code 的野心,已经彻底藏不住了。
01
MiniMax H3,
如何靠三段式架构设计成为后期任务之王?
Minimax H3 到底有多厉害?说一个例子你就懂了。
H3 刚一发布,字节剪映海外版 CapCut, 就迅速接入上线了,甚至还煞有介事地发了一条 X 官宣,生怕用户错过来一次对家生态的好东西。
不仅是视频质量没得说,在视觉包装与后期特效方面,Minimax H3 的表现堪称独树一帜。
比如这里,在 H3 已经生成了一段动画电影版奶牛猫+环尾狐猴打魁地奇的视频后,我突发奇想,把画面中的奶牛猫换成奶牛,并且生成一段米高梅风格带字体特效的狐猴怒吼片头。
H3 不仅理解到了其他任何元素不变的潜台词,甚至还贴心地考虑到了片头与视频正片里的狐猴应当保持一致的细节,修改的效果如下:
更进一步深挖,则会发现这种精细的后期能力与指令理解能力,其实离不开 MiniMax H3 的三段式模型构建。
如果把大多数视频生成模型想象成一台黑盒,它们的工作逻辑大致可以理解成:Prompt 输进去,视频出来,至于中间模型究竟如何理解 Prompt,最终又会产出怎样的成果,整个过程的可控性并不算高。
于是,抽卡也成为了相当长一段时间里关于 AI 视频生成的关键词。
而 H3 的不同之处就在于,通过三段式架构设计,它让这个黑盒变得更加可控。 在这个架构中,第一段是 H3-Context-IR,负责语义理解与任务编排;第二段是 330 亿参数的 H3-Base,负责视频内容生成;第三段 H3-Regenerate-2K,则主要负责高分辨率重生成。
这其中,在生成上起到决定性作用的是 H3-Base。
但理解能力的进步也同样功不可没。独立的 Context-IR 模块,在 H3 中的作用类似于一个导播台。借助它,用户可以一次上传 9 张图 +3 段视频 +3 段音频作为上下文,然后由它来负责理解复杂多模态输入之间的关系,并把用户到底想干什么翻译成模型可执行的结构化指令。
从此,即使是视频小白,在完全不知道什么叫伦勃朗光,什么叫正反打,什么叫希区柯克变焦的情况下,也能随手上传段参考音视频,让模型理解老板想要的五彩斑斓的黑究竟是什么样子的效果。
但只是在视频生成与后期修改方向站稳脚跟。就行了吗?MiniMax 表示,还不够!
02
H3 已经足够强,
为什么我们还需要 MiniMax Design?
H3 带来的兴奋劲还没彻底过去,8 月 3 号,MiniMax Hub 正式更名为 MiniMax Design ,并在首页留下了一句颇具野心的话:「Your localized multimodal AI Agent team。」
是的,它没有把自己描述成「AI 视频生成器」,甚至没有把视频作为宣传重点,整个产品的入口是 Agent,任务拆解以及具体执行的与同样是 Agent,完全不需要用户在提示词以及创作技巧上过多费心。
凭借着这种低门槛与自动化,MiniMax Design 在海外 AI 创作者圈快速升温。
X 上,一大批设计师和 AI 艺术家展示他们用 MiniMax H3 制作的作品:有人只提供一个网站概念和几张页面参考,MiniMax Design 便自动拆解需求,生成动态网页展示、UI 动效和完整视觉方案;
有人上传一个动漫角色设定图,让 AI 直接制作角色展示 PV,包括动作设计、镜头切换和视觉特效;
还有创作者上传音乐,让系统自动完成角色、画面、字幕和节奏匹配,生成一支完整 MV。
有意思的地方在于,这些播放量数万甚至十几万的博主,他们大多不是专业的 AI 视频创作者,在生成这些视频的过程中,他们也并没有进行复杂的几千字 Prompt 调试,只要给出目标或简单描述,剩下的工作就由 Agent 直接自主完成。
其中,主 Agent 会首先判断创作意图,然后拆任务、匹配模型,再把工作分发出去。随后,后台多个 Agent 就会并行工作——文案 Agent 写脚本、图像 Agent 出分镜、视频 Agent 调用 H3 生成画面——结果汇总到画布上后,你还可以继续调整、编排、组合。
按照这些博主说的方法,我输入「生成一个奶牛猫带着环尾狐猴穿越到魔法世界,正在与一群巫师玩魁地奇的视频」之后,然后添加了 Documentary Skill 让 MiniMax Design 自动生成视频。
Skill 先是询问我期望生成的视频时长、清晰度以及比例,紧接着又将我这一句模糊的自然语言指令,扩充为长度有 700 多字的专业提示词,再然后,只要几分钟,视频生成了。
当然,除了考虑了小白的使用体验,对于专业视频制作大拿 MiniMax Design 同样有杀手锏。针对这部分用户,MiniMax Design 设计了专门的 agent 3D 导演台,可以极大提升抽卡成功率,降低制作成本。
用户只要上传一张参考照与参考视频,就能在 3D 导演台里调整摆放角色素体、调度机位与姿态,快速搭建分镜参考,将其变成模型上下文的一部分。类似自动剪辑、自动添加字幕的需求,也只要给 Agent 一句命令,全都能精准执行。
H3 再便宜也要花钱,于是思量再三后,在接下来的一周里,我选择借着对比不同平台上的 H3 表现效果为由,在不同 Agent 平台上轮流薅羊毛。
而这一对比,其实就不难发现: 在 MinMax Design 用 H3,似乎有一些特殊的魔法加成。
因为在 MiniMax Design 的设计中,Mini Max 团队基于 H3 的特点,构建了大量针对性的 Skill。
比如,用户提供了一段模糊输入后,这些 Skill 会更清楚如何将其转化成适合 H3 的提示词。图片、视频和音频,哪些内容应该作为参考,哪些部分需要保留、增强或修改,也全部手拿把掐。
不同创作场景下,这种深度适配,还可以展现出极强的针对性。
比如,在 PV、MV 等叙事向视频制作中,MiniMax Design 会先锚定内容主题、音乐节奏与核心参考素材,确立统一的视觉基调与分镜逻辑,再自主匹配人物、场景、镜头动作等核心创作资产,将碎片化的创意构思,变成风格统一叙事流畅的完整作品。
MiniMax H3+MiniMax Design 设计出的视频,在字体包装、Logo 动效设计上的表现,已经接近传统手搓 PV 的视效
针对电影片头、特效包装等高专业度场景,其拆解能力则更为精细。产品会逐层拆分文字版式、图形视觉、镜头运动、转场特效等专业元素,精准区分固有视觉基底、需要强化的特效层次、需要迭代优化的细节瑕疵,再联动调用 H3 的原生生成、参考精准控制、视频精细化编辑三大核心能力,完成高质感、专业化的视觉内容创作。
MiniMax H3+MiniMax Design 设计出的电影片头,动作的连贯性、视觉主体的一致性以及配乐的选择,已经接近影视级成品
而这一套模型与产品深度耦合的路径,构成了 MiniMax 独有的行业壁垒,也是绝大多数竞品无法复刻的核心优势。
但问题是,这样的优势,对一个商业化的公司,究竟价值几何呢?
03
模型+视频 Agent 的想象空间,
究竟有多大?
要理解视频 Agent 的价值,最好的参照系是已经跑通商业逻辑的编程 Agent——这个赛道在过去两年跑出了整个 AI 应用层最疯狂的增长曲线。
成立仅 4 年的 Cursor 在高速发展三年后,到 2026 年依然能保持 7 倍的估值增速与 8 倍的 ARR 增速,堪称全球软件产业的奇迹。Claude Code 的故事更夸张。2025 年 5 月才正式公开的 Claude Code 到 2026 年 2 月,不到一年时间,ARR 已经达到 25 亿美元,成为 Anthropic 增长最快的业务板块,贡献了总营收的近十分之一。
两个案例都指向一个结论: 一个能帮助用户完成完整任务的 Agent,会成为模型以及商业化营收的超级入口。
而相比编程 Agent,视频 Agent 的价值只会更大,壁垒也更强。
两者的核心差异,体现在两个维度:
第一,反馈闭环的确定性不同。 编程是纯逻辑的数字世界,代码对不对、能不能跑,编译器会给出明确、无歧义的答案,Agent 可以基于报错信息自动迭代修正。但视频创作没有绝对标准:画面好不好看、节奏顺不顺、人物表情到不到位,都是审美和感知层面的判断,这意味着视频 Agent 需要更强的意图理解能力和更精细的人机交互设计。
第二,素材与状态的管理成本不同。 代码项目的资产是文本文件,版本管理、局部修改、上下文复用都有成熟的方案。但视频项目的资产是海量的片段素材、角色资产、场景资产,时序上的一致性、局部修改后的画面衔接,至今都是行业难题。
更关键的区别在于修改的成本结构。 代码改错一行,回滚一个 commit 就解决了;视频改一处不满意,如果模型只能整条重新生成,成本是几十秒的 GPU 算力加上不可控的新结果。
这就导致一个核心矛盾:视频越长,修改的需求越多,重新生成的成本也越高。
所以代码 Agent 可以先生成、再测试、失败重来,而视频 Agent 必须再更高可控度的前提下,支持精准的局部编辑。这要求模型本身具备多模态上下文理解能力,也要求工作台能把保留、修改、重生成这件事做得顺滑。
对买量素材、电商短视频、教育科普动画这类批量生产的场景来说:生成、调整、剪辑、导出都能在一个工作台里完成,工作流带来的效率提升,也远大于单个镜头的画质优化。
在这一背景下,MiniMax H3+MiniMax Design,距离成为视频领域的 Claude Code 式产品,或许只 有 一步之遥。