登录

MiniMax Design来了!推动H 3从模型能力走向商业内容生产


速读:推动H3从模型能力走向商业内容生产MiniMaxDesign来了! 今天(20日),通用AI科技公司MiniMax发布多模态创作Agent工作台MiniMaxDesign,进一步释放原生多模态视频模型H3的生产力,推动模型能力进入商业内容生产流程。 用户确认构图和人物关系后,系统再将结果作为H3生成视频的参考,将部分试错提前到分镜阶段。 值得一提的是,MiniMax分享了对多模态生产力的两个判断:首先,未来的内容创作与修改将逐步从像素、图层、时间点和参数操作,转向语义层面的交互。 面对一项具体任务,MiniMaxDesign可以判断需要提供哪些文字、图片、视频和音频,并识别其中需要参考或保留的内容,将创作需求转化为适合H3执行的素材和指令,补充音视频生成前的分镜规划,以及生成后的剪辑和成片装配能力。
MiniMax Design来了!推动H3从模型能力走向商业内容生产 _ 东方财富网

MiniMax Design来了!推动H3从模型能力走向商业内容生产

2026年08月20日 13:05

  今天(20日),通用AI科技公司MiniMax发布多模态创作Agent工作台MiniMax Design,进一步释放原生多模态视频模型H3的生产力,推动模型能力进入商业内容生产流程。

  MiniMax Design是一款多模态创作Harness。用户提出创作需求后,Agent能够理解目标、拆解任务,并调用相应的模型与技能(Skills),完成素材处理、内容生成、编辑和最终交付。

  H3具备多模态理解、视频生成、视频编辑和参考控制等能力,尤其适合Video Editing等对理解、控制与修改要求较高的任务。MiniMax Design在此基础上继续解决任务规划、素材组织和多环节协作问题,让模型能够参与内容从构思到交付的完整过程。作为MiniMax 围绕H3构建的创作产品,MiniMax Design把对模型能力边界、输入方式和使用方法的理解沉淀在Agent与Skills中。

  面对一项具体任务,MiniMax Design可以判断需要提供哪些文字、图片、视频和音频,并识别其中需要参考或保留的内容,将创作需求转化为适合H3执行的素材和指令,补充音视频生成前的分镜规划,以及生成后的剪辑和成片装配能力。

  例如,其亮点功能“3D导演台”可以根据场景、人物动作和镜头要求,在3D空间中摆放角色、调整姿态与机位,并从不同视角检查画面。用户确认构图和人物关系后,系统再将结果作为H3生成视频的参考,将部分试错提前到分镜阶段。镜头生成完成后,MiniMax Design还可以继续完成自动剪辑和字幕添加,将分散的素材组织为完整视频。

  MiniMax Design擅长处理目标明确、涉及多个制作环节,并且需要持续生成和修改的商业内容任务。在KOC、UGC、电商种草和带货视频等场景中,MiniMax Design可以理解商品信息和传播目标,规划脚本与镜头,并继续完成素材生成、剪辑和字幕,让一套商品素材更快转化为多个可用版本。在 教育 科普和MG动画等知识内容场景中,用户可以直接提供教案、课件或知识点,MiniMax Design会梳理内容结构和讲解顺序,再组织配音、画面和动画表达,将文字材料逐步制作成完整视频。

  对于PV、MV、电影片头、特效包装和角色宣传片等创意短片,MiniMax Design可以结合H3的生成、参考控制和视频编辑能力,由Agent规划整体创意与镜头,Skills执行具体制作环节,支持连续生成、精细控制和反复修改,减少创作者在多个专业工具之间切换的成本。

  围绕H3开源后形成的创作者生态,MiniMax Design已将部分社区工作流集合到产品中。已经使用ComfyUI的专业创作者也可以接入原有的本地部署方式和成熟工作流,选择云端或本地运行,并让Agent根据对话协助编辑工作流节点、调整生成参数。

  自然语言将逐步成为人与多模态内容交互的重要接口。用户负责表达创作意图,Agent负责理解、规划和执行,模型与工具则在统一工作流中完成具体任务。“MiniMax Design是MiniMax将H3的模型能力进一步组织为商业内容生产力的产品实践。”MiniMax相关负责人表示,“与此同时,我们欢迎用户在产品中探索或创建更加有趣、实用的开源工作流,让开源社区中的探索沉淀为可复用的生产能力,进一步拓展H3的应用范围。”

  值得一提的是,MiniMax分享了对多模态生产力的两个判断: 首先,未来的内容创作与修改将逐步从像素、图层、时间点和参数操作,转向语义层面的交互。用户只需说明想要什么、改变什么和保留什么,系统负责理解意图,并完成相应的生成、修改、重组和编辑。

   其次,多模态模型需要理解的Context将从一次输入扩展到整个Project。一项完整的内容任务通常包含多轮对话,以及剧本、图片、视频、音频、人物、场景、道具和品牌资产。不同版本及其修改记录也会成为后续创作的上下文。Context长度之外,模型能否理解并有效使用这些内容,将影响其处理复杂任务的能力。

(文章来源:上观新闻)

主题:新股|基金|美股