视频模型
分类
|GAIRPaper115
李飞飞、YilunDu罕见联手:别给机器人建大脑了,直接偷视频模型的李飞飞、YilunDu罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIRPaper115
文章
李飞飞、YilunDu罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIRPaper115
文章
自己
而这篇论文换了个问法:为什么不干脆用视频模型自己的母语跟它说话?
文章
李飞飞
懂物理
总结来看,这篇论文可以概括出一句话:过去视频模型懂物理但不懂动作,是因为缺一个"翻译接口",如今通过MVA把动作变成像素遮罩轨迹即可完成翻译,同时,MVA模型能同时做正向(世界模拟)和逆向(动作生成)。
文章
过去视频模型懂物理不懂动作,是因为缺"翻译接口"
文章