AI仿真人剧集井喷:演技如何“数字生成”
AI仿真人剧集井喷:演技如何“数字生成”
2026年09月28日 07:09
近年来,AI技术深度融入影视创作,特别是在近期,纯AI技术制作的仿真人影视剧集迎来井喷期,也越来越为大众接受。
与过去相较,在克服恐怖谷效应、完善真人情感表达、摆脱套路表演等领域,相关制作技术如何跨过这些门槛?AI“真人”走向何方?
上午10点,长寿路景源时尚产业园一个位于6楼的办公室里,派晨(上海)智能科技有限公司的AI仿真人短剧生产组正紧锣密鼓工作,生成师面前的电脑屏幕上,公司自主开发的IPVISE AI创意平台依托多模态大语言模型,正将一个个真人形象及真实场景视图融合,生成5秒到15秒不等的视频片段。接下来,它们将被拼合为一部40—60集的短剧,最终在海外付费平台上线。这一业务开展3个月后,相关营收已经进入持平状态,由于已与头部播放平台签约深度合作,成本还将进一步下降,前景乐观。
AI仿真人短剧生产组工作现场。
年初以来,AI仿真人影视剧集迎来井喷期,也越来越为大众接受,更多企业投身于此。数据显示,2026年第一季度全国共发布AI剧超10万部,其中AI仿真人剧占比达58%,新剧贡献播放量占比92.88%。
从市场规模到用户覆盖,数字“真人”正加速从技术试验走向主流消费,甚至开始谨慎迈入“工业化时代”。这股爆发式浪潮因何而来?
从伪人到真人
如何跨越恐怖谷
“恐怖谷效应”曾是AI生成写实人物最大的障碍。它指人类对于自身高度相似、却又不完全像人的事物产生的不适与恐惧。当相似度高但未达真实人类时,好感骤降,形成“谷底”,直至完全逼真才回升。
在AI仿真人短剧中同样如此。当一张脸“看起来像真人但又不太对”时,观众会本能地感到不适。然而近几个月来,不少AI仿真人短剧似乎已经解决了这个问题。“脸上连毛孔、色斑都有,根本没区别了”“上次看到个真人帅哥的视频,我还恍惚别是AI生成的吧”,线上、线下出现不少这样的声音。
如何跨过恐怖谷?从技术层面看,大模型的快速迭代是首要原因。上溯AI影视生成技术的发展脉络:2022年是图像生成与大语言模型元年,AI首次具备高质量图像生成与自然语言交互能力,为影视创作提供了视觉素材与文本侧的基础能力。
2023年是视频生成启蒙落地之年,Runway Gen-2正式发布,成为首个公开可用的文生视频模型;Stable Video Diffusion开源。AI从静态图像正式迈入动态视频生成时代,影视创作的“动态化”门槛大幅降低。
2024年是视频生成技术迭代跃升之年。OpenAI发布Sora,基于DiT架构支持60秒高清连贯视频,被定义为“世界模拟器”,年底向公众开放,确立了视频生成的主流技术范式。
2025年进入视频生成工业化成熟阶段。Runway Gen-4、Google Veo 3、Sora 2、Seedance 1.0等密集发布,实现原生音画同步、多镜头叙事与世界一致性。标准化视频生成时长延伸至两分钟级别,人物跨帧稳定性大幅提升,AI影视进入准工业化生产阶段。
今年,随着Seedance 2.0/2.5、Kling 3.0相继发布,AI视频从“可用型玩具”正式升级为“工业化生产工具”,成本与效率优势凸显,真人影视生产流程被深度重构。
“我刚进入这一领域时,真人剧与AI真人剧之间的差距在70%左右,‘人机味’明显,现在不细看已经看不出太大差别。”派晨(上海)智能科技有限公司创始人陈宇峰说。在应用层面,Kling等模型在日系、小清新风格上表现突出,即梦等模型在通用欧美人或中国古装题材上效率更高,制作团队会根据风格需求灵活调用不同模型,同时兼顾效果和成本。对于要求特别精细的作品,团队还会用PS对人物面部进行重新上色涂改,甚至用手绘板手动调整细节。
技术并非唯一答案。2023开始接触AI技术的AICG( 人工智能 生成内容)导演孙佳泞分享了她所在团队总结的一套标准化流程。
“首先你得有一个把控审美的人。”她强调,看的脸越多,经验越丰富,就越能捕捉到面孔之间的细微差异——比如眉间距、脸部折叠度等,这些恰恰是“捏”出来的脸可以与其他作品区分开来的地方。同时,真人的脸不是完美的,这边加颗痣,那边涂点小雀斑,反而会更有活人感。这些细节调整在技术层面上已经完全能够实现。
具体操作中也有不少窍门。比如在将角色面部二维视图“喂”给大模型前,可以注意使用淡灰色背景出图,出双视图(一张大脸加一张全身),这样能更好地把控最终效果。“我们圈内有一句话叫‘垃圾进,垃圾出’,你一定要把控‘喂’进去的东西不是垃圾。如果这张图看上去一般,指望视频模型据此跑出惊艳的效果是不可能的。”
在提示词(在“捏”脸时对AI大模型提出具体要求)的编写上,同样需要拿捏分寸——不可过于粗略笼统,否则就无法获得符合需求的面部特征;也不可过于具体烦琐,否则很可能导致AI注意力分散,甚至因指令冲突而出现“脸部抽筋”等怪异画面。
当被问及对AI内容生成技术未来有何展望时,她左手平摊向上,右手食指垂直抵于左手掌沿,仿佛平地竖起一根旗杆。“技术或许正经历一次跳跃,”孙佳泞说,“当站在这里(手指、手掌交汇处)的时候,平地上的我们看不清竖直向上的方向,只能拥抱它,往前走。”
告别“ 橡胶 拳头”
“演技”怎样生成
视频生成技术迅速进步,AI人物越来越“像真人”。上海视觉艺术学院艺术与科技专业副主任朱爱华认为,AI仿真人影像正在从对“外观拟真”的追求,进入对“角色可信度”的更深层挑战。
“脸做得很真实,并不等于人物就真实。”她说。真正让观众相信一个角色的,往往不是哭、笑、愤怒这些明确表情,而是一个眼神、一次迟疑、一个停顿,以及这些细微,甚至不那么标准的反应共同形成的那种“活人感”。真正困难的,也不是把某个表情做得更像,而是让人物的行为、情绪和关系在具体情境中成立。
这也正在改变AI影像创作者的工作方式。AI工具越强,创作者越不能只停留在“把画面生成出来”,而需要越来越多地进行导演式判断:人物为什么这样行动,这个镜头为什么存在,前后节奏和人物关系是否成立。
在AI仿真人剧中,观众对“ 橡胶 拳头”已习以为常——每当角色需要呈现愤怒、焦虑、激动等情绪时,总会给垂在腿侧的拳头一个特写,伴随着“嘎吱嘎吱”的声音缓缓捏紧。这已成AI生成真人角色表演套路化、表面化的缩影。
随着技术发展和观众需求的提升,如何从“生成视频”,到逼近甚至达到“生成演技”,是当前行业最前沿的命题之一。
近日,一部AI创作的仿真人短剧以上佳“表演”和优秀故事在全球平台获得播放量突破1亿次的佳绩。观众热议:“如果AI仿真人剧有奥斯卡,一定能拿奖。”以它为代表的诸多精品好剧的出现,似乎为AI仿真人视频拓展出更高的上限。
从单纯爽剧,到走心好剧,目前不少创作团队在操作层面更加精雕细琢。例如加强提示词的把控,总导演与生成师合作时,脑海里先把镜头、光影、走位想一遍,甚至自己演一遍给对方看,帮助其在编写提示词时精准把握尺度。
AI的算力是有限的,将其集中用在“刀刃”上,往往能发挥良好效果。例如,这场戏专注于脸部情绪变化,从哀到喜再由喜到哀,提示词就应重点放在情绪变化上;那场戏着重表现肢体动作,如掩面而泣、奔跑时摔了一跤,那么提示词就应聚焦动作。如果贪心想兼顾,可能反而会顾此失彼。
另一种方法是探索新功能。例如,不少主流视频生成模型可以参考真人视频做多模态联合建模,提取其中的动作时序、神态特征以及肢体参数等,将其整合、适配、迁移到目标虚拟角色的骨骼绑定及面部拓扑结构上,从而达到虚拟角色完全复刻真人表演的效果。
还有一些笨办法,比如多“抽卡”。AI视频生成常被称为“抽卡”,这源于其底层的“黑盒”属性。从艺术创作角度看,这种不可控的“意外”有时会带来启发,成为意外之喜,抽卡越多,提供的选择就越多,当然消耗的算力、时间成本也越高。在目前的专业短剧制作团队中,一般情况下抽两三次卡,即可获得有效画面;若要打造精品剧或处理剧中重点情节,可能需要抽上10次。
不过,也有人对“生成演技”持悲观态度,认为AI生成角色的底层逻辑是对表情符号的统计拟合,缺乏真实生命体验,因此很难达到顶级的水平。网上的相关热门讨论中,一个例子常被提及——《花样年华》中男女主对戏时那种幽微、复杂的人类情感表达,AI显然难以展现。
还有一重隐忧指向AI生成内容的“马太效应”。当大量AI作品被上传到网络,又被用作训练下一代模型的数据时,整个模型的审美可能会不断向“平均值”靠拢。长期沉浸在这种审美环境中的年轻观众,可能会丧失对更高品质表演的感知和鉴赏能力。
上海视觉艺术学院广播电视编导专业副主任甘露认为,未来技术的突破不应仅停留在图像生成层面,更需建立角色心理的逻辑模型。
麻省理工学院曾开展过一个项目,通过采集瞳孔放大、心跳加快等生理反馈数据,辅助编剧进行微短剧的节奏把控与爆点转折设计。不过,目前表演的符号化建设尚未成熟,若未来技术真正完善,其影响力将十分显著。
在她看来,AI提升“表演水平”离不开三个核心要素。
首先是人类生命体验的数据库。表演的本质源于真实的生命感受,无论是微笑、大笑、苦笑还是笑中带泪,都基于人类真实的肉身体验。算法没有肉身,无法拥有真实的生命体验,其底层素材只能来自人类真实的生活积累。这也引发了伦理层面的讨论——是否需要采集所有人类活动,对于这一点目前学界与公众仍在探讨中。
其次是专业影视创作者的叙事把控能力。AI目前只能输出碎片化的表演片段,而表演的节奏、停顿、独白以及人物情绪的递进层次,都需要编剧和导演凭借人文判断进行筛选、调取、舍弃与排序。相关从业人员必须学会驾驭这一工具,使其服务于创作,就像驾驶 汽车 一样,要让人主导工具,而非被工具主导。
最后是表演艺术本身的理论体系构建。需要将斯坦尼体系等现有表演理论,转化为可与AI对话、能被提示词拆解的语言体系,把表演艺术知识注入人机协同的创作流程,而非单纯依赖AI自由随机生成。
影视工业的
第二次深度数字化
如今,在较为成熟的AI仿真人内容生产团队中,熟练掌握提示词撰写、资产生成、视频剪辑甚至配乐等AI使用能力的3—4人,花一周时间即可完成一部40至60集的短剧,所需算力成本控制在1万到1.5万元人民币左右,具体数额取决于剧集级别和精度要求。
指数级下降的成本背后,是生产工具变革对传统影视制作模式的深刻冲击。
“我更愿意把它理解为影视工业的第二次深度数字化。”上海大学 上海电影 学院教师、青年电影导演、编剧徐响说。过去,从胶片进入数字时代时,数字技术首先改变的是电影摄影、后期制作、发行和放映的方式;而这一轮生成式 人工智能 开始介入的是更靠近创作源头的部分——人物从哪里来、空间如何建立、影像如何产生、表演如何被控制,甚至一个完整世界如何被构建。总体而言,它改变的是电影的影像究竟如何被生产。
在他看来,目前至少有几个变化非常明显。
第一,技术竞争正在从“生成能力”转向“导演控制能力”。前两年大家讨论的是一段视频能不能生成得足够逼真,现在真正有价值的技术指标已经变成:人物能否跨镜头保持一致,空间关系能不能持续存在,摄像机能不能准确调度,人物能不能完成复杂动作和表演,声音、对白、环境和画面能否共同形成一个完整场景。AI影像的核心竞争已经开始从“数字拟真”转向“虚拟片场”。对于电影导演来说,这个变化非常重要。
第二,AI正在从一种工具变成新的影视基础设施。它逐步覆盖项目开发、剧本研究、视觉开发、分镜预演、拍摄、虚拟制作、特效、声音、剪辑、宣发甚至运营等环节。产业已经开始出现相对明确的商业模式。所以未来人们可能不会再单独讨论“这是不是AI电影”,就像今天已经很少有人问一部电影是不是“数字电影”。AI会逐渐融入传统电影制作的工作流,变成影视生产的基础能力。
第三,影视生产的组织方式正在被重新定义。传统电影工业建立在高度专业化的部门分工之上:编剧、导演、摄影、美术、视效、剪辑,每一个环节都有完整的专业系统。AI并不会简单地把这些专业消灭,但它会重新划分这些专业之间的边界。一个导演以前要通过十几个部门才能验证的视觉构想,现在可能在前期就能够快速预演;一个小型创作团队过去无法承担的世界观、动作场面和类型规模,现在有了被实现的可能。未来或许一端是规模很小、能力高度复合的“超级创作者”,另一端是把模型、Agent、专业工作流和传统影视人才重新组织起来的“AI电影工厂”。
这实际上已不仅关乎降本增效,而是在改变影视工业的生产组织结构。相关产业研究也已经把“超级个体与AI工厂并行”列为未来值得关注的趋势。
第四,AI正在孕育一种可能不同于传统实拍、动画和CG的新影像形态。目前很多AI作品仍然在努力模仿传统电影,这很正常,因为任何新媒介最开始都会模仿旧媒介。
徐响真正感兴趣的是,当AI不再受制于传统摄像机、真实物理空间甚至稳定人物形态之后,它会不会产生属于自己的语言和叙事方法。从这一视角来看,世界模型的发展尤其值得关注——它已开始从“生成视频”走向“生成一个可以持续存在、可以进入和改变的世界”。如果这条路线继续发展,未来导演面对的不止是“一段生成式影像”,更是一个可以调度人物、摄像机、光线甚至事件发展的“生成世界”。到那时,导演工作的对象都会发生变化。
与此同时,他提出行业还有第五个,也是最关键的变化:技术红利正在迅速结束,内容竞争重新回归。当所有人都可以运用AI,“会生成”很快就不再构成竞争力。真正稀缺的将重新变成剧作、导演判断、审美、社会经验、娱乐性以及作者性。
“AI影视真正进入成熟阶段的标志,不只是我们终于做出了一个所有人都看不出是AI的镜头,更重要的是,有一天观众根本不关心这个作品用了什么技术,他只关心这个人物、这个故事以及这部作品有没有真正打动自己。”徐响说,从这个意义上看,当下正如一道分水岭——上半场解决的是AI能不能生成影像;现在进入的下半场,解决的是人能不能用AI创造真正的电影。他始终认为,影像创作最终面对的仍然是人。AI越强,创作者对于现实、人物、文化和自身经验的判断,会变得越重要。
(文章来源:上观新闻)