登录

张平文院士:机理与数据融合计算,贵在取长补短


速读:张平文院士:机理与数据融合计算,贵在取长补短。 这也正是他演讲的核心主旨:机理与数据的融合计算,贵在取长补短。 换句话说,科学计算与机器学习正在走向融合,我把它简称为“机理与数据的融合计算”。 数据驱动的计算有了前所未有的用武之地,也让数据与机理的“联姻”从可能变成了必须。 机理模型不是万能的。
作者:张平文 来源:中国科学报 发布时间:2026/8/21 14:14:4

张平文院士:机理与数据融合计算,贵在取长补短

8月14日,苏州一场暴雨,让前来参加中国科学院学部“科学与技术前沿论坛”的中国科学院院士张平文在路上多花了好几个小时。不仅他,许多院士专家都辗转多时才抵达苏州。他在次日的报告中以此切入——如果短临天气预报更准一点,大家可能就不会在暴雨中颇费周折了。

这次“被困在路上”的经历,恰成了他在主旨报告中的一个生动注脚。诸如雷雨大风、短时强降雨这样的短临天气预报为什么报不准?张平文回答得很直接:以机理为主的预报模型与以观测为主的预报模型,无论谁“单打独斗”都很难做到精细预报;要精准预报,二者“谁也离不开谁”,需要各取所长,融合贯通。

这也正是他演讲的核心主旨:机理与数据的融合计算,贵在取长补短。以下为其演讲主要内容,与原报告有删节。

张平文院士在数据科学与应用论坛上。主办方供图

两种计算范式,走向融合

科学计算走到今天,主要形成了两条路径。

一条是基于机理的计算范式。先把物理规律写成数学方程,再设计算法去求解。这条路的好处是能理解、精度高、可解释、能外推,在流体力学、电磁学等领域非常成功。但它的软肋也很明显:真实世界的问题远没有方程写得那么“简洁又美丽”——我们做数学、做物理的,那些越简单、越漂亮的东西,是我们最高的价值追求。但追求“简而美”这条路走得很艰辛,显然很多实际问题并不那么简洁,也没那么美。

另一条是以数据为中心的计算范式。统计也好、机器学习也好,不依赖物理公式、不需要学物理,只要有足够的数据,可以直接拿来建模。它的优点是效率高、应用面广,尤其是在大语言模型这样的场景中大放异彩。但代价也摆在那里:不可解释、缺乏理论保障、误差有时候也比较大。

一个“可解释但建模难”,一个高效但“解释不清”,两种模式的优缺点都非常清晰。很自然地,怎么融合、如何优势互补,就成了我们必须研究的问题。换句话说,科学计算与机器学习正在走向融合,我把它简称为“机理与数据的融合计算”。

说句题外话,在过去,做统计的与做计算数学的总好像是“分道扬镳”,统计科学家并不认为自己做的是数学,或者卡在了数学和非数学的分水岭上。但现在,机器学习的兴起,在某种程度上让这个局面发生了重大变化。数据驱动的计算有了前所未有的用武之地,也让数据与机理的“联姻”从可能变成了必须。

但要指出的是,融合不是目的,不同领域、不同场景、不同问题对精度、效率、鲁棒性的要求不同,要根据场景的需要选择合适的融合方式。简单说,融合就是取长补短。

三种融合方式,场景决定怎么“融”

那融合具体怎么做?我结合团队的实际工作,谈一下常见的三种融合路径。

一种情况是“机理搭台,数据唱戏”。

机理模型不是万能的。比如流体力学中应力和应变的关系,不同流体有不同表现,物理定律本身写到这儿就“写不下去”了,也就是所谓的“不封闭”。这时候怎么办?让数据来填空。机理把大框架搭好,具体缺口的参数由数据来拟合。这是用数据辅助机理建模,模型还是那个模型,但“残缺”的部分由数据补上。

反过来还有一种情况:数据太“自由”了,需要机理来“管一管”。

纯数据驱动的模型,学习能力强,但也容易“学歪”——学出了一些违背基本物理守恒律的结果,而学习者自己还不知道。我们团队的做法是把物理守恒性、对称性等原则作为约束条件,并将其“压”进数据模型的损失函数里。这相当于给脱缰的野马套上一副缰绳,跑得快、但不跑偏。这是用机理来约束数据模型,增加数据模型的可解释性和可靠性。

第三种情况最“激烈”——发生在模型和数据都没那么可靠的情况下,需要二者动态融合,典型场景就是天气预报。

在气象预报中,大尺度大气动力学方程能算大趋势,但暴雨、雷雨大风这类小尺度信息进不去;观测数据更准确,但其稀疏性和不均匀性会降低准确率。模型不准,数据也不准,单独哪一头都靠不住。要想真的预报准,就得让模型和数据交替修正、相互纠偏。

2022年北京冬奥会期间对冬奥赛场的天气预报就是典型。赛场多在山区,对精细化预报要求极高,在不恰当的天气环境下比赛,运动员可能会受伤。我们团队的方案是:数值模式提供大尺度的趋势信息,更多观测点的观测数据补充小尺度的局部信息,再在模式之上叠一层机器学习做实时订正——大尺度靠机理,细节靠数据,线下聚类模型、实时执行订正,两套体系交替迭代。我们这套被称作MOML算法的方案,进入了气象台的业务平台,显著提升了小尺度预报的准确率。

所以,仅靠模型或者仅靠数据,都不太可能把这件事情做得很漂亮。像暴雨这样的预测,尤其困难。

但要强调的是,这三种融合方式没有高下之分。用哪一种,取决于场景对精度的要求、数据的可获得性、对可解释性的需求。比如,生命科学对精度的要求就是高于地学,自动驾驶对可靠性的要求高于内容推荐,同样是预测,股市和天气的“融合方式”也完全不同。

AI从“能聊天”走向“会干活”的关键一步

我认为,融合计算不是某一项具体技术,而是未来智能化场景的一类底座。

当前人工智能有三个最热的概念——物理AI、世界模型、时空智能:物理AI是要让AI进入物理世界去感知和行动,自动驾驶、机器人是典型代表;世界模型是在机器内部构建可推演的虚拟环境,可用于仿真训练和数据生成;时空智能则是将时空大数据与AI结合,从卫星星座到数字孪生地球,核心都是让数据带上时空物理约束。

三者虽然叫法不同,但本质的共同点,都是要把物理规律“嵌入”数据驱动的AI。从算法的角度来说,都是要从基于数据的计算,推向机理与数据的融合计算。

机理描述世界“应该如何运转”,保障物理一致性和可解释性;数据反映世界“实际是什么样子”,提供表达能力和适应性。两者结合,我认为是AI从“能聊天”走向“会干活”的关键一步。

而在理论层面,融合计算也把数学推向了一个新战场:高维空间。过去做计算,三维以下我们都搞明白了,但深度学习把计算带入高维空间——这就搞不那么清楚了。高维数学分析需要重新建立,融合计算的模式本身也值得作为新的数学问题来研究。这既是挑战,也是数学科学难得的机遇。

总结来讲,计算历史悠久且越来越重要,融合计算方兴未艾:它是应用数学的核心部分,也是交叉学科的基础。对许多领域而言,未来的核心就是数据科学、物理学、数学、计算机的交叉融合,而机理与数据的融合计算则是学科交叉的基础,也是应用数学做好“服务”的核心要点。

( 作者系武汉大学校长、中国科学院院士,《中国科学报》记者根据其在中国科学院学部科学与技术前沿论坛上的发言整理 )

主题:计算|数据|融合|融合计算|计算范式|机器学习|贵在取长补短