点击蓝字

关注我们
AI TIME欢迎每一位AI爱好者的加入!
西湖大学吴泰霖实验室
论文题目:RealPDEBench: A Benchmark for Complex Physical Systems with Real-World Data
项目主页:https://realpdebench.github.io/
代码仓库:https://github.com/AI4Science-WestlakeU/RealPDEBench
文章链接:https://arxiv.org/abs/2601.01829
Open Review:https://openreview.net/forum?id=y3oHMcoItR


点击阅读原文查看作者讲解
复杂物理系统的时空演化预测是科学与工程领域长期关注的核心问题,典型场景涵盖流体力学、燃烧与可控核聚变等多类多尺度复杂动力学系统。近年来,科学机器学习(Scientific ML)在神经算子、物理约束学习与大模型预训练等方向快速发展,为高维、强非线性、非定常系统的高效准确建模开辟了新的范式。然而,一个关键瓶颈逐渐凸显出来:目前多数AI模型主要在数值仿真数据上训练与验证,而真实世界的实验观测数据昂贵、稀缺且无法构成体系,我们难以评估这些模型在真实世界的测量数据上究竟表现如何。
现实与仿真之间存在较大的差距,在现实中测量,常常会受传感器噪声干扰、观测数据不完整或者实验环境不稳定等因素的影响。而仿真数据虽然能提供更全的变量和更密的参数覆盖,但是却无法避免数值离散带来的误差、理想化的边界条件,以及因简化物理过程而产生的偏差。正因为如此,当前AI for PDE领域急需一个能同时包含真实测量数据与配对仿真数据的标准基准框架。这样的基准可以帮助AI for PDE的研究更系统地评估模型在实际测量场景下的性能,进而探究“sim-to-real”的迁移难题,从而为Scientific ML在真实世界中的部署和落地提供更可靠的评估依据。
基于这一动机,西湖大学吴泰霖实验室,联合范迪夏实验室,以及上海交大周德智实验室,提出了RealPDEBench。这是首个同时包含真实世界测量数据与配对数值仿真数据的机器学习基准框架。该基准由五个物理场景的数据集、三类任务、九个评估指标以及十个代表性基线方法构成,覆盖了流体、燃烧等多个不同的复杂物理系统。它提供了一个统一、模块化的代码框架,以便快速复现实验和开展扩展性的研究。
1
五种物理场景:从经典流动到燃烧多物理场

RealPDEBench构建了五个具有代表性的复杂物理系统场景,采集了多种工况下的真实实验测量数据,计算了对应的CFD仿真数据,旨在覆盖从基础流动到强耦合、多尺度、多物理过程的一系列关键挑战。最终,本文提供了包含736条真实&仿真配对轨迹的数据集,每条轨迹记录了系统参数(如雷诺数、控制频率、当量比等)及其系统状态。 五种物理系统包括:
Cylinder:圆柱绕流的层流到湍流的过渡与卡门涡街的形成,是流体动力学的经典非定常基准;
Controlled Cylinder:在圆柱绕流基础上引入外部周期性控制(振动幅值与频率),构成了“控制响应预测”的挑战;
FSI(流固耦合):圆柱在漩涡流体作用下产生非线性涡激振动,涉及流体力与结构动力学的强耦合与锁定现象;
Foil:由三维实验/仿真提取的剖面数据,体现三维效应带来的小尺度涡结构与湍流的复杂性;
Combustion:三维旋流燃烧(氨气/甲烷/空气)的实验与仿真数据,涉及反应流、多场耦合与多尺度动力学。
在真实测量数据的采集中,流体的数据通过循环水槽结合PIV(粒子图像测速)获取速度场;燃烧数据则通过OH*化学发光成像获取火焰光强等表征量。与之配对的仿真数据使用 CFD(大涡模拟)在匹配参数设置下生成,从而形成相同工况的实验与仿真对照。
经过我们的观察,意识到仿真数据与真实测量数据呈现出不同的误差特性,真实数据主要受到传感器噪声影响,而仿真数据的误差则主要由数值误差与建模误差主导。其中,仿真数据具有独特优势,其获取成本更低、可提供更多观测模态(物理变量),并且不受测量噪声的直接影响,而真实数据则反映出了物理系统外在表现的状态,是物理系统真实变化的体现。
2
三类任务设置:以真实世界评测为核心的 Sim-to-Real 研究
为了在统一框架下比较真实测量与仿真数据的训练效果,RealPDEBench定义了三类预测任务,并明确:所有模型最终都在真实数据测试集上进行评估,以贴近实际部署的目的,三类任务包括:
仅使用仿真数据训练(Simulated Training):模型在仿真数据上训练,直接在真实数据上测试;
仅使用真实数据训练(Real-world Training):模型只用有限真实样本训练;
仿真数据预训练 + 真实数据微调(Simulated Pretraining + Real-world Finetuning):先利用大量仿真数据预训练,再用少量真实数据微调。
这一设计不仅将“sim-to-real”定义为可量化与可复现的基准任务,也为研究“如何融合仿真优势与真实可靠性”提供了简洁可用的实验平台。
通过三类任务结果的对比发现,首先,仅使用真实数据训练的模型相较于仅使用仿真数据训练的模型具有明显优势,其相对 L2 误差减小了 9.39% 至 78.91%,说明仅使用仿真数据训练无法准确捕捉实际场景中的复杂特性。其次,以仿真预训练初始化模型参数并在真实数据上微调的模型,其误差低于仅使用真实数据从头训练的模型,表明仿真数据作为预训练数据对于模型性能的提升是有帮助的。此外,仿真预训练还能加速真实数据训练过程中的收敛,微调模型用更少的训练更新即可达到相同或更优的性能,而且训练过程中RMSE损失下降更快。
3
九个评估指标与十个基线模型:同时衡量数据像素误差与物理一致性

RealPDEBench 不仅采用了 RMSE、MAE、相对 L2 误差、R² 等常见数据误差指标,还引入了面向物理一致性的度量,例如频域误差(Fourier Space Error)、周期性相关的 Frequency Error、以及速度剖面等长期统计量(MVPE)。除此之外,针对“sim-to-real”的问题,论文还设计了更新比例(Update Ratio)用于刻画“仿真预训练 + 真实微调”相对“从真实数据直接训练”的收敛效率与准确度优势。
基线模型方面,论文覆盖九类深度学习模型与一个降阶模型(DMD),包括 U-Net、FNO、DeepONet、MWT、GK-Transformer、Transolver,以及预训练 PDE foundation model(DPOT)等,形成从传统经典模型到大模型预训练方案的系统对照。
经过系统性的实验,本文发现不同模型架构在各类评测指标上呈现出不同的权衡,基于卷积的模型在逐像素计算的RMSE上表现精度更高,而基于算子学习与谱域的方法更能保留周期性与全局物理特征。此外,自回归的长时序评估也体现了误差累积差异,部分模型在短期预测中表现良好,但在多步 rollout 中误差会逐步累积;相比之下,大规模预训练模型(如 DPOT)能够保持更稳定的长时序预测性能。

4
总结:面向可落地的科学机器学习
AI for PDE 这一研究领域,长期以来都面临着 “理论上看着有用,实际落地却难上加难” 的困境。导致这个困境的核心原因是仿真数据和真实场景的脱节。在做仿真时,无法避免地要做一些理想化简化,比如忽略复杂未知的噪声、固定简化边界条件,或是把物理间的耦合关系简化处理,但在真实的工业生产、实际场景中,PDE 问题会更加复杂:多源噪声无处不在,边界条件可能随时突变,还常常伴随着多尺度多物理场耦合的情况。
所以本文认为,未来的研究方向,必须从 “单纯追求仿真场景下的精度提升” 转变为“搭建仿真与真实数据之间的桥梁”。这不仅仅是算法的调整,更是从 “拟合那些理想化的方程” 到 “真正解决实际问题” 的本质跨越。而RealPDEBench最有价值的地方,就是通过 “真实数据和仿真数据配对” 的机制,给解决这个核心矛盾提供了关键支撑和平台。
5
思考与展望:不存在完美的数据
当前AI的成就,从早期概念的提出到深度学习兴起,再到大模型在各行各业的广泛应用,无一不是建立在数据驱动的逻辑之上的。数据也与算法、算力共同构成了现代AI的三大要素。然而,当AI走进物理系统——尤其是PDE系统时,数据的角色发生了微妙却关键的转变,它不再是“所见即所得”,反而常常以各种方式“干扰”模型与评价指标,导致许多模型在测试集上表现优异,却难以真正落地。
那么,究竟是什么原因造成了AI for PDE在落地时的困难?我们又该朝什么方向推动它的“下半场”?
首先必须明确的是,这个问题的根源并不在AI本身,而是在于PDE系统实在太复杂了。这类系统往往具有强非线性、非定常、多尺度、多物理场耦合等等的特点,其本身的求解与描述就是难题。从这个现实出发,至少可以从“观测”与“计算”两个维度看到数据在这一领域的天然局限:
一方面,对多数PDE系统的观测能力非常有限。以燃烧过程为例,其中可能涉及上千个化学物种,而当前技术能观测到的往往不足十分之一,且成本高昂。即便是那些可观测的量,也常伴随显著的噪声——这来自硬件精度、观测手段、环境干扰等多重因素。可以说,在当前技术条件下,物理系统的真实状态大多“看不见”,少数能“看见”的也未必完全真实。
另一方面,通过数值计算也无法获得系统的精确描述。以著名的纳维-斯托克斯方程为例,至今仍无通用闭式解,CFD依赖于离散化与各种简化模型。面对真实世界中复杂的边界条件、运动边界及流固耦合等问题,直接进行高精度模拟(如DNS)计算成本极高,实践中往往会引入更多简化假设。在这个过程中,系统的真实面貌难免被模糊甚至扭曲——我们什么都可以算,但算出来的不一定对。
既然无论是测量数据还是仿真数据,都无法完美刻画物理系统,那么基于这些“不完美”数据训练的AI模型,是否注定无法落地?作者认为未必。
关键在于明确目标:需要的不是让AI完美复现PDE系统的演化,而是让它完成我们希望它完成的任务。理论与实践之间始终存在鸿沟,但有时实践完全可以“脱离”理论独立生效——未必通晓内在机理,但只要方法管用,就可以投入使用。模型能否落地,往往取决于几个关键指标是否达标,而不必强求对系统完美的掌握。这也正应了那句话:“不管黑猫白猫,能捉老鼠的就是好猫”。
对AI研究者而言,这意味着在AI for PDE乃至更广泛的AI for Science领域中,不能只追求方法层面上的迭代与创新,更应当从真实的科学问题出发,开发真正能解决问题的模型与路径。
与此同时,AI作为数据驱动的方法,具备一项重要优势,它善于从数据中提取内在特征。无论是带有噪声的实测数据,还是存在误差的仿真数据,AI都可以对其进行特征提取、融合、同化,甚至有可能从这两种都不完美的数据视角中,提炼出更接近物理系统真实状态的特征表达。换句话说,测量和仿真可被视为理解物理系统的两种不同“视角”,而AI或许能提供另一种视角——一种更贴近本质的推断,这就是我们常说的“第四范式”。尽管这一视角仍需验证,但它代表着一种值得探索的可能性。
这也正是作者构建RealPDEBench的初衷,即将实测与仿真这两个既有优势又各有缺陷的视角置于同一框架下,推动未来的AI方法能够兼顾二者所长,在“不完美”的数据之间搭建桥梁,逐步逼近传统方法难以触及的、更真实的系统表示。
此外,AI for PDE的“下半场”,或许就在于构建更为严谨、多元的评估体系。当数据本身存在固有缺陷时,单一、理想化的评价指标容易产生误导。未来的关键方向,可能是开发能够系统衡量模型在“不完美” ground truth下的准确性、泛化能力与实用价值的评估方法。这要求超越传统误差验证的范式,转向一种融合多源数据、多重标准与面向物理系统真实状态的综合评估框架,从而引导研究从“表现优异”走向“真正可用”。
作者介绍
胡佩炎,西湖大学吴泰霖实验室(长期)访问学生,中科院数学院博士生,研究方向包括将AI应用于物理系统(PDE以及流体等实际系统)的仿真和控制,以及生成模型的基础算法,惯于用数学工具建模和求解研究过程中遇到的问题。平时喜欢跳舞💃和陪狗狗们玩🐶
冯浩东,西湖大学吴泰霖实验室访问学生,西湖大学范迪夏实验室四年级博士生,研究兴趣覆盖AI for PDE、流动控制、仿生机器人、大气污染、可控核聚变。这些兴趣的最终目标是从实际应用需求出发,用AI解决复杂物理系统与工程中的难题。业余定期follow最新出版小说,重点关注历史与官场题材,中国原构古建筑爱好者。
往期精彩文章推荐
关于AI TIME
AI TIME源起于2019年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球AI学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。
迄今为止,AI TIME已经邀请了2000多位海内外讲者,举办了逾800场活动,超1000万人次观看。

我知道你
在看
提出观点,表达想法,欢迎
留言

点击 阅读原文 观看作者直播回放!


154

被折叠的 条评论
为什么被折叠?



