科研仿真环境全景:sim2real gap 与 AI
从 DFT、分子动力学、GraphCast,到虚拟细胞、ESM3 和 Lean:13 个学科的代表性仿真,gap 有多大、该用什么指标量,以及它们和 AI 训练的关系。
一个领域的 AI 进展速度,与它的 reward 可验证性成正比,与它的 sim2real gap 成反比。
0结论先行
-
"仿真"其实分三代,不能放在一起比。
- 第一代:第一性原理数值模拟。 包括 DFT、分子动力学、CFD、数值天气预报(NWP)、Geant4、MuJoCo。物理方程是已知的,误差来自近似和算力。
- 第二代:AI 仿真器(emulator/surrogate)。 例如 MLIP、GraphCast、BioEmu。它们用第一代的输出做训练,快 10³–10⁵ 倍,但精度的上限就是老师(第一代模拟器)。
- 第三代:数据驱动的"世界模型"。 包括虚拟细胞、ESM3、Evo 2、小鼠视皮层数字孪生。这些领域没有可用的第一性原理方程,模型直接从实验数据里学。 ESM3 和虚拟细胞属于第三代,它们的 gap 形态和 DFT 完全不同。
-
sim2real gap 要分三层量: ① 模拟器对真实实验;② AI 仿真器对模拟器;③ 设计出来的东西在湿实验中的成功率。最容易被夸大的是用 ② 冒充 ①。例如 AI 天气模型对着 ERA5 算的误差,比对着真实观测站低 15–45%;FEP 在公开基准上 RMSE 为 1.73 kcal/mol,换到药企私有体系变成 2.44。
-
按 gap 从小到大排序: 数学(Lean,验证层 gap≈0,但内核实现有过 bug,见 §2.13)< 刚体机器人控制和等离子体控制(已 zero-shot 上真机)< 天气、流体(仿真本身已很准)< 材料和分子能量(DFT 本身有系统误差)< 蛋白设计(湿实验成功率 5–50%)< 药物结合自由能 < 虚拟细胞(2025 年仍未稳定打败"取平均"这种朴素基线)。
-
与 AI 的关系已经有四种形态,成熟度依次下降: 仿真造数据训 AI(最成熟)→ AI 替代仿真 → 仿真作 RL 环境训控制策略(TCV 托卡马克、1 型糖尿病人工胰腺、机器人)→ 仿真或预测器作 LLM agent 的工具和 reward(ether0、Lean、虚拟细胞 agent)。前沿公司(Periodic Labs、Lila)押的是第五种:"把大自然本身当 RL 环境"。原因正是第 3 点:大部分科学仿真器的 gap 太大,不适合做终极 reward。
1全景总表
| 学科 | 第一性原理模拟(1代) | AI 仿真器/基础模型(2/3代) | 仿的对象 | 真值来源 |
|---|---|---|---|---|
| 细胞生物 | 全细胞 ODE 模型(Karr 支原体 2012 ⓚ)、VCell ⓚ | Arc State、scGPT/Geneformer;蛋白质组虚拟细胞(Nature 2026) | 扰动 → 转录组/细胞状态 | Perturb-seq 单细胞测序 |
| 蛋白质/RNA/基因组 | Rosetta(能量函数)ⓚ | ESM3、AlphaFold3、Boltz、RFdiffusion、BindCraft、Evo 2 | 序列 ↔ 结构 ↔ 功能 | 晶体/冷冻电镜、湿实验活性 |
| 分子动力学/药物 | GROMACS、AMBER、OpenMM、FEP+ | BioEmu、AI2BMD ⓚ | 构象系综、结合自由能 | ITC/IC50、稳定性测量 |
| 材料 | VASP、Quantum ESPRESSO(DFT) | UMA、MACE-MP、MatterSim、Orb、PET-OAM;GNoME、MatterGen | 晶体能量/力 → 稳定性、性质 | 合成 + XRD、物性测量 |
| 化学/量子化学 | ORCA、Gaussian、PySCF | UMA(OMol25 训练);ether0(推理模型) | 分子能量、反应、性质 | 量热、光谱、产率 |
| 天气/气候 | ECMWF IFS、E3SM | GraphCast/GenCast/WeatherNext 3、Aurora、NeuralGCM ⓚ | 大气状态演化 | 观测站、卫星、再分析 |
| 流体/工程 | OpenFOAM、Ansys Fluent | FNO 神经算子、NVIDIA PhysicsNeMo;The Well(15 TB 数据) | Navier-Stokes 流场 | 风洞、PIV |
| 聚变/等离子体 | 回旋动理学 GENE/GX、自由边界平衡 FGE ⓚ | TORAX(JAX 可微输运)ⓚ | 等离子体平衡与输运 | 托卡马克诊断 |
| 粒子物理 | Geant4、Pythia | CaloChallenge 生成模型(CaloDiT-2 等) | 粒子-探测器相互作用 | 对撞机数据 |
| 天体/宇宙学 | IllustrisTNG、SIMBA、ASTRID、EAGLE | CAMELS 套件 + 神经推断 | 宇宙大尺度结构 | 巡天观测 |
| 神经科学 | NEURON、Blue Brain(2024 结束)ⓚ | 小鼠视皮层数字孪生(MICrONS);FlyWire + NeuroMechFly/flybody;BAAIWorm ⓚ | 神经响应、脑-身体闭环 | 钙成像、电生理、行为 |
| 医学/生理 | UVA/Padova T1D 模拟器、心脏电生理模型 | 虚拟病人队列、数字孪生对照组 | 病人对药物/器械的响应 | 临床试验 |
| 机器人/具身 | MuJoCo、Isaac Sim、Genesis、SAPIEN | 视频世界模型(Cosmos、SC3-Eval) | 刚体接触动力学、视觉 | 真机成功率 |
| 数学(对照组,不属于三代仿真,是 verifier/真值本身) | —(Lean 4、Isabelle 是证明检查器,不是模拟器) | AlphaProof、DeepSeek-Prover | 证明是否成立 | 证明器内核本身即真值 |
2分学科详解
2.1 细胞生物:虚拟细胞(Virtual Cell)
代表
-
Arc Institute State:Arc 的第一代虚拟细胞模型,在 1 亿+ 单细胞扰动数据上训练(Tahoe-100M、Parse-PBMC、Replogle-Nadig)。它预测干细胞、癌细胞、免疫细胞在药物、细胞因子或基因扰动下的转录组响应。Arc 称:在 Tahoe-100M 上,State 区分扰动效应的能力比已有模型高 50%,差异表达基因识别准确度是已有模型的 2 倍。
-
数据基建:Arc Virtual Cell Atlas 已超过 6 亿细胞。2026-01,Tahoe、Arc、Biohub 联合启动新数据集项目,扰动丰富度是 Tahoe-100M 的 4 倍以上。
-
另一条路线是蛋白质组层面:An operational perturbation proteomics-based virtual cell model(Nature 2026)。
sim2real gap:所有领域里最大、也最有争议
-
Virtual Cell Challenge 2025:超过 5000 人注册,300+ 队进入决赛。第一名 BioMap,Generalist 奖 Altos Labs,第三名 Outlier(TransPert 是一个只用汇总数据的统计模型)。官方复盘原话:预测模型尚未在所有指标上稳定超过朴素基线,只在扰动区分和差异表达识别上有明显进步。
-
独立基准(2026):在未见过的单基因扰动上,最好的模型(State)比"细胞均值"基线好 26%,调好的线性/加性基线好 19%,GEARS 好 22%。好几个基础模型连线性基线都没打过。 深度模型真正拉开差距的地方在三处:组合(非加性)扰动、跨细胞类型迁移、表征任务(注释、整合)。
-
推荐指标:
- 差异表达基因重合度(DE score)
- 扰动区分度:预测结果能否认回是哪个扰动
- 全谱 MAE
- 每个指标都要对"扰动均值基线"做归一化
- 2025 年的教训是"窄指标会被 overfit",所以 2026 年改成 6 个指标聚合,评测工具 cell-eval 与 NVIDIA 共建。
-
更硬的检验是前瞻验证:模型推荐的扰动,在真实 Perturb-seq 或表型筛选里的命中率。
-
VCC 2026 升级:从"同一细胞类型内泛化"改成"在 6 个全新细胞系上零样本预测 CRISPRi 响应",不提供该挑战专属的训练集。11-05 截止,11 月中下旬公布结果。
与 AI 的关系
-
虚拟细胞本身就是 AI 模型,是第三代仿真。
-
它开始被当作 agent 的环境:BioDiscoveryAgent 在 in silico 模型里迭代提出扰动、模拟结果、修正假设。2026 年出现了 AssayBench、VCWorld、CellScientist 等"虚拟细胞 × LLM agent"基准和框架。
-
⚠️ 风险:用一个打不过线性基线的模拟器当 reward,agent 学到的是模拟器的偏差。
2.2 蛋白质 / RNA / 基因组
代表
-
ESM3(EvolutionaryScale):同时建模序列、结构、功能三个轨道的生成式语言模型。旗舰案例 esmGFP 与最近的已知荧光蛋白只有 58% 序列同一性,按进化速率估算相当于 5 亿年以上的距离,湿实验确认会发光。第三方用它做打结蛋白,引导生成的成功率为 89/100(这是计算指标,没有湿实验验证)。
-
AlphaFold3 / Boltz:结构预测,覆盖蛋白、核酸、配体复合物。
-
RFdiffusion / BindCraft / AlphaProteo:结合蛋白(binder)设计。
-
Evo 2(Arc):全生命域的基因组语言模型。
sim2real gap:这里的"real"就是湿实验成功率
-
Binder 设计的公开命中率:RFdiffusion(2023)约 19%;AlphaProteo(2024)按靶点从个位数到 88%;BindCraft(Nature 2025)平均 46.3%,范围 10–100%。
-
生产环境要打折:CRO 实践反馈,真实项目中未经过滤的 RFdiffusion/BindCraft 输出,湿实验命中率只有论文数字的一小部分,要靠激进的可开发性过滤才能补回来。命中率从 <1% 提到几十个百分点,真正的杠杆不是模型变大,而是"设计→合成→测量→反馈"这个湿实验闭环。
-
基因组尺度:用 Evo 1/Evo 2 生成噬菌体全基因组(bioRxiv 2025-09,后发 Science),筛选约 300 个设计,得到 16 个有活性的噬菌体,成功率约 5%;其中部分在生长竞争和裂解动力学上超过天然 ΦX174,鸡尾酒组合能快速击穿三株 E. coli 的抗性。这是"全基因组生成"的第一个成功率锚点。
-
RNA 明显落后于蛋白:CASP16 里 RNA 单体赛道上,深度学习(AlphaFold3、DeepFoldRNA)要和模板、物理模型、专家人工精修混合使用才进前列——纯端到端还不够;混合队 GuangzhouRNA-human 拿到 Z-score 第二。EnsembleFold 在 19 个系综靶点上平均 TM-score 0.657,比 AlphaFold3 基线好 10.2%(TM-score 0.657 在蛋白领域只能算中等)。
-
推荐指标:湿实验命中率(每设计多少条测多少条)、亲和力 Kd 分布、可开发性通过率;结构类用 TM-score / RMSD / DockQ;预筛类用 pLDDT、ipTM 等自评分与实际成功率的相关性(已有 2025 研究专门评估 AlphaFold/ESMFold/ProteinMPNN 的零样本预测能力,结论是有用但远非充分)。
与 AI 的关系:本身就是 AI;反向关系是"结构预测器作为设计模型的 reward"——这是目前最成熟的"AI 用仿真器训 AI",例如 ProteinZero 这类用在线 RL 自我改进的工作。
2.3 分子动力学与药物结合自由能
代表
-
经典 MD:GROMACS、AMBER、OpenMM,力场 + 数值积分,模拟纳秒到毫秒。
-
FEP+(Schrödinger)/ OpenFE:炼金术自由能微扰,算结合亲和力,是计算药化的现役主力。
-
BioEmu(Microsoft Research, Science 2025):生成式深度学习直接采样蛋白平衡系综,单 GPU 每小时生成数千个统计独立结构,集成了 200+ 毫秒 MD 数据训练。
sim2real gap:有一个公认的"1 kcal/mol 门槛"
-
BioEmu 对毫秒级 MD 和实验数据的相对自由能误差 < 1 kcal/mol,加速 4–5 个数量级;小蛋白折叠稳定性以及突变体 ΔΔG 的相关系数 > 0.6。注意这是"对 MD"和"对实验"的混合评估——典型的第二代模拟器 gap。
-
FEP 的真实 gap 有一个很漂亮的对照实验(OpenFE 2025 大规模协作评估):公开数据集 58 个体系,加权 RMSE 1.73 kcal/mol(10 个达到亚 kcal);私有药企数据集 37 个体系,加权 RMSE 2.44 kcal/mol(只有 2 个达到亚 kcal)。 同一套方法,真实项目难度下精度掉 40%。这是全文最值得记住的一个数字对。
-
推荐指标:ΔΔG 的 RMSE(kcal/mol)、Spearman/Kendall 排序相关(做先导优化时排序比绝对值重要)、前瞻性命中富集倍数。
2.4 材料
代表
-
第一代:DFT(VASP / Quantum ESPRESSO),PBE 泛函是事实标准。
-
第二代(MLIP,通用原子间势):MACE-MP、MatterSim、Orb、SevenNet、Meta UMA、EPFL PET-OAM-XL。评测场是 Matbench Discovery(稳定性判别、几何优化、声子、热导 κ、MD、双原子势能曲线多榜单)。OMat24 训练的模型在稳定性 F1 上已 >0.9,形成能精度约 20 meV/atom(对 DFT 而言)。
-
生成式:GNoME(DeepMind,220 万个预测稳定晶体 ⓚ)、MatterGen(Microsoft, Nature 2025)。
-
自动化实验:A-Lab(LBNL),17 天无人值守从 58 个目标合成出 41 个(约 71%)。
sim2real gap:这是"两层 gap 叠加"的教科书案例
-
第二层(MLIP vs DFT)已经很小:F1 > 0.9、20 meV/atom。
-
第一层(DFT vs 实验)才是天花板:PBE 形成能与更高级方法的偏差在 0.15 eV/atom 量级;带隙是重灾区——LDA/PBE 的 MAE > 1 eV、MAPE 约 50%(某些基准上 PBE 对 70 个绝缘体 MAD 1.28 eV,PBEsol 对 121 个材料 MAE 1.35 eV);HSE06/mBJ 能压到 0.28–0.30 eV。所以一个 MLIP 哪怕把 DFT 学到 1 meV,也无法修正 DFT 自己的 1 eV 带隙错误。 这是 AI 材料领域最容易被掩盖的事实。
-
第三层(设计 → 合成):MatterGen 以 200 GPa 体模量为条件生成 TaCr₂O₆ 并合成成功,实测 169 GPa,相对误差 <20%;但结构存在 Ta/Cr 组分无序,而且外界质疑该化合物早在 1972 年就有报道、属于训练集覆盖范围。A-Lab 的 41/58 也被同行质疑 XRD 相鉴定的严谨性 ⓚ。
-
注:XRD 不是仿真器,而是 L3 层的"真值获取"工具——把合成产物打 X 射线衍射,看峰位/强度能否对上目标结构。其中"由候选晶体结构算理论衍射谱"(布拉格定律 + 结构因子、Rietveld 精修)是一步确定性物理计算,但它是分析工具,不是被 AI 替代或拿来训练的对象。XRD 相鉴定的假阳性(多相混合、组分无序被误判为目标相)是"合成成功率"这一 L3 指标最主要的误差来源之一。"可合成性"和"新颖性"这两件事,现有仿真基本不管。
-
推荐指标:能量/力/应力的 MAE(对 DFT);稳定性判别 F1、发现精度(对 DFT 凸包);κ_SRME 等物性指标;对实验要看合成成功率、目标物性的相对误差、以及"是不是真的新化合物"。
2.5 化学与量子化学
代表
-
第一代:ORCA、Gaussian、PySCF。
-
OMol25(Meta,2025-05):超过 1 亿条高精度 DFT 计算(ORCA,ωB97M-V/def2-TZVPD),覆盖生物分子、金属配合物、电解质,耗费 60 亿+ 超算核时;配套 UMA(在 300 亿原子上训练,用 Mixture of Linear Experts 同时吃多套不同 DFT 设定的数据)。
-
反应/合成侧:逆合成规划、自驱动实验室(self-driving lab)。
-
ether0(FutureHouse):24B 化学推理模型,GRPO + 可验证奖励,64 万道题、375 类任务;在分子设计和推理上超过通用 LLM、专用化学模型甚至人类专家(开放式问题上优势最明显)。
sim2real gap
-
量子化学在小分子能量上是精度最高的学科之一(金标准 CCSD(T) 可到化学精度 1 kcal/mol ⓚ),但一到凝聚相、溶剂、反应动力学、产率就急剧退化。
-
合成产率几乎无法从第一性原理预测,这是自驱动实验室存在的根本原因。
-
推荐指标:能量 MAE(kcal/mol)、力 MAE、反应能垒误差;实验侧看预测产率的 MAE、逆合成路线的实验可执行率。
2.6 天气与气候
代表:ECMWF IFS(第一代);GraphCast、GenCast(扩散,概率预报,在 96% 以上的目标上优于 ECMWF ENS)、WeatherNext 3(2026-08,FGN mesh transformer,直接同化卫星原始观测,0.05° 站点 / 0.1° 地面 / 0.25° 气压层,逐小时起报)、微软 Aurora、NeuralGCM(混合可微动力核)。
sim2real gap:这个领域给了全文最干净的"基准夸大"证据
-
AI 天气模型基本都以 ERA5 再分析为训练和评测基准。而 ERA5 本身就是模式产物。南亚季风的观测对比研究发现:AI 模型对真实气象站观测的 MAE,比对 ERA5 的 MAE 高 15–45%(所有变量,含降水)。结论是"以再分析为中心的标准基准会系统性高估业务技巧"。
-
WeatherNext 3 的应对就是直接吃原始观测,这是趋势信号。
-
推荐指标:RMSE / ACC(确定性)、CRPS、ensemble spread-skill ratio、Brier score(概率);极端事件另算;并且必须报告"对观测"而不只是"对再分析"的分数。WeatherBench 2 是标准场地 ⓚ。
2.7 流体与工程 CFD
代表:OpenFOAM、Ansys Fluent(第一代,RANS/LES/DNS);神经算子 FNO、NVIDIA PhysicsNeMo;数据基建 The Well(PolymathicAI,15 TB、16 个物理域,从生物系统、流体、声散射到磁流体和超新星,统一 PyTorch API + 预训练基线);汽车气动专用基准 CarBench(2025)。
sim2real gap
-
第一代自身的 gap 主要来自湍流模型和边界条件:AIAA 阻力预测研讨会(DPW)系列的结论是:巡航点、无分离流时,RANS 算设计方案之间的增量尚可接受;一旦有大面积湍流分离或偏离设计点,各家结果散布明显,甚至出现风洞里不存在的分离泡。LES/DNS 更准,但贵到工业上跑不起。
-
第二代(神经代理)比 CFD 快约 1000 倍,但它的老师是 CFD,误差是叠加的:surrogate 误差 + 湍流模型误差。
-
推荐指标:场量的相对 L2 误差、能谱保真度、长程 rollout 稳定性(这是神经 PDE 求解器的主要死法)、守恒量漂移;对实物看阻力/升力系数与风洞的偏差。
2.8 聚变与等离子体
代表:自由边界平衡演化模型(TCV 用的 FGE)、回旋动理学(GENE/GX)、TORAX(DeepMind 的 JAX 可微输运求解器,可反传、可做 RL)ⓚ。
sim2real gap:这是"仿真训练直接上真机"的最佳范例
-
DeepMind × 瑞士等离子体中心(Nature 2022):RL 策略只在仿真器里训练,然后 zero-shot 直接跑在 TCV 托卡马克真机上,成功控制拉长形位形、负三角形位形、"雪花"位形,还维持了两团等离子体同时存在的 droplet 形态。后续工作(2023)把形状精度提升到 65%、等离子体电流长期偏差显著下降、新任务训练时间缩短 3 倍以上。
-
能 zero-shot 成功的原因是:电磁+平衡方程是强物理先验,状态可观测,控制频率高(kHz),而且失败代价可控。这些条件生物学一条都不满足。
-
推荐指标:形状误差(cm)、电流跟踪误差、放电存活率、真机首次尝试成功率。
2.9 粒子物理与宇宙学
-
Geant4 是粒子穿过探测器的第一性原理蒙特卡洛,LHC 整个物理分析都建立在它之上;数据/MC 差异通过"scale factor"校正,通常在百分之几量级 ⓚ。它的问题不是精度而是贵:量能器模拟是最耗时的部分。于是有了 CaloChallenge 2022:30+ 个生成模型参赛,扩散/transformer 类保真度高但慢,GAN/VAE 快但差;CaloDiT-2 已能在常用物理可观测量上与 Geant4 良好吻合。这是"用仿真数据训 AI 去替代仿真"的最纯粹形态。
-
宇宙学:IllustrisTNG / SIMBA / ASTRID / EAGLE 这些流体模拟用的亚格子物理各不相同,本身就是"对现实的不同近似"。CAMELS 项目干脆把这件事做成方法论:在 TNG 上训练、在 SIMBA 上测试,用跨模拟器泛化来度量 sim2real 风险;MIEST 之类估计器专门做"抹掉模拟器指纹"的表征学习。这套"跨模拟器留一法"是全文最值得被别的学科抄走的评测范式。
2.10 神经科学
代表
-
小鼠视皮层数字孪生(MICrONS,Nature 2025):在多只小鼠看自然视频的大规模钙成像上训练基础模型,能预测对全新刺激域(相干运动点、噪声)的神经元响应,并已在体内验证;还能预测细胞类型、树突特征和连接关系。配套的电镜重建有 20 万+ 细胞、5 亿突触。
-
果蝇:FlyWire 全脑连接组(约 13.9 万神经元)+ NeuroMechFly v2 / flybody(87 关节、基于 X 射线断层扫描的 3D 身体,跑在 MuJoCo 上);Nature 2025 的 flybody 做了全身物理仿真的运动控制;2026 年出现 FlyGM 等"连接组图模型驱动全身运动"的工作。
-
线虫有 BAAIWorm ⓚ;Blue Brain 项目 2024 年结束 ⓚ。
sim2real gap
-
感觉编码这层已经相当准(数字孪生对新刺激的响应预测在体内被验证);但行为、学习、跨脑区闭环这层还很远。
-
⚠️ 这个领域最近有"病毒式演示"污染问题(比如"果蝇在玩 Beat Saber"这类视频),需要看是不是真的连接组约束下的闭环。
-
推荐指标:单试次响应的相关系数 / 可解释方差、对分布外刺激的泛化(关键)、预测的连接关系与电镜真值的一致性;行为侧看运动学与真实果蝇步态的统计吻合。
2.11 医学与生理:最被低估的成功案例
-
UVA/Padova 1 型糖尿病模拟器:2008 年被 FDA 接受,作为人工胰腺控制器临床前设计与安全测试中动物试验的替代品。 从那以后,为设计人工胰腺算法而做的动物实验几乎绝迹。模拟器含 300 个虚拟受试者(100 成人 / 100 青少年 / 100 儿童)。到 2023 年,在它上面开发的算法已有 6 个进入临床使用:Medtronic 670G/770G、780G、CamAPS FX、Diabeloop、Tandem Control-IQ、Insulet Omnipod 5。这是"仿真环境直接产出被监管接受的真实产品"的最强先例,而且它是一个手工建的 ODE 模型,不是深度学习。
-
监管框架:FDA 已发布计算建模可信度评估的最终指南,基于 ASME V&V 40,定义了 8 类可信度证据(台架验证、体内验证、群体验证等)。已知局限是 V&V40 假定只有一个验证对照物、语言偏向台架试验,对 in silico 临床试验不完全适配。
-
心脏方向:虚拟病人队列 + 从 ECG 反推激活/复极序列的数字孪生,用于器械开发。
-
推荐指标:虚拟队列与真实队列在终点上的分布重合度、CoU(context of use)下的 V&V40 可信度等级、以及最硬的——监管是否接受。
2.12 机器人与具身(已有专门追踪,此处从简)
-
第一代:MuJoCo(接触金标准)、Isaac Sim、Genesis、SAPIEN;第三代:视频世界模型(Cosmos、SC3-Eval、WorldEval)。
-
sim2real gap 的度量方式与别的学科不同,主要是排序保真度:SIMPLER 用 1500+ 组"仿真-真机配对评测"证明可以做到较强相关,关键指标是 Pearson r 与 MMRV(mean minimum rank violation,最小排序违背率)——因为当几个策略真机成绩接近时,r 会失真,真正要问的是"模拟器有没有排错序"。
-
已有结论:纯物理仿真基准与真机的相关性偏弱(r 约 0.4),视频世界模型评测可达 0.9+;真机绝对成功率普遍只有 ~44%,与仿真虚高形成反差。
2.13 数学:验证层 gap≈0 的对照组(但内核会有 bug)
Lean 4 / Isabelle 严格说不是"仿真",而是真值本身——内核检查通过就是证明成立,验证这一步不存在近似。这正是为什么 AlphaProof、DeepSeek-Prover-V2、Leanabell-Prover-V2 这条线进展最快:可验证奖励无限量、零噪声、零成本。2026 年的新方向是把 Lean 的 REPL 接进 RL 训练做稠密的、tactic 级的信用分配,而不只是最终结果奖励。
Lean 的元理论(它凭什么是真值)
-
基础是依值类型论,具体是归纳构造演算(CIC)的一个变体。按 Curry-Howard 对应,命题即类型、证明即项,"检查证明"就等于"类型检查"。
-
宇宙层级:
Prop(非直谓、证明无关:同一命题的任意两个证明定义上相等)⊂Type 0⊂Type 1⊂ …,支持宇宙多态。 -
归纳类型(含互递归、嵌套)由内核自动生成递推子(recursor)。结构递归和良基递归由前端编译成递推子,所以内核里没有终止性检查器。Coq 的 guard checker 历史上出过多次漏洞,Lean 在设计上避开了这一类问题。
-
类型论之外只加三条公理:
propext(命题外延)、Quot.sound(商类型,函数外延性由它导出)、Classical.choice(选择公理,排中律由 Diaconescu 定理导出)。所以 Mathlib 是经典数学。 -
一致性:Carneiro(2019,The Type Theory of Lean)构造了集合论模型,证明 Lean 相对 ZFC + 可数个不可达基数一致 ⓚ。也就是说,信任 Lean ≈ 信任略强于 ZFC 的集合论。按哥德尔第二不完备定理,这已经是能做到的最好结果。
-
已知的理论瑕疵:定义相等不传递、类型检查理论上不可判定、subject reduction 不成立 ⓚ。这些影响完备性(内核可能拒绝本应接受的证明),不影响可靠性(它接受的东西都是对的)。
信任链上真正出过事的地方(按可信度从高到低)
| 层 | 会不会错 | 历史 |
|---|---|---|
| 元理论 | 无法自证一致,相对 ZFC+不可达基数一致 | 从未发现漏洞 |
| 内核实现(几千行 C++) | 会,普通软件 bug | 2026-07 #14576:AI 辅助生成的 Collatz"证伪"利用嵌套归纳类型幽灵参数漏检证出 False,1 小时修复;独立内核 nanoda(另有 bug)和 Lean4Lean(同 bug)都没拦住;随后 OpenAI Selsam 用 AI 审计又挖出多处,均可被 nanoda 捕获 |
| native_decide/reduceBool | 会,信任未验证的编译器 | 2023 年 Carneiro 用随机 IO 构造矛盾;修复为显式公理 trustCompiler,可被 #print axioms 看见 |
| 前端 elaborator/tactic | 常有 bug,但内核会复查,基本无害 | — |
| 形式化 gap | 最常见:Lean 命题≠想证的数学命题 | 基准集中多次发现形式化错题 |
其他证明器同样如此:Rocq(Coq)专门维护 critical-bugs.md,记录多个能证出 False 的历史漏洞(Set+1 类型计算、native_compute 常量名冲突、guard checker 等)。表达力越强,内核越大,可被攻击的面也越大:HOL Light 的内核只有几百行 ⓚ,Lean 和 Rocq 的内核要大得多。
对 RL 环境的含义:RL 极擅长找后门,内核的可靠性已经是 AI 安全基础设施问题。 工程纪律:
-
禁用
native_decide、自定义axiom和直接的元编程声明,用#print axioms做白名单; -
证明通过后,再用至少一个独立内核(如 nanoda、lean4checker)复核;
-
"证出"著名猜想或反常结论时,默认先当 bug 处理。
长期方向是经过验证的验证器:Lean4Lean 在 Lean 里形式化 Lean 的类型检查器;Rocq 有 MetaCoq,HOL Light 有基于 CakeML 的 Candle ⓚ。
这条对照组解释了整篇报告的结构性规律:一个领域的 AI 进展速度,与它的 reward 可验证性成正比,与它的 sim2real gap 成反比。
3sim2real gap 横向对比与指标体系
3.1 三层 gap 必须分开报
| 层 | 问的问题 | 典型指标 | 常见的作弊/自欺 |
|---|---|---|---|
| L1 模拟器 vs 真实 | 物理保真度够吗 | 与实验测量的 MAE/相对误差 | 压根不测,默认模拟器是对的 |
| L2 AI 仿真器 vs 模拟器 | 学老师学得像吗 | 能量/力 MAE、场的 L2 误差、rollout 稳定性 | 拿 L2 的漂亮数字冒充 L1 |
| L3 设计 → 现实 | 产出的东西能用吗 | 湿实验命中率、合成成功率、真机成功率、临床终点 | 只报最好靶点、不报分母 |
3.2 各领域 gap 现状打分
| 领域 | L1(仿真 vs 实验) | L3(设计 → 现实) | 最该用的指标 |
|---|---|---|---|
| 数学/形式化 | 无(即真值;残余风险在内核实现和形式化 gap) | 可验证,但需多内核复核 | 独立内核复核通过率 + 公理白名单 |
| 等离子体控制 | 小,够 zero-shot 上真机 | TCV 已成功 | 形状误差、真机首试成功率 |
| 机器人操作 | 中(视觉+接触) | 真机 ~44% | MMRV + Pearson r |
| 天气 | 小,但对观测差 15–45% | 业务预报已上线 | CRPS、对观测的 RMSE |
| CFD | 中(分离流、非设计点散布大) | 工程上可用 | 相对 L2、阻力系数偏差 |
| 粒子物理 | 小(数据/MC 百分之几) | — | 物理可观测量分布吻合 |
| 材料 | 大(带隙 MAE >1 eV) | 合成 + 物性误差 <20%(单例) | 合成成功率、物性相对误差 |
| 量子化学/小分子 | 小(~1 kcal/mol) | 产率无法预测 | 能量 MAE、产率 MAE |
| 药物结合自由能 | 中→大(1.73 → 2.44 kcal/mol) | 前瞻富集倍数 | ΔΔG RMSE + Spearman |
| 蛋白设计 | 不适用 | 5%(全基因组)~46%(binder) | 湿实验命中率(带分母) |
| 神经科学 | 感觉编码小、行为大 | — | OOD 刺激下的可解释方差 |
| 医学/生理 | 中,但监管已认可 | 已产出 6 个上市产品 | V&V40 可信度等级 |
| 虚拟细胞 | 最大 | 尚无前瞻验证共识 | 相对均值基线归一化的多指标 |
3.3 四条通用的评测纪律(来自本次调研的横向教训)
-
永远先打朴素基线。 虚拟细胞领域的"取均值/线性加性"基线,已经淘汰了一批基础模型。任何号称 SOTA 的科学模型,先问"比取平均好多少"。
-
对着真实观测评,不要对着模拟产物评。 天气的 15–45% 差距就是代价。
-
公开基准和私有/真实任务要分开报。 FEP 的 1.73 vs 2.44 是最干净的例子。
-
跨模拟器留一验证。 CAMELS 的做法(TNG 训练 → SIMBA 测试)应该成为所有依赖模拟数据训练的领域的标配。
-
单指标必被 overfit。VCC 2025 的教训写在官方复盘里:"窄的评分面会诱导对指标而非对生物学的优化。"
4与 AI 的关系:五种形态,成熟度递减
形态一:仿真产数据训 AI(最成熟,已工业化)
-
OMat24 / OMol25 → MLIP:OMol25 有 1 亿+ DFT 计算、烧掉 60 亿+ 超算核时,UMA 在 300 亿原子上训练。这是"用超算把物理定律蒸馏进神经网络"。
-
ERA5/HRES → GraphCast/WeatherNext;200 毫秒 MD → BioEmu;Geant4 → CaloDiT;The Well 15 TB → 神经 PDE 求解器。
-
共同模式:第一代模拟器变成了数据工厂,AI 拿走 10³–10⁵ 倍的加速。
形态二:AI 替代仿真(进行中)
关键判据是"替代之后误差有没有超过原模拟器对真实的误差"。在天气领域已经越过(AI 比 IFS 准),在材料 MLIP 领域越过了对 DFT 的需求但没越过 DFT 自身的天花板,在 CFD 领域还没。
形态三:仿真作 RL 环境训控制策略(已有真实成功)
-
TCV 托卡马克:仿真训练 → zero-shot 真机。
-
UVA/Padova T1D:仿真训练 → FDA 认可 → 6 个上市产品。
-
机器人:Isaac/MuJoCo 大规模域随机化,但排序保真度仍是瓶颈。
-
共性:状态可观测、物理先验强、动作频率高、失败可回滚。 这三个成功案例都是控制问题,不是发现问题。
形态四:仿真/预测器作 LLM agent 的工具与 reward(2025–2026 主战场)
-
ether0:RDKit 等确定性化学检查器当 verifier,GRPO 训练,64 万题 / 375 任务。
-
Lean:近零噪声 verifier,tactic 级稠密奖励。但 2026-07 的 #14576 事件证明 RL/AI 会主动利用内核 bug,所以需要多内核复核。
-
虚拟细胞 agent:BioDiscoveryAgent、CellScientist、VCWorld、AssayBench。
-
结构预测器作 binder 设计的 reward(ProteinZero 等在线 RL)。
-
⚠️ 这一形态的通病是 reward hacking:verifier 越弱,agent 越会去钻空子(这在代码 RL 环境里已被量化——SWE-bench Verified 抽样中 28.5% 的任务测试弱到错误 patch 也能过;科学 verifier 只会更弱)。
形态五:把大自然当 RL 环境(最贵,也是 2026 年的资本共识)
-
Periodic Labs:自建物理实验室,模型先在逐级提高保真度的模拟器里试,再上真实实验;reward 来自实验结果本身。原话逻辑是:"ChatGPT 对人类偏好奖励模型做优化,Periodic 对实验做优化。"
-
Lila Sciences:生命/化学/材料的自主实验室平台,假设-实验-学习闭环。
-
OpenAI 已在和药企做闭环实验(GPT-5 自主迭代协议);DeepMind 2026 年开自动化材料实验室;Anthropic 走的是企业工具路线(Claude for Life Sciences,接 Benchling / 10x / PubMed)。
-
经济学硬约束(SemiAnalysis 总结):一次生物实验成本数百到数千美元、耗时数小时,而一个代码任务的判分近乎免费。单位美元的数据回报低好几个数量级,加上生物实验 rollout 长、奖励稀疏、文献本身自相矛盾。业界的缓解手段是 step-level rubric 奖励(奖励过程而非只奖结果)和 in-flight 权重更新(同样时间里迭代约 2 倍)。目前科学领域的奖励仍以人工评分为主。
一句话判断
仿真环境对 AI 的价值,取决于它离"可验证奖励"有多近。Lean 最近(验证层 gap≈0,需防内核后门),控制类仿真其次(gap 小且可 zero-shot),材料和分子居中(gap 已知、可校正),虚拟细胞最远(gap 未知、基线都没打过)——所以最有钱的玩家选择绕过仿真,直接买真实实验当 reward。
5对 AI4S 平台与创业者的几条启示
-
要做"科学 RL 环境"产品,优先级应该按 verifier 强度排,而不是按学科热度排。 强 verifier 的洼地:形式化数学、量子化学的确定性检查、晶体结构有效性、逆合成路线的可执行性、生信 pipeline 的可复现性。虚拟细胞现在做 reward 太早。
-
卖"跨模拟器/跨基线评测"本身就是产品。 CAMELS 式的留一验证、VCC 的均值基线归一化、SIMPLER 的 MMRV——这套评测纪律在大多数学科里是缺位的,而缺位的地方就是信任缺口。
-
L2 冒充 L1 是这个行业最普遍的营销话术。 任何合作方给出"我们比 DFT/MD 准"的说法,都要追问对照物是模拟器还是实验。
-
T1D 模拟器是最值得研究的商业先例:一个手工 ODE 模型,因为拿到监管认可,垄断了一个赛道近 20 年、催生 6 个上市产品。监管接受度的护城河远比模型精度深。
附录 A一代仿真软件的产业格局(开源 vs 商业、公司、市值与利润)
结论
-
两个世界:工程仿真(CFD/有限元/多物理)高度商业化、寡头化,营业利润率 30–46%;科学仿真(DFT/MD/NWP/Geant4/MuJoCo)以开源和学术软件为主,靠政府、国际组织或大厂补贴。唯一上市的纯科学计算公司 Schrödinger 市值约 $2B,且长期亏损。
-
2024–2026 年工程仿真被 EDA 巨头和西门子并购,合计约 $50B:Synopsys 收购 Ansys(约 $35B),Cadence 收购 BETA CAE 和 Hexagon 的 MSC(约 €2.7B),西门子收购 Altair(约 $10B)。
A.1 按领域:开源还是商业,谁在支持
| 领域 | 主流软件 | 开源/商业 | 背后机构/公司 |
|---|---|---|---|
| CFD/有限元/多物理(工程) | Ansys Fluent/Mechanical、Simcenter STAR-CCM+、Altair、Abaqus、MSC Nastran、COMSOL、MATLAB/Simulink | 商业为主 | Synopsys(Ansys)、西门子(Simcenter+Altair)、达索(SIMULIA)、Cadence(BETA CAE、MSC、Fidelity)、COMSOL 与 MathWorks(私营) |
| 工程开源替代 | OpenFOAM、SU2、code_saturne | 开源 | OpenFOAM Foundation / OpenCFD(ESI,2023 年被 Keysight 收购 ⓚ) |
| DFT/量子化学 | VASP、Gaussian、Materials Studio/CASTEP、QuantumATK、ORCA、Q-Chem | 商业或学术授权 | VASP 按课题组收费;Gaussian Inc.(私营,年维护费 $12k,限制竞品开发者使用而长期有争议);达索 BIOVIA;Synopsys;ORCA 学术免费、商业收费 ⓚ |
| 量子化学开源 | Quantum ESPRESSO、CP2K、ABINIT、PySCF、Psi4、NWChem | 开源 | 学术与各国科研经费 |
| 分子动力学/药物 | GROMACS、OpenMM、LAMMPS、NAMD | 开源(实际主力) | 学术、NIH、DOE 国家实验室 |
| AMBER、CHARMM | 半开放(AmberTools 开源,GPU 引擎收费 ⓚ) | 学术联盟 | |
| Desmond、FEP+、OpenEye | 商业 | D.E. Shaw Research 开发、Schrödinger 分发;OpenEye 2022 年被 Cadence 收购 ⓚ;OpenFE 是药企联盟资助的开源 FEP | |
| 数值天气/气候 | ECMWF IFS、NOAA UFS/GFS、WRF、CESM、E3SM | 公共/开源 | 政府与国际组织;OpenIFS 自 2026-03-05 以 Apache 2.0 开源 |
| 粒子物理 | Geant4、Pythia | 开源 | 以 CERN 为首的国际合作 |
| 机器人 | MuJoCo、Isaac Sim/Isaac Lab、Newton、Genesis | 全部开源 | DeepMind(2021 年收购 MuJoCo,2022 年开源 ⓚ);NVIDIA(Isaac Sim Apache 2.0、Isaac Lab BSD-3);Newton 由 DeepMind、Disney、NVIDIA 共建,托管于 Linux 基金会 |
机器人仿真器开源不是因为没价值,而是价值被 NVIDIA(卖 GPU)和 Google(生态)拿走了。
A.2 公司市值与利润(2026-09)
| 公司 | 仿真资产 | 市值 | 相关营收 | 利润率 |
|---|---|---|---|---|
| Synopsys | Ansys(约 $35B,2025-07-17 完成) | 数据源分歧大($60–96B),9/18 股价约 $385 | FY26 指引 $9.69–9.74B,其中 Ansys 约 $2.98B | Q3 FY26 non-GAAP 营业利润率 41.6%,GAAP 14.4%(摊销重) |
| Ansys(被收购前) | Fluent、Mechanical、HFSS | — | 2024 年 $2.545B | GAAP 28.2%,non-GAAP 45.7% |
| Cadence | BETA CAE(2024)、Hexagon MSC(2026-02-23)、Fidelity、OpenEye | 约 $77–78B | 2025 年 $5.30B;2026 指引 $5.9–6.0B(仿真未单列) | non-GAAP 约 45% |
| 达索系统 | SIMULIA、BIOVIA | 约 $34B | 2025 年 €6.24B(仿真未单列) | non-IFRS 32.0%;2026 增速指引仅 3–5% |
| 西门子 | Simcenter + Altair(约 $10B,2025-03) | 集团市值不可比 | Altair 2024 年 $665.8M | FY25 Q4 Altair 与 Dotmatics 整合拖累利润 €135M |
| Schrödinger | FEP+、Maestro、Desmond | 约 $2.17B | 2025 年 $256M(软件 $200M) | 2025 年净亏损 $103M;Q2 2026 账面盈利 $6.0M 主要来自 $45.9M 股权投资收益,核心业务仍亏 |
| MathWorks(私营) | MATLAB/Simulink | — | 2024 年约 $1.5B | 未披露 |
| COMSOL(私营) | COMSOL Multiphysics | — | 约 $1 亿量级(第三方估算,可信度低) | 未披露 |
市场规模:CAE 2025 年约 $12–13B,前五家占 50–55%;量子化学软件 2024 年约 $0.62B,相差约 20 倍。
A.3 四个判断
-
钱在工程,不在科学。 航空、汽车、芯片的产品认证流程绑定特定软件,切换成本极高;科学仿真的用户要可公开、可复现的代码,天然倾向开源。
-
EDA 吞并仿真是为了"从芯片到系统"。 AI 芯片的先进封装、散热、电磁、信号完整性都需要多物理仿真。Ansys 约 $35B 的价格说明,成熟工程仿真的定价在营收 10 倍以上。
-
Schrödinger 是反面教材。 科学计算软件卖给药企,软件年营收约 $200M 就碰到天花板,只能靠自研药物管线讲故事,长期亏损。卖科学仿真软件本身很难成为大生意。
-
对第二代 AI 仿真器的含义。 工程领域,AI 代理模型冲击高利润在位者,但后者已在自集成 AI(Ansys SimAI、PhysicsNeMo 合作),且握有认证壁垒。科学领域,AI 模型(UMA、MACE、GraphCast)大多也开源,软件本身不值钱,价值在数据、算力和湿实验验证。
附录 B二代与三代的市场格局(公司、融资估值、收入)
结论
-
私募估值远高于公开市场定价。 一级市场头部估值:Isomorphic(媒体报道 $15–20B)、Lila($8.5B 投前,谈判中)、Periodic Labs($7.5B,谈判中)、CuspAI($2.6B)、PhysicsX($2.4B)。已上市的 AI 制药/AI4S 公司(Recursion 约 $1.8B、Schrödinger 约 $2.2B、晶泰约 300 亿港元量级)都停在几十亿美元,而且大多亏损。
-
几乎没有公司靠"卖模型"赚钱。 二代公司卖给工程和能源客户(与 Ansys 同一批买家);三代公司要么自研管线(Isomorphic、Xaira、Recursion),要么做数据工厂(Tahoe),要么是非营利机构开源模型(Arc、Biohub)。EvolutionaryScale(ESM3)2025-11 被非营利的 Biohub 收购,说明"独立卖蛋白质模型"这门生意没跑通。
-
最大的钱流向了"真实实验室当 RL 环境"(Lila、Periodic Labs),与正文 §4 形态五的判断一致。
-
大厂的角色是平台而非卖软件:NVIDIA(Earth-2、PhysicsNeMo、BioNeMo、Cosmos、ALCHEMI)靠 GPU 变现,NVentures 还投了 Lila、Luminary、Orbital;Google DeepMind(WeatherNext、AlphaFold/Isomorphic)、Microsoft(MatterGen、MatterSim、Aurora、BioEmu)、Meta(UMA,开源)都没有单独披露这部分收入。
B.0 二代 vs 三代:区别、代表与资本画像
| 第二代:AI 仿真器 / 代理模型 | 第三代:数据驱动世界模型 | |
|---|---|---|
| 老师 | 物理模拟器(DFT、MD、CFD、NWP) | 实验数据(测序、结构库、成像) |
| 数据来源 | 算力换数据,无限、无噪声 | 湿实验,贵、少、有批次效应 |
| 核对方式 | 回原模拟器再算一次 | 只能再做一次实验 |
| 精度上限 | 等于老师 | 无明确上限,也无下限保证 |
| 卖点 | 快 10³–10⁵ 倍,本质是省钱 | 做原来算不了的事,本质是新能力 |
| 当 RL 奖励 | 可用且可纠正 | 目前噪声太大 |
| 代表模型 | MACE、UMA、MatterSim、Orb;GraphCast、GenCast、WeatherNext、Aurora;BioEmu;FNO/PhysicsNeMo | Arc State、Xaira X-Cell;ESM3、AlphaFold3;Evo 2;小鼠视皮层数字孪生 |
| 代表公司估值 | 集中在 $1–3B:CuspAI $2.6B、PhysicsX $2.4B、Tomorrow.io >$1B、深势科技独角兽 | 两极分化:Isomorphic 媒体报道 $15–20B、Xaira 累计融资约 $1.3B、Chai $1.3B;上市公司 Recursion 约 $1.8B、晶泰约 300 亿港元量级 |
| 收入形态 | 卖给工程、能源、材料客户的软件/服务收入,持续但规模小、多不披露 | 主要是少数药企合作大单,波动大(晶泰 2025 年 +201%,2026 H1 回落) |
| 估值锚 | CAE 市场(PhysicsX $2.4B ↔ Ansys 年收入约 $3B) | 药物管线期权价值,可以几乎没有收入 |
| 主要风险 | 在位者(Ansys、西门子)自带 AI 且握有认证壁垒 | 一级市场 $10B+ vs 二级市场 $2–4B 的定价落差 |
混合型:NeuralGCM(物理内核 + 学习模块)、BioEmu(MD + 实验数据)、WeatherNext 3(开始直接吃观测数据)。横跨两代的 Lila(投前 $8.5B)和 Periodic Labs($7.5B)用二代模型在模拟器里预筛、用真实实验当训练信号,是估值涨得最快的一类。
B.1 第二代:AI 仿真器 / 代理模型公司
| 方向 | 公司 | 最新融资 / 估值 | 收入 / 备注 |
|---|---|---|---|
| 工程 CFD/结构 | PhysicsX(伦敦) | 2026-06 Series C $300M(Temasek 领投),估值 $2.4B;累计 $489M | 未披露;2025-11 估值约 $1B,7 个月翻 2.4 倍 |
| Neural Concept(瑞士,EPFL 衍生) | 2025-12 Series C $100M(高盛领投) | 客户 50+ 家(GM、GE Vernova、Safran) | |
| Luminary Cloud(美国) | 2025-09 Series B $72M;累计 $187M | NVentures 参投 | |
| 在位者自带 AI | Ansys SimAI、西门子 Simcenter AI | 对初创公司的主要威胁 | |
| 材料/化学 MLIP | CuspAI(剑桥) | 2026 Series B $450M,估值 $2.6B(KP、NEA 领投) | 未披露;推出"AI Materials Foundry" |
| Orbital Industries(原 Orbital Materials) | 2026-05 Series B $50M | 开源 Orb 势函数 | |
| 深势科技(北京) | 2025-12 C 轮超 8 亿元,独角兽 | DeePMD、Uni-Mol、Hermite、玻尔科研平台;未上市 | |
| 天气 | Tomorrow.io | 2026 Series F $175M + $35M,估值 >$1B | 自建气象卫星,AI 预报 |
| WindBorne Systems | Series B $37M,估值 $250M | 过去一年收入增至 3 倍(自有探空气球网 + AI 模型) | |
| Jua / Brightband | $21.5M / $10M | 能源交易 / 地球系统 AI | |
| 机器人仿真 | Genesis AI | 2025-07 种子轮 $105M | 自研物理引擎 + 机器人基础模型 |
| 大厂 | Google(WeatherNext)、NVIDIA(Earth-2、PhysicsNeMo)、Microsoft(Aurora、MatterSim、BioEmu)、Meta(UMA) | — | 靠 GPU/云变现,或开源不收费 |
B.2 第三代:数据驱动世界模型公司
| 方向 | 公司 | 最新融资 / 估值 | 收入 / 盈亏 |
|---|---|---|---|
| 结构/药物基础模型 | Isomorphic Labs(Alphabet) | 2026-05 Series B $2.1B(Thrive 领投);估值媒体报道 $15–20B | 与 Novartis、Lilly、J&J 合作,收入未披露 |
| Xaira | 累计约 $1.3B | 发布 X-Cell 虚拟细胞模型(4.9B 参数) | |
| Chai Discovery(OpenAI 投资) | 2025-12 Series B $130M,估值 $1.3B;累计 >$225M;报道在谈 $400M 新一轮 | 未披露 | |
| EvolutionaryScale(ESM3) | 种子轮 $142M → 2025-11 被 Biohub 收购,约 50 人加入 | 独立商业化终止 | |
| 虚拟细胞 | Tahoe Therapeutics | $30M,估值 $120M | 数据工厂(Tahoe-100M),与 Arc/Biohub 共建数据集 |
| Noetik | 未详 | 患者组织多模态数据 | |
| Arc Institute、Biohub | 非营利 | State、Evo 2、ESM3 开源 | |
| 上市公司 | Recursion(RXRX) | 市值约 $1.8B(2026-08) | 2024 年收入 $58.8M;2025 年前三季度净亏损 $536.6M |
| 晶泰控股(2228.HK) | 市值数据源分歧(32 亿 vs 332 亿港元,后者与股价 HK$6.93 量级吻合) | 2025 年收入 8.03 亿元(+201%),首次盈利 1.35 亿元;但 2026 H1 收入约 3.9 亿元(-24%),亏损约 2.3 亿元(二手摘要,待核) |
B.3 横跨两代:把真实实验室当环境
| 公司 | 融资 / 估值 | 备注 |
|---|---|---|
| Lila Sciences | 2025-10 Series A 共 $350M,估值 >$1.3B;2026-06 报道在谈 $2B、投前 $8.5B(CalPERS、NVentures 领投) | 自主实验室覆盖生命、化学、材料 |
| Periodic Labs | 2025-09 种子轮 $300M,估值 $1.3B;2026-05 报道在谈 $500M、估值 $7.5B | 已有半导体行业付费客户;模型先在逐级提高保真度的模拟器里试,再上真实实验 |
B.4 二代代表模型背后的机构:成立时间、估值、收入
| 模型 | 首发 | 背后机构 | 机构成立 | 母公司市值 / 公司估值 | 母公司年收入 | 该模型的商业化与收入 |
|---|---|---|---|---|---|---|
| MACE(含 MACE-MP-0) | 2022(通用势 2023) | 剑桥大学 Csányi 组 + ACEsuit 开源社区 | 学术 | — | — | 代码与 MACE-MP-0 系列为 MIT;MACE-OFF、OMAT、OMOL、MATPES、MH 等新模型为学术许可(ASL),禁止商用。无直接收入 |
| UMA | 2025-05 | Meta FAIR Chemistry(前身是 2020 年与 CMU 合作的 Open Catalyst 项目) | FAIR 2013;Meta 2004 | Meta 约 $1.70T(2026-09-18) | 2025 年 $201.0B,净利 $60.5B | Hugging Face 申请下载,须同意 FAIR Chemistry License(可商用,有地域和用途限制),不单独收费 |
| MatterSim | 2024-05 | Microsoft Research AI for Science | 2022-07(Chris Bishop 创立);Microsoft 1975 | Microsoft 约 $3.71T | FY26(至 2026-06)$331.8B,净利 $133.7B | MIT 开源,接入 Azure / Microsoft Discovery 生态;收入未单列 |
| Orb | 2024 | Orbital Industries(原 Orbital Materials,伦敦) | 2022(创始人 Jonathan Godwin 来自 DeepMind) | 估值未披露;累计融资约 $71M(2024-02 A 轮 $16M,2026-05 B 轮 $50M) | 未披露 | Apache 2.0 开源;公司转向数据中心冷却等工业硬件(Orbital IT)变现 |
| GraphCast / GenCast / WeatherNext | 2023 / 2024 / WeatherNext 2 于 2025-11、WeatherNext 3 于 2026-08 | Google DeepMind | DeepMind 2010,2014 被 Google 收购;Alphabet 2015 | Alphabet 约 $4.10T | 2025 年 $402.8B,净利 $132.2B | 数据上架 BigQuery / Earth Engine,Vertex AI 早期访问;已接入 Search、Gemini、Pixel、Maps Weather API(间接变现,未单列) |
| Aurora | 2024-06(Aurora 1.5 后续) | Microsoft Research AI for Science | 同上 | Microsoft 约 $3.71T | 同上 | Microsoft Foundry 托管部署、Planetary Computer Pro;已用于 MSN Weather;未单列。核心作者 2024-06 出走创立 Silurian(融资约 $6M) |
| BioEmu | 2024-12 预印本,Science 2025 | Microsoft Research AI for Science | 同上 | 同上 | 同上 | MIT 开源,无直接收入 |
| FNO(傅里叶神经算子) | 2020 | 加州理工(Zongyi Li、Anima Anandkumar) | 学术 | — | — | neuraloperator 库 MIT 开源(2020),被 NVIDIA 等框架吸收 |
| PhysicsNeMo(原 Modulus) | Modulus 2023 年开源,2025 年更名 | NVIDIA | 1993 | NVIDIA 约 $5.58T | FY26(至 2026-01)$215.9B,净利 $120.1B;数据中心 $197.3B | Apache 2.0 开源,靠 GPU 和 NVIDIA AI Enterprise 变现 |
要点
-
这 10 个代表模型里,8 个出自大厂实验室或大学,只有 Orb 背后是独立创业公司(外加 Aurora 团队出走创立的 Silurian)。
-
模型本身几乎没有直接收入:大多开源,大厂的变现方式是带动云用量(Azure、Google Cloud)、GPU 销量(NVIDIA)或增强自家消费产品(Google 搜索和地图天气、MSN 天气)。相对母公司 $2000–4000 亿的年收入,这部分无法、也没有被单独披露。
-
真正把二代模型当生意做的是下游公司:PhysicsX、CuspAI、Neural Concept、深势科技等,它们常常直接基于这些开源模型再做行业化,赚的是行业交付和数据的钱。
-
这意味着二代的"模型层"已被大厂开源免费化,护城河只能建在行业数据、工作流集成和客户交付上。
B.5 判断
-
二代的估值锚是 CAE 市场:PhysicsX $2.4B 对应 Ansys 年收入约 $3B,赌的是"AI 代理模型吃掉一部分传统仿真预算"。风险在于在位者自带 AI,且握有认证壁垒。
-
三代的估值锚是药物管线,不是模型:Isomorphic、Xaira 的估值来自对未来药物的期权;公开市场对 Recursion、晶泰这类"AI 平台 + 管线"公司只给 $2–4B,且收入依赖少数合作大单,波动剧烈(晶泰 2025 年爆发、2026 H1 回落)。
-
一级市场正在给"数据 + 真实验证"定最高价:Lila、Periodic 半年内估值涨 5–6 倍,而纯模型公司(EvolutionaryScale)被收编。这和正文结论一致:仿真 gap 越大的领域,价值越往数据和湿实验端迁移。
附录 C二代为何被采用、开源格局、市场规模与降低一代 gap 的新方法
C.1 高校和企业为什么用二代而不是一代
核心原因:在精度"够用"的前提下,二代把计算成本降了 3–5 个数量级,很多原来做不了的研究变得可以做。 但实际做法不是替换一代,而是把两者串起来用。
-
快 10³–10⁵ 倍,研究尺度直接变了。
- 材料/化学:DFT 算一个结构要几分钟到几小时,通用原子势(MACE、UMA 等)是毫秒级,精度接近 DFT。以前 DFT 分子动力学只能跑几百个原子、几十皮秒,现在能跑几万到几百万原子、纳秒级;界面、缺陷、电解液、催化剂表面这类必须够大够久的体系才算得动。
- 天气:GraphCast 在一台 TPU v4 上不到 1 分钟出 10 天预报;ECMWF 的 HRES 要在超算上跑约 1 小时。
- 蛋白:BioEmu 单 GPU 每小时生成几千个独立构象,原来要跑毫秒级 MD 才能看到的隐藏口袋等构象变化,现在几小时就能拿到。
-
能做大规模筛选。 一代只能算"已经想好的几个候选";二代可以先扫百万级,再挑少数交给 DFT 或实验。GNoME 预测 220 万个晶体结构,其中 38 万个预测稳定,就是这个模式。
-
概率预报和不确定性变便宜。 集合预报原来要把整个物理模式跑几十遍;GenCast 一类模型一次采几十上百个成员。
-
可微分,能接进优化和 AI 流程。 可以做反向设计、接进 RL 当奖励或约束、被 LLM agent 调用;一代的 Fortran/C 老代码很难改成可微分。
-
门槛低。 硬件:一块 GPU 即可,不用排队申请超算机时。许可证:VASP 按课题组收费、Gaussian 年维护费 $1.2 万、商业 CAE 按席位收年费,而 MACE-MP-0、MatterSim、Orb、BioEmu、PhysicsNeMo 都开源免费。人:一代软件要懂泛函选择、收敛参数、网格划分的专家,二代基本
pip install加几行 Python。 -
企业看重迭代速度。 设计循环从"改一版等一晚 CFD"变成"几秒出结果",一天能试几百个方案。
为什么一代没被淘汰:标准做法是三级漏斗。
二代大规模粗筛(百万级候选,快、便宜)→ 留下前 1% → 一代精算验证(DFT / MD / CFD,贵但可信)→ 留下最有希望的几个 → 实验 / 风洞 / 临床做最终裁判
-
二代的训练数据就是一代算的,精度上限是一代;遇到新化学体系还得回去跑 DFT/CFD。
-
分布外不可信:没见过的元素组合、极端条件、没见过的流态,二代可能给出看似合理的错误结果。
-
认证:航空、汽车、核电、医疗器械的认证流程认的是一代商业软件加验证记录。
| 高校 | 企业 | |
|---|---|---|
| 首要动机 | 研究更大尺度、更长时间的科学问题 | 缩短设计周期 |
| 典型用法 | 在开源原子势上微调自己的体系;研究机理 | 二代筛选加速;关键决策仍用一代加实验 |
| 在意的风险 | 可复现性、审稿人质疑 | 分布外出错导致设计失误;认证 |
| 许可证 | 很重要,经费有限 | 次要,但希望少买席位 |
C.2 二代模型:开源还是闭源
"开源"要分四档,而且各家效果最好的业务版往往不开源。许可证均已在 GitHub/Hugging Face 核对。
| 档位 | 模型 | 许可证 | 能否商用 |
|---|---|---|---|
| ① 完全开源 | MACE 代码 + MACE-MP-0 系列(MP-0a、MP-0b3、MPA-0) | MIT | ✅ |
| MatterSim、MatterGen(微软) | MIT | ✅ | |
| Orb(Orbital) | Apache 2.0 | ✅ | |
| Aurora / Aurora 1.5(微软,1.5 版 2026-07 开源) | MIT | ✅ | |
| BioEmu(微软) | MIT | ✅ | |
| neuraloperator(FNO 库) | MIT | ✅ | |
| PhysicsNeMo(NVIDIA) | Apache 2.0 | ✅ | |
| NeuralGCM(Google Research) | 代码 Apache 2.0 | ✅(代码) | |
| ECMWF AIFS | 权重 CC BY 4.0 | ✅ | |
| Skala(微软深度学习 DFT 泛函) | MIT | ✅ | |
| ② 开放权重,需申请 | UMA(Meta;fairchem 代码 MIT) | 权重须同意 FAIR Chemistry License,可商用但有地域和用途限制 | ✅(有条件) |
| ③ 开源但禁止商用 | GraphCast、GenCast(DeepMind) | 代码 Apache 2.0,权重 CC BY-NC-SA 4.0 | ❌ |
| 盘古气象(华为)、伏羲(复旦) | 权重 CC BY-NC-SA 4.0 | ❌ | |
| MACE-OFF23、MACE-OMAT-0、MACE-OMOL-0、MACE-MATPES、MACE-MH | 学术许可 ASL | ❌ | |
| ④ 闭源 | WeatherNext 2 / 3(Google 业务版) | 不放权重;数据经 BigQuery / Earth Engine,Vertex AI 早期访问 | 付费 |
| GNoME | 只公开预测结构数据,模型不开放 | — | |
| Silurian GFT、Tomorrow.io;Ansys SimAI、PhysicsX、Neural Concept、Luminary;CuspAI 等 | 商业服务 | 付费 |
规律:
-
同一家公司,研究版开源、业务版闭源。 Google 的 GraphCast、GenCast 开放权重但禁止商用;业务上跑的 WeatherNext 2/3 只卖数据和服务。
-
开源策略对应商业模式。 微软最开放(靠 Azure 和 Foundry 变现);NVIDIA 开源(靠 GPU);Meta 开放但要申请(无云业务要保护);Google 研究版开放、业务版闭源;创业公司闭源(模型即产品);Orbital 是例外(开源建影响力,靠工业硬件赚钱)。
-
许可证对企业比对高校重要。 高校基本不受限;企业商用只能选 ①、② 档,或买 ④ 档服务。同一个 MACE 家族,早期 MP-0 系列可商用,后来基于 OMAT/OMOL 等更大数据训练的新模型反而改成了学术许可。天气方向,AIFS(CC BY 4.0)和 Aurora(MIT)是少数"业务级精度 + 可商用"的选择。
C.3 市场规模:一代约 $120–150 亿/年,二代实际收入约 $10–20 亿
一代
| 细分 | 年规模 | 说明 |
|---|---|---|
| 工程仿真 CAE | 约 $120–130 亿(2025) | 前五家占 50–55%;按公司自下而上(Ansys 约 $30 亿、MathWorks 约 $15 亿,加西门子、达索、Cadence)对得上 |
| "仿真软件"大口径 | $130–270 亿 | 各研究机构口径差很大,有的含离散事件、培训仿真 |
| 量子化学软件 | 约 $6 亿(2024) | 约为工程仿真的 1/20 |
| 分子模拟 / 药物计算 | 规模小 | 最大纯业务公司 Schrödinger 软件收入约 $2 亿 |
| 天气、粒子物理、分子动力学、机器人仿真 | 软件收入几乎为零 | 政府和国际组织出资(ECMWF、CERN)或开源;钱花在超算和 GPU 上 |
二代
| 口径 | 数字 | 可信度 |
|---|---|---|
| "物理 AI 工程仿真"市场 | $150 亿(2025) | 不可信:把传统 CAE 加了 AI 功能的部分也算进去 |
| 多物理代理模型 AI | $14 亿(2024) | 口径较窄 |
| AI 天气建模 | $2–11 亿(2025) | 各家相差 5 倍 |
| AI 材料发现 | $7–13 亿(2025) | 含平台和服务 |
| 自下而上估算(本文判断) | 纯二代产品收入约 $10–20 亿以内 | 创业公司收入不披露,估计每家数千万美元量级;大厂不单列 |
对照:2025–26 年流入二代公司的风险投资合计约 $15 亿以上(CuspAI $4.5 亿、PhysicsX 约 $4.5 亿、Tomorrow.io $2.1 亿、Genesis AI $1.05 亿、Neural Concept $1 亿、Luminary $0.72 亿、Orbital $0.5 亿……)。每年的融资额和整个细分的年收入差不多大,处在资本抢跑、收入没跟上的阶段。
C.4 sim2real 精度:一代 vs 二代
(L1 = 仿真对真实实验;L2 = AI 模型对它所学的模拟器)
| 领域 | 一代对真实(L1) | 二代对一代(L2) | 二代对真实 |
|---|---|---|---|
| 材料 DFT | 形成能约 0.1–0.15 eV/原子;带隙 PBE MAE >1 eV(约 50%),HSE/mBJ 约 0.3 eV | 约 20 meV/原子,稳定性 F1 >0.9 | 与 DFT 基本相同,继承 DFT 的误差 |
| 小分子量子化学 | CCSD(T) 为金标准;常用泛函误差明显更大 | 取决于训练数据的计算级别 | 用高精度数据训练可接近化学精度 |
| 结合自由能 FEP | 公开 1.73 kcal/mol,药企私有 2.44 kcal/mol | BioEmu 对 MD <1 kcal/mol | 与 MD 同量级 |
| 天气 | 业务数值预报为基线 | GraphCast 在 >90% 指标上优于 HRES;GenCast 在 >96% 指标上优于 ENS | 例外:二代优于一代(学的是融合了观测的再分析);但对观测站误差比对再分析高 15–45% |
| CFD | 巡航无分离流时增量可用;分离流、非设计点散布大 | 分布内相对 L2 误差约几个百分点 | 两层误差叠加 |
| 粒子物理 Geant4 | 量能器平均能量响应与束流测试数据吻合到百分之几 | 生成模型在常用物理量上与 Geant4 吻合 | 接近 Geant4 |
| 机器人 | 纯物理仿真评测与真机相关性约 0.4 | — | 视频世界模型评测相关性 0.9+ |
规律:二代精度上限是一代,唯一例外是天气。要真正降低 sim2real 误差,必须改一代自己。
C.5 近几年降低一代 gap 的方法
主线两条:用 AI 修正物理近似;直接从观测和实验学。
-
用 AI 把更高级的理论变便宜。
- Skala(微软,arXiv 2506.14665,v6 2026-04):深度学习拟合的交换关联泛函,成本保持半局域泛函水平,小分子原子化能达到化学精度,GMTKN55 误差 2.8 kcal/mol,超过主流杂化泛函。目前覆盖主族分子,过渡金属和周期性体系在后续计划中。MIT 开源。
- DM21(DeepMind,Science 2021):在分数电荷体系上训练的神经网络泛函,修正电荷离域等系统误差(外界对其在分数电荷体系上的效果有质疑)。
- 神经网络波函数:FermiNet、Psiformer,直接从第一性原理解多电子薛定谔方程。
- 训练数据升级:OMol25 用 ωB97M-V/def2-TZVPD,明显高于材料界惯用的 PBE。
-
跳过模拟器,直接从观测学。
- Aardvark Weather(Nature 2025):首个端到端纯数据驱动天气系统,从原始观测直接出预报,不依赖数值预报;观测量少一个数量级、算力少几个数量级,多个变量 RMSE 低于业务数值预报基线。
- WeatherNext 3(2026-08):直接同化原始卫星观测。
- DiffTRe(Nature Communications 2021):用实验观测量(热力学、结构、力学性质)直接训练神经网络势,而不只是对齐 DFT。
-
物理 + ML 混合,只替换最不准的那一块。
- 湍流:ML 学 RANS 闭合项(张量基神经网络 TBNN 等);ML 训练的 LES 壁面模型已在真实飞机构型上与参考数据吻合。
- 气候:NeuralGCM 保留物理动力内核,用学习模块替代云、对流等参数化。
- 分子力场:MACE-OFF 等 ML 力场替代固定电荷经典力场。
-
校准与数字孪生。 机器人用系统辨识、域随机化、3D 高斯溅射 real-to-sim;粒子物理用束流测试数据调 Geant4 模型;天气和工程用数据同化持续注入观测。
-
更高分辨率和算力。 欧盟 Destination Earth 的气候数字孪生首次业务化生产 5–10 km 全球多年代际预估;极端天气孪生全球 4.4 km、欧洲区域 500–750 m;2026 年夏季进入持续运行阶段。
趋势:一代和二代的边界正在消失。 Skala 本质上还是 DFT 泛函(一代),却是 AI 训练出来的;NeuralGCM 是一代物理内核加二代学习模块。方向正从"AI 替代物理"转向"AI 修正物理,再用真实数据校准"。
6参考来源
虚拟细胞
-
Virtual Cell Challenge 2025 Wrap-Up: Winners and Reflections — Arc Institute
-
Benchmarking virtual cell models for in-the-wild perturbation response (arXiv 2604.27646)
-
Signal, Bounds, and Baselines: Principles for Evaluating Virtual Cell Perturbation Models (bioRxiv)
-
An operational perturbation proteomics-based virtual cell model (Nature 2026)
-
BioDiscoveryAgent (ICLR 2024) · How to build the virtual cell with AI (Cell 2024)
蛋白/RNA/基因组
-
One-shot design of functional protein binders with BindCraft (Nature 2025)
-
Code to complex: AI-driven de novo binder design (Structure 2025)
-
Generative design of bacteriophages with genome language models (Science) · bioRxiv 版
-
Evaluating zero-shot prediction of protein design success by AlphaFold, ESMFold, ProteinMPNN
分子动力学 / 自由能
材料 / 化学
-
Matbench Discovery (Nature Machine Intelligence 2025) · leaderboard repo
-
A generative model for inorganic materials design — MatterGen (Nature 2025) · MSR blog · novelty dispute
-
Many-body perturbation theory vs. DFT: band gap benchmark (npj Comput Mater 2025)
-
UMA: A Family of Universal Models for Atoms (arXiv 2506.23971) · Meta FAIR OMol25 发布
-
An autonomous laboratory for the accelerated synthesis of novel materials — A-Lab
-
ether0: a scientific reasoning model for chemistry — FutureHouse
天气 / 流体 / 物理 / 宇宙学
-
WeatherNext 3 (arXiv 2609.03582) · Google WeatherNext research & benchmarks
-
The Well: 15TB of physics simulations — PolymathicAI · arXiv 2412.00568
-
Fast Calorimeter Simulation Challenge 2022 · A Generalisable Generative Model for Multi-Detector Calorimeter Simulation (arXiv 2509.07700)
-
Toward Robustness across Cosmological Simulation Models TNG/SIMBA/Astrid/EAGLE (ApJ)
聚变 / 神经科学 / 医学 / 机器人 / 数学
-
Magnetic control of tokamak plasmas through deep reinforcement learning (Nature 2022) · Towards practical RL for tokamak magnetic control (arXiv 2307.11546)
-
Foundation model of neural activity predicts response to new stimulus types (Nature 2025) · Functional connectomics spanning multiple areas of mouse visual cortex (Nature 2025)
-
Whole-Brain Connectomic Graph Model Enables Whole-Body Locomotion Control in Fruit Fly (arXiv 2602.17997) · Deconstructing viral fly sims — Patrick Mineault
-
Credibility assessment of in silico clinical trials for medical devices (PLOS Comput Biol) · FDA final guidance on in silico model credibility
-
SIMPLER: Evaluating Real-World Robot Manipulation Policies in Simulation · A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation (arXiv 2606.10366)
-
Process-Verified Reinforcement Learning for Theorem Proving via Lean (arXiv 2606.20068)
-
Postmortem for Kernel Soundness Bug #14576 — Leonardo de Moura · lean4 issue #14576
-
Lean4Lean: Verifying a Typechecker for Lean, in Lean · Rocq critical-bugs.md · Touring the MetaCoq Project
RL for Science 产业侧
附录 A:产业格局
-
Synopsys Q3 FY2026 results · Synopsys completes $35B Ansys deal · Ansys FY2024 results · SNPS market cap
-
Cadence FY2025 results · Cadence to buy Hexagon D&E · CDNS market cap
-
Schrödinger FY2025 results · Schrödinger Q2 2026 · SDGR market cap
-
CAE market (MarketsandMarkets) · Quantum-chemistry software market · MathWorks · Gaussian pricing
附录 B:二代/三代市场
-
PhysicsX $300M Series C · PhysicsX (Tracxn) · Neural Concept $100M Series C · Luminary Cloud $72M Series B
-
CuspAI $450M Series B · Orbital Industries $50M Series B (Fortune) · 深势科技 C 轮(量子位) · AI materials VC returns (PitchBook)
-
Tomorrow.io Series F (SiliconANGLE) · WindBorne (TechCrunch) · Genesis AI $105M seed
-
Isomorphic Labs $2.1B Series B · Forbes on Isomorphic · Chai Discovery $130M Series B (TechCrunch) · Xaira X-Cell
-
Recursion market cap · Recursion 10-Q (9M 2025) · 晶泰控股 2025 年度业绩 · 晶泰控股行情
-
Lila Sciences $8.5B talks (Bloomberg) · Periodic Labs $7B talks (Bloomberg) · Periodic Labs $500M (Forbes)
-
Orbital Industries $50M (Resilience Media) · Orbital Materials (Tracxn) · MACE (GitHub) · UMA paper
-
WeatherNext 2 (Google blog) · Aurora next phase (Microsoft) · Aurora 1.5 · Silurian founders (GeekWire) · PhysicsNeMo
-
Big tech market caps (Motley Fool, 2026-09) · Alphabet FY2025 · Meta FY2025 · Microsoft FY2026 Q4 · NVIDIA FY2026
附录 C
-
许可证核对:ACEsuit/mace(README 模型许可表) · mace-off README · microsoft/mattersim · orbital-materials/orb-models · microsoft/bioemu · microsoft/aurora · neuraloperator · NVIDIA/physicsnemo · google-research/neuralgcm · microsoft/skala · facebook/UMA · FAIR Chemistry models · GraphCast repo · ECMWF AIFS open weights · Pangu-Weather · FuXi · Aurora 1.5
-
市场规模:CAE market · Simulation software (Mordor) · Physics AI engineering simulation · Multi-physics surrogate AI · AI-based weather modelling · AI in materials discovery
-
精度与方法:GraphCast (DeepMind blog) · GNoME (DeepMind) · DPW-5 summary · DPW-6 summary · Geant4 validation with CMS test-beam data · Validation of Geant4 physics models (OSTI) · Skala (arXiv 2506.14665) · DM21 (Science 2021) · DM21 质疑 (phys.org) · FermiNet · Aardvark Weather (Nature 2025) · DiffTRe (Nat Commun 2021) · Data-augmented turbulence model · Destination Earth Climate DT · DestinE 2025
-
机构核对:Microsoft Research AI for Science · Open Catalyst Project launch · Meta AI (Wikipedia) · Google DeepMind (Wikipedia) · Meta market cap · PhysicsNeMo (PyPI)