AI for Science · Simulation

科研仿真环境全景:sim2real gap 与 AI

从 DFT、分子动力学、GraphCast,到虚拟细胞、ESM3 和 Lean:13 个学科的代表性仿真,gap 有多大、该用什么指标量,以及它们和 AI 训练的关系。

一个领域的 AI 进展速度,与它的 reward 可验证性成正比,与它的 sim2real gap 成反比。

13
学科 / 方向
3
代仿真 · 3 层 gap
5
种与 AI 的关系
~$50B
2024–26 工程仿真并购

更新于 2026-09-21 · 标 ⓚ 的数字来自既有知识,本次未重新核实

目录
  1. 0. 结论先行
  2. 1. 全景总表
  3. 2. 分学科详解
  4. 3. sim2real gap 横向对比与指标体系
  5. 4. 与 AI 的关系:五种形态,成熟度递减
  6. 5. 对 AI4S 平台与创业者的几条启示
  7. 附录 A:一代仿真软件的产业格局(开源 vs 商业、公司、市值与利润)
  8. 附录 B:二代与三代的市场格局(公司、融资估值、收入)
  9. 附录 C:二代为何被采用、开源格局、市场规模与降低一代 gap 的新方法
  10. 6. 参考来源

0结论先行

  1. "仿真"其实分三代,不能放在一起比。

    • 第一代:第一性原理数值模拟。 包括 DFT、分子动力学、CFD、数值天气预报(NWP)、Geant4、MuJoCo。物理方程是已知的,误差来自近似和算力。
    • 第二代:AI 仿真器(emulator/surrogate)。 例如 MLIP、GraphCast、BioEmu。它们用第一代的输出做训练,快 10³–10⁵ 倍,但精度的上限就是老师(第一代模拟器)。
    • 第三代:数据驱动的"世界模型"。 包括虚拟细胞、ESM3、Evo 2、小鼠视皮层数字孪生。这些领域没有可用的第一性原理方程,模型直接从实验数据里学。 ESM3 和虚拟细胞属于第三代,它们的 gap 形态和 DFT 完全不同。
  2. sim2real gap 要分三层量: ① 模拟器对真实实验;② AI 仿真器对模拟器;③ 设计出来的东西在湿实验中的成功率。最容易被夸大的是用 ② 冒充 ①。例如 AI 天气模型对着 ERA5 算的误差,比对着真实观测站低 15–45%;FEP 在公开基准上 RMSE 为 1.73 kcal/mol,换到药企私有体系变成 2.44。

  3. 按 gap 从小到大排序: 数学(Lean,验证层 gap≈0,但内核实现有过 bug,见 §2.13)< 刚体机器人控制和等离子体控制(已 zero-shot 上真机)< 天气、流体(仿真本身已很准)< 材料和分子能量(DFT 本身有系统误差)< 蛋白设计(湿实验成功率 5–50%)< 药物结合自由能 < 虚拟细胞(2025 年仍未稳定打败"取平均"这种朴素基线)。

  4. 与 AI 的关系已经有四种形态,成熟度依次下降: 仿真造数据训 AI(最成熟)→ AI 替代仿真 → 仿真作 RL 环境训控制策略(TCV 托卡马克、1 型糖尿病人工胰腺、机器人)→ 仿真或预测器作 LLM agent 的工具和 reward(ether0、Lean、虚拟细胞 agent)。前沿公司(Periodic Labs、Lila)押的是第五种:"把大自然本身当 RL 环境"。原因正是第 3 点:大部分科学仿真器的 gap 太大,不适合做终极 reward。

1全景总表

学科 第一性原理模拟(1代) AI 仿真器/基础模型(2/3代) 仿的对象 真值来源
细胞生物 全细胞 ODE 模型(Karr 支原体 2012 ⓚ)、VCell ⓚ Arc State、scGPT/Geneformer;蛋白质组虚拟细胞(Nature 2026) 扰动 → 转录组/细胞状态 Perturb-seq 单细胞测序
蛋白质/RNA/基因组 Rosetta(能量函数)ⓚ ESM3、AlphaFold3、Boltz、RFdiffusion、BindCraft、Evo 2 序列 ↔ 结构 ↔ 功能 晶体/冷冻电镜、湿实验活性
分子动力学/药物 GROMACS、AMBER、OpenMM、FEP+ BioEmu、AI2BMD ⓚ 构象系综、结合自由能 ITC/IC50、稳定性测量
材料 VASP、Quantum ESPRESSO(DFT) UMA、MACE-MP、MatterSim、Orb、PET-OAM;GNoME、MatterGen 晶体能量/力 → 稳定性、性质 合成 + XRD、物性测量
化学/量子化学 ORCA、Gaussian、PySCF UMA(OMol25 训练);ether0(推理模型) 分子能量、反应、性质 量热、光谱、产率
天气/气候 ECMWF IFS、E3SM GraphCast/GenCast/WeatherNext 3、Aurora、NeuralGCM ⓚ 大气状态演化 观测站、卫星、再分析
流体/工程 OpenFOAM、Ansys Fluent FNO 神经算子、NVIDIA PhysicsNeMo;The Well(15 TB 数据) Navier-Stokes 流场 风洞、PIV
聚变/等离子体 回旋动理学 GENE/GX、自由边界平衡 FGE ⓚ TORAX(JAX 可微输运)ⓚ 等离子体平衡与输运 托卡马克诊断
粒子物理 Geant4、Pythia CaloChallenge 生成模型(CaloDiT-2 等) 粒子-探测器相互作用 对撞机数据
天体/宇宙学 IllustrisTNG、SIMBA、ASTRID、EAGLE CAMELS 套件 + 神经推断 宇宙大尺度结构 巡天观测
神经科学 NEURON、Blue Brain(2024 结束)ⓚ 小鼠视皮层数字孪生(MICrONS);FlyWire + NeuroMechFly/flybody;BAAIWorm ⓚ 神经响应、脑-身体闭环 钙成像、电生理、行为
医学/生理 UVA/Padova T1D 模拟器、心脏电生理模型 虚拟病人队列、数字孪生对照组 病人对药物/器械的响应 临床试验
机器人/具身 MuJoCo、Isaac Sim、Genesis、SAPIEN 视频世界模型(Cosmos、SC3-Eval) 刚体接触动力学、视觉 真机成功率
数学(对照组,不属于三代仿真,是 verifier/真值本身) —(Lean 4、Isabelle 是证明检查器,不是模拟器) AlphaProof、DeepSeek-Prover 证明是否成立 证明器内核本身即真值

2分学科详解

2.1 细胞生物:虚拟细胞(Virtual Cell)

代表

sim2real gap:所有领域里最大、也最有争议

与 AI 的关系

2.2 蛋白质 / RNA / 基因组

代表

sim2real gap:这里的"real"就是湿实验成功率

与 AI 的关系:本身就是 AI;反向关系是"结构预测器作为设计模型的 reward"——这是目前最成熟的"AI 用仿真器训 AI",例如 ProteinZero 这类用在线 RL 自我改进的工作。

2.3 分子动力学与药物结合自由能

代表

sim2real gap:有一个公认的"1 kcal/mol 门槛"

2.4 材料

代表

sim2real gap:这是"两层 gap 叠加"的教科书案例

2.5 化学与量子化学

代表

sim2real gap

2.6 天气与气候

代表:ECMWF IFS(第一代);GraphCast、GenCast(扩散,概率预报,在 96% 以上的目标上优于 ECMWF ENS)、WeatherNext 3(2026-08,FGN mesh transformer,直接同化卫星原始观测,0.05° 站点 / 0.1° 地面 / 0.25° 气压层,逐小时起报)、微软 Aurora、NeuralGCM(混合可微动力核)。

sim2real gap:这个领域给了全文最干净的"基准夸大"证据

2.7 流体与工程 CFD

代表:OpenFOAM、Ansys Fluent(第一代,RANS/LES/DNS);神经算子 FNO、NVIDIA PhysicsNeMo;数据基建 The Well(PolymathicAI,15 TB、16 个物理域,从生物系统、流体、声散射到磁流体和超新星,统一 PyTorch API + 预训练基线);汽车气动专用基准 CarBench(2025)。

sim2real gap

2.8 聚变与等离子体

代表:自由边界平衡演化模型(TCV 用的 FGE)、回旋动理学(GENE/GX)、TORAX(DeepMind 的 JAX 可微输运求解器,可反传、可做 RL)ⓚ。

sim2real gap:这是"仿真训练直接上真机"的最佳范例

2.9 粒子物理与宇宙学

2.10 神经科学

代表

sim2real gap

2.11 医学与生理:最被低估的成功案例

2.12 机器人与具身(已有专门追踪,此处从简)

2.13 数学:验证层 gap≈0 的对照组(但内核会有 bug)

Lean 4 / Isabelle 严格说不是"仿真",而是真值本身——内核检查通过就是证明成立,验证这一步不存在近似。这正是为什么 AlphaProof、DeepSeek-Prover-V2、Leanabell-Prover-V2 这条线进展最快:可验证奖励无限量、零噪声、零成本。2026 年的新方向是把 Lean 的 REPL 接进 RL 训练做稠密的、tactic 级的信用分配,而不只是最终结果奖励。

Lean 的元理论(它凭什么是真值)

信任链上真正出过事的地方(按可信度从高到低) | 层 | 会不会错 | 历史 | |---|---|---| | 元理论 | 无法自证一致,相对 ZFC+不可达基数一致 | 从未发现漏洞 | | 内核实现(几千行 C++) | 会,普通软件 bug | 2026-07 #14576:AI 辅助生成的 Collatz"证伪"利用嵌套归纳类型幽灵参数漏检证出 False,1 小时修复;独立内核 nanoda(另有 bug)和 Lean4Lean(同 bug)都没拦住;随后 OpenAI Selsam 用 AI 审计又挖出多处,均可被 nanoda 捕获 | | native_decide/reduceBool | 会,信任未验证的编译器 | 2023 年 Carneiro 用随机 IO 构造矛盾;修复为显式公理 trustCompiler,可被 #print axioms 看见 | | 前端 elaborator/tactic | 常有 bug,但内核会复查,基本无害 | — | | 形式化 gap | 最常见:Lean 命题≠想证的数学命题 | 基准集中多次发现形式化错题 |

其他证明器同样如此:Rocq(Coq)专门维护 critical-bugs.md,记录多个能证出 False 的历史漏洞(Set+1 类型计算、native_compute 常量名冲突、guard checker 等)。表达力越强,内核越大,可被攻击的面也越大:HOL Light 的内核只有几百行 ⓚ,Lean 和 Rocq 的内核要大得多。

对 RL 环境的含义:RL 极擅长找后门,内核的可靠性已经是 AI 安全基础设施问题。 工程纪律:

长期方向是经过验证的验证器:Lean4Lean 在 Lean 里形式化 Lean 的类型检查器;Rocq 有 MetaCoq,HOL Light 有基于 CakeML 的 Candle ⓚ。

这条对照组解释了整篇报告的结构性规律:一个领域的 AI 进展速度,与它的 reward 可验证性成正比,与它的 sim2real gap 成反比。

3sim2real gap 横向对比与指标体系

3.1 三层 gap 必须分开报

层 问的问题 典型指标 常见的作弊/自欺
L1 模拟器 vs 真实 物理保真度够吗 与实验测量的 MAE/相对误差 压根不测,默认模拟器是对的
L2 AI 仿真器 vs 模拟器 学老师学得像吗 能量/力 MAE、场的 L2 误差、rollout 稳定性 拿 L2 的漂亮数字冒充 L1
L3 设计 → 现实 产出的东西能用吗 湿实验命中率、合成成功率、真机成功率、临床终点 只报最好靶点、不报分母

3.2 各领域 gap 现状打分

领域 L1(仿真 vs 实验) L3(设计 → 现实) 最该用的指标
数学/形式化 无(即真值;残余风险在内核实现和形式化 gap) 可验证,但需多内核复核 独立内核复核通过率 + 公理白名单
等离子体控制 小,够 zero-shot 上真机 TCV 已成功 形状误差、真机首试成功率
机器人操作 中(视觉+接触) 真机 ~44% MMRV + Pearson r
天气 小,但对观测差 15–45% 业务预报已上线 CRPS、对观测的 RMSE
CFD 中(分离流、非设计点散布大) 工程上可用 相对 L2、阻力系数偏差
粒子物理 小(数据/MC 百分之几) — 物理可观测量分布吻合
材料 大(带隙 MAE >1 eV) 合成 + 物性误差 <20%(单例) 合成成功率、物性相对误差
量子化学/小分子 小(~1 kcal/mol) 产率无法预测 能量 MAE、产率 MAE
药物结合自由能 中→大(1.73 → 2.44 kcal/mol) 前瞻富集倍数 ΔΔG RMSE + Spearman
蛋白设计 不适用 5%(全基因组)~46%(binder) 湿实验命中率(带分母)
神经科学 感觉编码小、行为大 — OOD 刺激下的可解释方差
医学/生理 中,但监管已认可 已产出 6 个上市产品 V&V40 可信度等级
虚拟细胞 最大 尚无前瞻验证共识 相对均值基线归一化的多指标

3.3 四条通用的评测纪律(来自本次调研的横向教训)

  1. 永远先打朴素基线。 虚拟细胞领域的"取均值/线性加性"基线,已经淘汰了一批基础模型。任何号称 SOTA 的科学模型,先问"比取平均好多少"。

  2. 对着真实观测评,不要对着模拟产物评。 天气的 15–45% 差距就是代价。

  3. 公开基准和私有/真实任务要分开报。 FEP 的 1.73 vs 2.44 是最干净的例子。

  4. 跨模拟器留一验证。 CAMELS 的做法(TNG 训练 → SIMBA 测试)应该成为所有依赖模拟数据训练的领域的标配。

  5. 单指标必被 overfit。VCC 2025 的教训写在官方复盘里:"窄的评分面会诱导对指标而非对生物学的优化。"

4与 AI 的关系:五种形态,成熟度递减

形态一:仿真产数据训 AI(最成熟,已工业化)

形态二:AI 替代仿真(进行中)

关键判据是"替代之后误差有没有超过原模拟器对真实的误差"。在天气领域已经越过(AI 比 IFS 准),在材料 MLIP 领域越过了对 DFT 的需求但没越过 DFT 自身的天花板,在 CFD 领域还没。

形态三:仿真作 RL 环境训控制策略(已有真实成功)

形态四:仿真/预测器作 LLM agent 的工具与 reward(2025–2026 主战场)

形态五:把大自然当 RL 环境(最贵,也是 2026 年的资本共识)

一句话判断

仿真环境对 AI 的价值,取决于它离"可验证奖励"有多近。Lean 最近(验证层 gap≈0,需防内核后门),控制类仿真其次(gap 小且可 zero-shot),材料和分子居中(gap 已知、可校正),虚拟细胞最远(gap 未知、基线都没打过)——所以最有钱的玩家选择绕过仿真,直接买真实实验当 reward。

5对 AI4S 平台与创业者的几条启示

  1. 要做"科学 RL 环境"产品,优先级应该按 verifier 强度排,而不是按学科热度排。 强 verifier 的洼地:形式化数学、量子化学的确定性检查、晶体结构有效性、逆合成路线的可执行性、生信 pipeline 的可复现性。虚拟细胞现在做 reward 太早。

  2. 卖"跨模拟器/跨基线评测"本身就是产品。 CAMELS 式的留一验证、VCC 的均值基线归一化、SIMPLER 的 MMRV——这套评测纪律在大多数学科里是缺位的,而缺位的地方就是信任缺口。

  3. L2 冒充 L1 是这个行业最普遍的营销话术。 任何合作方给出"我们比 DFT/MD 准"的说法,都要追问对照物是模拟器还是实验。

  4. T1D 模拟器是最值得研究的商业先例:一个手工 ODE 模型,因为拿到监管认可,垄断了一个赛道近 20 年、催生 6 个上市产品。监管接受度的护城河远比模型精度深。

附录 A一代仿真软件的产业格局(开源 vs 商业、公司、市值与利润)

结论

  1. 两个世界:工程仿真(CFD/有限元/多物理)高度商业化、寡头化,营业利润率 30–46%;科学仿真(DFT/MD/NWP/Geant4/MuJoCo)以开源和学术软件为主,靠政府、国际组织或大厂补贴。唯一上市的纯科学计算公司 Schrödinger 市值约 $2B,且长期亏损。

  2. 2024–2026 年工程仿真被 EDA 巨头和西门子并购,合计约 $50B:Synopsys 收购 Ansys(约 $35B),Cadence 收购 BETA CAE 和 Hexagon 的 MSC(约 €2.7B),西门子收购 Altair(约 $10B)。

A.1 按领域:开源还是商业,谁在支持

领域 主流软件 开源/商业 背后机构/公司
CFD/有限元/多物理(工程) Ansys Fluent/Mechanical、Simcenter STAR-CCM+、Altair、Abaqus、MSC Nastran、COMSOL、MATLAB/Simulink 商业为主 Synopsys(Ansys)、西门子(Simcenter+Altair)、达索(SIMULIA)、Cadence(BETA CAE、MSC、Fidelity)、COMSOL 与 MathWorks(私营)
工程开源替代 OpenFOAM、SU2、code_saturne 开源 OpenFOAM Foundation / OpenCFD(ESI,2023 年被 Keysight 收购 ⓚ)
DFT/量子化学 VASP、Gaussian、Materials Studio/CASTEP、QuantumATK、ORCA、Q-Chem 商业或学术授权 VASP 按课题组收费;Gaussian Inc.(私营,年维护费 $12k,限制竞品开发者使用而长期有争议);达索 BIOVIA;Synopsys;ORCA 学术免费、商业收费 ⓚ
量子化学开源 Quantum ESPRESSO、CP2K、ABINIT、PySCF、Psi4、NWChem 开源 学术与各国科研经费
分子动力学/药物 GROMACS、OpenMM、LAMMPS、NAMD 开源(实际主力) 学术、NIH、DOE 国家实验室
AMBER、CHARMM 半开放(AmberTools 开源,GPU 引擎收费 ⓚ) 学术联盟
Desmond、FEP+、OpenEye 商业 D.E. Shaw Research 开发、Schrödinger 分发;OpenEye 2022 年被 Cadence 收购 ⓚ;OpenFE 是药企联盟资助的开源 FEP
数值天气/气候 ECMWF IFS、NOAA UFS/GFS、WRF、CESM、E3SM 公共/开源 政府与国际组织;OpenIFS 自 2026-03-05 以 Apache 2.0 开源
粒子物理 Geant4、Pythia 开源 以 CERN 为首的国际合作
机器人 MuJoCo、Isaac Sim/Isaac Lab、Newton、Genesis 全部开源 DeepMind(2021 年收购 MuJoCo,2022 年开源 ⓚ);NVIDIA(Isaac Sim Apache 2.0、Isaac Lab BSD-3);Newton 由 DeepMind、Disney、NVIDIA 共建,托管于 Linux 基金会

机器人仿真器开源不是因为没价值,而是价值被 NVIDIA(卖 GPU)和 Google(生态)拿走了。

A.2 公司市值与利润(2026-09)

公司 仿真资产 市值 相关营收 利润率
Synopsys Ansys(约 $35B,2025-07-17 完成) 数据源分歧大($60–96B),9/18 股价约 $385 FY26 指引 $9.69–9.74B,其中 Ansys 约 $2.98B Q3 FY26 non-GAAP 营业利润率 41.6%,GAAP 14.4%(摊销重)
Ansys(被收购前) Fluent、Mechanical、HFSS — 2024 年 $2.545B GAAP 28.2%,non-GAAP 45.7%
Cadence BETA CAE(2024)、Hexagon MSC(2026-02-23)、Fidelity、OpenEye 约 $77–78B 2025 年 $5.30B;2026 指引 $5.9–6.0B(仿真未单列) non-GAAP 约 45%
达索系统 SIMULIA、BIOVIA 约 $34B 2025 年 €6.24B(仿真未单列) non-IFRS 32.0%;2026 增速指引仅 3–5%
西门子 Simcenter + Altair(约 $10B,2025-03) 集团市值不可比 Altair 2024 年 $665.8M FY25 Q4 Altair 与 Dotmatics 整合拖累利润 €135M
Schrödinger FEP+、Maestro、Desmond 约 $2.17B 2025 年 $256M(软件 $200M) 2025 年净亏损 $103M;Q2 2026 账面盈利 $6.0M 主要来自 $45.9M 股权投资收益,核心业务仍亏
MathWorks(私营) MATLAB/Simulink — 2024 年约 $1.5B 未披露
COMSOL(私营) COMSOL Multiphysics — 约 $1 亿量级(第三方估算,可信度低) 未披露

市场规模:CAE 2025 年约 $12–13B,前五家占 50–55%;量子化学软件 2024 年约 $0.62B,相差约 20 倍。

A.3 四个判断

  1. 钱在工程,不在科学。 航空、汽车、芯片的产品认证流程绑定特定软件,切换成本极高;科学仿真的用户要可公开、可复现的代码,天然倾向开源。

  2. EDA 吞并仿真是为了"从芯片到系统"。 AI 芯片的先进封装、散热、电磁、信号完整性都需要多物理仿真。Ansys 约 $35B 的价格说明,成熟工程仿真的定价在营收 10 倍以上。

  3. Schrödinger 是反面教材。 科学计算软件卖给药企,软件年营收约 $200M 就碰到天花板,只能靠自研药物管线讲故事,长期亏损。卖科学仿真软件本身很难成为大生意。

  4. 对第二代 AI 仿真器的含义。 工程领域,AI 代理模型冲击高利润在位者,但后者已在自集成 AI(Ansys SimAI、PhysicsNeMo 合作),且握有认证壁垒。科学领域,AI 模型(UMA、MACE、GraphCast)大多也开源,软件本身不值钱,价值在数据、算力和湿实验验证。

附录 B二代与三代的市场格局(公司、融资估值、收入)

结论

  1. 私募估值远高于公开市场定价。 一级市场头部估值:Isomorphic(媒体报道 $15–20B)、Lila($8.5B 投前,谈判中)、Periodic Labs($7.5B,谈判中)、CuspAI($2.6B)、PhysicsX($2.4B)。已上市的 AI 制药/AI4S 公司(Recursion 约 $1.8B、Schrödinger 约 $2.2B、晶泰约 300 亿港元量级)都停在几十亿美元,而且大多亏损。

  2. 几乎没有公司靠"卖模型"赚钱。 二代公司卖给工程和能源客户(与 Ansys 同一批买家);三代公司要么自研管线(Isomorphic、Xaira、Recursion),要么做数据工厂(Tahoe),要么是非营利机构开源模型(Arc、Biohub)。EvolutionaryScale(ESM3)2025-11 被非营利的 Biohub 收购,说明"独立卖蛋白质模型"这门生意没跑通。

  3. 最大的钱流向了"真实实验室当 RL 环境"(Lila、Periodic Labs),与正文 §4 形态五的判断一致。

  4. 大厂的角色是平台而非卖软件:NVIDIA(Earth-2、PhysicsNeMo、BioNeMo、Cosmos、ALCHEMI)靠 GPU 变现,NVentures 还投了 Lila、Luminary、Orbital;Google DeepMind(WeatherNext、AlphaFold/Isomorphic)、Microsoft(MatterGen、MatterSim、Aurora、BioEmu)、Meta(UMA,开源)都没有单独披露这部分收入。

B.0 二代 vs 三代:区别、代表与资本画像

第二代:AI 仿真器 / 代理模型 第三代:数据驱动世界模型
老师 物理模拟器(DFT、MD、CFD、NWP) 实验数据(测序、结构库、成像)
数据来源 算力换数据,无限、无噪声 湿实验,贵、少、有批次效应
核对方式 回原模拟器再算一次 只能再做一次实验
精度上限 等于老师 无明确上限,也无下限保证
卖点 快 10³–10⁵ 倍,本质是省钱 做原来算不了的事,本质是新能力
当 RL 奖励 可用且可纠正 目前噪声太大
代表模型 MACE、UMA、MatterSim、Orb;GraphCast、GenCast、WeatherNext、Aurora;BioEmu;FNO/PhysicsNeMo Arc State、Xaira X-Cell;ESM3、AlphaFold3;Evo 2;小鼠视皮层数字孪生
代表公司估值 集中在 $1–3B:CuspAI $2.6B、PhysicsX $2.4B、Tomorrow.io >$1B、深势科技独角兽 两极分化:Isomorphic 媒体报道 $15–20B、Xaira 累计融资约 $1.3B、Chai $1.3B;上市公司 Recursion 约 $1.8B、晶泰约 300 亿港元量级
收入形态 卖给工程、能源、材料客户的软件/服务收入,持续但规模小、多不披露 主要是少数药企合作大单,波动大(晶泰 2025 年 +201%,2026 H1 回落)
估值锚 CAE 市场(PhysicsX $2.4B ↔ Ansys 年收入约 $3B) 药物管线期权价值,可以几乎没有收入
主要风险 在位者(Ansys、西门子)自带 AI 且握有认证壁垒 一级市场 $10B+ vs 二级市场 $2–4B 的定价落差

混合型:NeuralGCM(物理内核 + 学习模块)、BioEmu(MD + 实验数据)、WeatherNext 3(开始直接吃观测数据)。横跨两代的 Lila(投前 $8.5B)和 Periodic Labs($7.5B)用二代模型在模拟器里预筛、用真实实验当训练信号,是估值涨得最快的一类。

B.1 第二代:AI 仿真器 / 代理模型公司

方向 公司 最新融资 / 估值 收入 / 备注
工程 CFD/结构 PhysicsX(伦敦) 2026-06 Series C $300M(Temasek 领投),估值 $2.4B;累计 $489M 未披露;2025-11 估值约 $1B,7 个月翻 2.4 倍
Neural Concept(瑞士,EPFL 衍生) 2025-12 Series C $100M(高盛领投) 客户 50+ 家(GM、GE Vernova、Safran)
Luminary Cloud(美国) 2025-09 Series B $72M;累计 $187M NVentures 参投
在位者自带 AI Ansys SimAI、西门子 Simcenter AI 对初创公司的主要威胁
材料/化学 MLIP CuspAI(剑桥) 2026 Series B $450M,估值 $2.6B(KP、NEA 领投) 未披露;推出"AI Materials Foundry"
Orbital Industries(原 Orbital Materials) 2026-05 Series B $50M 开源 Orb 势函数
深势科技(北京) 2025-12 C 轮超 8 亿元,独角兽 DeePMD、Uni-Mol、Hermite、玻尔科研平台;未上市
天气 Tomorrow.io 2026 Series F $175M + $35M,估值 >$1B 自建气象卫星,AI 预报
WindBorne Systems Series B $37M,估值 $250M 过去一年收入增至 3 倍(自有探空气球网 + AI 模型)
Jua / Brightband $21.5M / $10M 能源交易 / 地球系统 AI
机器人仿真 Genesis AI 2025-07 种子轮 $105M 自研物理引擎 + 机器人基础模型
大厂 Google(WeatherNext)、NVIDIA(Earth-2、PhysicsNeMo)、Microsoft(Aurora、MatterSim、BioEmu)、Meta(UMA) — 靠 GPU/云变现,或开源不收费

B.2 第三代:数据驱动世界模型公司

方向 公司 最新融资 / 估值 收入 / 盈亏
结构/药物基础模型 Isomorphic Labs(Alphabet) 2026-05 Series B $2.1B(Thrive 领投);估值媒体报道 $15–20B 与 Novartis、Lilly、J&J 合作,收入未披露
Xaira 累计约 $1.3B 发布 X-Cell 虚拟细胞模型(4.9B 参数)
Chai Discovery(OpenAI 投资) 2025-12 Series B $130M,估值 $1.3B;累计 >$225M;报道在谈 $400M 新一轮 未披露
EvolutionaryScale(ESM3) 种子轮 $142M → 2025-11 被 Biohub 收购,约 50 人加入 独立商业化终止
虚拟细胞 Tahoe Therapeutics $30M,估值 $120M 数据工厂(Tahoe-100M),与 Arc/Biohub 共建数据集
Noetik 未详 患者组织多模态数据
Arc Institute、Biohub 非营利 State、Evo 2、ESM3 开源
上市公司 Recursion(RXRX) 市值约 $1.8B(2026-08) 2024 年收入 $58.8M;2025 年前三季度净亏损 $536.6M
晶泰控股(2228.HK) 市值数据源分歧(32 亿 vs 332 亿港元,后者与股价 HK$6.93 量级吻合) 2025 年收入 8.03 亿元(+201%),首次盈利 1.35 亿元;但 2026 H1 收入约 3.9 亿元(-24%),亏损约 2.3 亿元(二手摘要,待核)

B.3 横跨两代:把真实实验室当环境

公司 融资 / 估值 备注
Lila Sciences 2025-10 Series A 共 $350M,估值 >$1.3B;2026-06 报道在谈 $2B、投前 $8.5B(CalPERS、NVentures 领投) 自主实验室覆盖生命、化学、材料
Periodic Labs 2025-09 种子轮 $300M,估值 $1.3B;2026-05 报道在谈 $500M、估值 $7.5B 已有半导体行业付费客户;模型先在逐级提高保真度的模拟器里试,再上真实实验

B.4 二代代表模型背后的机构:成立时间、估值、收入

模型 首发 背后机构 机构成立 母公司市值 / 公司估值 母公司年收入 该模型的商业化与收入
MACE(含 MACE-MP-0) 2022(通用势 2023) 剑桥大学 Csányi 组 + ACEsuit 开源社区 学术 — — 代码与 MACE-MP-0 系列为 MIT;MACE-OFF、OMAT、OMOL、MATPES、MH 等新模型为学术许可(ASL),禁止商用。无直接收入
UMA 2025-05 Meta FAIR Chemistry(前身是 2020 年与 CMU 合作的 Open Catalyst 项目) FAIR 2013;Meta 2004 Meta 约 $1.70T(2026-09-18) 2025 年 $201.0B,净利 $60.5B Hugging Face 申请下载,须同意 FAIR Chemistry License(可商用,有地域和用途限制),不单独收费
MatterSim 2024-05 Microsoft Research AI for Science 2022-07(Chris Bishop 创立);Microsoft 1975 Microsoft 约 $3.71T FY26(至 2026-06)$331.8B,净利 $133.7B MIT 开源,接入 Azure / Microsoft Discovery 生态;收入未单列
Orb 2024 Orbital Industries(原 Orbital Materials,伦敦) 2022(创始人 Jonathan Godwin 来自 DeepMind) 估值未披露;累计融资约 $71M(2024-02 A 轮 $16M,2026-05 B 轮 $50M) 未披露 Apache 2.0 开源;公司转向数据中心冷却等工业硬件(Orbital IT)变现
GraphCast / GenCast / WeatherNext 2023 / 2024 / WeatherNext 2 于 2025-11、WeatherNext 3 于 2026-08 Google DeepMind DeepMind 2010,2014 被 Google 收购;Alphabet 2015 Alphabet 约 $4.10T 2025 年 $402.8B,净利 $132.2B 数据上架 BigQuery / Earth Engine,Vertex AI 早期访问;已接入 Search、Gemini、Pixel、Maps Weather API(间接变现,未单列)
Aurora 2024-06(Aurora 1.5 后续) Microsoft Research AI for Science 同上 Microsoft 约 $3.71T 同上 Microsoft Foundry 托管部署、Planetary Computer Pro;已用于 MSN Weather;未单列。核心作者 2024-06 出走创立 Silurian(融资约 $6M)
BioEmu 2024-12 预印本,Science 2025 Microsoft Research AI for Science 同上 同上 同上 MIT 开源,无直接收入
FNO(傅里叶神经算子) 2020 加州理工(Zongyi Li、Anima Anandkumar) 学术 — — neuraloperator 库 MIT 开源(2020),被 NVIDIA 等框架吸收
PhysicsNeMo(原 Modulus) Modulus 2023 年开源,2025 年更名 NVIDIA 1993 NVIDIA 约 $5.58T FY26(至 2026-01)$215.9B,净利 $120.1B;数据中心 $197.3B Apache 2.0 开源,靠 GPU 和 NVIDIA AI Enterprise 变现

要点

  1. 这 10 个代表模型里,8 个出自大厂实验室或大学,只有 Orb 背后是独立创业公司(外加 Aurora 团队出走创立的 Silurian)。

  2. 模型本身几乎没有直接收入:大多开源,大厂的变现方式是带动云用量(Azure、Google Cloud)、GPU 销量(NVIDIA)或增强自家消费产品(Google 搜索和地图天气、MSN 天气)。相对母公司 $2000–4000 亿的年收入,这部分无法、也没有被单独披露。

  3. 真正把二代模型当生意做的是下游公司:PhysicsX、CuspAI、Neural Concept、深势科技等,它们常常直接基于这些开源模型再做行业化,赚的是行业交付和数据的钱。

  4. 这意味着二代的"模型层"已被大厂开源免费化,护城河只能建在行业数据、工作流集成和客户交付上。

B.5 判断

  1. 二代的估值锚是 CAE 市场:PhysicsX $2.4B 对应 Ansys 年收入约 $3B,赌的是"AI 代理模型吃掉一部分传统仿真预算"。风险在于在位者自带 AI,且握有认证壁垒。

  2. 三代的估值锚是药物管线,不是模型:Isomorphic、Xaira 的估值来自对未来药物的期权;公开市场对 Recursion、晶泰这类"AI 平台 + 管线"公司只给 $2–4B,且收入依赖少数合作大单,波动剧烈(晶泰 2025 年爆发、2026 H1 回落)。

  3. 一级市场正在给"数据 + 真实验证"定最高价:Lila、Periodic 半年内估值涨 5–6 倍,而纯模型公司(EvolutionaryScale)被收编。这和正文结论一致:仿真 gap 越大的领域,价值越往数据和湿实验端迁移。

附录 C二代为何被采用、开源格局、市场规模与降低一代 gap 的新方法

C.1 高校和企业为什么用二代而不是一代

核心原因:在精度"够用"的前提下,二代把计算成本降了 3–5 个数量级,很多原来做不了的研究变得可以做。 但实际做法不是替换一代,而是把两者串起来用。

  1. 快 10³–10⁵ 倍,研究尺度直接变了。

    • 材料/化学:DFT 算一个结构要几分钟到几小时,通用原子势(MACE、UMA 等)是毫秒级,精度接近 DFT。以前 DFT 分子动力学只能跑几百个原子、几十皮秒,现在能跑几万到几百万原子、纳秒级;界面、缺陷、电解液、催化剂表面这类必须够大够久的体系才算得动。
    • 天气:GraphCast 在一台 TPU v4 上不到 1 分钟出 10 天预报;ECMWF 的 HRES 要在超算上跑约 1 小时。
    • 蛋白:BioEmu 单 GPU 每小时生成几千个独立构象,原来要跑毫秒级 MD 才能看到的隐藏口袋等构象变化,现在几小时就能拿到。
  2. 能做大规模筛选。 一代只能算"已经想好的几个候选";二代可以先扫百万级,再挑少数交给 DFT 或实验。GNoME 预测 220 万个晶体结构,其中 38 万个预测稳定,就是这个模式。

  3. 概率预报和不确定性变便宜。 集合预报原来要把整个物理模式跑几十遍;GenCast 一类模型一次采几十上百个成员。

  4. 可微分,能接进优化和 AI 流程。 可以做反向设计、接进 RL 当奖励或约束、被 LLM agent 调用;一代的 Fortran/C 老代码很难改成可微分。

  5. 门槛低。 硬件:一块 GPU 即可,不用排队申请超算机时。许可证:VASP 按课题组收费、Gaussian 年维护费 $1.2 万、商业 CAE 按席位收年费,而 MACE-MP-0、MatterSim、Orb、BioEmu、PhysicsNeMo 都开源免费。人:一代软件要懂泛函选择、收敛参数、网格划分的专家,二代基本 pip install 加几行 Python。

  6. 企业看重迭代速度。 设计循环从"改一版等一晚 CFD"变成"几秒出结果",一天能试几百个方案。

为什么一代没被淘汰:标准做法是三级漏斗。

二代大规模粗筛(百万级候选,快、便宜)→ 留下前 1% → 一代精算验证(DFT / MD / CFD,贵但可信)→ 留下最有希望的几个 → 实验 / 风洞 / 临床做最终裁判

高校 企业
首要动机 研究更大尺度、更长时间的科学问题 缩短设计周期
典型用法 在开源原子势上微调自己的体系;研究机理 二代筛选加速;关键决策仍用一代加实验
在意的风险 可复现性、审稿人质疑 分布外出错导致设计失误;认证
许可证 很重要,经费有限 次要,但希望少买席位

C.2 二代模型:开源还是闭源

"开源"要分四档,而且各家效果最好的业务版往往不开源。许可证均已在 GitHub/Hugging Face 核对。

档位 模型 许可证 能否商用
① 完全开源 MACE 代码 + MACE-MP-0 系列(MP-0a、MP-0b3、MPA-0) MIT ✅
MatterSim、MatterGen(微软) MIT ✅
Orb(Orbital) Apache 2.0 ✅
Aurora / Aurora 1.5(微软,1.5 版 2026-07 开源) MIT ✅
BioEmu(微软) MIT ✅
neuraloperator(FNO 库) MIT ✅
PhysicsNeMo(NVIDIA) Apache 2.0 ✅
NeuralGCM(Google Research) 代码 Apache 2.0 ✅(代码)
ECMWF AIFS 权重 CC BY 4.0 ✅
Skala(微软深度学习 DFT 泛函) MIT ✅
② 开放权重,需申请 UMA(Meta;fairchem 代码 MIT) 权重须同意 FAIR Chemistry License,可商用但有地域和用途限制 ✅(有条件)
③ 开源但禁止商用 GraphCast、GenCast(DeepMind) 代码 Apache 2.0,权重 CC BY-NC-SA 4.0 ❌
盘古气象(华为)、伏羲(复旦) 权重 CC BY-NC-SA 4.0 ❌
MACE-OFF23、MACE-OMAT-0、MACE-OMOL-0、MACE-MATPES、MACE-MH 学术许可 ASL ❌
④ 闭源 WeatherNext 2 / 3(Google 业务版) 不放权重;数据经 BigQuery / Earth Engine,Vertex AI 早期访问 付费
GNoME 只公开预测结构数据,模型不开放 —
Silurian GFT、Tomorrow.io;Ansys SimAI、PhysicsX、Neural Concept、Luminary;CuspAI 等 商业服务 付费

规律:

  1. 同一家公司,研究版开源、业务版闭源。 Google 的 GraphCast、GenCast 开放权重但禁止商用;业务上跑的 WeatherNext 2/3 只卖数据和服务。

  2. 开源策略对应商业模式。 微软最开放(靠 Azure 和 Foundry 变现);NVIDIA 开源(靠 GPU);Meta 开放但要申请(无云业务要保护);Google 研究版开放、业务版闭源;创业公司闭源(模型即产品);Orbital 是例外(开源建影响力,靠工业硬件赚钱)。

  3. 许可证对企业比对高校重要。 高校基本不受限;企业商用只能选 ①、② 档,或买 ④ 档服务。同一个 MACE 家族,早期 MP-0 系列可商用,后来基于 OMAT/OMOL 等更大数据训练的新模型反而改成了学术许可。天气方向,AIFS(CC BY 4.0)和 Aurora(MIT)是少数"业务级精度 + 可商用"的选择。

C.3 市场规模:一代约 $120–150 亿/年,二代实际收入约 $10–20 亿

一代

细分 年规模 说明
工程仿真 CAE 约 $120–130 亿(2025) 前五家占 50–55%;按公司自下而上(Ansys 约 $30 亿、MathWorks 约 $15 亿,加西门子、达索、Cadence)对得上
"仿真软件"大口径 $130–270 亿 各研究机构口径差很大,有的含离散事件、培训仿真
量子化学软件 约 $6 亿(2024) 约为工程仿真的 1/20
分子模拟 / 药物计算 规模小 最大纯业务公司 Schrödinger 软件收入约 $2 亿
天气、粒子物理、分子动力学、机器人仿真 软件收入几乎为零 政府和国际组织出资(ECMWF、CERN)或开源;钱花在超算和 GPU 上

二代

口径 数字 可信度
"物理 AI 工程仿真"市场 $150 亿(2025) 不可信:把传统 CAE 加了 AI 功能的部分也算进去
多物理代理模型 AI $14 亿(2024) 口径较窄
AI 天气建模 $2–11 亿(2025) 各家相差 5 倍
AI 材料发现 $7–13 亿(2025) 含平台和服务
自下而上估算(本文判断) 纯二代产品收入约 $10–20 亿以内 创业公司收入不披露,估计每家数千万美元量级;大厂不单列

对照:2025–26 年流入二代公司的风险投资合计约 $15 亿以上(CuspAI $4.5 亿、PhysicsX 约 $4.5 亿、Tomorrow.io $2.1 亿、Genesis AI $1.05 亿、Neural Concept $1 亿、Luminary $0.72 亿、Orbital $0.5 亿……)。每年的融资额和整个细分的年收入差不多大,处在资本抢跑、收入没跟上的阶段。

C.4 sim2real 精度:一代 vs 二代

(L1 = 仿真对真实实验;L2 = AI 模型对它所学的模拟器)

领域 一代对真实(L1) 二代对一代(L2) 二代对真实
材料 DFT 形成能约 0.1–0.15 eV/原子;带隙 PBE MAE >1 eV(约 50%),HSE/mBJ 约 0.3 eV 约 20 meV/原子,稳定性 F1 >0.9 与 DFT 基本相同,继承 DFT 的误差
小分子量子化学 CCSD(T) 为金标准;常用泛函误差明显更大 取决于训练数据的计算级别 用高精度数据训练可接近化学精度
结合自由能 FEP 公开 1.73 kcal/mol,药企私有 2.44 kcal/mol BioEmu 对 MD <1 kcal/mol 与 MD 同量级
天气 业务数值预报为基线 GraphCast 在 >90% 指标上优于 HRES;GenCast 在 >96% 指标上优于 ENS 例外:二代优于一代(学的是融合了观测的再分析);但对观测站误差比对再分析高 15–45%
CFD 巡航无分离流时增量可用;分离流、非设计点散布大 分布内相对 L2 误差约几个百分点 两层误差叠加
粒子物理 Geant4 量能器平均能量响应与束流测试数据吻合到百分之几 生成模型在常用物理量上与 Geant4 吻合 接近 Geant4
机器人 纯物理仿真评测与真机相关性约 0.4 — 视频世界模型评测相关性 0.9+

规律:二代精度上限是一代,唯一例外是天气。要真正降低 sim2real 误差,必须改一代自己。

C.5 近几年降低一代 gap 的方法

主线两条:用 AI 修正物理近似;直接从观测和实验学。

  1. 用 AI 把更高级的理论变便宜。

    • Skala(微软,arXiv 2506.14665,v6 2026-04):深度学习拟合的交换关联泛函,成本保持半局域泛函水平,小分子原子化能达到化学精度,GMTKN55 误差 2.8 kcal/mol,超过主流杂化泛函。目前覆盖主族分子,过渡金属和周期性体系在后续计划中。MIT 开源。
    • DM21(DeepMind,Science 2021):在分数电荷体系上训练的神经网络泛函,修正电荷离域等系统误差(外界对其在分数电荷体系上的效果有质疑)。
    • 神经网络波函数:FermiNet、Psiformer,直接从第一性原理解多电子薛定谔方程。
    • 训练数据升级:OMol25 用 ωB97M-V/def2-TZVPD,明显高于材料界惯用的 PBE。
  2. 跳过模拟器,直接从观测学。

    • Aardvark Weather(Nature 2025):首个端到端纯数据驱动天气系统,从原始观测直接出预报,不依赖数值预报;观测量少一个数量级、算力少几个数量级,多个变量 RMSE 低于业务数值预报基线。
    • WeatherNext 3(2026-08):直接同化原始卫星观测。
    • DiffTRe(Nature Communications 2021):用实验观测量(热力学、结构、力学性质)直接训练神经网络势,而不只是对齐 DFT。
  3. 物理 + ML 混合,只替换最不准的那一块。

    • 湍流:ML 学 RANS 闭合项(张量基神经网络 TBNN 等);ML 训练的 LES 壁面模型已在真实飞机构型上与参考数据吻合。
    • 气候:NeuralGCM 保留物理动力内核,用学习模块替代云、对流等参数化。
    • 分子力场:MACE-OFF 等 ML 力场替代固定电荷经典力场。
  4. 校准与数字孪生。 机器人用系统辨识、域随机化、3D 高斯溅射 real-to-sim;粒子物理用束流测试数据调 Geant4 模型;天气和工程用数据同化持续注入观测。

  5. 更高分辨率和算力。 欧盟 Destination Earth 的气候数字孪生首次业务化生产 5–10 km 全球多年代际预估;极端天气孪生全球 4.4 km、欧洲区域 500–750 m;2026 年夏季进入持续运行阶段。

趋势:一代和二代的边界正在消失。 Skala 本质上还是 DFT 泛函(一代),却是 AI 训练出来的;NeuralGCM 是一代物理内核加二代学习模块。方向正从"AI 替代物理"转向"AI 修正物理,再用真实数据校准"。

6参考来源

虚拟细胞

蛋白/RNA/基因组

分子动力学 / 自由能

材料 / 化学

天气 / 流体 / 物理 / 宇宙学

聚变 / 神经科学 / 医学 / 机器人 / 数学

RL for Science 产业侧

附录 A:产业格局

附录 B:二代/三代市场

附录 C