挑战赛与验证板块首页
案例与体系设计
Adaptyv 蛋白结合剂题库与湿实验平台RNA 结构预测题库与自动化实验室体系设计
验证服务与模型能力
蛋白 binder 验证服务三家对比Absci & Claude Science 蛋白 Bin…湿实验与前沿模型的科研能力训练:谁真的把现实接进了训练回路
验证实验室的投入
Adaptyv 自建验证实验室:外购设备清单与总价估算晶泰科技 bio 侧实验设备投入:与 Adaptyv 对比RNA相关CRO/CDMO/设备商 与 清华对口实验室 名录

湿实验与前沿模型的科研能力训练:谁真的把现实接进了训练回路

整理 2026-09-20 · 来源与可靠度标注见正文
本文目录
  1. 0. 一页结论
  2. 1. 科研能力的训练配方:五层
  3. 2. 湿实验用在哪一环:三层
  4. 3. 为什么三大 lab 不把湿实验放进 RL:四个结构性原因
  5. 4. 实际使用的四种"湿实验替代品"
  6. 5. 判断与跟踪点
  7. 6. 数据口径与不确定性
  8. 7. 来源

日期:2026-09-20 范围:美国 frontier lab(OpenAI / Anthropic / Google DeepMind)训练"能做科研"的模型的实际配方;湿实验结果在其中处于哪个位置;以及"把物理实验当 RL 环境"这条路线的实际进展(Periodic Labs、Lila Sciences)。 关联:rubric 评测侧的调研见 (本文第 4 节的"替代真值"与之衔接)。 数据口径提示见文末。


0. 一页结论

  1. 三大 lab 都在用湿实验,但没有一家公开把湿实验结果当作 RL 奖励信号。 湿实验出现在两个位置:事后验证(发布会证据)、结果回流当训练数据(慢回路)。
  2. 真正把物理实验当 RL 环境的是从这些 lab 出走的人创的新公司:Periodic Labs(前 OpenAI 后训练负责人 Liam Fedus + 前 DeepMind GNoME 作者 Ekin Dogus Cubuk)、Lila Sciences。
  3. 原因是物理的,不是意愿问题:训练步 = 分钟级,湿实验 = 天到周级,差 3–5 个数量级;而一次 RL run 需要几十万次 rollout。再加成本、信号稀疏、credit assignment 不可解、以及"为窄域牺牲通用性"的取舍。
  4. 前沿模型实际用的是四种"湿实验替代品":形式化验证器(Lean)、计算仿真代理(DFT / MD / 对接)、已完成实验的回溯真值、rubric。湿实验本身的角色是最终背书与校准,不是梯度来源。
  5. Anthropic 的路线最值得跟踪,虽然不性感:自建湾区湿实验室 + 生物专业语料训练 + 资助外部湿实验验证(众包真值数据)。这是一个不依赖在线 RL 的慢回路,与其通用模型生意不冲突。
  6. Periodic Labs 是数据护城河赌注,不是模型能力赌注。 检验点唯一且清晰:什么时候报出第一个由 RL 闭环得到的新材料或超导结果。到 2026-09 还没有——9 月那篇技术文只讲训练与服务基建,明确没有报告新验证的材料或超导结果。
  7. 团队流向是最有信息量的信号:最懂"怎么训模型"和"怎么做材料发现"的两个人离开大 lab 自建实验室,说明他们判断这件事在通用 lab 体制内做不了。若湿实验 RL 真能成,最先成的大概率不是 OpenAI 或 Anthropic。

1. 科研能力的训练配方:五层

层 做法 证据 / 说明
1. 语料 科学专业语料进预训练 / 中训练 Anthropic 明确在"从结构生物学到临床监管申报文件"上训练 Claude
2. RLVR 在有机械判定器的科学子集上做 RL:形式化数学证明(Lean)、代码、单元测试、仿真可验证任务 RLVR 是 2026 配方地基;数学/代码能力的跨域迁移是主要收益来源
3. rubric RL 开放式科研产出无唯一答案 → rubric 当奖励 FrontierScience-Research 的 10 分制、ResearchRubrics、HealthBench 一路(详见 rubric 专篇)
4. agentic 长程 RL 工具使用(检索 / Scholar / 代码解释器)、多轮、长程;rollout 极长迫使训练与推理异步 Periodic 原话:"科学 rollout 可推理并执行工具一小时以上,而一个训练步只要几分钟",故训练与推理跑在分离 GPU 池上防空转
5. test-time scaling 推理时聚合 / 自演化,不做盲目重采样 UniScientist 的 Aggr@8;UniMath 的 pool_refine_tournament

量级参考:后训练算力已超过预训练(Cursor Composer 1.5 在 RL 后训练上的算力超过其基座预训练)。科研能力主要是后训练的产物。


2. 湿实验用在哪一环:三层

Tier 1:只做事后验证(最主流,三大 lab 都在这层)

OpenAI × Retro Biosciences —— GPT-4b micro(GPT-4o 的生物学特化版)

  • 设计两个改造版 Yamanaka 因子:RetroSOX、RetroKLF
  • 湿实验结果:多能性标记表达提升 50 倍以上;SOX2 的建议中超过 30% 优于野生型;iPSC 生成从常规 3 周压到 7 天;老年供体间充质干细胞中 85% 以上在 12 天内激活内源多能性基因
  • 后续在多供体、多细胞类型、多递送方式上复现,确认完整多能性与基因组稳定性
  • GPT-4b micro 为研究用途,未公开发布

Anthropic —— 2026-08 公布对 15 个靶点的 de novo 蛋白结合体设计,命中率 22–35%(行业常规 10–15%),湿实验验证由 Adaptyv Bio 与 Twist Bioscience 执行。

Google DeepMind —— AI co-scientist 进入真实实验室验证假设(AML 药物再定位、肝纤维化等方向)。

共同点:湿实验是发布会上的证据,不在训练回路里。

Tier 2:湿实验数据回流当训练数据(Anthropic 走得最远)

  • Anthropic 已在旧金山湾区自建湿生物实验室并招 bench 科学家,让 Claude 做真实实验。
  • 公开描述的回路:AI 计算生成假设与分子 → 人类科学家在 bench 上测试 → 结果回流改进模型。
  • 措辞要抓准:是"结果回流改进模型",不是"结果当奖励做 RL"。前者可以是 SFT、数据集、评测集,不需要在线梯度。
  • Life Sciences Verification Program:Anthropic 出最多 100 万美元 Claude 额度 + 额外资金资助湿实验验证,Modal 出 25 万美元算力,Twist 提供 DNA 合成。本质是众包湿实验真值数据,让外部实验室替它生产验证数据。
  • 战略表述:想把生命科学的整个 R&D 周期压缩一个数量级(10×)。

Tier 3:湿实验当 RL 环境(只有新公司在做)

Periodic Labs

  • 团队来历本身即论据:Liam Fedus(前 OpenAI 后训练负责人、ChatGPT 共同创造者)+ Ekin Dogus Cubuk(前 DeepMind 化学物理研究负责人、GNoME 论文作者),2025 年创立。
  • 模型 Neon:1 万亿参数 MoE;最终训练 run 峰值 1,300 张 Nvidia H200;集群利用率 95%+;训练吞吐比 Megatron 基线高 4.1×;推理从 10 提升到 25 tokens/s/请求;prefill-decode 解耦使 rollout 时长减半,Delta Router Replay 使解码提速 2.5×。
  • 明确把物理实验当 RL 环境,"现实提供反馈";被迫把模型训练、工具执行、实验室运营做成一个系统(不存在可外购的"湿实验 reward API")。
  • 融资:3 亿美元种子轮;2026-03 传以 70 亿美元估值融 5 亿美元。
  • 冷静事实:9 月那篇技术文只讲怎么训练与部署 Neon,没有报告任何新验证的材料或超导结果。闭环基建已建成,闭环产出未公布。

Lila Sciences

  • "AI Science Factories":生成假设 → 机器人执行 → 实时学习的闭环,横跨生物、化学、材料。
  • 2026-08 宣布其 RNA 发现引擎在单个自主研究回路内从超稳定 mRNA 推进到 CAR-T 应用。

其他同类光谱:Coscientist、CuspAI、A-Lab、FutureHouse Kosmos、Sakana AI Scientist(自主程度不一,多数仍是人类主导的加速器)。


3. 为什么三大 lab 不把湿实验放进 RL:四个结构性原因

  1. 时间尺度差 3–5 个数量级。 训练步几分钟,湿实验几天到几周;一次 RL run 需要几十万到上百万次 rollout。算术不成立。
  2. 样本效率与成本不匹配。 RL 是海量样本方法,湿实验一条几百到几万美元——用最贵的信号喂最饿的算法。
  3. 信号稀疏且带噪声,credit assignment 几乎无解。 实验失败可能源于假设错误,也可能是移液操作、试剂批次、细胞状态。模型该为哪一步担责无法归因。
  4. 通用模型 vs 垂直模型的取舍。 三大 lab 卖通用模型,湿实验信号只在极窄领域有效(某类蛋白、某类材料)。把窄域稀疏信号灌进通用模型性价比极差。Periodic / Lila 敢做,正因为它们放弃了通用性。

4. 实际使用的四种"湿实验替代品"

替代真值 例子 反馈速度 局限
形式化验证器 Lean(IMO-ProofBench、FrontierMath Erdős 的 68 个形式化问题) 秒级 只有数学有
计算 / 仿真代理 DFT、分子动力学、分子对接、量子化学计算;预训练代理模型用便宜信号预测昂贵测量值 分钟到小时 代理与现实存在系统性偏差
回溯真值(已完成但模型未见的实验) BenchBench-Protocol:Benchling 上 96 篇已发表协议、149 任务,发表版与科学家改动版的差异即真值 零成本 污染风险
rubric FrontierScience-Research 10 分制、ResearchRubrics、BiomniBench 六维过程级 秒级 奖励"说到了"不奖励"说对了"(见 rubric 专篇第 3 节)

结论:这四种都是湿实验的影子。湿实验本身的角色是最终背书与校准,不是梯度来源。这与 rubric 专篇的架构结论一致——真值层的用途是校准便宜的代理信号,而非直接驱动训练。


5. 判断与跟踪点

判断

  1. "用湿实验做 RL"目前基本不存在于通用前沿模型的训练中。 它以三种降级形态存在:事后验证(PR 价值最高)、回流当训练数据(Anthropic)、资助外部生产验证数据(Anthropic Verification Program)。说某个前沿模型"通过湿实验强化学习训练出来",目前没有公开证据支持。
  2. Periodic Labs 是数据护城河赌注。 论点是"互联网数据将尽,唯一的新数据来源是现实本身"。它赌的是自己造数据的闭环,不是模型架构优势。
  3. 团队流向的信息量大于任何官方表态。 两个最懂训练与材料发现的人离开大 lab 自建实验室 → 他们判断这件事在通用 lab 体制内做不了(要为窄域牺牲通用性,还要自己运营实验室)。
  4. Anthropic 的慢回路路线更符合物理现实:湿实验结果累积成数据集,下一代模型受益;不需要在线 RL,也不与通用模型生意冲突。这条路线被低估。
  5. 对评测的含义:带湿实验真值的科研 benchmark 必然小样本、慢、贵(BioLab Bench、BiomniBench 都在百题级)。其定位应是校准器而非排行榜——用小而真的真值集校准大而便宜的 rubric 集。

跟踪点

  • Periodic Labs 何时报出第一个由 RL 闭环(而非人类直觉 + AI 辅助)得到的新材料或超导结果。这是这条路线成立与否的唯一硬检验。
  • Periodic 5 亿美元 / 70 亿估值这轮是否落地、投资人构成。
  • Anthropic 自建湿实验室的产出是否进入下一代 Claude 的训练数据,以及是否公开披露口径。
  • Anthropic Verification Program 资助的外部湿实验数据归属与使用权条款(这决定了它是不是在低成本收购真值数据)。
  • 是否出现"湿实验 reward 中间层"的第三方服务(把实验室封装成可调用的 reward API)——若出现,Tier 3 的门槛会骤降。
  • Lila 的 RNA 引擎闭环成果是否有同行评议或第三方复现。

6. 数据口径与不确定性

  • 全部内容基于 2026-09-20 的公开检索与部分页面抓取;多数论文与技术博客只读了摘要或检索摘要,未逐篇通读。
  • Anthropic "结果回流改进模型"来自第三方报道对其做法的描述,Anthropic 未公开说明该回流是 SFT、数据集还是 RL;本文据措辞判定为非 RL,属推断,未经其确认。
  • Periodic Labs 的 GPU / 吞吐 / 模型规模数字来自对其 9 月技术文的二手报道,未核对原文。
  • "三大 lab 没有一家把湿实验当 RL 奖励"是基于公开信息的判断,不排除未公开的内部做法。
  • Retro Biosciences 的 50× 等数字为 OpenAI / Retro 自报口径,未见独立复现报告(其自述已在多供体多细胞类型复现)。
  • Periodic 70 亿美元估值、5 亿美元融资为传闻口径(2026-03 报道),未确认交割。
  • Lila Sciences 的 RNA 引擎成果为公司公告口径。

7. 来源

OpenAI

Anthropic

Periodic Labs / Lila / 自主实验室

训练配方侧

本文为个人研究笔记,结论基于成文时可获得的公开信息;带〔估算〕〔推断〕或⚠️的数字未经独立核实。