从靶点发现到 binder 构想:仿真工具链与 sim2real 准确性
日期:2026-09-23|复用 (FEP、binder 命中率、BioEmu、虚拟细胞数据来自该报告)+ 本次补检|⚠️ 为未在本次回源的行业常识
0. 结论
- 越往上游,越不可仿真。 结构预测 > 结合姿态 > 亲和力 > 细胞功能 > 病人疗效,sim2real gap 逐级放大。真正决定 Phase II 成败的靶点生物学,恰恰是仿真最弱的环节:虚拟细胞模型 2025 年仍未稳定打败"取平均"的朴素基线。
- 计算在今天的真实角色是"富集过滤器",不是实验的替代品。 它把候选从千万到亿级筛到几百个再去做实验,价值体现为命中率倍数:传统高通量筛选(HTS)命中率通常低于 1% ⚠️;超大库对接的实测命中率可达 11–24%;AI 蛋白 binder 设计为 9–88%。
- 公开基准和真实项目之间普遍打折。 FEP 的误差从公开集 1.73 kcal/mol 放大到药企私有集 2.44 kcal/mol(折合 Kd 从约 18 倍放大到约 60 倍);AlphaFold3 的配体姿态成功率从训练期内的 74.5% 掉到训练后新数据上的 55.8%。
1. 按研发阶段的工具链
| 阶段 | 做什么 | 主流工具(商业 / 开源 / 中国) | 仿真性质 |
|---|---|---|---|
| ① 靶点发现 | 找疾病相关基因和通路 | 遗传学统计(GWAS、孟德尔随机化)、Open Targets、知识图谱、组学分析;虚拟细胞模型(Arc State、Xaira) | 不是物理仿真,是数据驱动的统计和模型 |
| ② 靶点结构 | 得到蛋白三维结构 | AlphaFold2/3、RoseTTAFold、Boltz、Chai;中国:百度 HelixFold3、字节 Protenix ⚠️;金标准仍是冷冻电镜和 X 射线晶体学 | 二代(AI 从结构库学习) |
| ③ 口袋与动态 | 找可结合的口袋和隐藏构象 | 分子动力学:GROMACS、AMBER、OpenMM、Desmond;BioEmu;口袋识别:fpocket、SiteMap ⚠️ | 一代物理 + 二代 AI |
| ④ 苗头发现(小分子) | 从巨型虚拟库筛分子 | 对接:Glide、GOLD、AutoDock Vina、DOCK;中国:深势 Uni-Dock(GPU)⚠️;库:Enamine REAL 等可按需合成库 | 一代近似打分 |
| ④' binder 设计(蛋白/抗体) | 从头设计结合蛋白或抗体 | RFdiffusion、ProteinMPNN、BindCraft、AlphaProteo、Chai-2;Rosetta | 二代生成模型 |
| ⑤ 亲和力排序与先导优化 | 比较哪个分子结合更强 | FEP+(Schrödinger)、OpenFE;Boltz-2(AI 亲和力) | 一代物理精算 + 二代加速 |
| ⑥ ADMET / PK | 吸收、代谢、毒性、人体药代 | ADMETlab、SwissADME ⚠️;PBPK:Simcyp(Certara)、GastroPlus(Simulations Plus)⚠️ | 统计模型 + 生理模型 |
谁在用:
- 大药企:Schrödinger 全家桶(Maestro/Glide/FEP+/Desmond)、MOE、OpenEye(已被 Cadence 收购),加自建 AI。
- 中国 biotech:多数买 Schrödinger 或 MOE 许可,或者依赖 CRO(药明等)的计算化学(CADD)团队。
- 高校:以开源为主(GROMACS、Vina、Rosetta、AlphaFold/Boltz、RDKit)。
- 商业规模很小:Schrödinger 2025 年软件收入约 2 亿美元,公司仍亏损。
2. 各阶段 sim2real 准确性
| 阶段 | 指标 | 数字 | gap |
|---|---|---|---|
| ① 靶点/虚拟细胞 | 扰动响应预测 vs 实测 | 2025 年仍未稳定打败"取平均"基线(Arc State 自称比已有模型好 50%,但对照的是其他模型) | 最大 |
| ② 结构预测 | 蛋白–配体姿态 RMSD < 2Å | AlphaFold3:PoseBusters 76%;训练期内 74.5% → 训练后 55.8%;偏向主导构象,隐藏口袋弱 | 中 |
| ③ 动态 | BioEmu vs 毫秒级 MD | 相对自由能误差 < 1 kcal/mol,快 4–5 个数量级(这是 AI 对模拟器的比较,不是对实验) | L2 小,L1 未知 |
| ④ 对接 | 姿态 / 亲和力 / 命中率 | 姿态正确率 60–80%;打分与实测亲和力相关性弱;但 Lyu 2019 超大库对接:D4 受体测 549 个,发现 81 个新骨架活性分子(命中率约 24%),AmpC 测 44 个(约 11%);排名最靠前的往往是假阳性 | 大,但富集有效 |
| ④' binder 设计 | 湿实验命中率 | RFdiffusion 约 19%;AlphaProteo 9–88%;BindCraft 平均 46%;Chai-2 从头设计抗体:每条设计 16% 命中,52 个无已知抗体的靶点中 50% 一轮就找到结合物,全程不到 2 周;生产环境未过滤的输出命中率远低于论文 | 中(持续缩小) |
| ⑤ 亲和力 | 误差 | FEP:公开 1.73 kcal/mol(Kd 约 18 倍)vs 私有 2.44(约 60 倍);Boltz-2 在 FEP 基准上 Pearson 0.62,与 OpenFE 相当,快 1000 倍以上,CASP16 亲和力赛道第一 | 大 |
| ⑥ PBPK | 人体药代预测 | 药物相互作用等场景已被监管机构接受作为申报依据 ⚠️ | 小(有大量人体数据校准) |
3. 三个判断
- 仿真最准的地方,是有海量真值数据的地方:结构有 PDB,PBPK 有几十年人体药代数据。最不准的是靶点和细胞功能,因为缺少大规模扰动的真值数据。所以 Perturb-seq 等大规模扰动数据生产是整条链最稀缺的资产,也就是"验证即服务"里的训练数据生产。
- 计算改变的是实验的经济学,而不是取代实验:命中率从低于 1% 提到 10–50%,意味着合成和测试的分子数下降一到两个数量级。受益者是能快速做"设计 → 合成 → 测量"闭环的一方,比如 CRO 和自驱实验室。
- 大模型本身不是仿真器,而是这些工具的编排者:智能体调用 AlphaFold、对接、FEP、ADMET 工具,其准确性上限由工具和湿实验决定。注意:大模型最常被用来"提假设"的靶点环节,恰好是 sim2real 最差的环节,所以是双重不确定。
Sources
- Lyu et al. 2019 Nature:超大库对接
- 对接打分与亲和力相关性(JCIM 2026)
- 打分函数综述
- Boltz-2
- Boltz-2(Recursion 发布)
- Chai-2
- AlphaFold3
- AF3 泛化问题
- cofolding 泛化(NSMB)
- AlphaProteo
- BindCraft(Nature 2025)
- 其余(FEP 1.73/2.44、BioEmu、虚拟细胞、Schrödinger 财务、binder 生产环境打折)见 09-21 仿真全景报告的来源列表
本文为个人研究笔记,结论基于成文时可获得的公开信息;带〔估算〕〔推断〕或⚠️的数字未经独立核实。