大模型在中国医药研发链条中的应用机会:成本替代 vs 能力创造
本文目录
日期:2026-09-23|综合本目录 09-22/23 全部调研(研发费用结构、研发人员、仪器采购、校企医关系)+ "创造型 vs 替代型"框架()|外部案例均已联网核实;⚠️ 为本文估算
0. 结论先行
- 钱在哪里,替代的天花板就在哪里。 中国医药研发每年约 2200 亿元:临床和外包约 45–55%,人员约 25–30%,材料试剂约 8–15%。大模型能直接触达的是"文档、数据、协调"这部分劳动,不是病人、动物、试剂和机器本身。估算可替代的劳动池约 300–500 亿元/年 ⚠️,但真正能被供应商收走的只是一小部分,因为模型层已被开源模型压成商品价格,药企倾向于自建。
- 替代型机会里,最确定的是注册申报和医学写作,其次是临床运营中的文书与数据工作。 这类工作输出可以逐项对回源数据,验证便宜。例证:诺和诺德的临床研究报告从 10 周以上缩短到 10 分钟,FDA 的内部审评工具把 2–3 天的工作压缩到约 6 分钟。
- 创造型机会的价值量级大一个数量级,但瓶颈在验证。 一项首创药(FIC)资产的对外授权首付款就可能达到 10 亿美元以上(三生 × 辉瑞 12.5 亿美元),超过整个行业一年的文书替代价值。大模型在"提出假设"上已经有实证(Robin 用 2.5 个月发现 ripasudil 用于干性 AMD;Google Co-Scientist 推荐的 vorinostat 在肝纤维化类器官中使相关染色质改变降低 91%),但每一个假设都要湿实验和临床去验证。
- 中国的独特位置:替代红利小,验证红利大。 中国研发人力便宜(恒瑞研发人均约 41 万元),同样的替代省下的钱比美国少;而且大模型正在抹平中国"工程师红利"中文书和执行的那一半。但中国拥有全球最快的临床入组、最大的 CRO 湿实验产能,以及 390 多家已在院内部署大模型的三甲医院。最适合中国的定位是做"AI 假设的验证工厂",而不是比拼谁的模型更会写文档。
- 校、企、医之间最薄弱的"转化层",恰好是大模型最能补位的地方。 高校资产池"大而稀"、信噪比接近零,以前没有人能把几万份专利和结题报告全部读一遍;医院数据出不了院,但院内部署的模型可以把非结构化病历变成可研究的数据。这两件事今天基本没人在做,属于创造型。
1. 先算账:钱和人在哪里
| 环节 | 中国年支出量级 | 构成(来自本目录报告) | 大模型可触达部分 | 类型 |
|---|---|---|---|---|
| 临床试验和外包 | 约 1000–1200 亿元 | 君实"临床研究及技术服务费"占研发 62%;恒瑞"设计试验费"占 30% | 医学写作、数据管理、监查报告、药物警戒、患者预筛 ⚠️约 15–25% | 替代为主 |
| 研发人员 | 约 550–650 亿元 | 恒瑞 5,684 人、人均约 41 万元;君实 640 人、人均 56 万元;60% 硕士以上,主体 30–40 岁 | 文献、数据分析、写作、编程 ⚠️约 20–30% 工时 | 替代 + 能力放大 |
| 材料、试剂、动物 | 约 180–330 亿元 | 恒瑞"直接投入"占 17% | 减少失败实验和重复实验 | 间接 |
| 仪器设备 | 高端进口占 80–90% | 企业买方约 55–70%,高校 25–35% | 方法开发、数据解析、机器人编排 | 能力 |
| 对外授权(产出端) | 2025 年 1357 亿美元,首付款约 70 亿美元 | 同质化扎堆,首创药少(2025 年 76 个获批药中新靶点仅 11 个) | 靶点和假设生成、资产筛选、竞争情报 | 创造 |
要点:替代型的天花板等于被替代劳动的工资总额,而中国的研发工资只有美国同类岗位的几分之一,所以同样的效率提升在中国值的钱更少。创造型的价值按产出定价:多一个首创药资产,就可能多一笔 10 亿美元级的首付款。
2. 成本替代:替人把已经在做的事做得更便宜更快
按"验证成本从低到高"排序。验证越便宜,大模型推进越快。
2.1 注册申报与医学写作 ★★★★★
- 场景:临床研究报告(CSR)、研究者手册、IND/NDA 的 CTD 模块、CDE 发补回复、中美双报的中英互译、说明书比对。
- 例证:
- 诺和诺德的 NovoScribe(Claude + 专家审定文本库 + 病例变量),临床文档编写从 10 周以上缩短到 10 分钟,器械验证方案所需资源下降 95%,目标是自动生成完整的 CTD。
- FDA 2025 年 6 月全局上线审评工具 Elsa,用于方案审评、不良事件汇总、标签比对,原本 2–3 天的工作约 6 分钟完成。审评方一旦用了 AI,申报方不用就会在节奏上落后。
- 复星医药 PharmAID 已上线 AI 翻译和医学写作功能。
- 中国特殊性:出海交易爆发后,大量 biotech 要同时应对 CDE、FDA、EMA,还要准备买方尽调的数据包,而懂英文注册写作的人才稀缺且贵。这是中国 biotech 最直接的痛点。
- 为什么验证便宜:每个数字都能对回统计表(TLF),每句话都能对回方案,可以做成确定性核查。
- 价值归属:药企自建或 CRO 内部化。恒瑞把大模型使用情况纳入干部考核,说明大药企走自建路线;独立 SaaS 在中国的定价空间有限。
2.2 临床运营中的文书与数据 ★★★★
- 场景:
- 患者预筛:从电子病历里判断是否符合入排标准
- 源数据核查(SDV)、EDC 录入、数据质疑(query)
- 监查访视报告
- 研究中心可行性评估
- 例证:NIH 的 TrialGPT 在患者与试验的匹配上准确率 87.3%,接近专家水平;在用户研究中,招募筛选时间减少 42.6%(Nature Communications 2024)。
- 中国特殊性:瓶颈在医院的临床试验机构(GCP 机构)和主要研究者(PI)身上,头部医院的 PI 接不过来,研究协调员(CRC)人手紧张。必须在院内部署:患者数据受人类遗传资源和数据出境规定约束,不能出医院。已有 390 多家三甲医院自主部署了 DeepSeek,这条路已经铺好了。
- 边界:临床成本的大头是给研究中心和受试者的费用,以及医疗检查本身,大模型碰不到。能替代的只是其中的行政和数据部分。
2.3 药物警戒(PV) ★★★★
- 个例报告录入、医学编码(MedDRA)、文献监测、定期安全性报告(PSUR/PBRER)撰写。这类工作量随上市产品增加而线性增长,高度模板化,可对照原始报告验证。FDA Elsa 也把不良事件汇总列为用途之一。
- 对 CRO 的冲击:PV 和数据管理是 CRO 按人头计费(FTE)的劳动力套利业务,最先被压价。
2.4 研发人员的日常知识工作 ★★★
- 文献综述、专利检索、实验方案(SOP)起草、电子实验记录本(ELN)整理、统计和生信代码(SAS 转 R、单细胞分析流程)。
- 代码类任务的验证最便宜(跑一下就知道对不对),是个人层面见效最快的一类。
- 中国的特殊性: 恒瑞 5,684 名研发人员中约 88% 在 40 岁以下,是最容易接受新工具的群体;但人均成本低,所以替代算账比美国弱,更多体现为"同样的人做更多项目"。恒瑞自称 AI 让靶点发现周期缩短约 15%,但这个数字没有第三方核实。
2.5 高校技术转移办公室(TTO)文书 ★★★
- 专利撰写与权利要求的布局、可授权性初评、许可合同起草。
- 针对的是今天调研发现的症状:"专利为结题而写,缺乏可授权性"。大模型可以让一个不懂药物化学的 TTO 员工写出覆盖面更完整的权利要求,但最终还要专利代理人把关。
替代型小结
| 场景 | 验证成本 | 中国可替代规模 ⚠️ | 谁拿走价值 |
|---|---|---|---|
| 注册/医学写作 | 低 | 数十亿元 | 药企自建、CRO |
| 临床数据/预筛 | 中 | 百亿元级(含 CRC、SDV、数据管理) | 医院院内平台、SMO、CRO |
| 药物警戒 | 低 | 十亿元级 | CRO、药企 |
| 研发知识工作 | 低(代码)到中(综述) | 百亿元级工时 | 基本被药企自己吸收 |
| TTO 文书 | 中 | 小 | 高校、专利代理机构 |
替代型的共同宿命:模型层是开源和国产模型,壁垒不在模型。应用层除非握有独占数据(如院内病历)或者嵌入受监管的流程(GxP 验证、审计轨迹),否则会被压到接近成本价。
3. 能力创造:做人之前做不了、做不好的事
3.1 跨领域的靶点与假设生成:直击"新靶点多来自海外文献"
- 问题:"十五五"目标是 2030 年首创药占全球 25%,但 2025 年 76 个获批药中新靶点只有 11 个。中国的原创短板在"源头"。
- 大模型做到了什么:
- FutureHouse 的 Robin 多智能体系统:文献检索智能体提出"增强视网膜色素上皮吞噬"这一假设,筛选出青光眼药 ripasudil,吞噬作用比对照高 7.5 倍。全部假设、实验选择、数据分析都由 AI 完成,人只负责动手做实验,从构思到投稿 2.5 个月(Nature 2026 发表)。
- Google Co-Scientist 为肝纤维化推荐的 3 个表观遗传药物中 2 个有显著抗纤维化作用;其中已获批的抗癌药 vorinostat 使 TGFβ 诱导的染色质改变降低 91%(Advanced Science)。
- 斯坦福 Virtual Lab:一个 AI"PI"带领化学家、计算机科学家、批评者等智能体,设计了 92 个新纳米抗体,其中 2 个对 JN.1/KP.3 变异株的结合优于原有抗体(Nature 2025)。
- 为什么是创造型:没有人能同时通读几十万篇论文和几个组学数据库,再做跨学科联想。这不是"更快做同一件事",而是以前根本没人做。
- 瓶颈:假设生成变便宜了,验证没有。英矽智能的 rentosertib(AI 发现的靶点和分子)Phase IIa 只有 71 人,主要终点是安全性;60mg 组 FVC 改善 +98.4 mL,安慰剂组为 -20.3 mL,现已进入 III 期。AI 分子的临床成功率还没被证明优于传统方法。
3.2 让高校资产池变得"可搜索"
- 问题:结论是高校生物医药资产池每年约 20–40 亿元,"大而稀",定价无效是因为信噪比接近零,不是因为存在可以套利的错误定价。
- 大模型改变了什么:信噪比低的池子之所以没人碰,是因为筛选成本高于期望收益。大模型把"读一份专利或结题报告并判断可开发性"的成本降低了两到三个数量级,让以前不值得搜的池子第一次值得搜。
- 具体做法:把全国高校和院所的生物医药专利、NSFC 结题报告、硕博论文、会议摘要全部读一遍,按以下维度打分,再交给人类专家做二次筛选:
- 靶点新颖性
- 化合物是否可成药
- 权利要求的覆盖范围
- 海外是否已有同靶点管线
- 课题组是否仍在推进
- 对应缺失的一层:美国有"NIH 资助 → VC 支持的 biotech 转化层";中国缺少这层专业转化机构,TTO 也不专业。一个由大模型驱动的"资产发现 + 转化评估"层,今天基本没人在做。
- 注意:这不改变"大部分资产不值钱"的事实,只是把找到少数值钱资产的成本降下来。验证仍需实验,所以最好和概念验证基金、CRO 捆绑。
3.3 医院的非结构化数据:让"校院分离"下的数据变得可研究
- 问题:医院握有病人、样本和病历,但数据不愿意也不能交给大学的实验室;医生科学家稀缺,临床太忙,做不了研究。
- 大模型改变了什么:
- 院内部署的模型把自由文本病历、病理报告、影像报告结构化。以前人工翻病历,一个研究最多翻几百份,现在可以覆盖十万级病例。
- 用真实患者分布去模拟入排标准,发现哪些排除条件可以放宽而不影响安全性,从而扩大可入组人群。
- 帮繁忙的临床医生把临床观察变成可执行的研究者发起研究(IIT)方案。这正是华西、瑞金这类研究型医院的转化来源。
- 为什么是创造型:数据一直在那里,但人工成本让它无法被大规模研究;而且数据不出院,模型进院,这条路径同时绕开了数据合规和"校院分离"的障碍。
- 价值归属:握有数据和部署权的医院及其合作方(应用层壁垒 = 独占数据 + 牌照)。
3.4 自驱实验室(SDL):大模型做"大脑",机器人做"手"
- 例证:晶泰科技的智能自主实验平台号称人效提升 5 倍、数据采集能力提升 40 倍,已与礼来签署最高 2.5 亿美元的药物发现合作,并向罗氏、JW 制药交付自动化系统。
- 大模型在这里的角色:把科学家的意图翻译成实验方案,再翻译成机器人指令;读仪器数据;决定下一轮实验。它是编排者,不是化学家本身。
- 和仪器调研的交叉:
- 高端仪器进口占比 80–90%,美国 2025 年起限制高参数流式和蛋白组学质谱对华出口。
- 假设(⚠️ 待验证):国产仪器厂商在硬件精度上短期追不上,但可以在"对智能体友好"上领先,即开放 API、提供机器可读的数据格式、支持远程和自动化调度。在 SDL 时代,这可能是国产替代的一个新切入点。
- 高校大型仪器利用率偏低(科技部每年考核"开放共享")。智能体预约、远程操作、代测服务可以提高利用率,这更偏替代型。
3.5 小型 biotech 的全球化能力
- 问题:对外授权首付款仅占总额约 5.8%,部分原因是买方议价力强、信息不对称。中腰部 biotech 缺少全球 BD、注册、竞争情报团队。
- 大模型改变了什么:一个 20 人的 biotech 可以做出以前只有百人团队才能做的全球竞品格局分析、FDA 级别的数据包和对标交易分析。这是能力下沉:它提升了弱势方的上限,但不改变资产本身的质量。
- ⚠️ 这一条对首付款比例能有多大影响,没有证据支撑,只能算方向性判断。
4. 按主体划分:企业、高校、医院各自最该用在哪里
| 主体 | 替代型首选 | 创造型首选 | 关键约束 |
|---|---|---|---|
| 仿转创大药企(恒瑞、石药、中生) | 注册写作、药物警戒、研发知识工作 | 靶点假设生成 + 自有湿实验闭环 | 人力便宜,替代算账弱;自建为主 |
| Biotech(君实、科伦博泰) | 临床文书、数据管理(外包费占 60%,压价空间最大) | 全球 BD 和注册能力下沉 | 现金紧张,要按效果付费 |
| CRO/CDMO(药明系、泰格) | 被替代方:医学写作、数据管理、PV 的 FTE 模式受冲击 | 转型为"AI 假设验证工厂"(湿实验 + SDL) | 按人头计费的商业模式要重写 |
| 高校和院所 | 价值低:研究生劳动力便宜 | 跨学科假设生成、存量资产筛选、TTO 专业化 | 激励错位:考核看论文,不看转化 |
| 研究型医院 | CRC/SDV/病历质控(已部署 390+ 家) | 病历结构化 → 真实世界研究、IIT、入排标准优化 | 数据合规,只能院内部署 |
一个反直觉的结论:高校的替代价值最低,因为研究生便宜;但它的创造价值最高,因为它是新靶点的源头。医院恰好相反,替代价值最先落地(已经大规模部署),创造价值潜力大但需要跨越数据治理门槛。
5. 用"两问筛选"给每个场景打分
| 场景 | ① 今天有人在做吗? | ② 壁垒在哪一层? | 验证成本 | 判断 |
|---|---|---|---|---|
| 注册/医学写作 | 有(写作人员、CRO) | 模型层 → 穿透折扣;例外是嵌入 GxP 流程 | 低 | 替代型,确定性高但利润薄 |
| 临床数据和预筛 | 有(CRC、CRA) | 应用层:院内数据 + 医院关系 | 中 | 替代型,有数据壁垒 |
| 药物警戒 | 有(PV 外包) | 模型层 | 低 | 替代型,压价最快 |
| 跨领域靶点生成 | 几乎没有(没有人读得完) | 模型层 + 验证能力 | 高(湿实验 + 临床) | 创造型,价值归验证端 |
| 高校资产筛选 | 没有(筛选成本太高没人做) | 应用层:数据整合 + 验证基金 | 中高 | 创造型,缺失的转化层 |
| 病历结构化 → 研究 | 部分(人工翻病历,规模小) | 应用层:独占数据 + 牌照 | 中 | 创造型,数据飞轮 |
| 自驱实验室编排 | 少量(晶泰等) | 应用层:物理闭环 | 实验本身即验证 | 创造型,物理壁垒最强 |
贯穿全局的规律:生成越便宜,价值越向验证端迁移。在医药领域,验证端是湿实验产能、类器官和动物模型、临床试验机构、患者数据。这些都是物理的、受监管的、中国相对有优势的资源。
6. 风险和陷阱
- 幻觉在受监管文档里是事故,不是瑕疵:GxP 和数据完整性要求每句话可溯源。能落地的产品本质上是"生成 + 确定性核查 + 审计轨迹",其中核查层才是核心。
- 数据合规:人类遗传资源管理和数据出境规定意味着境外模型碰不到中国患者数据,国产开源模型院内部署是默认路径,模型层难以收费。
- AI 发现药物的临床成功率尚未证明更高:rentosertib 进入 III 期是里程碑,但 III 期结果出来之前,"AI 找靶点"的叙事仍是期权,不是现金流。
- 高校激励不变,工具就用不起来:考核看论文和帽子,没人有动力用大模型去筛选可转化资产。需要转化基金或药企买单。
- 替代收益被价格战吃掉:中国药企付费意愿低,恒瑞走自建路线。独立的文书类 SaaS 很难在中国做大,出海服务中国 biotech 的全球申报可能是例外。
7. 对投资和创业的含义
- 避开:纯粹"模型套壳"的医学写作和问答工具,模型层在穿透式降价。
- 关注:
- "院内部署 + 数据结构化"平台:握有医院关系和数据治理能力,是真实世界研究和 IIT 的入口。
- "资产发现 + 验证基金"的转化层:大模型负责筛选高校存量资产,基金加 CRO 做概念验证。补的是中国最缺的一环。
- 自驱实验室和对智能体友好的仪器:物理闭环是最硬的壁垒,也可能是国产仪器换道的机会。
- CRO 转型:从按人头计费转向"AI 假设验证即服务",谁先转,谁就能吃到验证端的价值。
Sources
- Anthropic:Novo Nordisk 案例
- MongoDB:Novo Nordisk 临床研究报告分钟级生成
- FDA Elsa(R&D World)
- FDA Elsa(McDermott)
- Robin(Nature 2026)
- Robin(FutureHouse)
- Google Co-Scientist 肝纤维化(Advanced Science)
- DeepMind:Co-Scientist 肝纤维化
- Virtual Lab 纳米抗体(Nature 2025)
- TrialGPT(Nature Communications)
- Rentosertib Phase IIa(Nature Medicine)
- Insilico:rentosertib 启动 III 期
- 澎湃:恒瑞要求 DeepSeek 全面落地并纳入考核
- DeepSeek 与恒瑞全链条智能化
- 710+ 医院 DeepSeek 部署图谱
- DeepSeek 已植入 90 家大三甲
- 晶泰科技 × 礼来合作
- 晶泰科技智能自主实验平台
- 科技部:大型科研仪器开放共享评价考核结果
附:追问(2026-09-23)
A. 靶点假设现在是怎么做的、花多少
两条路径
- Fast-follow(中国主流):选靶点其实是做情报。由药物情报、BD、转化医学团队和立项委员会,根据海外已有临床验证的靶点、会议摘要、专利和竞品管线(数据来自医药魔方、Citeline、Cortellis)做立项判断。几个人花几周到几个月,钱不多;真正的代价是扎堆。
- 首创新靶点(FIC):分"发现"和"验证"两步。
- 发现:文献、人类遗传学(GWAS、孟德尔随机化)、医院样本的多组学和单细胞、CRISPR 功能筛选、表型筛选。
- 验证:多个细胞系敲除或敲低 + 回补、敲除小鼠和疾病模型、工具化合物、患者组织表达、生物标志物、成药性评估。
- 国内零件价格:全身敲除(KO)小鼠约 1 万元起,条件性敲除(CKO)约 2 万元起,最快 7 周交付(赛业、集萃药康)。零件已经工业化,贵的是"判断做哪些实验、怎么解读"的科学家时间。
- 一个新靶点的完整验证包 ⚠️估算:1–3 年、3–10 名科学家、500 万–3000 万元。学术界的版本通常是一个或几个博士课题,周期更长。
账本(Paul et al. 2010,13 家大药企基准)
- 靶点到苗头化合物阶段:每个项目约 100 万美元、12 个月,成功率 80%。每上市一个药要启动约 24 个这样的项目,合计约 2400 万美元,只占每个上市药自付研发成本(8.73 亿美元)的约 2.7%。
- 但选错靶点的代价在下游:阿斯利康 2005–2010 年 142 个项目中,Phase II 失败的项目有 65% 是因为无效,很多是对靶点理解不足;Phase II 阶段每个上市药摊到约 1.85 亿美元。
- 有人类遗传学证据支持的靶点,获批概率是没有的 2.6 倍(Minikel et al., Nature 2024)。
- 用同一模型算:Phase II 成功率从 34% 提到 45%,每个上市药的自付成本从 8.73 亿美元降到 7.28 亿美元(-17%)。AI 在靶点环节的价值不在于省掉那 2.7% 的人力,而在于提高下游成功率。这是创造型。
B. "AI 假设验证即服务"是什么
定义:客户(或 CRO 自己)的 AI 能以很低的成本生成大量假设,包括靶点–疾病关联、老药新用候选、分子设计。CRO 提供标准化、可通过接口下单、快速返回结构化数据的湿实验闭环,把结果喂回 AI 继续迭代。
| 维度 | 传统 CRO | 验证即服务 |
|---|---|---|
| 下单单位 | 按人头(FTE)或按项目 | 按假设、按数据点、按迭代轮次 |
| 实验设计 | 客户科学家设计 | AI + CRO 联合,自动生成方案 |
| 周期 | 数周到数月 | 数天到 1–2 周一轮 |
| 交付物 | PDF 报告 | 结构化数据 + 元数据 + 质控,包括负结果 |
| 客户 | 药企研发部门 | 药企 + AI 药物发现公司 + 大模型公司(买训练数据) |
产品菜单举例
- 靶点验证包:AI 给出的靶点清单 × 相关细胞或类器官 CRISPR 敲除 + 表型读数 + 现货敲除小鼠,4–8 周内给出做或不做的结论。
- 老药新用筛选:AI 候选药物清单 → 患者来源类器官或共培养体系(类似 Co-Scientist 的肝类器官实验)。
- 分子设计闭环:AI 设计的分子 → 合成 + ADME/活性测试 → 1–2 周一轮。例:Ginkgo Datapoints 与 Inductive Bio、Tangible Scientific 的 lab-in-the-loop 合作(2025.8),以及 ADME-One(2026.5)。
- 训练数据生产:出售包含负样本的标准化数据集。Ginkgo Datapoints 自我定位就是"Bio × AI 数据供应商"。
为什么适合中国 CRO
- 湿实验产能全球最便宜;模式动物库巨大(赛业 6800+ 敲除品系,药康近 3 万个品系);能对接医院样本;速度快。
- 按人头计费的文书类业务(医学写作、数据管理、药物警戒)正在被大模型吃掉,需要新的增长点。
- 核心经济性:卖验证不承担假设风险。 无论 AI 的假设成功与否,验证费都照收,是"卖铲子"的位置,对应"价值向验证端迁移"。
要解决的问题:数据权属和知识产权归属、实验标准化和可复现性、接口化改造(今天 CRO 的下单流程靠邮件和合同),以及 BIOSECURE 对美国客户的限制。
来源:
- Paul et al. 2010, NRDD(成功率和周期来自 Knowledge Portal 转录;各阶段成本为原文表格数值,按其成功率复算后与原文总额 8.73 亿美元一致)
- Cook et al. 2014 AZ 5R
- Minikel 2024 Nature
- 赛业敲除小鼠价格
- Ginkgo lab-in-the-loop
- ADME-One
C. 追问:AI 在靶点预测和结构设计上是否已超过人(证据分级)
一句话结论:在能快速验证的窄任务上,AI 已经超过人;在真正决定价值的"选对靶点、提高 Phase II 疗效成功率"这件事上,目前没有证据表明 AI 超过人。
| 层级 | 任务 | 证据 | 注意事项 |
|---|---|---|---|
| 已超人 | 蛋白–配体结合姿态 | AlphaFold3 在 PoseBusters 上成功率 76%,远超经典对接工具 Vina | 训练集外的新数据上从 74.5% 降到 55.8%;新口袋、罕见结合模式泛化差 |
| 已超人 | 从头设计蛋白结合剂 | AlphaProteo 实验成功率 9–88%,是次优方法的 5–700 倍;首个计算设计出的 VEGF-A 结合剂 | 这类任务传统上靠免疫和筛选,人工理性设计几乎做不到 |
| 已超人 | 化学知识与推理 | ChemBench(Nature Chemistry 2025):最好的模型平均得分超过最好的人类化学家 | 基础题会犯错,而且过度自信 |
| 部分超人 | 预测实验结果 | BrainBench(Nature Human Behaviour 2024):大模型 81% vs 神经科学专家 63% | 回顾性测试,存在训练数据泄漏的可能 |
| 部分超人 | 生成研究想法 | Si et al.:100+ 位研究者盲评,大模型的想法新颖性显著高于人类专家 | 后续研究发现执行后大模型想法的得分下降更多,人类想法反超(ideation–execution gap) |
| 部分超人 | 预测 Phase II→III | Insilico inClinico:准前瞻 AUC 0.88,前瞻 79% 准确率 | 公司自报,样本有限 |
| 部分超人 | 靶点–疾病排序 | OTRec 时间外推 AUC 0.872 vs Open Targets 0.559(预印本);RareGPS 排名前 1% 的靶点从 I 期走到 IV 期的概率是中位组的 8 倍 | 有独立评测认为复杂算法只比简单启发式略好,有争议 |
| 未证明 | Phase II 疗效成功率 | Jayatunga 2024:AI 发现的分子 Phase I 成功率 80–90%(历史 40–65%),Phase II 约 40%,与历史持平;6,147 个在研药中 AI 发现的靶点只有 24 个 | AI 优化的是可计算的性质(ADMET、安全性),还不能预测病人身上的疗效 |
| 个案成功 | 老药新用 | BenevolentAI 用知识图谱在 2020 年 1 月提出 baricitinib,RECOVERY 试验死亡率降低 13%,9 个月后获 FDA 紧急使用授权 | 单例,而且是用已知药物做新适应症 |
| 个案进行中 | AI 靶点 + AI 分子 | rentosertib Phase IIa 有积极信号,已进入 III 期 | III 期结果是整个叙事的关键节点 |
为什么"选对靶点"最难证明:反馈周期 7–10 年;样本极小(24 个靶点);回顾性基准有泄漏;AI 公司也倾向选相对安全的靶点。
对"价值在下游成功率"判断的修正:目前被证明"数据驱动胜过直觉"的最强证据来自人类遗传学(获批概率 2.6 倍),而不是大模型直觉。更现实的组合是"大模型整合证据(遗传学 + 组学 + 文献)+ 快速湿实验验证"。靶点预测领域缺一个类似 CASP 的前瞻性评测,这本身就是验证基础设施层的空白。
来源:
本文为个人研究笔记,结论基于成文时可获得的公开信息;带〔估算〕〔推断〕或⚠️的数字未经独立核实。