RNA

RNA 结构预测题库与自动化实验室体系设计

对标 Adaptyv×Anthropic 蛋白结合剂竞赛,设计面向 RNA 结果预测的公开挑战赛体系 — 数据库、湿实验闭环、与大模型公司的合作路径

Adaptyv×Anthropic 模式真正可复制的核心,不是"蛋白"这个分子类型,
而是"真实能力缺口的靶点 + 便宜可规模化的验证 + 三轨开放赛制 + 全量公开"这套组合。

设计 2026-09-29 · 基于 Adaptyv 蛋白结合剂研究笔记 · bio 板块第二篇

核心结论

01为什么是 RNA:CASP16 证据

RNA 结构预测完整满足参考材料的六条筛选标准,而且证据比蛋白结合剂案例更硬:CASP16 中所有此前未见的天然 RNA 靶点,没有一个预测的 TM-score 超过 0.8,人类专家团队目前仍全面压制自动化方法——这类差距在蛋白质结构预测上已经是七八年前的旧新闻。

0/42
CASP16全新RNA靶点突破TM-score 0.8
8,801
PDB中RNA结构总数(蛋白233,272个)
24款
已获批核酸药物
22/24
是ASO或siRNA

但 RNA 有一处蛋白结合剂案例没有的结构性麻烦:结构验证本身(冷冻电镜/X 射线/NMR)慢且贵,做不到蛋白结合剂 ELISA/SPR 那样规模化到几千个数据点。这决定了本设计必须把"结构预测"拆成多条独立赛道,分别匹配不同的验证方式,不能照搬蛋白竞赛的单一赛制。

蛋白质结构预测(AlphaFold)已经是"AI全面超越人类专家"的解决了的问题,Adaptyv×Anthropic 做的是在"结构已解决"基础上往上一层做"结合剂设计";RNA 是反过来——结构预测这一层本身还没解决,人类专家依然领先自动化方法。这个差异直接决定了怎么和大模型公司谈合作。

Assessment of nucleic acid structure prediction in CASP16 · Ribonanza: deep learning of RNA structure through dual crowdsourcing · Template-based RNA structure prediction advanced through a blind code competition

赛道拆分

02三条赛道对应制药管线的三个阶段

预测一条已存在 RNA 的结构、设计一条全新功能 RNA、验证一条候选药物序列的功能——这是成本结构完全不同的三件事,必须拆成三条赛道分开跑。

赛道A · 结构预测 赛道B · 适体/功能RNA设计 赛道C · 功能效力与脱靶筛查

赛道ARNA结构预测(预测向,近乎零边际成本,可立刻启动)

给定一条此前未公开结构的 RNA 序列,预测其三维结构,用 TM-score 对照后续解出的真实实验结构评分。不需要自建或委托湿实验,直接接入已运行多年、有公信力的 CASP-RNA / RNA-Puzzles 盲测流程。反泄漏设计沿用反事实变异方法论——对已解出结构做点突变/序列重排,检验模型是否真的在推理折叠规则而非背 PDB 记录。成本接近零,瓶颈是题库和评分流程的工程搭建,不是资金,可作为"先自研再对外谈合作"的第一步。

赛道BRNA功能/结合分子设计(设计向,需要湿实验验证闭环,真正对标Adaptyv)

针对给定靶点(蛋白质、小分子,或另一段RNA/DNA),设计能结合或执行特定功能的 RNA 分子——适体(aptamer)、核酶(ribozyme)、核开关(riboswitch)等。化学合成该 RNA(不需要细胞培养,比蛋白表达更快更便宜),用结合检测(SPR、MST、荧光偏振)或活性检测确认设计是否成功。这段成本结构与蛋白结合剂案例高度相似,是真正能复制 Adaptyv 那套"自动化实验室规模化验证"打法的部分。

两条赛道互补:赛道A便宜、能立刻跑,适合作为"先自研"阶段的第一炮;赛道B更贵、需要湿实验伙伴,但叙事和商业价值更贴近 Adaptyv 案例本身,适合作为拿到赛道A首轮结果后,向大模型公司谈资助的第二阶段。

深化

03RNA 是"药"还是"靶点",决定该测什么

赛道A/B 都还没回答一个更根本的问题:从最终 RNA 制药研发的角度看,RNA 在药物里到底扮演"药"还是"靶点",这两种身份该测的东西几乎是反着来的,不能都套用 Adaptyv 那套"结合力 Kd"范式。

RNA 的身份具体药物类型该测什么是否像 Adaptyv 测 Kd
RNA 是药本身siRNA细胞内敲低效力(量效曲线IC50)+ 脱靶转录组沉默谱(引导链第2–8位"种子区"与非靶基因3'UTR碰巧互补导致)不是——结合力不是决定性指标,功能性敲低效果才是
RNA 是药本身ASO/gapmer细胞内敲低效力 + RNase H切割特异性 + 脱靶杂交筛查不是,同上
RNA 是药本身mRNA疫苗/蛋白替代翻译效率(报告蛋白产量)+ 先天免疫激活,且很大程度测的是LNP配方而非RNA序列本身不是,这是功能表达检测
RNA 是靶点适体(aptamer)对靶点的结合亲和力 Kd是——唯一和Adaptyv技术路线完全同构的部分,即赛道B
RNA 是靶点靶向RNA结构的小分子药物小分子对RNA特定3D口袋的结合与功能调控效果部分是——前提是先知道RNA三维结构,正是赛道A的直接下游应用

已获批的24款核酸药物里,14款ASO加8款siRNA占了22款,真正的适体只有2款——approved药物的主力测的根本不是结合力,是细胞里敲低得干不干净、脱靶打没打偏。这条测试路径值得单独列为赛道C功能效力与脱靶筛查,专门覆盖"RNA是药"的场景。

赛道A的下游价值也因此变得更清晰:靶向RNA结构的小分子药物是一个真实存在、有名有姓的赛道——Arrakis Therapeutics、Expansion Therapeutics、Ribometrix(明确做"靶向功能性3D RNA结构的小分子疗法")、Skyhawk Therapeutics,2025年9月xFOREST Therapeutics还和Axcelead刚官宣了一个专做"RNA结构靶向小分子疗法"的合作。这条线要成立,前提就是先知道RNA的三维结构长什么样。

必须诚实面对:递送才是RNA药物失败的头号原因——核酸酶降解、细胞摄取难、内体逃逸(被专门点名"最主要的胞内瓶颈")、免疫清除、生物分布不可控,这些基本由LNP配方或偶联化学决定,跟RNA序列本身设计得好不好关系不大。赛道A/B/C全部测到满分,仍然测不到RNA药物实际失败的最大原因。

全景对比

04三条赛道:在做什么 · 湿实验难度 · 仿真模型水平 · 制药流程用法

维度赛道A · 结构预测赛道B · 适体/功能RNA设计赛道C · 功能效力与脱靶筛查
目前在做什么给定未公开结构的RNA序列,预测三维结构,用TM-score对照真实解出结构评分;核心目标是攻克CASP16级别的"全新折叠"盲测针对给定靶点设计适体/核酶/核开关,化学合成后用SPR/MST/BLI测结合力或催化活性用活细胞功能检测(敲低量效曲线/翻译效率报告基因)+脱靶转录组图谱,评估siRNA/ASO/mRNA候选序列
湿实验是否好做不需要主动做——依赖学术界cryo-EM/X射线/NMR产出节奏;真做的话极贵极慢(单个新结构数万美元、数周到数月),是"蹭"而非"自己做"化学合成+SPR/MST/BLI结合检测本身成熟自动化,三条里"验证"步骤最像Adaptyv;但"设计出对的候选"仍是湿实验密集型——传统SELEX基线成功率约30%,反复迭代数周到数月中等——比结构测定容易得多,比纯结合检测复杂(需活细胞培养+转染/递送);已有高通量自动化先例(96孔板LNP-mRNA库筛选、iMonocyte平台)
现有仿真模型水平分层次:二级结构预测已相当成熟,经典热力学方法(ViennaRNA/RNAstructure)在全新序列上不输深度学习;三维局部结构AlphaFold3有优势(75–79%案例LDDT超过专用RNA工具);但三维整体折叠(CASP16盲测)仍未突破,人类专家仍压制自动化方法纯计算设计目前公开证据显示尚不如传统方法——数据有限导致深度学习在适体结构预测上还没超越非深度学习方法;但"计算指导湿实验"有实测效果,最多可将SELEX迭代次数减少80%、把亲和力提到最高450倍分层次:on-target敲低效力预测已有实用模型(从SVM/随机森林到Transformer架构OligoFormer),精度中等偏上(SVR回归R²约0.516,分类ROC约0.886);脱靶预测明确没有统一行业标准,多种方法并存但无权威共识
药物研发流程里怎么用不直接产出候选分子,是最上游的"靶点表征"——为"靶向RNA结构的小分子药物设计"提供口袋信息;也用于理解mRNA/siRNA自身结构如何影响翻译效率/RISC加载产出可直接进入候选分子阶段——适体本身可成药(如已获批的pegaptanib),也可作诊断/递送载体的靶向模块;比赛道A更接近成药末端,但商业体量小(全球仅2款适体药物获批)产出直接对应approved药物主力模态(24款核酸药物里22款是ASO/siRNA);测完还要走化学修饰优化、递送系统匹配(GalNAc/LNP)、动物药代动力学、临床——不覆盖递送和PK,而这两项是RNA药物失败的头号原因
三条赛道对应制药管线的三个不同阶段,互不替代:赛道A是靶点表征,最上游、离成药最远、但计算难度最大;赛道B是候选分子生成,湿实验验证最像Adaptyv、但计算设计能力目前是三条里最不成熟的;赛道C是候选分子的分子层面验证,离已获批药物最近,但不覆盖递送这个已确认的最大死亡谷。一套完整体系应该按"C验证候选序列的功能→A/B视具体药物类型提供结构或结合信息"的组合方式使用,不是三选一。

siRNA脱靶种子区效应机制 · ASO/gapmer细胞敲低筛查方法 · RNA靶向小分子药物发现综述 · RNA药物递送瓶颈综述 · AlphaFold3 RNA结构预测基准评测 · siRNA效力预测机器学习方法综述 · 计算辅助适体设计vs传统SELEX

数据库设计

05"新鲜靶点" RNA 题库

RNA 题库需要一套持续运作的数据管道,而非一次性静态数据集。核心字段:靶点元数据(序列、来源、解出方法、功能分类、首次公开披露的精确时间戳——反泄漏审计能成立的核心字段)、反事实变体(点突变/序列重排,标注预期是否改变折叠方式)、失败/阴性结果(全部公开,避免幸存者偏差)、版本化排行榜快照。

赛道A的靶点流可以直接接入两个现成信息源:PDB 里 RNA 结构的持续新增披露,以及 CASP-RNA / RNA-Puzzles 现有的盲测流程——重新发明一套等价物没有必要。真正需要新建的,是把这些零散的新靶点披露转成一套结构化、带反事实变体的题库管线。

自动化实验室设计

06该建什么、该租什么

不该建:RNA结构解析(冷冻电镜/X射线/NMR)的自建产能。单个新结构解析成本数万美元级、周期数周到数月,不满足"单点成本可控、能撑几千数据点"这一条。该建或该租:RNA合成+结合/活性检测这一段自动化产线,对应赛道B,技术底座和Adaptyv的蛋白结合剂验证高度同构。

类型代表特点
云实验室(自动化产能,按次提交)Ginkgo Bioworks Cloud Lab——已提供从DNA序列提交到自动化体外转录、纯化、qPCR定量的端到端RNA生产流水线(384孔板规模),并已在做"迷你结合剂候选物"的自动化表达纯化筛选与Adaptyv云实验室模式最接近,边际成本低
CRO(项目制,人工参与判断)Axolabs、Aurigene Services——均提供自动化RNA/寡核苷酸合成+结合力(Kd)/活性检测服务更接近传统CRO模式,适合复杂案例

这三家是检索到的真实存在的候选,报价、产能、能否支持竞赛所需的规模化盲测协议都需要单独询价尽调,不能在此断言具体成本。

与 Adaptyv 实际自建内容的设备/投入对比

检索确认 Adaptyv 自己的自动化实验室不做结构测定——它的流水线是基因合成对接→自动化表达→纯化→结合动力学检测(BLI/SPR),产出KD值等数据,全程不涉及X射线/冷冻电镜/NMR解结构。Adaptyv 默认目标蛋白的结构已知,只验证新设计的结合剂是否真的结合。

维度Adaptyv 实际自建RNA 对应版(赛道B)RNA/蛋白结构测定实验室(另需自建)
核心设备自动化液体处理+基因合成对接+表达纯化+BLI/SPR结合动力学仪同构:RNA化学合成仪+纯化+SPR/MST/荧光偏振检测仪冷冻电镜(Titan Krios级)、X射线衍射仪+同步辐射beamtime、或NMR谱仪(600–800MHz以上)
单套核心仪器投入行业量级几十万到百万美元级与左列同量级冷冻电镜单台100万–600万美元;NMR谱仪(800MHz级)约190万美元起;X射线依赖同步辐射,同步辐射本身是数十亿美元级国家基础设施,企业无法自建
全套设施投入Adaptyv 2025年一轮融资4000万美元建设整个平台预计百万美元级量级即可启动一条产线一整套冷冻电镜中心行业量级在3000万–5000万美元以上,且不含同步辐射access
运行边际成本约150–250美元/设计,3天出结果预计同量级或更低(未询价确认)学术核心设施内部补贴价:冷冻电镜每小时50–500美元,NMR每小时8–15美元;单个结构解出仍需数周到数月人工分析
RNA相对蛋白质的额外难度不适用RNA化学合成不需要细胞,比蛋白表达更简单快速RNA晶体分辨率很少突破2埃;序列多样性低(4种碱基vs20种氨基酸)导致难形成晶体接触;RNA结构数据积累远不如蛋白质晶体学深厚
冷冻电镜/NMR的单机成本就比 Adaptyv 那类自动化工作站贵一到两个数量级,X射线路线更直接卡在"同步辐射不可能自建"这个物理/资金双重天花板上。自建 RNA 结构测定实验室不是"多花点钱就能对标 Adaptyv"的问题,而是换了一个完全不同量级的资本游戏。真要投入,更现实的路径是"买机时"而不是"买设备"。

Ginkgo Bioworks Cloud Lab · Axolabs CRO Services · Aurigene Oligonucleotide Synthesis · Adaptyv Bio 结合检测平台 · Titan Krios 冷冻电镜价格参考 · RNA 晶体学策略综述

公开挑战赛体系

07三轨规则移植

项目赛道A赛道B赛道C
轨道1(专业团队)大模型公司提供计算额度;不设"保障验证名额",改为保障"每轮能拿到多少条新鲜盲测靶点"大模型公司提供计算额度+联合出资湿实验预算,复制"每挑战保障约15个设计验证名额"大模型公司提供计算额度+联合出资细胞功能检测预算;细胞实验比结合检测复杂,名额规模参照赛道B但下调
轨道2(个人/小团队)免费/折扣模型访问,不需要湿实验资源免费/折扣模型访问,不保证验证配额免费/折扣模型访问,不保证验证配额
轨道3(完全开放)允许任何工具,充当公平对照组——重要性更高,因人类专家目前仍是最强预测者同样开放任何工具与方法允许任何工具,包括几十年积累的经典设计规则(如Reynolds rules),核心价值是验证大模型是否真的比行业经验规则更好
奖励无现金奖金,非现金荣誉奖项同左同左
结果披露固定日期全量公开,含未达标预测固定日期全量公开,含未确认结合的失败设计固定日期全量公开,含无效力或脱靶严重的失败候选

赛道A因验证成本趋近于零,可以比蛋白结合剂案例跑得更频繁,做成持续滚动的盲测。赛道C的验证节奏介于A和B之间——细胞功能检测比冷冻电镜/X射线快得多,但比纯粹的结合传感器检测慢,预计单轮周期以周为单位,接近赛道B但略快。

合作谈判结构

08与大模型公司的合作谈判结构

  1. 第一步(不需要任何外部合作方):自建赛道A的题库管线,以参赛方或个人身份跑一轮小规模盲测试点,产出第一版排行榜。证据是"CASP16尚未突破TM-score 0.8"这一已过同行评审确认的公开事实。
  2. 第二步(拿着第一步结果去谈):向大模型公司提出合作提案,核心筹码是"提供一个真实未解决、抗泄漏、有干净单一评分指标、且不是被刷坏的排行榜"(对照ADMET/TDC反面教训)。对价结构:模型公司出计算额度,挑战方出湿实验预算。
  3. 谈判对象不必只锁定一家:轨道3(完全开放)本身就是设计给"某一家模型公司资助,但结果由外部选手自发验证战绩"的机制,后续有空间引入第二家、第三家模型公司。
  4. 叙事重点:RNA结构预测"人类专家仍压制自动化方法"的现状应该当作卖点而非弱点来讲——这证明这是一个值得投入、还没被刷完的真问题。

成本与时间线

09成本与时间线估算

环节成本量级来源可靠度
赛道A题库管线搭建(工程)一次性工程投入,非湿实验支出高——可自行估算
赛道A单轮盲测验证接近零边际成本(复用PDB/CASP-RNA披露节奏)高
赛道B RNA合成+结合检测单点成本预计与蛋白结合剂案例(150–250美元/设计)同量级或更低低,需实际询价后才能确认
RNA新结构解析单点成本(不建议主动委托)数万美元级(同类蛋白环节5万–10万美元,RNA更高)中——外推,未单独核实
时间线:赛道A首版题库+排行榜数周到一两个月工程周期高
时间线:赛道B首轮竞赛五周挑战窗口+一个月验证周期,前提是完成供应商询价与合同签署中,取决于供应商谈判周期

风险与反面教训

10压力测试

  1. 排行榜被刷坏的风险:ADMET/TDC案例证明公开基准很难真正找到干净的新鲜靶点。赛道A的应对是绑定CASP-RNA/RNA-Puzzles这种已证明能持续产出新鲜盲测靶点的机制。
  2. "看似解决但评测体系本身坏了"的风险:2025年Kaggle赛事最好成绩来自模板检索而非深度学习,赛题设计必须包含"找不到模板的全新折叠"这类题目。
  3. 幸存者偏差风险:必须像Adaptyv一样强制全量公开失败设计,尤其是赛道B——参考材料里MBP靶点(90个设计全部失败)就是反面提醒。
  4. 结构解析瓶颈风险:赛道A的可信度依赖外部学术界产出新结构的节奏,这不受本项目控制。
  5. 供应商尽调未完成的风险:Ginkgo/Axolabs/Aurigene都只是检索到的候选,还没有实际询价,这是启动赛道B前必须走完的尽调步骤。

落地行动清单

11落地路径

赛道A可以作为独立的评测模块先行落地:结构预测题库是"母题+反事实变异+泄漏审计"方法论在蛋白 binder 之后的第二个应用场景,工程上可以复用同一套评测框架。

  1. 搭建赛道A的"新鲜RNA靶点"数据管线:监控PDB新增RNA结构披露节奏,评估接入CASP-RNA/RNA-Puzzles盲测流程的可行性。
  2. 把蛋白 binder 评测中的反事实变异方法论移植到RNA结构上,生成第一批测试集。
  3. 用赛道A题库跑一轮内部试点,产出第一版排行榜——作为后续对外谈合作的敲门砖。
  4. 向Ginkgo Bioworks Cloud Lab、Axolabs、Aurigene三家发起实际询价,确认单点成本、批量折扣、保密协议条款。
  5. 基于试点结果,准备面向大模型公司的合作提案一页纸,核心论点锁定"CASP16尚未突破TM-score 0.8"。
  6. 合作提案的目标对象不必只锁定一家,轨道3的赛制设计本身允许后续引入第二家模型公司。