核心结论
01为什么是 RNA:CASP16 证据
RNA 结构预测完整满足参考材料的六条筛选标准,而且证据比蛋白结合剂案例更硬:CASP16 中所有此前未见的天然 RNA 靶点,没有一个预测的 TM-score 超过 0.8,人类专家团队目前仍全面压制自动化方法——这类差距在蛋白质结构预测上已经是七八年前的旧新闻。
但 RNA 有一处蛋白结合剂案例没有的结构性麻烦:结构验证本身(冷冻电镜/X 射线/NMR)慢且贵,做不到蛋白结合剂 ELISA/SPR 那样规模化到几千个数据点。这决定了本设计必须把"结构预测"拆成多条独立赛道,分别匹配不同的验证方式,不能照搬蛋白竞赛的单一赛制。
Assessment of nucleic acid structure prediction in CASP16 · Ribonanza: deep learning of RNA structure through dual crowdsourcing · Template-based RNA structure prediction advanced through a blind code competition
赛道拆分
02三条赛道对应制药管线的三个阶段
预测一条已存在 RNA 的结构、设计一条全新功能 RNA、验证一条候选药物序列的功能——这是成本结构完全不同的三件事,必须拆成三条赛道分开跑。
赛道ARNA结构预测(预测向,近乎零边际成本,可立刻启动)
给定一条此前未公开结构的 RNA 序列,预测其三维结构,用 TM-score 对照后续解出的真实实验结构评分。不需要自建或委托湿实验,直接接入已运行多年、有公信力的 CASP-RNA / RNA-Puzzles 盲测流程。反泄漏设计沿用反事实变异方法论——对已解出结构做点突变/序列重排,检验模型是否真的在推理折叠规则而非背 PDB 记录。成本接近零,瓶颈是题库和评分流程的工程搭建,不是资金,可作为"先自研再对外谈合作"的第一步。
赛道BRNA功能/结合分子设计(设计向,需要湿实验验证闭环,真正对标Adaptyv)
针对给定靶点(蛋白质、小分子,或另一段RNA/DNA),设计能结合或执行特定功能的 RNA 分子——适体(aptamer)、核酶(ribozyme)、核开关(riboswitch)等。化学合成该 RNA(不需要细胞培养,比蛋白表达更快更便宜),用结合检测(SPR、MST、荧光偏振)或活性检测确认设计是否成功。这段成本结构与蛋白结合剂案例高度相似,是真正能复制 Adaptyv 那套"自动化实验室规模化验证"打法的部分。
两条赛道互补:赛道A便宜、能立刻跑,适合作为"先自研"阶段的第一炮;赛道B更贵、需要湿实验伙伴,但叙事和商业价值更贴近 Adaptyv 案例本身,适合作为拿到赛道A首轮结果后,向大模型公司谈资助的第二阶段。
深化
03RNA 是"药"还是"靶点",决定该测什么
赛道A/B 都还没回答一个更根本的问题:从最终 RNA 制药研发的角度看,RNA 在药物里到底扮演"药"还是"靶点",这两种身份该测的东西几乎是反着来的,不能都套用 Adaptyv 那套"结合力 Kd"范式。
| RNA 的身份 | 具体药物类型 | 该测什么 | 是否像 Adaptyv 测 Kd |
|---|---|---|---|
| RNA 是药本身 | siRNA | 细胞内敲低效力(量效曲线IC50)+ 脱靶转录组沉默谱(引导链第2–8位"种子区"与非靶基因3'UTR碰巧互补导致) | 不是——结合力不是决定性指标,功能性敲低效果才是 |
| RNA 是药本身 | ASO/gapmer | 细胞内敲低效力 + RNase H切割特异性 + 脱靶杂交筛查 | 不是,同上 |
| RNA 是药本身 | mRNA疫苗/蛋白替代 | 翻译效率(报告蛋白产量)+ 先天免疫激活,且很大程度测的是LNP配方而非RNA序列本身 | 不是,这是功能表达检测 |
| RNA 是靶点 | 适体(aptamer) | 对靶点的结合亲和力 Kd | 是——唯一和Adaptyv技术路线完全同构的部分,即赛道B |
| RNA 是靶点 | 靶向RNA结构的小分子药物 | 小分子对RNA特定3D口袋的结合与功能调控效果 | 部分是——前提是先知道RNA三维结构,正是赛道A的直接下游应用 |
已获批的24款核酸药物里,14款ASO加8款siRNA占了22款,真正的适体只有2款——approved药物的主力测的根本不是结合力,是细胞里敲低得干不干净、脱靶打没打偏。这条测试路径值得单独列为赛道C功能效力与脱靶筛查,专门覆盖"RNA是药"的场景。
赛道A的下游价值也因此变得更清晰:靶向RNA结构的小分子药物是一个真实存在、有名有姓的赛道——Arrakis Therapeutics、Expansion Therapeutics、Ribometrix(明确做"靶向功能性3D RNA结构的小分子疗法")、Skyhawk Therapeutics,2025年9月xFOREST Therapeutics还和Axcelead刚官宣了一个专做"RNA结构靶向小分子疗法"的合作。这条线要成立,前提就是先知道RNA的三维结构长什么样。
全景对比
04三条赛道:在做什么 · 湿实验难度 · 仿真模型水平 · 制药流程用法
| 维度 | 赛道A · 结构预测 | 赛道B · 适体/功能RNA设计 | 赛道C · 功能效力与脱靶筛查 |
|---|---|---|---|
| 目前在做什么 | 给定未公开结构的RNA序列,预测三维结构,用TM-score对照真实解出结构评分;核心目标是攻克CASP16级别的"全新折叠"盲测 | 针对给定靶点设计适体/核酶/核开关,化学合成后用SPR/MST/BLI测结合力或催化活性 | 用活细胞功能检测(敲低量效曲线/翻译效率报告基因)+脱靶转录组图谱,评估siRNA/ASO/mRNA候选序列 |
| 湿实验是否好做 | 不需要主动做——依赖学术界cryo-EM/X射线/NMR产出节奏;真做的话极贵极慢(单个新结构数万美元、数周到数月),是"蹭"而非"自己做" | 化学合成+SPR/MST/BLI结合检测本身成熟自动化,三条里"验证"步骤最像Adaptyv;但"设计出对的候选"仍是湿实验密集型——传统SELEX基线成功率约30%,反复迭代数周到数月 | 中等——比结构测定容易得多,比纯结合检测复杂(需活细胞培养+转染/递送);已有高通量自动化先例(96孔板LNP-mRNA库筛选、iMonocyte平台) |
| 现有仿真模型水平 | 分层次:二级结构预测已相当成熟,经典热力学方法(ViennaRNA/RNAstructure)在全新序列上不输深度学习;三维局部结构AlphaFold3有优势(75–79%案例LDDT超过专用RNA工具);但三维整体折叠(CASP16盲测)仍未突破,人类专家仍压制自动化方法 | 纯计算设计目前公开证据显示尚不如传统方法——数据有限导致深度学习在适体结构预测上还没超越非深度学习方法;但"计算指导湿实验"有实测效果,最多可将SELEX迭代次数减少80%、把亲和力提到最高450倍 | 分层次:on-target敲低效力预测已有实用模型(从SVM/随机森林到Transformer架构OligoFormer),精度中等偏上(SVR回归R²约0.516,分类ROC约0.886);脱靶预测明确没有统一行业标准,多种方法并存但无权威共识 |
| 药物研发流程里怎么用 | 不直接产出候选分子,是最上游的"靶点表征"——为"靶向RNA结构的小分子药物设计"提供口袋信息;也用于理解mRNA/siRNA自身结构如何影响翻译效率/RISC加载 | 产出可直接进入候选分子阶段——适体本身可成药(如已获批的pegaptanib),也可作诊断/递送载体的靶向模块;比赛道A更接近成药末端,但商业体量小(全球仅2款适体药物获批) | 产出直接对应approved药物主力模态(24款核酸药物里22款是ASO/siRNA);测完还要走化学修饰优化、递送系统匹配(GalNAc/LNP)、动物药代动力学、临床——不覆盖递送和PK,而这两项是RNA药物失败的头号原因 |
siRNA脱靶种子区效应机制 · ASO/gapmer细胞敲低筛查方法 · RNA靶向小分子药物发现综述 · RNA药物递送瓶颈综述 · AlphaFold3 RNA结构预测基准评测 · siRNA效力预测机器学习方法综述 · 计算辅助适体设计vs传统SELEX
数据库设计
05"新鲜靶点" RNA 题库
RNA 题库需要一套持续运作的数据管道,而非一次性静态数据集。核心字段:靶点元数据(序列、来源、解出方法、功能分类、首次公开披露的精确时间戳——反泄漏审计能成立的核心字段)、反事实变体(点突变/序列重排,标注预期是否改变折叠方式)、失败/阴性结果(全部公开,避免幸存者偏差)、版本化排行榜快照。
赛道A的靶点流可以直接接入两个现成信息源:PDB 里 RNA 结构的持续新增披露,以及 CASP-RNA / RNA-Puzzles 现有的盲测流程——重新发明一套等价物没有必要。真正需要新建的,是把这些零散的新靶点披露转成一套结构化、带反事实变体的题库管线。
自动化实验室设计
06该建什么、该租什么
不该建:RNA结构解析(冷冻电镜/X射线/NMR)的自建产能。单个新结构解析成本数万美元级、周期数周到数月,不满足"单点成本可控、能撑几千数据点"这一条。该建或该租:RNA合成+结合/活性检测这一段自动化产线,对应赛道B,技术底座和Adaptyv的蛋白结合剂验证高度同构。
| 类型 | 代表 | 特点 |
|---|---|---|
| 云实验室(自动化产能,按次提交) | Ginkgo Bioworks Cloud Lab——已提供从DNA序列提交到自动化体外转录、纯化、qPCR定量的端到端RNA生产流水线(384孔板规模),并已在做"迷你结合剂候选物"的自动化表达纯化筛选 | 与Adaptyv云实验室模式最接近,边际成本低 |
| CRO(项目制,人工参与判断) | Axolabs、Aurigene Services——均提供自动化RNA/寡核苷酸合成+结合力(Kd)/活性检测服务 | 更接近传统CRO模式,适合复杂案例 |
这三家是检索到的真实存在的候选,报价、产能、能否支持竞赛所需的规模化盲测协议都需要单独询价尽调,不能在此断言具体成本。
与 Adaptyv 实际自建内容的设备/投入对比
检索确认 Adaptyv 自己的自动化实验室不做结构测定——它的流水线是基因合成对接→自动化表达→纯化→结合动力学检测(BLI/SPR),产出KD值等数据,全程不涉及X射线/冷冻电镜/NMR解结构。Adaptyv 默认目标蛋白的结构已知,只验证新设计的结合剂是否真的结合。
| 维度 | Adaptyv 实际自建 | RNA 对应版(赛道B) | RNA/蛋白结构测定实验室(另需自建) |
|---|---|---|---|
| 核心设备 | 自动化液体处理+基因合成对接+表达纯化+BLI/SPR结合动力学仪 | 同构:RNA化学合成仪+纯化+SPR/MST/荧光偏振检测仪 | 冷冻电镜(Titan Krios级)、X射线衍射仪+同步辐射beamtime、或NMR谱仪(600–800MHz以上) |
| 单套核心仪器投入 | 行业量级几十万到百万美元级 | 与左列同量级 | 冷冻电镜单台100万–600万美元;NMR谱仪(800MHz级)约190万美元起;X射线依赖同步辐射,同步辐射本身是数十亿美元级国家基础设施,企业无法自建 |
| 全套设施投入 | Adaptyv 2025年一轮融资4000万美元建设整个平台 | 预计百万美元级量级即可启动一条产线 | 一整套冷冻电镜中心行业量级在3000万–5000万美元以上,且不含同步辐射access |
| 运行边际成本 | 约150–250美元/设计,3天出结果 | 预计同量级或更低(未询价确认) | 学术核心设施内部补贴价:冷冻电镜每小时50–500美元,NMR每小时8–15美元;单个结构解出仍需数周到数月人工分析 |
| RNA相对蛋白质的额外难度 | 不适用 | RNA化学合成不需要细胞,比蛋白表达更简单快速 | RNA晶体分辨率很少突破2埃;序列多样性低(4种碱基vs20种氨基酸)导致难形成晶体接触;RNA结构数据积累远不如蛋白质晶体学深厚 |
Ginkgo Bioworks Cloud Lab · Axolabs CRO Services · Aurigene Oligonucleotide Synthesis · Adaptyv Bio 结合检测平台 · Titan Krios 冷冻电镜价格参考 · RNA 晶体学策略综述
公开挑战赛体系
07三轨规则移植
| 项目 | 赛道A | 赛道B | 赛道C |
|---|---|---|---|
| 轨道1(专业团队) | 大模型公司提供计算额度;不设"保障验证名额",改为保障"每轮能拿到多少条新鲜盲测靶点" | 大模型公司提供计算额度+联合出资湿实验预算,复制"每挑战保障约15个设计验证名额" | 大模型公司提供计算额度+联合出资细胞功能检测预算;细胞实验比结合检测复杂,名额规模参照赛道B但下调 |
| 轨道2(个人/小团队) | 免费/折扣模型访问,不需要湿实验资源 | 免费/折扣模型访问,不保证验证配额 | 免费/折扣模型访问,不保证验证配额 |
| 轨道3(完全开放) | 允许任何工具,充当公平对照组——重要性更高,因人类专家目前仍是最强预测者 | 同样开放任何工具与方法 | 允许任何工具,包括几十年积累的经典设计规则(如Reynolds rules),核心价值是验证大模型是否真的比行业经验规则更好 |
| 奖励 | 无现金奖金,非现金荣誉奖项 | 同左 | 同左 |
| 结果披露 | 固定日期全量公开,含未达标预测 | 固定日期全量公开,含未确认结合的失败设计 | 固定日期全量公开,含无效力或脱靶严重的失败候选 |
赛道A因验证成本趋近于零,可以比蛋白结合剂案例跑得更频繁,做成持续滚动的盲测。赛道C的验证节奏介于A和B之间——细胞功能检测比冷冻电镜/X射线快得多,但比纯粹的结合传感器检测慢,预计单轮周期以周为单位,接近赛道B但略快。
合作谈判结构
08与大模型公司的合作谈判结构
- 第一步(不需要任何外部合作方):自建赛道A的题库管线,以参赛方或个人身份跑一轮小规模盲测试点,产出第一版排行榜。证据是"CASP16尚未突破TM-score 0.8"这一已过同行评审确认的公开事实。
- 第二步(拿着第一步结果去谈):向大模型公司提出合作提案,核心筹码是"提供一个真实未解决、抗泄漏、有干净单一评分指标、且不是被刷坏的排行榜"(对照ADMET/TDC反面教训)。对价结构:模型公司出计算额度,挑战方出湿实验预算。
- 谈判对象不必只锁定一家:轨道3(完全开放)本身就是设计给"某一家模型公司资助,但结果由外部选手自发验证战绩"的机制,后续有空间引入第二家、第三家模型公司。
- 叙事重点:RNA结构预测"人类专家仍压制自动化方法"的现状应该当作卖点而非弱点来讲——这证明这是一个值得投入、还没被刷完的真问题。
成本与时间线
09成本与时间线估算
| 环节 | 成本量级 | 来源可靠度 |
|---|---|---|
| 赛道A题库管线搭建(工程) | 一次性工程投入,非湿实验支出 | 高——可自行估算 |
| 赛道A单轮盲测验证 | 接近零边际成本(复用PDB/CASP-RNA披露节奏) | 高 |
| 赛道B RNA合成+结合检测单点成本 | 预计与蛋白结合剂案例(150–250美元/设计)同量级或更低 | 低,需实际询价后才能确认 |
| RNA新结构解析单点成本(不建议主动委托) | 数万美元级(同类蛋白环节5万–10万美元,RNA更高) | 中——外推,未单独核实 |
| 时间线:赛道A首版题库+排行榜 | 数周到一两个月工程周期 | 高 |
| 时间线:赛道B首轮竞赛 | 五周挑战窗口+一个月验证周期,前提是完成供应商询价与合同签署 | 中,取决于供应商谈判周期 |
风险与反面教训
10压力测试
- 排行榜被刷坏的风险:ADMET/TDC案例证明公开基准很难真正找到干净的新鲜靶点。赛道A的应对是绑定CASP-RNA/RNA-Puzzles这种已证明能持续产出新鲜盲测靶点的机制。
- "看似解决但评测体系本身坏了"的风险:2025年Kaggle赛事最好成绩来自模板检索而非深度学习,赛题设计必须包含"找不到模板的全新折叠"这类题目。
- 幸存者偏差风险:必须像Adaptyv一样强制全量公开失败设计,尤其是赛道B——参考材料里MBP靶点(90个设计全部失败)就是反面提醒。
- 结构解析瓶颈风险:赛道A的可信度依赖外部学术界产出新结构的节奏,这不受本项目控制。
- 供应商尽调未完成的风险:Ginkgo/Axolabs/Aurigene都只是检索到的候选,还没有实际询价,这是启动赛道B前必须走完的尽调步骤。
落地行动清单
11落地路径
赛道A可以作为独立的评测模块先行落地:结构预测题库是"母题+反事实变异+泄漏审计"方法论在蛋白 binder 之后的第二个应用场景,工程上可以复用同一套评测框架。
- 搭建赛道A的"新鲜RNA靶点"数据管线:监控PDB新增RNA结构披露节奏,评估接入CASP-RNA/RNA-Puzzles盲测流程的可行性。
- 把蛋白 binder 评测中的反事实变异方法论移植到RNA结构上,生成第一批测试集。
- 用赛道A题库跑一轮内部试点,产出第一版排行榜——作为后续对外谈合作的敲门砖。
- 向Ginkgo Bioworks Cloud Lab、Axolabs、Aurigene三家发起实际询价,确认单点成本、批量折扣、保密协议条款。
- 基于试点结果,准备面向大模型公司的合作提案一页纸,核心论点锁定"CASP16尚未突破TM-score 0.8"。
- 合作提案的目标对象不必只锁定一家,轨道3的赛制设计本身允许后续引入第二家模型公司。