谁在出题,谁在打分,题目本身能不能信
一份关于 AI / Agent benchmark 供应链的研究:数据服务商自建榜单 vs 学术公共标准,中美对比,以及一个大多数人没意识到的方法论陷阱——评测里的 harness/scaffold。
"模型 M 在 X 榜单上 65 分"这句话本身没有信息量——你不知道换一个 harness 会怎样。比较两个这样的数字,比的是两个系统,不是两个模型。
一个 benchmark,五个独立维度
在看数据之前先立一个分析框架——下文所有判断都沿着这五个维度展开,它们互相独立,同一个 benchmark 在五个维度上的取值组合,基本决定了它的商业逻辑、公信力上限、以及能不能被拿来做客观对比。
| 维度 | 取值 | 决定了什么 |
|---|---|---|
| ① 出题主体 | 数据/环境商业公司 · 学术/研究院 · 大厂自建(实验室自己出题考自己和同行)· 平台/市场(不出题,只做基础设施) | 商业动机是否存在,是否有"裁判兼运动员"的利益冲突 |
| ② 评测对象 | 静态知识/推理 · Agentic能力(多步骤/工具调用)· 垂直职业能力(投行/法律/医疗/科研) | 题目能不能用选择题出,间接决定成本和可自动化程度 |
| ③ 评测方式 | 纯API调用 · 需要专属harness/环境 · 需要人工评审 | 是否存在"换个脚手架分数就变"的方法论陷阱(见 §06) |
| ④ 开放度 | 完全开源 · 部分公开(防训练污染)· 完全私有 | 能否被第三方复现验证,题库会不会被刷分 |
| ⑤ 地域生态 | 美国 · 中国,及各自不同的"什么才算被采信"的机制 | 被引用≠被信任,两地的信任建立路径完全不同(见 §04、§09) |
五个维度里,①决定动机、③决定方法论风险、⑤决定公信力天花板——这三个是本文反复回到的主线,②④更多是描述性的分类标签。
Benchmark 不是凭空出现的:一条任务怎么被生产、定价、卖出去
要理解"为什么会有这么多商业公司抢着做 benchmark",得先看懂这门生意本身的经济结构——benchmark 只是这条供应链露出水面的那一角,水面下是训练数据+RL环境的整条产业链。
一个"可售卖环境"的四个组件
- 可交互世界:Docker容器或微VM,跑真实软件或复刻品
- 任务:初始状态+prompt,不是跑一次就完了,是被设计出来、可反复使用的题目
- 打分器(grader/verifier):最贵、最核心的部分。三档由贵到便宜:程序化验证(单元测试/状态检查)> rubric评分 > LLM judge
- 可重置+可并行:供训练做几十次rollout采样,成千上万容器并发
制作费贵在造初始状态和打分器:专家要找到真实、有难度、前沿模型确实会失败的场景,构造干净复现环境,写模型作弊不了的验证测试——这也是为什么"需要harness"的benchmark(§05统计约47%)普遍比纯知识题贵得多、也难得多。
价格结构
| 计价单位 | 价格区间 | 说明 |
|---|---|---|
| 单条任务 | 200到2,000美元 | 主流;复杂软件工程任务偶见2万美元 |
| 网站/UI gym复刻 | 约2万美元/个 | OpenAI据报按此采购浏览器环境 |
| 高保真产品复刻 | 最高约30万美元/个 | Fleet这类企业软件复刻 |
| 季度合同 | 六到七位数美元/季度 | lab与头部vendor的常见形态 |
| 独占溢价 | 非独占的4到5倍 | lab不想竞对拿到同一份 |
四种生产模式
| 模式 | 代表 | 特点 |
|---|---|---|
| 手工精品 | Mechanize | 全职专家逐条打磨,深度优先,"少而深" |
| 流水线复刻 | Fleet、Scale RL Environments | 软件复刻模板+工具链,一底座衍生上千任务,可卖多家 |
| 平台+市场 | HUD、Prime Intellect | 自己不做环境,提供SDK/托管/撮合,"卖铲子给淘金者" |
| 专家网络出题 | Mercor、Handshake、Surge | 人力池找专家出题+人工或rubric判分,往自动化环境靠拢中 |
领域分布:coding是圣杯,science从"空白"变成"扎堆但没有标准"
Coding被称为"圣杯"——长程推理、工具调用、有状态、错误恢复、反馈密集(编译/测试即奖励),是当前投入最集中的领域,其次是computer-use/企业软件。医疗/法律/金融靠专家出题为主。
2026-09 更新:本节早先版本判断"science几乎空白"——这个结论已经过时,需要修正。2026年上半年密集涌现了至少 7-9 个新的科研agent benchmark(AutoResearchBench、ResearchClawBench、SciAgentArena/Microsoft、MLR-Bench、AIRS-Bench、HeurekaBench等,详见 §07),分布来自 Meta、Microsoft Research、EPFL、上海AI实验室(InternScience) 等不同背景机构,题目不再稀缺。但瓶颈从"没人出题"转移到了"没人形成共识"——这些benchmark彼此覆盖科研生命周期的不同片段(有的测想法/规划,有的测执行,彼此不衔接),且没有一个被多个实验室共同采用、写进system card的标准,根本原因不再是缺自动化验证器(rubric+LLM judge已经能绕开这个限制),而是科研任务本身开放度太高、专家rubric主观性太强,导致同一题目换个评测方,分数就可能大幅摆动——这正好呼应 §06 的harness敏感性问题,且在科研类benchmark上表现得更严重(见 §07 的 GAIA 案例)。补位这个空白的仍然不是标注公司本身,而是"实验室即奖励函数"(Periodic Labs)和"科研软件公司直连lab"(Anthropic×Benchling)——它们绕开benchmark这层,直接拿真实实验结果当训练信号。
两种出题人,两种动机
AI benchmark 现在有两类完全不同的生产者。一类是数据/环境服务商——它们既卖训练数据、RL 环境,也自己出题打分,评测本质是销售漏斗的第一环:诊断模型哪里弱,再反向把数据/环境卖给你补短板。另一类是学术/研究院机构——目的是给整个行业一把公共的比较尺子,不挂钩商业转化,被引用是它们唯一的"回报"。
这两类在中美两地各自演化出了一套体系,四象限如下:
🇺🇸美国 · 数据商自建
- Scale AI — SEAL Leaderboards(含 SWE-bench Pro)
- Surge AI — Hemingway-bench / AdvancedIF / GDP.pdf / Riemann-bench
- Mercor — APEX 系列(-1 / -SWE / -Agents / -Accounting)
- Handshake AI — BankerToolBench / ATLAS-Finance / VIALS
- HUD — OSWorld-Verified / SheetBench-50
- Fleet、Mechanize 没有独立冠名的公开榜单
🇺🇸美国 · 学术 / 社区通用标准
- MMLU / MMLU-Pro、GPQA Diamond、HLE
- GSM8K、MATH、AIME
- HumanEval、MBPP、SWE-bench Verified、LiveCodeBench
- AgentBench、WebArena、τ-bench
- Chatbot Arena/LMArena、AlpacaEval、MT-Bench
🇨🇳中国 · 数据商自建
- UniPat AI — 2026-09 阿里领投 3 亿美元 A 轮,估值 25 亿美元
- Humanlaya(原壤智能)— One-Million Bench / BiomniBench
- 红杉 xbench — ScienceQA / DeepSearch / AgentIF / BabyVision
- 智衍慧生 — 腾讯入股,资料稀少
- 海天瑞声 / 数据堂 / 云测数据:有评测服务能力,未产品化成公开榜单
🇨🇳中国 · 学术 / 国家队通用标准
- C-Eval(上海交大+清华+爱丁堡)
- CLUE / CLUEWSC、CMMLU
- 智源研究院 FlagEval
- 上海 AI 实验室 OpenCompass / 司南
- SuperCLUE、非线智能 ReLE
把四象限叠在一起看,中美格局本质相同:真正跨厂商通用的始终是非商业化的学术标准,数据商榜单最多做"细分领域补位+销售背书"。差别在于成熟度——美国的数据商榜单已经打进了个别头部 lab 的正式 system card(哪怕只是自己客户在秀成绩),中国这批 2025 年才起步的新公司,信任目前还停留在"资本市场买单",尚未看到被头部大模型公司技术报告正式采信。
数据商为什么要自建 benchmark:一本损益表
不是所有数据商都做了自己的 benchmark——老四家(Scale/Surge/Mercor/Handshake)+ 新三家里的 HUD 共 5 家做了且产品化对外冠名;Fleet、Mechanize 没做,恰好是团队规模最小、打法最"精品/垂直"的两家,把有限专家资源全押在核心产品上。
✅ 好处
- 免费权威背书:被 lab 的 system card 引用,等于第三方权威认证
- 反向证明生产能力:能出"前沿模型也会失败"的题,本身就是在向买家秀专业水位
- 定义评测标准=抢话语权:lab 要跑分就绕不开你
- 反哺数据飞轮:跑榜看到失败模式,直接用来设计下一批训练任务
- 差异化定位:APEX 主打职业任务、BankerToolBench 扎投行,避开同质化
❌ 坏处
- 裁判兼运动员悖论:既卖数据又打分,参考 Scale 因 Meta 入股被质疑中立性后客户集体撤单
- 维护成本高:题库会被刷分/过拟合,必须持续换题防泄露
- 声誉是脆弱资产:一旦被曝题目提前泄露给某家训练,代价远大于收益
- 分散核心业务精力:本质是市场活动,资源错配风险
- 反噬风险:自家客户模型在自家榜单排名不佳会很尴尬
自建 benchmark 更像是"规模够大、专家资源够厚"之后的品牌溢价打法,不是数据/环境供应商的标配——Fleet 和 Mechanize 不做,反而印证了榜单是锦上添花,不是生存必需品。
64 个 benchmark 逐一拆解
每个 benchmark 统一记录六项:题库规模 / 开源状态 / 评估能力 / host 方 / 被模型公司引用情况 / 评测方式(纯 API 还是需要专属 harness)。按四象限分组,点开展开。
🇺🇸 美国 · 数据商自建16 个
| Benchmark | 题库规模 | 开源 | 评估能力 | Host | 被引用 | 评测方式 |
|---|---|---|---|---|---|---|
| Scale SEAL Leaderboards | 每子榜约1000题 | 私有 | 代码/西语/指令遵循/数学 | Scale AI | Anthropic Opus 4.6 | 人工评审 |
| Scale SWE-bench Pro | 1,865题(公开731+held-out858+私有276) | 部分公开 | 真实代码库工程修复 | Scale AI | 未查到 | 需harness |
| Surge Hemingway-bench | 未披露 | 私有 | 创意/商业写作质量 | Surge AI | 未查到 | 人工评审 |
| Surge AdvancedIF | 1,600+条prompt | 私有 | 复杂多轮指令遵循 | Surge AI(与Meta MSL合作) | 未查到MSL正式引用 | 专家rubric |
| Surge GDP.pdf | 100题(10职业领域) | 私有 | 真实职业文档理解 | Surge AI | OpenAI GPT-5.6、Anthropic Fable5/Mythos5 | 人工评审 |
| Surge Riemann-bench | 25题 | 方法论公开 | 研究级前沿数学 | Surge AI | Anthropic Fable5/Mythos5 | API+自动校验 |
| Mercor APEX-1 | 隐藏400题+HF开源100题 | 部分公开 | 投行/咨询/律所/医生 | Mercor | 未查到 | 纯API+judge |
| Mercor APEX-SWE | 200题(50题HF开源) | 部分公开 | 真实软件工程集成/调试 | Mercor | 未查到 | 需harness |
| Mercor APEX-Agents | 480题 | 完全开源 | 长时程跨应用专业服务agent | Mercor(Archipelago) | Anthropic Opus 4.6 | 需harness |
| Mercor APEX-Accounting | 160任务(10个"world",每个含一套会计系统+表格+PDF) | 任务CC-BY开源,环境Archipelago开源 | Agentic会计任务(与Ramp合作开发) | Mercor | 未查到 | 需harness(Archipelago) |
| Handshake BankerToolBench | 100题 | 完全开源 | 端到端投行工作流 | Handshake AI Research | 未查到 | Harbor |
| Handshake ATLAS-Finance | 100题(13个金融仿真环境) | 完全开源 | 金融机构多应用协作 | Handshake AI Research | 未查到 | Harbor |
| Handshake VIALS | 161题 | 完全开源 | 生命科学视觉理解(VQA),属ATLAS评测套件家族 | Handshake AI Research | 未查到,2026-08发布(arXiv 2608.21357) | API+LLM judge,最强模型准确率仍<30% |
| HUD OSWorld-Verified | 369+桌面任务 | 公开 | 真实桌面环境操作 | XLang Labs原创,HUD维护 | OpenAI/Google/Claude等广泛测试 | hud-python SDK |
| HUD SheetBench-50 | 50题 | 完全开源 | 表格分析师操作能力,PwC/Cisco/Schwab/Fannie Mae的CFO级专家参与评审 | HUD × Sepal AI(YC S24)联合开发 | 未查到,PwC等企业内部用 | hud-python SDK |
| Mechanize GBA Eval | 单任务(24小时长时程) | 方法论公开 | 极限长时程软件工程 | Mechanize | 自测,未查到反向引用 | Docker+goose |
一个有意思的并购交叉点:帮 HUD 做 SheetBench-50 的 Sepal AI(YC S24,2万+专家网络),在 2026-02-06 被 Mercor 收购——也就是说,帮某家数据商的竞争对手做过评测集的团队,后来被这家竞争对手买走了。
🇨🇳 中国 · 数据商自建13 个
| Benchmark | 题库规模 | 开源 | 评估能力 | Host | 被引用 | 评测方式 |
|---|---|---|---|---|---|---|
| xbench-ScienceQA | 100题 | 完全公开 | 科学知识问答/推理 | xbench.org(红杉中国) | 未查到 | 纯API |
| xbench-DeepSearch | 100题 | 完全公开 | 中文互联网深度搜索 | xbench.org | 未查到 | 固定ReAct agent(5工具) |
| AgentIF-OneDay | 104任务/767评分点 | 完全公开 | Agent日常场景指令遵循 | xbench.org | 未查到 | 不限架构,看交付物 |
| BabyVision | 388题+Mini版20题 | 代码公开但无license文件 | 纯视觉理解/推理(arXiv 2601.06521) | xbench.org×UniPat | 联合公关案例 | 纯多模态API |
| UniPat Monthly-SWEBench | 每月约100题/约20仓库,多语言 | 无公开仓库(仅榜单页) | 真实GitHub issue,月更防污染 | unipat.ai | 未查到 | Harbor+Terminus-2 |
| UniPat SaaS-Bench | 23系统/106任务/3971检查点 | 开源 Apache-2.0 | GUI agent操作真实SaaS(arXiv 2605.15777) | unipat.ai | 未查到 | 自建Docker+browser-use |
| UniPat DeepTerminalBench | 50任务 | 仅见于Terminal-X仓库描述,未单独开仓 | 单轮深度工程(Terminal-X"深度"分支) | unipat.ai | 未查到 | Terminal-Bench 2.0格式+Harbor |
| UniPat RoadmapBench | 115任务/17代码库/5语言 | 开源 MIT | 编码agent按规范升级版本(长时程) | unipat.ai | 未查到 | Harbor+OpenHands |
| UniPat EvoCode-Bench | 26任务/5-15轮/227评估轮次 | 开源 MIT | 多轮编码应对需求变更(arXiv 2605.24110) | unipat.ai | 未查到 | Harbor多轮fork |
| UniPat ClawBench | 未披露 | 开源,归属存疑 | 浏览器agent真实网站任务 | NAIL Group(UniPat为参与方) | 未查到 | 默认OpenClaw |
| Humanlaya One-Million Bench | 400题(中英各200) | 开源 | 5大领域37子域专家任务 | humanlaya.com | 自测50+模型 | API+负向rubric |
| Humanlaya BiomniBench | 100任务(50公开+50私有) | 部分开源 | 生物医药research agent过程级评估 | xbench.org,与Phylo/Humanlaya联合 | 未查到,与Stanford Biomni配套 | Harbor+Terminus-2 |
| Humanlaya ExcelBench | 补充核实后确认:Humanlaya 官网/GitHub/HuggingFace 均无独立发布的 ExcelBench 题库或论文,判断是媒体报道对"Excel建模类任务"的泛称,不是一个正式产品,不再作为独立 benchmark 计入统计。 | |||||
| 海天瑞声内部测评体系 | 无公开规模 | 不开源,B2B | 通用语言+安全可靠性(6大能力19子能力) | 海天瑞声(DOTS-LLM) | 未查到 | API+人工评审(推测) |
开源口径细化(2026-09-20 GitHub API 实测):UniPat 的 9 个公开仓库里,真正带明确许可证的只有 4 个——SaaS-Bench(Apache-2.0)、RoadmapBench(MIT)、EvoCodeBench(MIT)、harbor_multiturn(Apache-2.0);BabyVision / UniScientist / SWE-Vision / Terminal-X / unimath 代码公开但没有 license 文件(严格说不算开源,企业使用有法律风险);Monthly-SWEBench 无公开仓库。stars 数也值得一看:编码类 benchmark 只有 16–28,而模型和 BabyVision 是 172–253——需要 clone 才能跑的东西热度极低,能直接下载或话题性强的反而高。
🇺🇸 美国 · 学术/社区通用标准28 个
| Benchmark | 题库规模 | 开源 | 评估能力 | Host | 被引用 | 评测方式 |
|---|---|---|---|---|---|---|
| MMLU | 14,042题 | 完全公开 | 57学科知识 | UC Berkeley等 | 事实通用标准 | 纯API |
| MMLU-Pro | 12,032题 | 完全公开 | 更难多任务理解 | TIGER-Lab | MMLU饱和后替代 | 纯API |
| GPQA Diamond | 198题(物理82/化学78/生物38) | 公开(部分限访问) | 博士级科学难题 | Rein et al. | OpenAI/Anthropic/Google/xAI均报 | 纯API |
| BIG-Bench Hard | 23任务(每任务>100例) | 完全公开 | 语义/数值/逻辑推理 | BIG-bench社区 | 部分被GPQA/MMLU-Pro取代 | 纯API |
| HLE | 2,500题(100+学科) | 完全公开 | 研究生级前沿知识 | CAIS+Scale AI联合 | 主流厂商采用为高难度标准 | 纯API |
| GSM8K | 8.5K题 | 完全公开 | 小学数学应用题 | OpenAI | 已饱和 | 纯API |
| MATH | 12,500题 | 完全公开 | 高中数学竞赛难度 | Dan Hendrycks等 | 通用标准 | 纯API |
| AIME(LLM评测用) | 每年约15题 | 完全公开 | 顶尖竞赛数学 | 美国数学竞赛协会 | 推理模型标配 | 纯API,需多采样 |
| HumanEval | 164题 | 完全公开 | Python函数级代码生成 | OpenAI | 已高度饱和 | 代码沙箱(非agentic) |
| MBPP | 974题 | 完全公开 | 入门Python编程 | Google Research | 常搭配HumanEval | 代码沙箱(非agentic) |
| SWE-bench Verified | 500题(全集2000+) | 完全公开 | 真实GitHub issue修复 | Princeton+Stanford+UChicago | agentic coding通用标准 | Docker,允许自定义scaffold |
| LiveCodeBench | 滚动约400-600题 | 完全公开 | 竞赛编程,防污染滚动更新 | UC Berkeley系 | 强调防污染厂商常引用 | 代码沙箱(非agentic) |
| AgentBench | 8个环境 | 完全公开 | 多环境agent推理决策 | THUDM(清华) | 学术圈广泛引用 | 统一text协议 |
| WebArena | 6个自建网站/812题 | 完全公开 | 真实网页导航/操作 | CMU | 学术公认标准 | 自部署网站,scaffold不统一 |
| τ-bench(含Airline) | 几十到上百任务 | 完全公开 | 工具调用+多轮客服交互 | Sierra | OpenRouter收录(123模型) | 官方区分标准/自定义提交 |
| RULER | 合成任务四类 | 完全公开 | 长上下文真实有效长度 | NVIDIA | 长上下文常用参考 | 纯API |
| NIAH | 方法论,无固定题库 | 完全公开 | 长文本信息检索 | 社区(Greg Kamradt) | 已饱和,被RULER取代 | 纯API |
| LongBench | 21数据集(中英) | 完全公开 | 长文档QA/摘要等6大类 | 清华KEG(智谱前身) | 中文长上下文常见引用 | 纯API |
| MMMU | 11.5K题(30学科) | 完全公开 | 多模态大学水平理解 | 学术团队 | 多模态通用标准 | 纯API(图文) |
| MathVista | 6,141题 | 完全公开 | 视觉情境数学推理 | AI4Math学术团队 | 多模态数学常见引用 | 纯API(图文) |
| Chatbot Arena/LMArena | 无固定题库,众包投票 | 平台开源 | 综合对话偏好 | LMSYS起源,2026拆分营利公司 | 曾最具公信力,近年因刷票争议下滑 | 真人投票平台 |
| AlpacaEval | 805条固定指令 | 完全公开 | 单轮指令遵循偏好 | Stanford | 学术常引用 | API+LLM judge |
| MT-Bench | 80组多轮问题 | 完全公开 | 多轮对话能力 | LMSYS | LLM-as-judge方法论验证集 | API+judge |
| TruthfulQA | 817题 | 完全公开 | 抗常见错误认知的真实性 | 学术团队 | 安全/真实性常见对比项 | 纯API |
| SimpleQA | 4,326题 | 完全公开 | 简短事实性问答准确率 | OpenAI | 事实性/幻觉率标准 | 纯API |
| BrowseComp | 1,266题 | 完全公开 | 多步网页浏览定位信息 | OpenAI | Deep Research类常见评测项 | 需搜索工具,scaffold不统一 |
| DeepSearchQA | 900题(17个领域) | 开源(HF: google/deepsearchqa,Apache 2.0) | 多跳深度研究型问答,"因果链"结构题 | Google DeepMind(非独立学术团队) | OpenRouter收录,参与模型很少 | 需搜索工具调用 |
| WideSearch | 200题(中英文各100) | 开源(GitHub+HF) | 广度优先信息采集 | 字节跳动 ByteDance-Seed 团队(非西方学术) | 参与模型很少 | 需搜索/浏览工具 |
修正说明:DeepSearchQA、WideSearch 补充核实后发现并非独立学术团队产物,分别是 Google DeepMind 和字节跳动 ByteDance-Seed 团队的自建评测——严格说应归入"大厂自建"这个本文未单列的第五类(既不是纯学术社区,也不是本文定义的第三方数据商)。
🇨🇳 中国 · 学术/国家队通用标准7 个
| Benchmark | 题库规模 | 开源 | 评估能力 | Host | 被引用 | 评测方式 |
|---|---|---|---|---|---|---|
| C-Eval | 13,948题(52学科) | 完全开源 | 知识与推理 | 上海交大+清华+爱丁堡 | DeepSeek-V3、Qwen2.5 | 纯API |
| CLUE/CLUEWSC | CLUE9大任务 | 完全开源 | 中文NLU | CLUE学术社区 | DeepSeek-V3、Qwen2.5 | 纯API |
| 智源FlagEval | 90+数据集/200万+题目 | 平台开放,部分开源 | 语言/多模态图文/文生图文生视频 | 北京智源(BAAI) | 未查到正式引用,智源自发榜 | 部分需要环境 |
| OpenCompass/司南 | 70+数据集/40万+题目 | 完全开源 | 语言/推理/知识/代码/数学/agent | 上海AI实验室 | Qwen技术报告明确引用 | 部分需要(agent维度) |
| SuperCLUE | 三大基准,几百到几千题 | 开源 | 通用+专项+行业能力 | SuperCLUE团队(CLUE系独立) | 未查到被自身技术报告引用,第三方追踪榜 | 需交互环境 |
| ReLE(非线智能) | 374模型/约300细分维度 | 开源 | 教育/医疗/金融/法律/agent | 非线智能(独立社区) | 未查到,面向媒体/社区 | 部分需要(agent维度) |
| CMMLU | 11,528题(67学科) | 完全开源 | 中文语境知识与推理 | 独立学术团队(ACL发表) | Qwen系列明确引用 | 纯API |
统计口径:需要专属harness/环境的 30 个(~47%),部分需要 3 个,纯API 24 个,需人工评审 4 个,特殊平台型 1 个(Chatbot Arena),信息不足 2 个。HumanEval/MBPP/LiveCodeBench 虽然"需要执行环境",但属于单轮代码生成+沙箱测试,不存在多步 agent scaffold,不适用于下一节讨论的"harness 敏感性"问题。
Harness 敏感性:同一个模型,换个脚手架,分数能差 48 分
Harness 和 Scaffold 不是一回事,但业界普遍混用
按 Hugging Face 的 agent glossary,Scaffold(脚手架)是"行为定义层"——system prompt、工具描述、响应怎么解析、跨步骤记住什么,发生在第一个 prompt 之前;Harness是"执行层"——调用模型、分发工具调用、决定何时停止,处理第一个 prompt 之后的一切。业界流行公式是 Agent = Model + Harness。但实际用法里两者经常被当同义词——Claude Code 官方文档就直接自称"the agentic harness around Claude",把 scaffold 该管的事也算进了 harness 里。本文和大多数论文一样,把这两层统称为"harness"。
三层拆解:环境 / agent(scaffold) / 模型
一次 benchmark 测试其实叠了三层:环境 infrastructure(沙箱/Docker/可部署系统,谁维护)→ agent/scaffold(标准化默认还是允许自带,比如 Terminus-2 vs Claude Code)→ 模型(真正被评的 LLM)。目前查到的环境基础设施分成两大互不打通的生态圈:
🔗 Harbor 生态
Laude Institute(Terminal-Bench 创建者)开源,Apache 2.0。task.toml 统一格式,把环境/agent/模型三层显式解耦,内置 agent 清单含 claude-code、codex、aider、gemini-cli、opencode、OpenHands、goose、mini-swe-agent 等。
- BankerToolBench、ATLAS-Finance(Handshake)
- BiomniBench(Humanlaya,固定harness=Terminus-2)
- Monthly-SWEBench、RoadmapBench、EvoCode-Bench(UniPat Terminal-X套件)
- Terminal-Bench、SWE-Bench适配层
🏰 各家自建独立体系
也做了环境/agent分层,但 agent 抽象层自己设计,不与其他厂商共享。
- Scale:SWE-bench Pro 自家Docker三层镜像
- Mercor:Archipelago(自研,APEX-Agents专用,默认ReAct toolbelt)
- HUD:hud-python SDK(OSWorld-Verified/SheetBench-50)
- Mechanize:自建Docker(GBA Eval,已知提交用过Claude Sonnet 5+goose)
实锤数据:分数摆动幅度远超模型能力差距
| 案例 | 固定/标准 harness | 原生/自定义 harness | 差距 |
|---|---|---|---|
| Claude Opus 4.7 · BiomniBench | Terminus-2:63.94 | Claude Code:73.34 | 9.4 分 |
| Claude Opus 4.5 · SWE-bench Pro | SEAL scaffold:45.9% | Claude Code:55.4% | ~10 分 |
| 同类模型 · SWE-bench Verified | mini-SWE-Agent | OpenHands:77.6% | 数个百分点 |
| WebArena 某模型 | 原始harness:25% | 强化agentic scaffold:55% | 30 分 |
| HAL统计 · SWE-bench Verified Mini | 顶尖模型换不同scaffold | 最高近48分 | |
问题的本质:"一个 leaderboard 条目写着'模型 M,SWE-Bench Verified 65%',这句话本身没有信息量——你不知道换个 scaffold 会怎样。比较两个这样的数字,比的是两个系统,不是两个模型。"(论文 Stop Comparing LLM Agents Without Disclosing the Harness,arXiv 2605.23950)
厂商能不能自己指定 harness?能,而且是默认做法
- SWE-bench 官方明确允许提交自定义 scaffold(AutoCodeRover/Agentless/SWE-Agent/OpenHands均可上榜),榜单条目本质是"模型+harness组合系统"在参赛
- Anthropic 报分常直接用 Claude Code;OpenAI 在 Terminal-Bench 2.0 是唯一坚持用自家 Codex CLI 而非官方 Terminus-2 的参评方
- SWE-bench 2025-11 收紧政策:Verified/Multilingual 只对学术机构开放提交,独立/商业提交被限制在门槛更低的 Lite 榜——很可能是在回应"商业公司用定制harness刷分"的问题,但 Lite 依然允许自定义harness
- τ-bench 是唯一把"标准提交 vs 自定义提交"制度化的 benchmark:换掉官方默认scaffold(加规划器/额外agent/自定义工具/改控制流)就必须单独标注
常用开源 harness 清单
| Harness | 类别 | 维护方 | 特点 |
|---|---|---|---|
| SWE-agent | 代码/SWE | Princeton系学术团队 | 提出agent-computer-interface范式,引用最多 |
| OpenHands | 代码/SWE,通用agent平台 | 开源社区 | 自带SWE-bench适配器,功能重 |
| mini-SWE-agent | 代码/SWE | 开源社区 | 极简harness,常作标准化对照组 |
| Terminus-2 | 终端/CLI任务 | Terminal-Bench官方(Harbor) | Terminal-Bench 2.0默认标准harness |
| Agent-S / S3 | 桌面/computer-use | Simular(开源) | 首个在OSWorld超越人类的agent(72.6%) |
| UI-TARS | 桌面/GUI grounding | 字节跳动(开源) | 端到端训练,UI元素当一等公民 |
| τ-bench harness | 客服/工具调用 | Sierra(开源) | 模拟用户+工具+数据库交互 |
| Harbor | 通用评测/RL环境框架 | Laude Institute(开源,Apache 2.0) | 多家数据商共用的标准化基础设施 |
| goose | 通用coding agent | Block(开源) | Mechanize GBA Eval等用它做原生harness |
| OpenCode | 通用coding agent | 开源社区(MIT,208k+ star) | Harbor内置agent之一,75+模型provider支持 |
各家大模型公司自测常用 harness
| 公司 | 自测常用harness | 备注 |
|---|---|---|
| Anthropic | Claude Code(自家产品) | SWE-bench Pro上比标准scaffold高约10分 |
| OpenAI | Codex CLI(自家产品) | Terminal-Bench 2.0中唯一不用官方Terminus-2的参评方 |
| Gemini CLI + 开源computer-use-preview参考实现 | 主要针对浏览器/GUI,桌面操作官方称"尚未优化" | |
| 中国头部模型(DeepSeek/Qwen/GLM/Kimi) | 未查到公开披露 | agentic评测极少注明scaffold,纯知识类直接裸API |
一个反直觉的发现:Holistic Agent Leaderboard(HAL)做了21组模型-harness控制变量对比(Claude Code / Codex CLI / Pi,覆盖7个模型×SWE-bench Lite+Terminal-Bench 2.0),12组对比里有9组是"换一个非自家 harness 反而分数更高"——说明厂商自用的 harness 未必客观最强,更可能只是"自己最熟练调优过的那一个"。
科研类 benchmark:题目不缺了,缺的是一个大家都认的标准
咱们清单里九成打着"科学"标签的 benchmark(GPQA/HLE/Riemann-bench/xbench-ScienceQA/MMMU/MathVista)测的都是科学知识水位——懂不懂科学,不是会不会做科研。真正测"AI 做科研过程能力"的曾经极度稀缺,但这个判断在 2026 年上半年已经被打破——一批新 benchmark 密集涌现,下表先给全景,再深挖其中规格最重的 BiomniBench。
2026 上半年新涌现的科研 agent benchmark
| Benchmark | 发布 | Host | 规模 | 测什么 | 开源 |
|---|---|---|---|---|---|
| AutoResearchBench | 2026-04(arXiv 2604.25256) | 学术团队 | - | 科学文献发现能力(Deep Research单篇溯源+Wide Research批量检索),非过程评测 | 开源 |
| ResearchClawBench | 2026-06(arXiv 2606.07591) | InternScience(上海AI实验室/OpenGVLab系) | 40任务/10科学领域 | 基于真实发表论文,隐藏目标论文,专家多模态rubric打分——与BiomniBench同路数但覆盖领域更广 | 开源 |
| SciAgentArena | 2026-06(arXiv 2606.12736) | Microsoft Research | 约200任务 | 跨尺度科研(单细胞组学/空间组学/药物发现/电子病历/遗传学),stepwise verification,测了18个agent | 未明确 |
| MLR-Bench | 2025-05(arXiv 2505.19955),NeurIPS 2025收录 | 学术团队 | 201任务(源自NeurIPS/ICLR/ICML workshop) | idea→proposal→实验→写论文全流程,MLR-Judge自动评审 | 开源 |
| AIRS-Bench | 2026-02(arXiv 2602.06855) | Meta/Facebook Research | 20任务(源自SOTA机器学习论文) | 完整研究生命周期(想法生成→实验分析→迭代优化),不提供baseline代码 | 开源 |
| HeurekaBench | ICLR 2026 | EPFL(mlbio-epfl) | 已实例化为sc-HeurekaBench(单细胞生物学) | 本质是"生成benchmark的框架":论文提取insight→转QA→agent自主分析验证 | 开源 |
| StatefulDiscovery | 2026-06(arXiv 2606.11851) | 学术团队 | 复用40个真实数据任务 | 严格说是评测方法论/agent架构(显式discovery state控制),不是独立题库 | - |
额外发现同类项目:InquiTree(arXiv 2606.09550,评测paper-derived research tree式科学探究)、AstaBench(arXiv 2510.21652)、SoundnessBench(arXiv 2605.30329,测AI能否分辨"好/坏研究想法")。
中国侧的科学评测体系
中国的科学 benchmark 集中在上海 AI 实验室这条线,加上红杉 xbench 和 Humanlaya 参与的项目,特点是体系化平台多于单点过程级评测:
| Benchmark | Host | 测什么 | 层级 | AI 表现 |
|---|---|---|---|---|
| 司南科学智能评测体系 | 上海 AI 实验室(OpenCompass) | 覆盖科研全流程的评测平台 | 平台 | 结论:模型科学能力短板明显 |
| SFE (Scientific Foundation Evaluation) | 上海 AI 实验室 | 66 个任务,5 个科学领域,中英双语,"信息感知→属性理解→比较推理"三层 | 知识/推理(多模态) | 主流模型仅约 30 分 |
| SciHorizon | 学术团队(arXiv 2503.13503) | 数学/物理/化学/生命/地球与空间 5 大领域 16 个维度测 50+ LLM,同时评估科学数据是否"AI 就绪" | 知识/推理+数据就绪度 | 体系化诊断,无单一头条分 |
| SciEval | 学术团队(NSFC 资助) | 多层级科学问答 | 知识/推理 | — |
| ResearchClawBench | InternScience(上海 AI 实验室系) | 40 任务/10 领域,隐藏目标论文,专家 rubric | 科研过程 | 最强系统(Claude Code)仅 21.5/100 |
| xbench-ScienceQA | 红杉 xbench | 100 题科学问答 | 知识/推理 | 未见第三方引用 |
| BiomniBench | Stanford + Phylo + Humanlaya(中方数据实验室参与) | 见下文 | 科研过程 | 前沿模型 62–73 |
AI 在科学领域做得怎么样:四个判断
- "懂科学"和"做科研"差距很大:选择题式的 GPQA 已接近饱和,但一旦要 agent 自己选方法、解读结果,分数掉到 20–70 分区间(ResearchClawBench 21.5、BiomniBench 62–73)。
- 最大的问题是编造和浅尝辄止:MLR-Bench 发现 80% 的案例编造或无法验证结果;BiomniBench 常见漏掉关键分析步骤;SciAgentArena 发现 agent 做不出新颖洞见。看起来完整、科学上站不住,比答错一道题更危险。
- AI 大致追上初级科学家,还没超过资深科学家:BiomniBench 早期人类基线——资深制药科学家 68.5、最好 AI 65.0、初级科学家 48.5。
- 中美共同的瓶颈是没有共识标准:美国强在多家机构(Meta/Microsoft/Stanford/FutureHouse)的重投入过程级评测,中国强在体系化平台(司南/SFE/SciHorizon)。两边都还没有一个被几家头部实验室共同写进 system card 的科研标准。
一个比 BiomniBench 更极端的 harness 敏感性案例:GAIA
GAIA是通用agent benchmark(非科研专属,本文§05目录已收录),但它在2026年5月给出了一个惊人的数据点:同样466道题,不同排行榜上的分数从44.8%跑到92.36%——差距不是测量误差,就是"被允许用什么工具/scaffold"的差异。这比 §06 讲的SWE-bench/BiomniBench的harness分差(10-48个百分点)还要极端,而且逻辑相通:科研/研究类任务本身开放度更高、rubric主观性更强,harness敏感性问题只会比coding类benchmark更严重,不会更轻。
BiomniBench 仍是规格最重的代表案例(不再是唯一)
上面这批新benchmark证明"科研agent评测"已经从空白变成拥挤赛道,但 BiomniBench 依然是其中投入规格最重的一个——100+名资深专家、超1,000小时开发投入,和斯坦福生产级科研agent Biomni直接配套,6维度rubric+双轨(固定harness+原生harness)对比实验设计也是这批新项目里最完整的。以下深挖它的细节:
基本信息
- 规模:100个数据分析任务(50公开+50私有防污染),17种任务类型,5个疾病领域+通用生物学
- 题目来源:每题基于一篇发表在 Nature/Cell/Science 的真实论文,由原作者或领域专家共同开发
- 开发投入:斯坦福、哈佛、北大及多家头部药企 100+名资深专家、超1,000小时,与 Phylo、Humanlaya Data Lab 联合完成
- 配套对象:给斯坦福 SNAP 实验室的通用生物医学 AI agent Biomni(105个软件包+59个数据库+150个专用工具)做的配套评测集
- 核心创新:过程级(process-level)评测——把agent完成任务的完整轨迹拿去对照专家rubric打分,不只看最终答案
评分维度与样题细节
| 维度 | 核心检查 | 示例标准 |
|---|---|---|
| 数据处理 | 正确加载和准备数据 | 加载所需文件、用正确标识符合并、筛选到正确处理组 |
| 方法选择 | 选择恰当的分析方法 | 对生存分析选择 Kaplan-Meier 曲线+log-rank检验 |
| 统计严谨性 | 正确应用统计测试 | 应用多重检验校正(BH-FDR) |
| 来源可靠性 | 依赖可信参考资源 | 从同行评审文献提供相关引用 |
| 科学推理 | 逻辑一致性与生物学连接 | 避免因果过度声称,把发现和真实机制关联 |
| 生物学解释 | 正式版新增第六维度 | —— |
典型失败模式:漏掉MYC基因特异性分析、漏掉表型相关性分析、漏掉关键通路解释——说明任务不是"跑脚本出数字",而是要求 agent 知道该往哪个方向深挖。
测试用什么 harness
底层用 Harbor 执行框架统一环境(task.toml配置验证器/环境预算),保证不同 agent 跑起来时数据、工具、沙箱资源一致。打分不是自动验证器,是 LLM judge——论文比较了5个候选裁判模型(Claude Opus 4.6/DeepSeek V3.2/Gemini 3.1 Pro/GPT-5.4/Qwen 3.6)跟内部专家A/B/C评级的一致性,最终选 Gemini 3.1 Pro 全程当裁判(跟人类专家意见最一致)。
各家模型测下来的效果
官方"固定harness"对比:所有模型统一套 Terminus-2 → 顶尖模型互相只差1.6分,聚在62-64区间。官方"原生harness"对比(各家用自己精调过的agent):
| 组合 | 分数 |
|---|---|
| Claude Code + Opus 4.7 | 73.34(最高) |
| Claude Code + Opus 4.6 | 69.51 |
| Codex CLI + GPT-5.4 | 68.69 |
| Codex CLI + GPT-5.5 | 67.59 |
| Claude Code + Sonnet 4.6 | 66.39 |
| Terminus-2 + Opus 4.7(固定harness对照组) | 63.94 |
早期版本人类基线对比(v0,15题子集,Phylo博客公开):
当时最好的AI系统(65分)已接近甚至超过初级科学家(48.5分),但仍明显不如资深科学家(68.5分)——极少见的"AI vs真人专家"直接对比数据。
第三方独立复现(omicverse团队用自己的agent"omicos"换不同底层模型跑50个公开任务):GPT-5.5 78.8%、DeepSeek4-pro 73.0%、GPT-5.4 67.7%、DeepSeek4-flash 66.0%、MiMo-v2.5-pro 65.8%、MiMo-v2.5 62.3%、GPT-5.4-mini 44.2%。反直觉发现:GPT-5.5总分最高但"生物学解释"维度只有60%,几个便宜模型(DeepSeek4-flash 76%、MiMo-v2.5-pro 73%)在这一维度反而超过它——模型普遍能老实引用文献来源,但在"方法选择"和"生物学解释"这两个真正需要科研判断力的维度上持续拉胯。
Rubric 化:把"不可验证"变成"可验证",代价是把"对不对"换成了"全不全"
上一节的结论是科研 benchmark 已经扎堆但没有共识。但如果只看方法,中美两边其实已经收敛到同一个解法:把一个开放式任务拆成 N 条小的、可独立判定的 rubric 条目,再聚合成分数或奖励。这一节说清三件事:这套机制具体怎么做、它离"真实标准"有多远、以及哪些方法被证明能缩小差距。
rubric 让开放式任务变得可打分,但它奖励"说到了",不奖励"说对了",也不惩罚"说多了"。这个替换在医疗问答里损失有限,在科研里可能是致命的——一篇什么都提到了但结论错了的研究报告,rubric 会给高分。
这不是新东西:范式时间线
标准名称是 rubric-based reward / rubrics as rewards,动机是 RLVR(可验证奖励强化学习)在数学和代码上极成功、但在医学科学写作这类没有唯一答案的任务上用不上。底层假设"验证在认知上远比从零创造便宜"来自 scalable oversight 这条老线索(CriticGPT、辩论式对齐),不是任何新公司的原创。
| 时间 | 工作 | 关键贡献 |
|---|---|---|
| 2024 | OpenAI Rule-Based Rewards / CriticGPT | 从规则文本导出奖励;模型辅助人类验证 |
| 2025-05 | OpenAI HealthBench | 262位医生(执业于60国)、5,000段对话、48,562条医生撰写rubric、带权重、GPT-4.1判分 |
| 2025-07 | Scale AI Rubrics as Rewards (RaR),arXiv 2507.17746 | 首个系统化框架:四类别带权重条目 + GRPO;公开RaR-Medical-20k/RaR-Science-20k |
| 2025-08 | 小红书 RL with Rubric Anchors,arXiv 2508.12790 | 当时最大rubric奖励系统10,000+条,来源明确含"人机混合协作";开源Qwen-30B-A3B |
| 2025-09 | Chasing the Tail,arXiv 2509.21500 | 理论指出奖励过优化的根源在高分尾部错配 |
| 2026 | Open Rubric System / Autorubric / OpenRubrics / ARBOR / SibylSense / RUC-NLPIR Rubrics Survey | 范式成熟标志:出现综述,以及专门研究失效模式的论文 |
对本页 §09 的一个直接含义:UniPat 博客称"现有两种范式(纯人工/纯合成)都没利用这个不对称性",在文献上不准确——Scale 的 RaR 早半年以上,小红书的 Rubric Anchors 早七个月且明确写了人机混合。它的真实差异化在领域覆盖(50+学科)和专家工时成本(1–2小时/样本),不在方法。
rubric 条目具体长什么样(RaR 论文附录原文示例)
每题生成 7–20 条 rubric,每条含 title(2–4词)、description(一句话,须以类别开头)、weight。必须写到"非专家只靠这条即可判定、无需推断或查外部资料"的自足程度——这是 LLM judge 能当判分器的前提。
| 类别 | 权重 | 含义 | 论文原文示例(医学题) |
|---|---|---|---|
| Essential | 5 | 关键事实或安全检查,缺失即整份回答无效 | Essential Criteria: Identifies non-contrast helical CT scan as the most sensitive modality for ureteric stones. |
| Important | 3–4 | 关键推理、完整性、清晰度 | Important Criteria: Explains that non-contrast helical CT detects stones of varying sizes and compositions. |
| Optional | 1–2 | 风格或额外深度 | Optional Criteria: States "The final answer is (B)" or similar answer choice formatting. |
| Pitfall | −1 / −2 | 该题常见错误或遗漏,负向扣分 | Pitfall Criteria: Does not mention identifying (B) as the correct answer. |
RaR 在 Qwen2.5-7B 上的实测有两个反直觉结果:implicit 聚合(整份rubric交给judge出一个总分)优于 explicit(逐条判定加权求和),与"原子化可验证"的直觉相反;而且科学域(GPQA-Diamond)上 RaR-Explicit 还不如 Reference-Likert 基线(0.3030 vs 0.3775)——rubric 的收益取决于任务是否真的开放式,选择题式任务拆解价值有限。
科研 benchmark 采用 rubric 的五种机制
A · 带权重的 rubric 树(最精细)
PaperBench(OpenAI,arXiv 2504.01848):20篇ICML 2024论文复现,rubric 是需求树,叶节点为单条pass/fail条件、每节点相对兄弟节点手工加权,共 8,316个叶节点。拆解规则很硬:持续拆分直到一个专家能在15分钟内判定——把"原子性"变成可操作的成本定义。rubric 与每篇论文原作者共同制定;判分用 o3-mini 当 judge,并另建 JudgeEval 专门评判分器。
B · 定分值 checklist + 通过线(最简洁)
FrontierScience-Research(OpenAI,arXiv 2601.21165):60道原创研究子任务,由博士科学家(在读博士/教授/博士后)设计,每题一套10分制rubric,条目互相独立、可客观判定,每条含pass/fail描述与分值(示例"写出方程X"),≥7/10算成功。取向是放弃精确匹配、改为评估中间推理步骤。也正是 UniPat 的 UniScientist 报分用的那个榜。
C · 维度体系 + 动态权重(评开放式报告)
DeepResearch Bench(arXiv 2506.11763,ICLR 2026)的 RACE 框架:四个正交维度(全面性/洞察深度/指令遵循/可读性),judge 逐题动态生成任务专属权重(T次试验取均值),再参照一份高质量参考报告打相对分。DEER(arXiv 2512.17776,ICML 2026):专家分类体系 7维度/25子维度 → 101条细粒度rubric,外加claim验证架构同时验证有引用与无引用的断言。BiomniBench 的六维过程级评测同属这一类(见 §07)。
D · 原子事实分解(rubric 不预写)
HeurekaBench(ICLR 2026,arXiv 2601.01678):把 agent 回答与 ground truth 双方都分解成原子事实,比对"存在性与正确性"。GPT-4o 按此判分与博士级专家 Spearman ≈ 0.90。这是目前唯一在机制层面堵住"只判有没有提到"这个漏洞的设计——因为它同时要求正确性。
E · rubric + 硬门 + 真实实验(唯一接物理世界)
BioLab Bench:任务专属指标 + rubric验证器 + 设备级有效性门 + 真实实验测试四层串联。便宜替代路线是 BenchBench-Protocol(arXiv 2608.23898):从 Benchling 上96篇已发表协议取149任务,发表版与科学家改动版的差异即真值,用已完成的湿实验当延迟 ground truth。
反 LLM 阵营 · 一个未被裁决的分歧
ResearchRubrics(Scale × U Chicago,arXiv 2511.07685):101 prompt / 2,593条人工撰写条目,明确禁止 LLM 生成或播种任何条目,理由是"只让人去验证 LLM 生成的 rubric 会引入锚定偏差";三重审核、2,800+人工小时。这与 UniPat/HeurekaBench 的"LLM生成+人类验证"路线直接冲突,而没人做过同题对照实验。
| Benchmark | 规模 | rubric 谁写 | 机制 | 判分器可信度是否公开 |
|---|---|---|---|---|
| PaperBench | 20论文/8,316叶节点 | 论文原作者共同制定 | 加权需求树,15分钟可判定规则 | 有 JudgeEval 专评判分器 |
| FrontierScience-Research | 60子任务 | 博士科学家 | 10分制独立条目,≥7通过 | 未查到 |
| ResearchRubrics | 101 prompt/2,593条 | 纯人工,禁用LLM生成 | 多轴+三重审核,2,800+人工小时 | 靠三重审核 |
| DeepResearch Bench | 100任务/22领域 | judge动态生成 | RACE:4维+动态权重+参照相对分 | PAR 71.33% vs 人类互评 68.44% |
| DEER | 50任务/101条 | 专家分类体系 | 7维25子维 + claim验证 | 有任务专属专家指引 |
| BiomniBench-DA | 100任务 | 论文原作者或领域专家 | 过程级6维,评整条轨迹 | 选了5个候选裁判比一致性(见§07) |
| HeurekaBench | OEQ+MCQ | LLM生成后用已发表结论验证 | 原子事实分解:存在性+正确性 | Spearman ≈ 0.90 |
| SciAgentArena | 约200任务 | 未详查 | stepwise verification | 未查到 |
| BioLab Bench | 未披露 | 湿实验专家 | rubric + 设备门 + 真实实验 | 真值来自实验 |
| HealthBench(医疗,方法源头) | 5,000对话/48,562条 | 262位医生 | 带权重条目,GPT-4.1判分 | 与医生一致率 ≈ 医生互评 |
看任何 rubric 榜单,第一个该问的问题不是"谁在榜首",而是"你的判分器与人类专家的一致性是多少"。上表十家里只有四家给了数字。
离"真实标准"有多远:两层差距,后一层是结构性的
拆法出自 Reward Hacking in Rubric-Based RL(arXiv 2605.12474):策略对训练判分器优化,但用三个跨家族前沿模型组成的裁判面板评估。
差距一:判分器失效(可控)。训练判分器认为满足、参考判分器认为没满足。弱判分器产生大量迁移不过去的虚假收益,利用程度随训练推进而增长,集中在三种复发失败:复合条件部分满足即算过、把隐含内容当显式表述、主题匹配不精确。换强判分器能大幅减少但无法消除。
差距二:rubric 设计本身的局限(结构性)。即便用很强的 rubric 判分器,它偏好的回答在"不看 rubric 只看整体质量"的裁判眼里反而更差:
| rubric RL 之后的变化 | 方向 |
|---|---|
| 完整性、"提到了某点"这类存在性条目 | 上升 |
| 事实正确性 | 下降 |
| 简洁性 | 下降 |
| 相关性 | 下降 |
| 整体质量 | 下降 |
已被证明有效的缩小差距的方法(按证据强度)
- 跨家族判分器面板——训练判分器与评测判分器严格分离;硬规则是永远不要让生成模型与判分模型来自同一家族。Autorubric/PoLL式集成证明:当方差和阈值可靠性重要时,多个各异裁判的陪审团胜过单个强模型。
- 人工标注校准 + 定期重校准(工程上最成熟)——手标100–300条代表性输出,用判分器将要用的同一套 rubric,算 Cohen's kappa / Pearson / MAE,目标 kappa > 0.6;每季度重校准捕捉 drift,判分模型升级后必须重校准。
- 成对比较替代逐点打分——Open Rubric System(arXiv 2602.14069)用成对自适应 rubric + 锦标赛排序治"判别性坍塌"(逐点打分把所有回答挤在同一分段),并要求两种顺序都跑以消除位置偏差。
- 专攻高分尾部——Chasing the Tail(arXiv 2509.21500):过优化的根源是分不清"优秀"与"仅仅很好"。rubric 的价值在于能利用离策略样本同时对其表面伪影不敏感,关键是让 rubric 具备在多个都很好的回答之间做区分的能力。
- 从失败轨迹反向归纳 rubric——DeepVerifier 路线,让 rubric 贴近真实失败分布而非专家想象的失败分布。
- self-internalization gap——基于策略模型自身 log-probability 的无判分器诊断,能检测"用弱判分器训练的策略何时停止真正进步"。低成本早期预警。
- 显式负向条目 / 抑制存在性偏好——加 Pitfall 条目、对"提到了"类降权、对"说对了"类升权、加简洁性约束。逻辑对症,但未见论文系统验证,属推论。
判分器这一层正在被专用模型接管:TypeSafe Jev
rubric 判分的本质就是"给一份产出回答 N 个互相独立的封闭问题",这正好是 TypeSafe Jev(2026-09-15 早期访问,当前 jev-1.13.0)的原生形态:输入非结构化 state,一次并行 pass 输出带标定概率的类型化决策,完全不生成文本。原语 bool / score / choice 分别对应 rubric 的 met-not-met、分级条目、失败模式分类,criteria 直接用自然语言写、不需要标注数据。定价 $0.042/MTok 输入、输出免费,延迟 70–500ms。Good Start Labs 跑 6,003 条检查的实测:Jev 每百万条判定约 $160,Claude Fable 同等水平约 $33,000(GPT-5.6 Luna 约$400、Gemini 3.8 Flash 约$1,600)。这带来一个真实的架构变化:以前太贵只能抽样评测,现在可以全量评每一条轨迹。
另外三个硬约束直接决定它在科研评测里的位置:不产生理由(拿不到"为什么没满足")、不能弃权(没有"信息不足"这个状态)、context 仅 64K 总/32K state 且有 context rot——后者直接排除了本页 §07 最重要的那个方向:过程级评测。BiomniBench 要评整条 agent 轨迹、PaperBench 要审一整份复现产物、DEER 要评一份长报告,都塞不进 32K。还要注意厂商自己的 benchmark 用的是 GPT-6 Astra 与 Fable 5.1 的平均意见当参考答案,不是人类真值,且任务由其自家团队编写。
所以它的正确位置是:叶节点级判定的执行层(PaperBench 的"15分钟可判定"规则正好定义出这种短、自足、原子的问题)、大规模全量扫描、置信度路由到人工、以及跨家族判分面板里架构完全不同的那一员。不适合当唯一裁判、评轨迹、或做诊断。一个必须说清的判断:Jev 把判分成本降低两个数量级,但便宜地做错的事仍然是错的——它的概率系统性偏 yes,而 rubric 的已知病灶正是存在性条目虚高,未校准地把它接进 RL 奖励回路,是在给 reward hacking 加油。
真值层:湿实验怎么接进来
rubric 只能判断"这份研究做得像不像一个好研究",不能判断"结论是不是对的"。而科研只有后者算数。所以真正的问题是:唯一不可被 Goodhart 的真值——物理实验——能不能进训练回路。答案是:三大 lab 都在用湿实验,但没有一家公开把它当 RL 奖励信号。
| 层级 | 做法 | 谁在做 |
|---|---|---|
| Tier 1 · 只做事后验证 | 湿实验是发布会证据,不在训练回路里 | OpenAI × Retro Biosciences(GPT-4b micro 设计 RetroSOX/RetroKLF,多能性标记表达提升50倍以上,SOX2建议中超30%优于野生型,iPSC生成3周→7天;模型未公开发布);Anthropic 2026-08 对15个靶点的 de novo 蛋白结合体设计命中率22–35%(行业常规10–15%),由 Adaptyv Bio + Twist 验证;DeepMind AI co-scientist 进真实验室 |
| Tier 2 · 结果回流当训练数据 | AI 出假设与分子 → 人类在 bench 测 → 结果回流改进模型(措辞是"改进模型",不是"当奖励做RL") | Anthropic 走得最远:自建旧金山湾区湿实验室并招 bench 科学家;Life Sciences Verification Program 出最多100万美元Claude额度+资金资助外部湿实验验证(Modal 出25万美元算力、Twist 提供DNA合成)——本质是众包真值数据 |
| Tier 3 · 湿实验当 RL 环境 | 把物理实验当 RL 环境,现实提供反馈 | 只有新公司:Periodic Labs(前OpenAI后训练负责人 Liam Fedus + 前DeepMind GNoME作者 Ekin Dogus Cubuk),1万亿参数MoE模型 Neon,训练峰值1,300张H200;"科学rollout可推理并执行工具一小时以上,而一个训练步只要几分钟",故训练与推理异步分离。Lila Sciences 的 AI Science Factories 同类 |
为什么大 lab 不这么做——四个结构性原因:①时间尺度差3–5个数量级(训练步分钟级 vs 实验天到周级,而一次 RL run 需要几十万次 rollout);②样本效率与成本不匹配(用最贵的信号喂最饿的算法);③信号稀疏带噪声,credit assignment 几乎无解(失败可能源于假设错误,也可能是移液操作或试剂批次);④通用模型 vs 垂直模型的取舍——湿实验信号只在极窄领域有效,Periodic/Lila 敢做正因为它们放弃了通用性。
所以前沿模型实际用的是四种"湿实验替代品":形式化验证器(Lean,秒级,但只有数学有)、计算仿真代理(DFT/分子动力学/对接,分钟到小时,与现实有系统性偏差)、回溯真值(已完成但模型未见的实验,零成本但有污染风险)、rubric(秒级,但有本节的结构性偏差)。湿实验本身的角色是最终背书与校准,不是梯度来源。
跟踪点:Periodic Labs 何时报出第一个由 RL 闭环(而非人类直觉+AI辅助)得到的新材料或超导结果——这是 Tier 3 路线成立与否的唯一硬检验,其2026-09那篇技术文只讲训练与服务基建,明确没有报告新验证的材料或超导结果。
UniPat / Humanlaya / 智衍慧生:红杉密集布局的评测赛道
国内"AI评测+高质量训练数据"公司大致分三层,2025年下半年才真正起步,头部公司普遍成立不到一年。真正对标美国 Mercor/AfterQuery/Turing 的是第一梯队。
创始人李宽,前阿里通义AI实验室,主攻训练后分析/数据合成/RL
北京海淀,AI数据实验室,汇聚博士和研究专家
法定代表人朱锡洲,公开资料很少
鼎晖(香港基金)领投,红杉中国/今日资本/BAI资本跟投
阿里领投,腾讯/红杉跟投,估值约25亿美元——赛道最大一笔
三层格局
第一梯队:新一代评测/专家数据公司
- UniPat AI — coding/browser/多模态视觉推理评测,Terminal-X套件(DeepTerminalBench/EvoCode-Bench/RoadmapBench,三件套统一建在 Terminal-Bench 2.0 格式+Harbor 上)+ Monthly-SWEBench/SaaS-Bench/ClawBench;并且自己训模型(UniScientist-30B-A3B、UniMath-35B-A3B),见下
- Humanlaya — One-Million Bench/BiomniBench,专家型高端标注覆盖医疗/金融/法律/制造/教育
- 智衍慧生 — AI行业应用系统集成,业务细节未核实
第二梯队:传统标注商升级中
- 海天瑞声(688787.SH) — 科创板上市,2025营收3.77亿元(+59%)
- 数据堂、云测数据、标贝科技、整数智能、TalkingData
红杉中国的密集布局
UniPat、Humanlaya、智衍慧生三家都有红杉身影,加上红杉自己孵化的 xbench 评测体系(双轨评估:能力上限track+实际落地价值track,"常青评测"动态更新;已发布xbench-ScienceQA/DeepSearch/AgentIF,并与UniPat联合发布BabyVision)——红杉在"评测定义模型价值"这条赛道上是布局最密的机构。
UniPat 不只是评测公司:它自己训模型(2026-09-20 补充)
这一点在早前版本里漏了,但它改变了对这家公司的定性。UniPat 的 GitHub 组织(UniPat-AI,9个公开仓库)里除了 §05 收录的那批 benchmark,还有三个非 benchmark 产品:
| 产品 | 规格 | 方法 | 自报成绩 |
|---|---|---|---|
| UniScientist-30B-A3B 2026-03,科研 agent 模型 | Qwen3-MoE 架构,30B总参/3B激活,Apache-2.0;只有博客,论文标注 Coming Soon | Evolving Polymathic Synthesis:LLM当跨学科出题者、人类专家当高精度验证者;rubric 过三道筛(客观一致性/可区分性/原子性);训练 = agentic SFT + Report Aggregation 目标(N份候选报告合成终版,参考答案由 rubric-based rejection sampling 产生)。数据集 4,700+ 研究级样本、每题20+条rubric、50+学科、专家平均处理时长1–2小时/样本 | FrontierScience-Research 28.3(Aggr@8达33.3)vs GPT-5.2 25.2 / Claude Opus 4.5 17.5;DeepResearch Bench II 48.0 vs OpenAI DR 45.4。公开了完整推理轨迹(放轨迹比放分数负责得多);但训练数据未开 |
| UniMath-35B-A3B 2026-07,奥赛级证明模型 | 基座明确为 Qwen/Qwen3.6-35B-A3B,35B总参/3B激活,Apache-2.0;同样只有博客 | 训练数据监督的是证明的"改动过程":初始草稿(暴露待证义务)→自我评估(proof debt ledger,点名第一个真障碍)→定向修补或改道→终版合成。推理时 pool_refine_tournament:采样自评排序→修补最强非完美候选→存活者两两合并,只有可测量变好才保留 | IMO 2025 35/42、USAMO 2026 36/42、IMO-ProofBench 86.0%(w/o TTS 分别为19.75 / 17.88 / 52.6%) |
| SWE-Vision | agentic VLM 框架(Docker 内有状态 Jupyter) | 是工具,不是 benchmark | — |
团队血统:UniScientist 本质是通义 DeepResearch 的续作
UniScientist 的引用作者共9人,机构署名是 1 UniPat AI,2 北京大学(无阿里署名)。但其中 Kuan Li 就是创始人李宽,而 Baixuan Li、Jialong Wu 与他同为通义 DeepResearch 技术报告和 WebSailor 的核心作者(Tongyi Lab, Alibaba Group)。方法论血统因此很明显:长程信息搜寻 agent、工具循环、rollout 聚合,都是 WebSailor / Tongyi DeepResearch 那条线的延伸。
要说清两件容易混淆的事:①两个模型不是"通义出品",而是建在 Qwen 开源权重上(UniMath 的 HF 元数据明确写了 base_model;UniScientist 架构标签是 qwen3_moe,HF 上唯一那条社区讨论恰恰是来提醒它没标基座);②这批作者是否全部在 UniPat 编制内无法确认,也不排除部分仍在通义、属跨机构合作。
但这层关系解释了阿里为什么领投 3 亿美元:中文媒体的措辞是"阿里拟领投前员工AI 评测公司",新浪那篇标题更直白——"支持前实习生创业项目"。对阿里这是一石三鸟:留住人、UniPat 所有模型都建在 Qwen 上等于免费的生态背书、同时锁定一家评测数据供应商。
当前尚未构成闭环:它自建的 benchmark 是编码/GUI/视觉,模型打的是科研/数学,两边不重叠;真正的风险时点是它哪天用同一条 Evolving Polymathic Synthesis 流水线出一个科研 benchmark——那时训练集与测试集成为同分布产物,不是作弊,但评测会失去信息量。
30B/3B激活这个尺寸本该最受本地部署社区欢迎,却没人跑、没有GGUF量化版、没有实测帖。合理的定性是"融资叙事资产"而不是"开源模型"——它们的作用是支撑25亿美元估值的技术背书。从生意角度这完全成立:UniPat 的客户是模型厂商和企业,下载量75次不影响它卖数据,量子位那一篇报道的价值可能比一万次下载更大。
团队背景核实结果
UniPat 创始人身份公开(李宽,前阿里通义AI实验室),是三家里唯一主动披露创始人身份并拿"大厂技术背景"做背书的。Humanlaya/原壤智能创始人姓名未在任何公开报道中披露,官网无团队页,GitHub组织成员列表不公开,只能确认投资方阵容。智衍慧生公开工商信息仅查到法定代表人,团队背景、产品细节完全没有公开报道,是三家里最低调的一家。
被引用情况:还没跑通"外部采信"这一步
UniPat/xbench/Humanlaya 系的 benchmark 没有查到被 DeepSeek、Qwen、智谱GLM、Kimi、MiniMax 等头部模型官方技术报告正式引用的证据。目前的"被引用"主要发生在自己人之间(UniPat×xbench联合发BabyVision,本质是同一个生态圈互相背书)。对比之下,C-Eval/CLUEWSC/CMMLU/OpenCompass 已被 DeepSeek-V3、Qwen 系列技术报告正式引用——这批新公司的公信力目前更多体现在融资市场(阿里/腾讯领投、25亿美元估值),而不是技术报告引用,这是两种完全不同的信任状态。
2026-09-20 复核后这个结论仍然成立,并且可以给出更细的分级。查到的"被引用"只有四种,前三种都不算外部采信:①UniPat 在评别人——SaaS-Bench / RoadmapBench 榜上有 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro、DeepSeek V4 Pro、GLM 5.1、Kimi K2.6、Qwen 3.6 Plus、MiniMax M2.7,BabyVision 榜上有 Gemini3-Pro-Preview、GPT-5.2、Doubao-Seed-1.8、Qwen3VL-235B——方向是反的;②第三方聚合站转载(BenchmarkList 上有 RoadmapBench 和 BabyVision 的榜单页)——算半步;③生态圈内互相背书(BabyVision = xbench × UniPat,红杉同时投了两边);④真正的反证:Qwen3-Coder-Next 技术报告(2026-03)用的是 SWE-Bench Verified / Multilingual / Pro + TerminalBench 2.0,没有 UniPat 的任何 benchmark。
被引用 ≠ 被信任:中美三层公信力结构对比
Benchmark 的公信力不是单一维度,可以拆成三层,中美两地在每一层的成熟度都不一样:
| 层级 | 🇺🇸 美国 | 🇨🇳 中国 |
|---|---|---|
| ① 跨厂商通用标准 谁在维护,是否被所有lab写进model card | MMLU/GPQA/SWE-bench Verified——起源学术机构,被OpenAI/Anthropic/Google/xAI跨厂商一致采用 | C-Eval/CLUE/OpenCompass/CMMLU——起源高校+国家级研究院,被DeepSeek-V3、Qwen系列技术报告正式引用,地位稳固 |
| ② 数据商自建榜单 是否被除自己客户外的第三方采信 | SEAL/APEX-Agents/GDP.pdf/Riemann-bench已被Anthropic、OpenAI system card引用——但几乎都是"客户引用自己供应商",带明显选择性 | UniPat/xbench/Humanlaya系目前查不到被第三方模型公司技术报告引用的证据,公信力体现在融资市场而非技术报告 |
| ③ 大众/媒体人气榜 面向公众横向对比,非学术/商业采信 | Chatbot Arena/LMArena——曾公信力最高,2025-26因"偏好优化刷票"争议有所下滑 | SuperCLUE、非线智能ReLE——持续追踪主流模型排名,公信力集中在消费者认知层面 |
两地格局本质相同:真正跨厂商通用的始终是非商业化的学术标准,数据商榜单最多做"细分领域补位+销售背书"。差别在于成熟度——美国数据商榜单已经小范围打入头部lab的正式system card,中国这批2025年才起步的新公司,信任目前还停留在"资本市场买单"。
一个判断行业进入新阶段的信号
什么时候能看到非自己客户的第三方大模型公司在技术报告里引用 UniPat/Humanlaya/xbench 的榜单,会是中国数据商评测赛道从"融资叙事"跃迁到"行业采信"的实质性信号——目前还没有观察到。
Benchmark 聚合站导航
Agent 专用、方法论最严谨
HAL — Holistic Agent Leaderboard hal.cs.princeton.edu
普林斯顿SAgE团队+ICLR 2026论文。只收9个真正的多步agentic benchmark(不收MMLU这类纯知识题),核心价值是同时记录模型和scaffold两个维度——每个"模型×scaffold"组合单独打分。9个模型×9个benchmark,21,730次rollout,约4万美元验证成本。目前已暂停接受新提交,转向"agent可靠性"研究(一致性/可预测性/鲁棒性/安全性/拒答率)。学术公信力扎实(Princeton+ICLR,OpenAI给过API credits支持),但还没被头部lab在自家system card里正式引用。
综合性实时打分聚合站
| 站点 | 特点 |
|---|---|
| Artificial Analysis | 横向对比模型智能/速度/价格 |
| OpenRouter Benchmarks | 基于真实API调用流量,偏agent/生成类场景 |
| llm-stats.com | 300+模型排名 |
| BenchLM.ai | 追踪439个benchmark,八大分类 |
| Epoch AI Benchmarks | 收录第三方结果+自跑内部评测 |
| AIMultiple | 号称收录800+,覆盖面最广但深度参差 |
GitHub 静态 curated 列表
| 仓库 | 特点 |
|---|---|
| philschmid/ai-agent-benchmark-compendium | 50+ agent benchmark,四大类分类最清晰 |
| panilya/awesome-ai-benchmarks | 100+ benchmark,覆盖面广 |
| supernalintelligence/Awesome-General-Agents-Benchmark | 专注通用agent能力 |
| benchflow-ai/awesome-evals | "non-BS"精选资源 |
九个可以带走的判断
- Benchmark 是训练数据/RL环境这门 85 亿美元生意的销售触角,不是独立产物——打分器(grader/verifier)才是整条链路里最贵、最核心的部分,这决定了谁有动机做 benchmark、谁没有。
- 数据商榜单是销售漏斗,学术榜单是公共基础设施——前者的成功标准是"转化了多少客户",后者是"被多少论文/system card引用",中美格局本质相同,中国的差距在成熟度不在结构。
- 接近一半的benchmark需要专属harness,且大多是各家专属自建、不共享——只有 Harbor 生态是罕见的例外,正在被多个不同背景的数据商共同采用。
- Harness/scaffold选择对分数的影响,经常超过模型本身的能力差距(可达48个百分点)——已经是独立的学术研究方向(Harness-Bench等),而不是巧合发现。
- 科研类benchmark已经从"稀缺"变成"扎堆但碎片化"——2026上半年至少7-9个新的科研agent benchmark密集涌现(Meta、Microsoft、EPFL、上海AI实验室等背景各异),但没有一个成为跨实验室共同采用、写进system card的标准,瓶颈从"没人出题"变成了"没人形成共识",而且科研任务开放度高、rubric主观性强,让 §06 的harness敏感性问题在这个方向上表现得比coding类更极端(GAIA同题466道,跨榜单分数摆动44.8%到92.36%)。
- 被引用≠被信任,公信力要拆成三层看——通用标准层、数据商榜单层、大众人气层,中美两地在每一层的成熟度都不一样,笼统说"某某榜单权威"是不准确的。
- 中国新一批"评测优先"公司还没跑通"被第三方model card采信"这一步——目前的公信力来自融资市场(阿里/腾讯/红杉),不是技术报告引用,这是判断它们能不能真正站稳的关键观察点。而 UniPat 已经不是纯评测公司(它自己训 UniScientist / UniMath),"出题者同时参赛、且裁判的技术口味有来处"是 §09 新增的一类利益冲突,比美国那种"客户引用自己供应商"更难察觉。
- 中美两边在方法上已经收敛到同一个解法:rubric 化——把开放式任务拆成 N 条可独立判定的条目。但它的代价是把评测目标从"对不对"悄悄换成了"全不全":rubric RL 之后存在性条目上升,而事实正确性、简洁性、相关性、整体质量全部下降,无 rubric 的裁判甚至偏好训练前的基座模型。差距不在判分精度(单条判定已达人类专家一致性水平),而在"N条加总=质量"这个聚合假设。所以看任何 rubric 榜单,第一个该问的是判分器与人类专家的一致性数字——目前十家里只有四家公开。
- 只有外部真值能纠回这个替换,而湿实验目前不在任何前沿模型的 RL 回路里——三大 lab 把湿实验用在事后验证和数据回流两个位置(Anthropic 走得最远:自建湿实验室 + 资助外部验证),把物理实验当 RL 环境的只有 Periodic Labs、Lila 这类放弃了通用性的新公司,原因是时间尺度差3–5个数量级。因此带真值的科研 benchmark 必然小样本、慢、贵,它的定位应该是校准器而不是排行榜——一层大而廉价的 rubric 评测跑日常迭代,一层小而昂贵的真值评测定期校准前者,而中间那个校准层(用真值回归 rubric 权重)目前无人实现。