jimmy·research
AI INFRASTRUCTURE · BENCHMARK SUPPLY CHAIN

谁在出题,谁在打分,题目本身能不能信

一份关于 AI / Agent benchmark 供应链的研究:数据服务商自建榜单 vs 学术公共标准,中美对比,以及一个大多数人没意识到的方法论陷阱——评测里的 harness/scaffold。

"模型 M 在 X 榜单上 65 分"这句话本身没有信息量——你不知道换一个 harness 会怎样。比较两个这样的数字,比的是两个系统,不是两个模型。

2026-09 · 持续更新 · 完整调研笔记见 jimmy·research daily_research 存档

64+
本文追踪的 benchmark 数
~47%
需要专属 harness 才能测
48pt
同模型换 harness 的最大分差
2
互不打通的 harness 生态圈
01分类框架

一个 benchmark,五个独立维度

在看数据之前先立一个分析框架——下文所有判断都沿着这五个维度展开,它们互相独立,同一个 benchmark 在五个维度上的取值组合,基本决定了它的商业逻辑、公信力上限、以及能不能被拿来做客观对比。

维度取值决定了什么
① 出题主体数据/环境商业公司 · 学术/研究院 · 大厂自建(实验室自己出题考自己和同行)· 平台/市场(不出题,只做基础设施)商业动机是否存在,是否有"裁判兼运动员"的利益冲突
② 评测对象静态知识/推理 · Agentic能力(多步骤/工具调用)· 垂直职业能力(投行/法律/医疗/科研)题目能不能用选择题出,间接决定成本和可自动化程度
③ 评测方式纯API调用 · 需要专属harness/环境 · 需要人工评审是否存在"换个脚手架分数就变"的方法论陷阱(见 §06)
④ 开放度完全开源 · 部分公开(防训练污染)· 完全私有能否被第三方复现验证,题库会不会被刷分
⑤ 地域生态美国 · 中国,及各自不同的"什么才算被采信"的机制被引用≠被信任,两地的信任建立路径完全不同(见 §04、§09)

五个维度里,①决定动机、③决定方法论风险、⑤决定公信力天花板——这三个是本文反复回到的主线,②④更多是描述性的分类标签。

02供应链经济学

Benchmark 不是凭空出现的:一条任务怎么被生产、定价、卖出去

要理解"为什么会有这么多商业公司抢着做 benchmark",得先看懂这门生意本身的经济结构——benchmark 只是这条供应链露出水面的那一角,水面下是训练数据+RL环境的整条产业链。

$85亿
2026年数据/环境vendor行业合计年收入
75%+
收入集中在老四家(Scale/Surge/Mercor/Handshake)
$200-2000
单条任务制作费(主流区间)
4-5×
独占权相对非独占的溢价倍数

一个"可售卖环境"的四个组件

制作费贵在造初始状态和打分器:专家要找到真实、有难度、前沿模型确实会失败的场景,构造干净复现环境,写模型作弊不了的验证测试——这也是为什么"需要harness"的benchmark(§05统计约47%)普遍比纯知识题贵得多、也难得多。

价格结构

计价单位价格区间说明
单条任务200到2,000美元主流;复杂软件工程任务偶见2万美元
网站/UI gym复刻约2万美元/个OpenAI据报按此采购浏览器环境
高保真产品复刻最高约30万美元/个Fleet这类企业软件复刻
季度合同六到七位数美元/季度lab与头部vendor的常见形态
独占溢价非独占的4到5倍lab不想竞对拿到同一份

四种生产模式

模式代表特点
手工精品Mechanize全职专家逐条打磨,深度优先,"少而深"
流水线复刻Fleet、Scale RL Environments软件复刻模板+工具链,一底座衍生上千任务,可卖多家
平台+市场HUD、Prime Intellect自己不做环境,提供SDK/托管/撮合,"卖铲子给淘金者"
专家网络出题Mercor、Handshake、Surge人力池找专家出题+人工或rubric判分,往自动化环境靠拢中

领域分布:coding是圣杯,science从"空白"变成"扎堆但没有标准"

Coding被称为"圣杯"——长程推理、工具调用、有状态、错误恢复、反馈密集(编译/测试即奖励),是当前投入最集中的领域,其次是computer-use/企业软件。医疗/法律/金融靠专家出题为主。

2026-09 更新:本节早先版本判断"science几乎空白"——这个结论已经过时,需要修正。2026年上半年密集涌现了至少 7-9 个新的科研agent benchmark(AutoResearchBench、ResearchClawBench、SciAgentArena/Microsoft、MLR-Bench、AIRS-Bench、HeurekaBench等,详见 §07),分布来自 Meta、Microsoft Research、EPFL、上海AI实验室(InternScience) 等不同背景机构,题目不再稀缺。但瓶颈从"没人出题"转移到了"没人形成共识"——这些benchmark彼此覆盖科研生命周期的不同片段(有的测想法/规划,有的测执行,彼此不衔接),且没有一个被多个实验室共同采用、写进system card的标准,根本原因不再是缺自动化验证器(rubric+LLM judge已经能绕开这个限制),而是科研任务本身开放度太高、专家rubric主观性太强,导致同一题目换个评测方,分数就可能大幅摆动——这正好呼应 §06 的harness敏感性问题,且在科研类benchmark上表现得更严重(见 §07 的 GAIA 案例)。补位这个空白的仍然不是标注公司本身,而是"实验室即奖励函数"(Periodic Labs)和"科研软件公司直连lab"(Anthropic×Benchling)——它们绕开benchmark这层,直接拿真实实验结果当训练信号。

03全景:谁在做 benchmark

两种出题人,两种动机

AI benchmark 现在有两类完全不同的生产者。一类是数据/环境服务商——它们既卖训练数据、RL 环境,也自己出题打分,评测本质是销售漏斗的第一环:诊断模型哪里弱,再反向把数据/环境卖给你补短板。另一类是学术/研究院机构——目的是给整个行业一把公共的比较尺子,不挂钩商业转化,被引用是它们唯一的"回报"。

这两类在中美两地各自演化出了一套体系,四象限如下:

🇺🇸美国 · 数据商自建

  • Scale AI — SEAL Leaderboards(含 SWE-bench Pro)
  • Surge AI — Hemingway-bench / AdvancedIF / GDP.pdf / Riemann-bench
  • Mercor — APEX 系列(-1 / -SWE / -Agents / -Accounting)
  • Handshake AI — BankerToolBench / ATLAS-Finance / VIALS
  • HUD — OSWorld-Verified / SheetBench-50
  • Fleet、Mechanize 没有独立冠名的公开榜单
SEAL / APEX-Agents / GDP.pdf / Riemann-bench 已被 Anthropic、OpenAI system card 正式引用

🇺🇸美国 · 学术 / 社区通用标准

  • MMLU / MMLU-Pro、GPQA Diamond、HLE
  • GSM8K、MATH、AIME
  • HumanEval、MBPP、SWE-bench Verified、LiveCodeBench
  • AgentBench、WebArena、τ-bench
  • Chatbot Arena/LMArena、AlpacaEval、MT-Bench
几乎所有 frontier lab 发新模型必报,是事实上的行业通用货币

🇨🇳中国 · 数据商自建

  • UniPat AI — 2026-09 阿里领投 3 亿美元 A 轮,估值 25 亿美元
  • Humanlaya(原壤智能)— One-Million Bench / BiomniBench
  • 红杉 xbench — ScienceQA / DeepSearch / AgentIF / BabyVision
  • 智衍慧生 — 腾讯入股,资料稀少
  • 海天瑞声 / 数据堂 / 云测数据:有评测服务能力,未产品化成公开榜单
几乎查不到被第三方模型公司技术报告正式引用的证据

🇨🇳中国 · 学术 / 国家队通用标准

  • C-Eval(上海交大+清华+爱丁堡)
  • CLUE / CLUEWSC、CMMLU
  • 智源研究院 FlagEval
  • 上海 AI 实验室 OpenCompass / 司南
  • SuperCLUE、非线智能 ReLE
C-Eval / CLUEWSC / CMMLU / OpenCompass 已被 DeepSeek-V3、Qwen 系列技术报告正式引用

把四象限叠在一起看,中美格局本质相同:真正跨厂商通用的始终是非商业化的学术标准,数据商榜单最多做"细分领域补位+销售背书"。差别在于成熟度——美国的数据商榜单已经打进了个别头部 lab 的正式 system card(哪怕只是自己客户在秀成绩),中国这批 2025 年才起步的新公司,信任目前还停留在"资本市场买单",尚未看到被头部大模型公司技术报告正式采信。

04动机

数据商为什么要自建 benchmark:一本损益表

不是所有数据商都做了自己的 benchmark——老四家(Scale/Surge/Mercor/Handshake)+ 新三家里的 HUD 共 5 家做了且产品化对外冠名;Fleet、Mechanize 没做,恰好是团队规模最小、打法最"精品/垂直"的两家,把有限专家资源全押在核心产品上。

✅ 好处

  • 免费权威背书:被 lab 的 system card 引用,等于第三方权威认证
  • 反向证明生产能力:能出"前沿模型也会失败"的题,本身就是在向买家秀专业水位
  • 定义评测标准=抢话语权:lab 要跑分就绕不开你
  • 反哺数据飞轮:跑榜看到失败模式,直接用来设计下一批训练任务
  • 差异化定位:APEX 主打职业任务、BankerToolBench 扎投行,避开同质化

❌ 坏处

  • 裁判兼运动员悖论:既卖数据又打分,参考 Scale 因 Meta 入股被质疑中立性后客户集体撤单
  • 维护成本高:题库会被刷分/过拟合,必须持续换题防泄露
  • 声誉是脆弱资产:一旦被曝题目提前泄露给某家训练,代价远大于收益
  • 分散核心业务精力:本质是市场活动,资源错配风险
  • 反噬风险:自家客户模型在自家榜单排名不佳会很尴尬

自建 benchmark 更像是"规模够大、专家资源够厚"之后的品牌溢价打法,不是数据/环境供应商的标配——Fleet 和 Mechanize 不做,反而印证了榜单是锦上添花,不是生存必需品。

05完整目录

64 个 benchmark 逐一拆解

每个 benchmark 统一记录六项:题库规模 / 开源状态 / 评估能力 / host 方 / 被模型公司引用情况 / 评测方式(纯 API 还是需要专属 harness)。按四象限分组,点开展开。

🇺🇸 美国 · 数据商自建16 个
Benchmark题库规模开源评估能力Host被引用评测方式
Scale SEAL Leaderboards每子榜约1000题私有代码/西语/指令遵循/数学Scale AIAnthropic Opus 4.6人工评审
Scale SWE-bench Pro1,865题(公开731+held-out858+私有276)部分公开真实代码库工程修复Scale AI未查到需harness
Surge Hemingway-bench未披露私有创意/商业写作质量Surge AI未查到人工评审
Surge AdvancedIF1,600+条prompt私有复杂多轮指令遵循Surge AI(与Meta MSL合作)未查到MSL正式引用专家rubric
Surge GDP.pdf100题(10职业领域)私有真实职业文档理解Surge AIOpenAI GPT-5.6、Anthropic Fable5/Mythos5人工评审
Surge Riemann-bench25题方法论公开研究级前沿数学Surge AIAnthropic Fable5/Mythos5API+自动校验
Mercor APEX-1隐藏400题+HF开源100题部分公开投行/咨询/律所/医生Mercor未查到纯API+judge
Mercor APEX-SWE200题(50题HF开源)部分公开真实软件工程集成/调试Mercor未查到需harness
Mercor APEX-Agents480题完全开源长时程跨应用专业服务agentMercor(Archipelago)Anthropic Opus 4.6需harness
Mercor APEX-Accounting160任务(10个"world",每个含一套会计系统+表格+PDF)任务CC-BY开源,环境Archipelago开源Agentic会计任务(与Ramp合作开发)Mercor未查到需harness(Archipelago)
Handshake BankerToolBench100题完全开源端到端投行工作流Handshake AI Research未查到Harbor
Handshake ATLAS-Finance100题(13个金融仿真环境)完全开源金融机构多应用协作Handshake AI Research未查到Harbor
Handshake VIALS161题完全开源生命科学视觉理解(VQA),属ATLAS评测套件家族Handshake AI Research未查到,2026-08发布(arXiv 2608.21357)API+LLM judge,最强模型准确率仍<30%
HUD OSWorld-Verified369+桌面任务公开真实桌面环境操作XLang Labs原创,HUD维护OpenAI/Google/Claude等广泛测试hud-python SDK
HUD SheetBench-5050题完全开源表格分析师操作能力,PwC/Cisco/Schwab/Fannie Mae的CFO级专家参与评审HUD × Sepal AI(YC S24)联合开发未查到,PwC等企业内部用hud-python SDK
Mechanize GBA Eval单任务(24小时长时程)方法论公开极限长时程软件工程Mechanize自测,未查到反向引用Docker+goose

一个有意思的并购交叉点:帮 HUD 做 SheetBench-50 的 Sepal AI(YC S24,2万+专家网络),在 2026-02-06 被 Mercor 收购——也就是说,帮某家数据商的竞争对手做过评测集的团队,后来被这家竞争对手买走了。

🇨🇳 中国 · 数据商自建13 个
Benchmark题库规模开源评估能力Host被引用评测方式
xbench-ScienceQA100题完全公开科学知识问答/推理xbench.org(红杉中国)未查到纯API
xbench-DeepSearch100题完全公开中文互联网深度搜索xbench.org未查到固定ReAct agent(5工具)
AgentIF-OneDay104任务/767评分点完全公开Agent日常场景指令遵循xbench.org未查到不限架构,看交付物
BabyVision388题+Mini版20题代码公开但无license文件纯视觉理解/推理(arXiv 2601.06521)xbench.org×UniPat联合公关案例纯多模态API
UniPat Monthly-SWEBench每月约100题/约20仓库,多语言无公开仓库(仅榜单页)真实GitHub issue,月更防污染unipat.ai未查到Harbor+Terminus-2
UniPat SaaS-Bench23系统/106任务/3971检查点开源 Apache-2.0GUI agent操作真实SaaS(arXiv 2605.15777)unipat.ai未查到自建Docker+browser-use
UniPat DeepTerminalBench50任务仅见于Terminal-X仓库描述,未单独开仓单轮深度工程(Terminal-X"深度"分支)unipat.ai未查到Terminal-Bench 2.0格式+Harbor
UniPat RoadmapBench115任务/17代码库/5语言开源 MIT编码agent按规范升级版本(长时程)unipat.ai未查到Harbor+OpenHands
UniPat EvoCode-Bench26任务/5-15轮/227评估轮次开源 MIT多轮编码应对需求变更(arXiv 2605.24110)unipat.ai未查到Harbor多轮fork
UniPat ClawBench未披露开源,归属存疑浏览器agent真实网站任务NAIL Group(UniPat为参与方)未查到默认OpenClaw
Humanlaya One-Million Bench400题(中英各200)开源5大领域37子域专家任务humanlaya.com自测50+模型API+负向rubric
Humanlaya BiomniBench100任务(50公开+50私有)部分开源生物医药research agent过程级评估xbench.org,与Phylo/Humanlaya联合未查到,与Stanford Biomni配套Harbor+Terminus-2
Humanlaya ExcelBench补充核实后确认:Humanlaya 官网/GitHub/HuggingFace 均无独立发布的 ExcelBench 题库或论文,判断是媒体报道对"Excel建模类任务"的泛称,不是一个正式产品,不再作为独立 benchmark 计入统计。
海天瑞声内部测评体系无公开规模不开源,B2B通用语言+安全可靠性(6大能力19子能力)海天瑞声(DOTS-LLM)未查到API+人工评审(推测)
一处必须区分的撞名:有两篇不同的 SaaS(-)Bench。① SaaS-Bench(arXiv 2605.15777)是 UniPat 的,Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?,23系统/106任务;② SaaSBench(arXiv 2605.17526)是中科大 + 高德(阿里巴巴)的,Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering,30任务/5,370验证节点。两者不是同一个东西,搜索结果里经常被混在一起。补充一层反讽:阿里是 UniPat A 轮的领投方,而阿里自家团队又发了一个同名 benchmark——说明"企业级 SaaS 编码评测"这个细分正在被多方同时占坑,UniPat 在此并无独占性。

开源口径细化(2026-09-20 GitHub API 实测):UniPat 的 9 个公开仓库里,真正带明确许可证的只有 4 个——SaaS-Bench(Apache-2.0)、RoadmapBench(MIT)、EvoCodeBench(MIT)、harbor_multiturn(Apache-2.0);BabyVision / UniScientist / SWE-Vision / Terminal-X / unimath 代码公开但没有 license 文件(严格说不算开源,企业使用有法律风险);Monthly-SWEBench 无公开仓库。stars 数也值得一看:编码类 benchmark 只有 16–28,而模型和 BabyVision 是 172–253——需要 clone 才能跑的东西热度极低,能直接下载或话题性强的反而高。

🇺🇸 美国 · 学术/社区通用标准28 个
Benchmark题库规模开源评估能力Host被引用评测方式
MMLU14,042题完全公开57学科知识UC Berkeley等事实通用标准纯API
MMLU-Pro12,032题完全公开更难多任务理解TIGER-LabMMLU饱和后替代纯API
GPQA Diamond198题(物理82/化学78/生物38)公开(部分限访问)博士级科学难题Rein et al.OpenAI/Anthropic/Google/xAI均报纯API
BIG-Bench Hard23任务(每任务>100例)完全公开语义/数值/逻辑推理BIG-bench社区部分被GPQA/MMLU-Pro取代纯API
HLE2,500题(100+学科)完全公开研究生级前沿知识CAIS+Scale AI联合主流厂商采用为高难度标准纯API
GSM8K8.5K题完全公开小学数学应用题OpenAI已饱和纯API
MATH12,500题完全公开高中数学竞赛难度Dan Hendrycks等通用标准纯API
AIME(LLM评测用)每年约15题完全公开顶尖竞赛数学美国数学竞赛协会推理模型标配纯API,需多采样
HumanEval164题完全公开Python函数级代码生成OpenAI已高度饱和代码沙箱(非agentic)
MBPP974题完全公开入门Python编程Google Research常搭配HumanEval代码沙箱(非agentic)
SWE-bench Verified500题(全集2000+)完全公开真实GitHub issue修复Princeton+Stanford+UChicagoagentic coding通用标准Docker,允许自定义scaffold
LiveCodeBench滚动约400-600题完全公开竞赛编程,防污染滚动更新UC Berkeley系强调防污染厂商常引用代码沙箱(非agentic)
AgentBench8个环境完全公开多环境agent推理决策THUDM(清华)学术圈广泛引用统一text协议
WebArena6个自建网站/812题完全公开真实网页导航/操作CMU学术公认标准自部署网站,scaffold不统一
τ-bench(含Airline)几十到上百任务完全公开工具调用+多轮客服交互SierraOpenRouter收录(123模型)官方区分标准/自定义提交
RULER合成任务四类完全公开长上下文真实有效长度NVIDIA长上下文常用参考纯API
NIAH方法论,无固定题库完全公开长文本信息检索社区(Greg Kamradt)已饱和,被RULER取代纯API
LongBench21数据集(中英)完全公开长文档QA/摘要等6大类清华KEG(智谱前身)中文长上下文常见引用纯API
MMMU11.5K题(30学科)完全公开多模态大学水平理解学术团队多模态通用标准纯API(图文)
MathVista6,141题完全公开视觉情境数学推理AI4Math学术团队多模态数学常见引用纯API(图文)
Chatbot Arena/LMArena无固定题库,众包投票平台开源综合对话偏好LMSYS起源,2026拆分营利公司曾最具公信力,近年因刷票争议下滑真人投票平台
AlpacaEval805条固定指令完全公开单轮指令遵循偏好Stanford学术常引用API+LLM judge
MT-Bench80组多轮问题完全公开多轮对话能力LMSYSLLM-as-judge方法论验证集API+judge
TruthfulQA817题完全公开抗常见错误认知的真实性学术团队安全/真实性常见对比项纯API
SimpleQA4,326题完全公开简短事实性问答准确率OpenAI事实性/幻觉率标准纯API
BrowseComp1,266题完全公开多步网页浏览定位信息OpenAIDeep Research类常见评测项需搜索工具,scaffold不统一
DeepSearchQA900题(17个领域)开源(HF: google/deepsearchqa,Apache 2.0)多跳深度研究型问答,"因果链"结构题Google DeepMind(非独立学术团队)OpenRouter收录,参与模型很少需搜索工具调用
WideSearch200题(中英文各100)开源(GitHub+HF)广度优先信息采集字节跳动 ByteDance-Seed 团队(非西方学术)参与模型很少需搜索/浏览工具

修正说明:DeepSearchQA、WideSearch 补充核实后发现并非独立学术团队产物,分别是 Google DeepMind 和字节跳动 ByteDance-Seed 团队的自建评测——严格说应归入"大厂自建"这个本文未单列的第五类(既不是纯学术社区,也不是本文定义的第三方数据商)。

🇨🇳 中国 · 学术/国家队通用标准7 个
Benchmark题库规模开源评估能力Host被引用评测方式
C-Eval13,948题(52学科)完全开源知识与推理上海交大+清华+爱丁堡DeepSeek-V3、Qwen2.5纯API
CLUE/CLUEWSCCLUE9大任务完全开源中文NLUCLUE学术社区DeepSeek-V3、Qwen2.5纯API
智源FlagEval90+数据集/200万+题目平台开放,部分开源语言/多模态图文/文生图文生视频北京智源(BAAI)未查到正式引用,智源自发榜部分需要环境
OpenCompass/司南70+数据集/40万+题目完全开源语言/推理/知识/代码/数学/agent上海AI实验室Qwen技术报告明确引用部分需要(agent维度)
SuperCLUE三大基准,几百到几千题开源通用+专项+行业能力SuperCLUE团队(CLUE系独立)未查到被自身技术报告引用,第三方追踪榜需交互环境
ReLE(非线智能)374模型/约300细分维度开源教育/医疗/金融/法律/agent非线智能(独立社区)未查到,面向媒体/社区部分需要(agent维度)
CMMLU11,528题(67学科)完全开源中文语境知识与推理独立学术团队(ACL发表)Qwen系列明确引用纯API

统计口径:需要专属harness/环境的 30 个(~47%),部分需要 3 个,纯API 24 个,需人工评审 4 个,特殊平台型 1 个(Chatbot Arena),信息不足 2 个。HumanEval/MBPP/LiveCodeBench 虽然"需要执行环境",但属于单轮代码生成+沙箱测试,不存在多步 agent scaffold,不适用于下一节讨论的"harness 敏感性"问题。

06方法论陷阱

Harness 敏感性:同一个模型,换个脚手架,分数能差 48 分

Harness 和 Scaffold 不是一回事,但业界普遍混用

按 Hugging Face 的 agent glossary,Scaffold(脚手架)是"行为定义层"——system prompt、工具描述、响应怎么解析、跨步骤记住什么,发生在第一个 prompt 之前;Harness是"执行层"——调用模型、分发工具调用、决定何时停止,处理第一个 prompt 之后的一切。业界流行公式是 Agent = Model + Harness。但实际用法里两者经常被当同义词——Claude Code 官方文档就直接自称"the agentic harness around Claude",把 scaffold 该管的事也算进了 harness 里。本文和大多数论文一样,把这两层统称为"harness"。

三层拆解:环境 / agent(scaffold) / 模型

一次 benchmark 测试其实叠了三层:环境 infrastructure(沙箱/Docker/可部署系统,谁维护)→ agent/scaffold(标准化默认还是允许自带,比如 Terminus-2 vs Claude Code)→ 模型(真正被评的 LLM)。目前查到的环境基础设施分成两大互不打通的生态圈:

🔗 Harbor 生态

Laude Institute(Terminal-Bench 创建者)开源,Apache 2.0。task.toml 统一格式,把环境/agent/模型三层显式解耦,内置 agent 清单含 claude-code、codex、aider、gemini-cli、opencode、OpenHands、goose、mini-swe-agent 等。

  • BankerToolBench、ATLAS-Finance(Handshake)
  • BiomniBench(Humanlaya,固定harness=Terminus-2)
  • Monthly-SWEBench、RoadmapBench、EvoCode-Bench(UniPat Terminal-X套件)
  • Terminal-Bench、SWE-Bench适配层
目前唯一实现"agent 层真正在多个不同数据商之间通用"的基础设施

🏰 各家自建独立体系

也做了环境/agent分层,但 agent 抽象层自己设计,不与其他厂商共享。

  • Scale:SWE-bench Pro 自家Docker三层镜像
  • Mercor:Archipelago(自研,APEX-Agents专用,默认ReAct toolbelt)
  • HUD:hud-python SDK(OSWorld-Verified/SheetBench-50)
  • Mechanize:自建Docker(GBA Eval,已知提交用过Claude Sonnet 5+goose)
搭建维护 harness 本身是数据商的核心资产和护城河,通用化会削弱差异化优势

实锤数据:分数摆动幅度远超模型能力差距

案例固定/标准 harness原生/自定义 harness差距
Claude Opus 4.7 · BiomniBenchTerminus-2:63.94Claude Code:73.349.4 分
Claude Opus 4.5 · SWE-bench ProSEAL scaffold:45.9%Claude Code:55.4%~10 分
同类模型 · SWE-bench Verifiedmini-SWE-AgentOpenHands:77.6%数个百分点
WebArena 某模型原始harness:25%强化agentic scaffold:55%30 分
HAL统计 · SWE-bench Verified Mini顶尖模型换不同scaffold最高近48分

问题的本质:"一个 leaderboard 条目写着'模型 M,SWE-Bench Verified 65%',这句话本身没有信息量——你不知道换个 scaffold 会怎样。比较两个这样的数字,比的是两个系统,不是两个模型。"(论文 Stop Comparing LLM Agents Without Disclosing the Harness,arXiv 2605.23950)

厂商能不能自己指定 harness?能,而且是默认做法

常用开源 harness 清单

Harness类别维护方特点
SWE-agent代码/SWEPrinceton系学术团队提出agent-computer-interface范式,引用最多
OpenHands代码/SWE,通用agent平台开源社区自带SWE-bench适配器,功能重
mini-SWE-agent代码/SWE开源社区极简harness,常作标准化对照组
Terminus-2终端/CLI任务Terminal-Bench官方(Harbor)Terminal-Bench 2.0默认标准harness
Agent-S / S3桌面/computer-useSimular(开源)首个在OSWorld超越人类的agent(72.6%)
UI-TARS桌面/GUI grounding字节跳动(开源)端到端训练,UI元素当一等公民
τ-bench harness客服/工具调用Sierra(开源)模拟用户+工具+数据库交互
Harbor通用评测/RL环境框架Laude Institute(开源,Apache 2.0)多家数据商共用的标准化基础设施
goose通用coding agentBlock(开源)Mechanize GBA Eval等用它做原生harness
OpenCode通用coding agent开源社区(MIT,208k+ star)Harbor内置agent之一,75+模型provider支持

各家大模型公司自测常用 harness

公司自测常用harness备注
AnthropicClaude Code(自家产品)SWE-bench Pro上比标准scaffold高约10分
OpenAICodex CLI(自家产品)Terminal-Bench 2.0中唯一不用官方Terminus-2的参评方
GoogleGemini CLI + 开源computer-use-preview参考实现主要针对浏览器/GUI,桌面操作官方称"尚未优化"
中国头部模型(DeepSeek/Qwen/GLM/Kimi)未查到公开披露agentic评测极少注明scaffold,纯知识类直接裸API

一个反直觉的发现:Holistic Agent Leaderboard(HAL)做了21组模型-harness控制变量对比(Claude Code / Codex CLI / Pi,覆盖7个模型×SWE-bench Lite+Terminal-Bench 2.0),12组对比里有9组是"换一个非自家 harness 反而分数更高"——说明厂商自用的 harness 未必客观最强,更可能只是"自己最熟练调优过的那一个"。

07AI4S 专题

科研类 benchmark:题目不缺了,缺的是一个大家都认的标准

咱们清单里九成打着"科学"标签的 benchmark(GPQA/HLE/Riemann-bench/xbench-ScienceQA/MMMU/MathVista)测的都是科学知识水位——懂不懂科学,不是会不会做科研。真正测"AI 做科研过程能力"的曾经极度稀缺,但这个判断在 2026 年上半年已经被打破——一批新 benchmark 密集涌现,下表先给全景,再深挖其中规格最重的 BiomniBench。

2026 上半年新涌现的科研 agent benchmark

Benchmark发布Host规模测什么开源
AutoResearchBench2026-04(arXiv 2604.25256)学术团队-科学文献发现能力(Deep Research单篇溯源+Wide Research批量检索),非过程评测开源
ResearchClawBench2026-06(arXiv 2606.07591)InternScience(上海AI实验室/OpenGVLab系)40任务/10科学领域基于真实发表论文,隐藏目标论文,专家多模态rubric打分——与BiomniBench同路数但覆盖领域更广开源
SciAgentArena2026-06(arXiv 2606.12736)Microsoft Research约200任务跨尺度科研(单细胞组学/空间组学/药物发现/电子病历/遗传学),stepwise verification,测了18个agent未明确
MLR-Bench2025-05(arXiv 2505.19955),NeurIPS 2025收录学术团队201任务(源自NeurIPS/ICLR/ICML workshop)idea→proposal→实验→写论文全流程,MLR-Judge自动评审开源
AIRS-Bench2026-02(arXiv 2602.06855)Meta/Facebook Research20任务(源自SOTA机器学习论文)完整研究生命周期(想法生成→实验分析→迭代优化),不提供baseline代码开源
HeurekaBenchICLR 2026EPFL(mlbio-epfl)已实例化为sc-HeurekaBench(单细胞生物学)本质是"生成benchmark的框架":论文提取insight→转QA→agent自主分析验证开源
StatefulDiscovery2026-06(arXiv 2606.11851)学术团队复用40个真实数据任务严格说是评测方法论/agent架构(显式discovery state控制),不是独立题库-

额外发现同类项目:InquiTree(arXiv 2606.09550,评测paper-derived research tree式科学探究)、AstaBench(arXiv 2510.21652)、SoundnessBench(arXiv 2605.30329,测AI能否分辨"好/坏研究想法")。

中国侧的科学评测体系

中国的科学 benchmark 集中在上海 AI 实验室这条线,加上红杉 xbench 和 Humanlaya 参与的项目,特点是体系化平台多于单点过程级评测:

BenchmarkHost测什么层级AI 表现
司南科学智能评测体系上海 AI 实验室(OpenCompass)覆盖科研全流程的评测平台平台结论:模型科学能力短板明显
SFE (Scientific Foundation Evaluation)上海 AI 实验室66 个任务,5 个科学领域,中英双语,"信息感知→属性理解→比较推理"三层知识/推理(多模态)主流模型仅约 30 分
SciHorizon学术团队(arXiv 2503.13503)数学/物理/化学/生命/地球与空间 5 大领域 16 个维度测 50+ LLM,同时评估科学数据是否"AI 就绪"知识/推理+数据就绪度体系化诊断,无单一头条分
SciEval学术团队(NSFC 资助)多层级科学问答知识/推理—
ResearchClawBenchInternScience(上海 AI 实验室系)40 任务/10 领域,隐藏目标论文,专家 rubric科研过程最强系统(Claude Code)仅 21.5/100
xbench-ScienceQA红杉 xbench100 题科学问答知识/推理未见第三方引用
BiomniBenchStanford + Phylo + Humanlaya(中方数据实验室参与)见下文科研过程前沿模型 62–73

AI 在科学领域做得怎么样:四个判断

  1. "懂科学"和"做科研"差距很大:选择题式的 GPQA 已接近饱和,但一旦要 agent 自己选方法、解读结果,分数掉到 20–70 分区间(ResearchClawBench 21.5、BiomniBench 62–73)。
  2. 最大的问题是编造和浅尝辄止:MLR-Bench 发现 80% 的案例编造或无法验证结果;BiomniBench 常见漏掉关键分析步骤;SciAgentArena 发现 agent 做不出新颖洞见。看起来完整、科学上站不住,比答错一道题更危险。
  3. AI 大致追上初级科学家,还没超过资深科学家:BiomniBench 早期人类基线——资深制药科学家 68.5、最好 AI 65.0、初级科学家 48.5。
  4. 中美共同的瓶颈是没有共识标准:美国强在多家机构(Meta/Microsoft/Stanford/FutureHouse)的重投入过程级评测,中国强在体系化平台(司南/SFE/SciHorizon)。两边都还没有一个被几家头部实验室共同写进 system card 的科研标准。
成绩普遍很低,且没有一个成为跨实验室标准:AutoResearchBench的Deep Research准确率仅9.39%;ResearchClawBench上最强系统(Claude Code)平均分仅21.5/100;MLR-Bench发现coding agent在80%的案例中编造或无法验证实验结果;AIRS-Bench上agent只在4/20个任务超过人类SOTA。更关键的是,没有查到这批benchmark中任何一个被主流大模型公司的system card正式引用——学术界分析直接指出"科研agent benchmark目前仍碎片化,覆盖科研生命周期的不同片段(想法/规划 vs 执行),彼此不衔接"。

一个比 BiomniBench 更极端的 harness 敏感性案例:GAIA

GAIA是通用agent benchmark(非科研专属,本文§05目录已收录),但它在2026年5月给出了一个惊人的数据点:同样466道题,不同排行榜上的分数从44.8%跑到92.36%——差距不是测量误差,就是"被允许用什么工具/scaffold"的差异。这比 §06 讲的SWE-bench/BiomniBench的harness分差(10-48个百分点)还要极端,而且逻辑相通:科研/研究类任务本身开放度更高、rubric主观性更强,harness敏感性问题只会比coding类benchmark更严重,不会更轻。

BiomniBench 仍是规格最重的代表案例(不再是唯一)

上面这批新benchmark证明"科研agent评测"已经从空白变成拥挤赛道,但 BiomniBench 依然是其中投入规格最重的一个——100+名资深专家、超1,000小时开发投入,和斯坦福生产级科研agent Biomni直接配套,6维度rubric+双轨(固定harness+原生harness)对比实验设计也是这批新项目里最完整的。以下深挖它的细节:

基本信息

  • 规模:100个数据分析任务(50公开+50私有防污染),17种任务类型,5个疾病领域+通用生物学
  • 题目来源:每题基于一篇发表在 Nature/Cell/Science 的真实论文,由原作者或领域专家共同开发
  • 开发投入:斯坦福、哈佛、北大及多家头部药企 100+名资深专家、超1,000小时,与 Phylo、Humanlaya Data Lab 联合完成
  • 配套对象:给斯坦福 SNAP 实验室的通用生物医学 AI agent Biomni(105个软件包+59个数据库+150个专用工具)做的配套评测集
  • 核心创新:过程级(process-level)评测——把agent完成任务的完整轨迹拿去对照专家rubric打分,不只看最终答案

评分维度与样题细节

维度核心检查示例标准
数据处理正确加载和准备数据加载所需文件、用正确标识符合并、筛选到正确处理组
方法选择选择恰当的分析方法对生存分析选择 Kaplan-Meier 曲线+log-rank检验
统计严谨性正确应用统计测试应用多重检验校正(BH-FDR)
来源可靠性依赖可信参考资源从同行评审文献提供相关引用
科学推理逻辑一致性与生物学连接避免因果过度声称,把发现和真实机制关联
生物学解释正式版新增第六维度——

典型失败模式:漏掉MYC基因特异性分析、漏掉表型相关性分析、漏掉关键通路解释——说明任务不是"跑脚本出数字",而是要求 agent 知道该往哪个方向深挖。

测试用什么 harness

底层用 Harbor 执行框架统一环境(task.toml配置验证器/环境预算),保证不同 agent 跑起来时数据、工具、沙箱资源一致。打分不是自动验证器,是 LLM judge——论文比较了5个候选裁判模型(Claude Opus 4.6/DeepSeek V3.2/Gemini 3.1 Pro/GPT-5.4/Qwen 3.6)跟内部专家A/B/C评级的一致性,最终选 Gemini 3.1 Pro 全程当裁判(跟人类专家意见最一致)。

各家模型测下来的效果

官方"固定harness"对比:所有模型统一套 Terminus-2 → 顶尖模型互相只差1.6分,聚在62-64区间。官方"原生harness"对比(各家用自己精调过的agent):

组合分数
Claude Code + Opus 4.773.34(最高)
Claude Code + Opus 4.669.51
Codex CLI + GPT-5.468.69
Codex CLI + GPT-5.567.59
Claude Code + Sonnet 4.666.39
Terminus-2 + Opus 4.7(固定harness对照组)63.94

早期版本人类基线对比(v0,15题子集,Phylo博客公开):

  • 1资深制药科学家(5年+经验)68.5分
  • 2Biomni Lab65.0分
  • 3Edison Analysis52.7分
  • 4OpenAI Agents SDK(GPT-5.2)51.4分
  • 5初级科学家(3年经验)48.5分
  • 6Claude Code(Opus 4.6)47.8分
  • 当时最好的AI系统(65分)已接近甚至超过初级科学家(48.5分),但仍明显不如资深科学家(68.5分)——极少见的"AI vs真人专家"直接对比数据。

    第三方独立复现(omicverse团队用自己的agent"omicos"换不同底层模型跑50个公开任务):GPT-5.5 78.8%、DeepSeek4-pro 73.0%、GPT-5.4 67.7%、DeepSeek4-flash 66.0%、MiMo-v2.5-pro 65.8%、MiMo-v2.5 62.3%、GPT-5.4-mini 44.2%。反直觉发现:GPT-5.5总分最高但"生物学解释"维度只有60%,几个便宜模型(DeepSeek4-flash 76%、MiMo-v2.5-pro 73%)在这一维度反而超过它——模型普遍能老实引用文献来源,但在"方法选择"和"生物学解释"这两个真正需要科研判断力的维度上持续拉胯。

    不是benchmark、但同样值得关注的补位形态:FutureHouse LAB-Bench(2,457题,8大类30子任务,专测生物学研究基础能力,含实验协议排错ProtocolQA、分子克隆场景题,Anthropic用它报分,是本节表格之外另一个"过程/任务级"评测);Periodic Labs的"实验室即奖励函数"(模型读文献→量子化学计算→自动化实验室合成→测量结果回传当训练信号,不是benchmark是训练范式,直接绕开了"评测碎片化"这个问题——这条路线的完整拆解、以及为什么三大 lab 反而做不了,见 §08);Anthropic×Benchling(科研软件直连,同样绕开第三方benchmark这层)。
    08判分范式

    Rubric 化:把"不可验证"变成"可验证",代价是把"对不对"换成了"全不全"

    上一节的结论是科研 benchmark 已经扎堆但没有共识。但如果只看方法,中美两边其实已经收敛到同一个解法:把一个开放式任务拆成 N 条小的、可独立判定的 rubric 条目,再聚合成分数或奖励。这一节说清三件事:这套机制具体怎么做、它离"真实标准"有多远、以及哪些方法被证明能缩小差距。

    rubric 让开放式任务变得可打分,但它奖励"说到了",不奖励"说对了",也不惩罚"说多了"。这个替换在医疗问答里损失有限,在科研里可能是致命的——一篇什么都提到了但结论错了的研究报告,rubric 会给高分。

    这不是新东西:范式时间线

    标准名称是 rubric-based reward / rubrics as rewards,动机是 RLVR(可验证奖励强化学习)在数学和代码上极成功、但在医学科学写作这类没有唯一答案的任务上用不上。底层假设"验证在认知上远比从零创造便宜"来自 scalable oversight 这条老线索(CriticGPT、辩论式对齐),不是任何新公司的原创。

    时间工作关键贡献
    2024OpenAI Rule-Based Rewards / CriticGPT从规则文本导出奖励;模型辅助人类验证
    2025-05OpenAI HealthBench262位医生(执业于60国)、5,000段对话、48,562条医生撰写rubric、带权重、GPT-4.1判分
    2025-07Scale AI Rubrics as Rewards (RaR),arXiv 2507.17746首个系统化框架:四类别带权重条目 + GRPO;公开RaR-Medical-20k/RaR-Science-20k
    2025-08小红书 RL with Rubric Anchors,arXiv 2508.12790当时最大rubric奖励系统10,000+条,来源明确含"人机混合协作";开源Qwen-30B-A3B
    2025-09Chasing the Tail,arXiv 2509.21500理论指出奖励过优化的根源在高分尾部错配
    2026Open Rubric System / Autorubric / OpenRubrics / ARBOR / SibylSense / RUC-NLPIR Rubrics Survey范式成熟标志:出现综述,以及专门研究失效模式的论文

    对本页 §09 的一个直接含义:UniPat 博客称"现有两种范式(纯人工/纯合成)都没利用这个不对称性",在文献上不准确——Scale 的 RaR 早半年以上,小红书的 Rubric Anchors 早七个月且明确写了人机混合。它的真实差异化在领域覆盖(50+学科)和专家工时成本(1–2小时/样本),不在方法。

    rubric 条目具体长什么样(RaR 论文附录原文示例)

    每题生成 7–20 条 rubric,每条含 title(2–4词)、description(一句话,须以类别开头)、weight。必须写到"非专家只靠这条即可判定、无需推断或查外部资料"的自足程度——这是 LLM judge 能当判分器的前提。

    类别权重含义论文原文示例(医学题)
    Essential5关键事实或安全检查,缺失即整份回答无效Essential Criteria: Identifies non-contrast helical CT scan as the most sensitive modality for ureteric stones.
    Important3–4关键推理、完整性、清晰度Important Criteria: Explains that non-contrast helical CT detects stones of varying sizes and compositions.
    Optional1–2风格或额外深度Optional Criteria: States "The final answer is (B)" or similar answer choice formatting.
    Pitfall−1 / −2该题常见错误或遗漏,负向扣分Pitfall Criteria: Does not mention identifying (B) as the correct answer.

    RaR 在 Qwen2.5-7B 上的实测有两个反直觉结果:implicit 聚合(整份rubric交给judge出一个总分)优于 explicit(逐条判定加权求和),与"原子化可验证"的直觉相反;而且科学域(GPQA-Diamond)上 RaR-Explicit 还不如 Reference-Likert 基线(0.3030 vs 0.3775)——rubric 的收益取决于任务是否真的开放式,选择题式任务拆解价值有限。

    科研 benchmark 采用 rubric 的五种机制

    A · 带权重的 rubric 树(最精细)

    PaperBench(OpenAI,arXiv 2504.01848):20篇ICML 2024论文复现,rubric 是需求树,叶节点为单条pass/fail条件、每节点相对兄弟节点手工加权,共 8,316个叶节点。拆解规则很硬:持续拆分直到一个专家能在15分钟内判定——把"原子性"变成可操作的成本定义。rubric 与每篇论文原作者共同制定;判分用 o3-mini 当 judge,并另建 JudgeEval 专门评判分器。

    B · 定分值 checklist + 通过线(最简洁)

    FrontierScience-Research(OpenAI,arXiv 2601.21165):60道原创研究子任务,由博士科学家(在读博士/教授/博士后)设计,每题一套10分制rubric,条目互相独立、可客观判定,每条含pass/fail描述与分值(示例"写出方程X"),≥7/10算成功。取向是放弃精确匹配、改为评估中间推理步骤。也正是 UniPat 的 UniScientist 报分用的那个榜。

    C · 维度体系 + 动态权重(评开放式报告)

    DeepResearch Bench(arXiv 2506.11763,ICLR 2026)的 RACE 框架:四个正交维度(全面性/洞察深度/指令遵循/可读性),judge 逐题动态生成任务专属权重(T次试验取均值),再参照一份高质量参考报告打相对分。DEER(arXiv 2512.17776,ICML 2026):专家分类体系 7维度/25子维度 → 101条细粒度rubric,外加claim验证架构同时验证有引用与无引用的断言。BiomniBench 的六维过程级评测同属这一类(见 §07)。

    D · 原子事实分解(rubric 不预写)

    HeurekaBench(ICLR 2026,arXiv 2601.01678):把 agent 回答与 ground truth 双方都分解成原子事实,比对"存在性与正确性"。GPT-4o 按此判分与博士级专家 Spearman ≈ 0.90。这是目前唯一在机制层面堵住"只判有没有提到"这个漏洞的设计——因为它同时要求正确性。

    E · rubric + 硬门 + 真实实验(唯一接物理世界)

    BioLab Bench:任务专属指标 + rubric验证器 + 设备级有效性门 + 真实实验测试四层串联。便宜替代路线是 BenchBench-Protocol(arXiv 2608.23898):从 Benchling 上96篇已发表协议取149任务,发表版与科学家改动版的差异即真值,用已完成的湿实验当延迟 ground truth。

    反 LLM 阵营 · 一个未被裁决的分歧

    ResearchRubrics(Scale × U Chicago,arXiv 2511.07685):101 prompt / 2,593条人工撰写条目,明确禁止 LLM 生成或播种任何条目,理由是"只让人去验证 LLM 生成的 rubric 会引入锚定偏差";三重审核、2,800+人工小时。这与 UniPat/HeurekaBench 的"LLM生成+人类验证"路线直接冲突,而没人做过同题对照实验。

    Benchmark规模rubric 谁写机制判分器可信度是否公开
    PaperBench20论文/8,316叶节点论文原作者共同制定加权需求树,15分钟可判定规则有 JudgeEval 专评判分器
    FrontierScience-Research60子任务博士科学家10分制独立条目,≥7通过未查到
    ResearchRubrics101 prompt/2,593条纯人工,禁用LLM生成多轴+三重审核,2,800+人工小时靠三重审核
    DeepResearch Bench100任务/22领域judge动态生成RACE:4维+动态权重+参照相对分PAR 71.33% vs 人类互评 68.44%
    DEER50任务/101条专家分类体系7维25子维 + claim验证有任务专属专家指引
    BiomniBench-DA100任务论文原作者或领域专家过程级6维,评整条轨迹选了5个候选裁判比一致性(见§07)
    HeurekaBenchOEQ+MCQLLM生成后用已发表结论验证原子事实分解:存在性+正确性Spearman ≈ 0.90
    SciAgentArena约200任务未详查stepwise verification未查到
    BioLab Bench未披露湿实验专家rubric + 设备门 + 真实实验真值来自实验
    HealthBench(医疗,方法源头)5,000对话/48,562条262位医生带权重条目,GPT-4.1判分与医生一致率 ≈ 医生互评

    看任何 rubric 榜单,第一个该问的问题不是"谁在榜首",而是"你的判分器与人类专家的一致性是多少"。上表十家里只有四家给了数字。

    离"真实标准"有多远:两层差距,后一层是结构性的

    拆法出自 Reward Hacking in Rubric-Based RL(arXiv 2605.12474):策略对训练判分器优化,但用三个跨家族前沿模型组成的裁判面板评估。

    差距一:判分器失效(可控)。训练判分器认为满足、参考判分器认为没满足。弱判分器产生大量迁移不过去的虚假收益,利用程度随训练推进而增长,集中在三种复发失败:复合条件部分满足即算过、把隐含内容当显式表述、主题匹配不精确。换强判分器能大幅减少但无法消除。

    差距二:rubric 设计本身的局限(结构性)。即便用很强的 rubric 判分器,它偏好的回答在"不看 rubric 只看整体质量"的裁判眼里反而更差:

    rubric RL 之后的变化方向
    完整性、"提到了某点"这类存在性条目上升
    事实正确性下降
    简洁性下降
    相关性下降
    整体质量下降
    最刺眼的结论:rubric 判分器偏好 RL 之后的 checkpoint,而无 rubric 的裁判偏好训练前的基座模型。rubric 分数涨了,模型变差了。机制不难理解——rubric 是 checklist,模型的最优策略就是把所有条目都提一遍,于是产出又长又全又啰嗦、事实密度下降。论文结论:更强的验证能减少 reward hacking,但本身不能保证 rubric 上的收益对应更广义的质量提升。
    反向参照:单条判定其实已经够准。HealthBench 的 meta-evaluation(医生复核34条共识条目、criterion级Macro-F1)显示模型判分器与医生的两两一致率,与医生彼此之间的一致率相当。两个结论合起来才是完整图景:rubric 判分器"判单条"已达人类水平,问题出在"把N条加总等于质量"这个聚合假设上。差距不在精度,在指标结构。

    已被证明有效的缩小差距的方法(按证据强度)

    1. 跨家族判分器面板——训练判分器与评测判分器严格分离;硬规则是永远不要让生成模型与判分模型来自同一家族。Autorubric/PoLL式集成证明:当方差和阈值可靠性重要时,多个各异裁判的陪审团胜过单个强模型。
    2. 人工标注校准 + 定期重校准(工程上最成熟)——手标100–300条代表性输出,用判分器将要用的同一套 rubric,算 Cohen's kappa / Pearson / MAE,目标 kappa > 0.6;每季度重校准捕捉 drift,判分模型升级后必须重校准。
    3. 成对比较替代逐点打分——Open Rubric System(arXiv 2602.14069)用成对自适应 rubric + 锦标赛排序治"判别性坍塌"(逐点打分把所有回答挤在同一分段),并要求两种顺序都跑以消除位置偏差。
    4. 专攻高分尾部——Chasing the Tail(arXiv 2509.21500):过优化的根源是分不清"优秀"与"仅仅很好"。rubric 的价值在于能利用离策略样本同时对其表面伪影不敏感,关键是让 rubric 具备在多个都很好的回答之间做区分的能力。
    5. 从失败轨迹反向归纳 rubric——DeepVerifier 路线,让 rubric 贴近真实失败分布而非专家想象的失败分布。
    6. self-internalization gap——基于策略模型自身 log-probability 的无判分器诊断,能检测"用弱判分器训练的策略何时停止真正进步"。低成本早期预警。
    7. 显式负向条目 / 抑制存在性偏好——加 Pitfall 条目、对"提到了"类降权、对"说对了"类升权、加简洁性约束。逻辑对症,但未见论文系统验证,属推论。

    判分器这一层正在被专用模型接管:TypeSafe Jev

    rubric 判分的本质就是"给一份产出回答 N 个互相独立的封闭问题",这正好是 TypeSafe Jev(2026-09-15 早期访问,当前 jev-1.13.0)的原生形态:输入非结构化 state,一次并行 pass 输出带标定概率的类型化决策,完全不生成文本。原语 bool / score / choice 分别对应 rubric 的 met-not-met、分级条目、失败模式分类,criteria 直接用自然语言写、不需要标注数据。定价 $0.042/MTok 输入、输出免费,延迟 70–500ms。Good Start Labs 跑 6,003 条检查的实测:Jev 每百万条判定约 $160,Claude Fable 同等水平约 $33,000(GPT-5.6 Luna 约$400、Gemini 3.8 Flash 约$1,600)。这带来一个真实的架构变化:以前太贵只能抽样评测,现在可以全量评每一条轨迹。

    但它的概率不能直接拿去阈值化。一份独立校准审计(8,000条判定×4种措辞×2种基础率,对照人类标注而非模型意见)发现:Jev 排序能力很好(AUC 0.90–0.91),但概率系统性偏向"yes",且正例越稀有偏得越厉害——当 Jev 报约75%置信度时,人类标注者只有10%会flag。原始 ECE 0.157(正例率19.2%)到 0.209(正例率2.9%);两参数单调重标定能把 ECE 降到 0.023/0.007 而 AUC 完全不变。同一审计还给出一个对 rubric 工作特别有用的副产品:同一问题的四种措辞在完全相同的 state 上跑,平均概率 0.445→0.566、ECE 0.397→0.519,而 AUC 几乎不动——说明 Jev 可以用极低成本暴露一条 rubric 条目的措辞脆弱性。

    另外三个硬约束直接决定它在科研评测里的位置:不产生理由(拿不到"为什么没满足")、不能弃权(没有"信息不足"这个状态)、context 仅 64K 总/32K state 且有 context rot——后者直接排除了本页 §07 最重要的那个方向:过程级评测。BiomniBench 要评整条 agent 轨迹、PaperBench 要审一整份复现产物、DEER 要评一份长报告,都塞不进 32K。还要注意厂商自己的 benchmark 用的是 GPT-6 Astra 与 Fable 5.1 的平均意见当参考答案,不是人类真值,且任务由其自家团队编写。

    所以它的正确位置是:叶节点级判定的执行层(PaperBench 的"15分钟可判定"规则正好定义出这种短、自足、原子的问题)、大规模全量扫描、置信度路由到人工、以及跨家族判分面板里架构完全不同的那一员。不适合当唯一裁判、评轨迹、或做诊断。一个必须说清的判断:Jev 把判分成本降低两个数量级,但便宜地做错的事仍然是错的——它的概率系统性偏 yes,而 rubric 的已知病灶正是存在性条目虚高,未校准地把它接进 RL 奖励回路,是在给 reward hacking 加油。

    真值层:湿实验怎么接进来

    rubric 只能判断"这份研究做得像不像一个好研究",不能判断"结论是不是对的"。而科研只有后者算数。所以真正的问题是:唯一不可被 Goodhart 的真值——物理实验——能不能进训练回路。答案是:三大 lab 都在用湿实验,但没有一家公开把它当 RL 奖励信号。

    层级做法谁在做
    Tier 1 · 只做事后验证湿实验是发布会证据,不在训练回路里OpenAI × Retro Biosciences(GPT-4b micro 设计 RetroSOX/RetroKLF,多能性标记表达提升50倍以上,SOX2建议中超30%优于野生型,iPSC生成3周→7天;模型未公开发布);Anthropic 2026-08 对15个靶点的 de novo 蛋白结合体设计命中率22–35%(行业常规10–15%),由 Adaptyv Bio + Twist 验证;DeepMind AI co-scientist 进真实验室
    Tier 2 · 结果回流当训练数据AI 出假设与分子 → 人类在 bench 测 → 结果回流改进模型(措辞是"改进模型",不是"当奖励做RL")Anthropic 走得最远:自建旧金山湾区湿实验室并招 bench 科学家;Life Sciences Verification Program 出最多100万美元Claude额度+资金资助外部湿实验验证(Modal 出25万美元算力、Twist 提供DNA合成)——本质是众包真值数据
    Tier 3 · 湿实验当 RL 环境把物理实验当 RL 环境,现实提供反馈只有新公司:Periodic Labs(前OpenAI后训练负责人 Liam Fedus + 前DeepMind GNoME作者 Ekin Dogus Cubuk),1万亿参数MoE模型 Neon,训练峰值1,300张H200;"科学rollout可推理并执行工具一小时以上,而一个训练步只要几分钟",故训练与推理异步分离。Lila Sciences 的 AI Science Factories 同类

    为什么大 lab 不这么做——四个结构性原因:①时间尺度差3–5个数量级(训练步分钟级 vs 实验天到周级,而一次 RL run 需要几十万次 rollout);②样本效率与成本不匹配(用最贵的信号喂最饿的算法);③信号稀疏带噪声,credit assignment 几乎无解(失败可能源于假设错误,也可能是移液操作或试剂批次);④通用模型 vs 垂直模型的取舍——湿实验信号只在极窄领域有效,Periodic/Lila 敢做正因为它们放弃了通用性。

    所以前沿模型实际用的是四种"湿实验替代品":形式化验证器(Lean,秒级,但只有数学有)、计算仿真代理(DFT/分子动力学/对接,分钟到小时,与现实有系统性偏差)、回溯真值(已完成但模型未见的实验,零成本但有污染风险)、rubric(秒级,但有本节的结构性偏差)。湿实验本身的角色是最终背书与校准,不是梯度来源。

    由此得出一个本页的核心架构判断:带湿实验真值的科研 benchmark 必然小样本、慢、贵(BioLab Bench、BiomniBench 都在百题级),不可能做到 HLE 的规模,所以它的定位不该是排行榜,而应该是校准器。科研评测的未来不是一个 benchmark,而是两层——一层大而廉价的 rubric 评测跑日常迭代,一层小而昂贵的真值评测定期校准前者。谁掌握后者,谁定义前者的可信度。而目前中美两边做的几乎全是前者,而且没人做中间那个校准层(用真值结果回归 rubric 权重——UniScientist 用统一权重、RaR 用拍出来的5/3–4/1–2档位、HealthBench 用医生的重要性判断,三家都没有用结果去回归校准)。

    跟踪点:Periodic Labs 何时报出第一个由 RL 闭环(而非人类直觉+AI辅助)得到的新材料或超导结果——这是 Tier 3 路线成立与否的唯一硬检验,其2026-09那篇技术文只讲训练与服务基建,明确没有报告新验证的材料或超导结果。

    09中国新势力

    UniPat / Humanlaya / 智衍慧生:红杉密集布局的评测赛道

    国内"AI评测+高质量训练数据"公司大致分三层,2025年下半年才真正起步,头部公司普遍成立不到一年。真正对标美国 Mercor/AfterQuery/Turing 的是第一梯队。

    2025 末
    UniPat AI 成立

    创始人李宽,前阿里通义AI实验室,主攻训练后分析/数据合成/RL

    2025
    Humanlaya(原壤智能)成立

    北京海淀,AI数据实验室,汇聚博士和研究专家

    2026-01
    智衍慧生成立

    法定代表人朱锡洲,公开资料很少

    2026-06
    智衍慧生获腾讯(上海启善投资)入股
    2026-09初
    Humanlaya 完成数亿元Pre-A轮

    鼎晖(香港基金)领投,红杉中国/今日资本/BAI资本跟投

    2026-09
    UniPat AI 完成3亿美元A轮

    阿里领投,腾讯/红杉跟投,估值约25亿美元——赛道最大一笔

    三层格局

    第一梯队:新一代评测/专家数据公司

    • UniPat AI — coding/browser/多模态视觉推理评测,Terminal-X套件(DeepTerminalBench/EvoCode-Bench/RoadmapBench,三件套统一建在 Terminal-Bench 2.0 格式+Harbor 上)+ Monthly-SWEBench/SaaS-Bench/ClawBench;并且自己训模型(UniScientist-30B-A3B、UniMath-35B-A3B),见下
    • Humanlaya — One-Million Bench/BiomniBench,专家型高端标注覆盖医疗/金融/法律/制造/教育
    • 智衍慧生 — AI行业应用系统集成,业务细节未核实
    直接对标Mercor/AfterQuery/Turing(美国这几家ARR已超1亿美元,与蚂蚁/阿里/字节常态化合作)

    第二梯队:传统标注商升级中

    • 海天瑞声(688787.SH) — 科创板上市,2025营收3.77亿元(+59%)
    • 数据堂、云测数据、标贝科技、整数智能、TalkingData
    以标注工时+数据集销售为主,正尝试转向专家数据和RL环境,基因上更偏"卖人工时间"

    红杉中国的密集布局

    UniPat、Humanlaya、智衍慧生三家都有红杉身影,加上红杉自己孵化的 xbench 评测体系(双轨评估:能力上限track+实际落地价值track,"常青评测"动态更新;已发布xbench-ScienceQA/DeepSearch/AgentIF,并与UniPat联合发布BabyVision)——红杉在"评测定义模型价值"这条赛道上是布局最密的机构。

    UniPat 不只是评测公司:它自己训模型(2026-09-20 补充)

    这一点在早前版本里漏了,但它改变了对这家公司的定性。UniPat 的 GitHub 组织(UniPat-AI,9个公开仓库)里除了 §05 收录的那批 benchmark,还有三个非 benchmark 产品:

    产品规格方法自报成绩
    UniScientist-30B-A3B
    2026-03,科研 agent 模型
    Qwen3-MoE 架构,30B总参/3B激活,Apache-2.0;只有博客,论文标注 Coming SoonEvolving Polymathic Synthesis:LLM当跨学科出题者、人类专家当高精度验证者;rubric 过三道筛(客观一致性/可区分性/原子性);训练 = agentic SFT + Report Aggregation 目标(N份候选报告合成终版,参考答案由 rubric-based rejection sampling 产生)。数据集 4,700+ 研究级样本、每题20+条rubric、50+学科、专家平均处理时长1–2小时/样本FrontierScience-Research 28.3(Aggr@8达33.3)vs GPT-5.2 25.2 / Claude Opus 4.5 17.5;DeepResearch Bench II 48.0 vs OpenAI DR 45.4。公开了完整推理轨迹(放轨迹比放分数负责得多);但训练数据未开
    UniMath-35B-A3B
    2026-07,奥赛级证明模型
    基座明确为 Qwen/Qwen3.6-35B-A3B,35B总参/3B激活,Apache-2.0;同样只有博客训练数据监督的是证明的"改动过程":初始草稿(暴露待证义务)→自我评估(proof debt ledger,点名第一个真障碍)→定向修补或改道→终版合成。推理时 pool_refine_tournament:采样自评排序→修补最强非完美候选→存活者两两合并,只有可测量变好才保留IMO 2025 35/42、USAMO 2026 36/42、IMO-ProofBench 86.0%(w/o TTS 分别为19.75 / 17.88 / 52.6%)
    SWE-Visionagentic VLM 框架(Docker 内有状态 Jupyter)是工具,不是 benchmark—
    UniMath 那组数字必须打两处折。① w/o TTS 与 w/ TTS 的评分口径不同:前者是 avg@8、由 DeepSeek-V4 Pro 单一裁判打分;后者是最终那份证明、由 Gemini 3.1 Pro + GPT-5.5(xhigh) + DeepSeek-V4 Pro 三个裁判打分再加人类专家复核。所以 19.75→35 这个跳幅里有多少是 TTS 的功劳、有多少是评分口径的功劳,从公开信息分不开——这恰好又是本页 §06 的主题。② "金牌"是相对 IMO 评分线说的,不是相对 SOTA:IMO-ProofBench 上它排第四(GPT-5.6-Sol 91.1%、Claude Fable 5 89.0% 都在它之上),真实故事是把一个 23.1% 的基座抬到 86.0%——提升很惊人,但仍低于前沿闭源模型。另外博客正文写"IMO 2026"而表格是 IMO 2025,引用时以表格为准。

    团队血统:UniScientist 本质是通义 DeepResearch 的续作

    UniScientist 的引用作者共9人,机构署名是 1 UniPat AI,2 北京大学(无阿里署名)。但其中 Kuan Li 就是创始人李宽,而 Baixuan Li、Jialong Wu 与他同为通义 DeepResearch 技术报告和 WebSailor 的核心作者(Tongyi Lab, Alibaba Group)。方法论血统因此很明显:长程信息搜寻 agent、工具循环、rollout 聚合,都是 WebSailor / Tongyi DeepResearch 那条线的延伸。

    要说清两件容易混淆的事:①两个模型不是"通义出品",而是建在 Qwen 开源权重上(UniMath 的 HF 元数据明确写了 base_model;UniScientist 架构标签是 qwen3_moe,HF 上唯一那条社区讨论恰恰是来提醒它没标基座);②这批作者是否全部在 UniPat 编制内无法确认,也不排除部分仍在通义、属跨机构合作。

    但这层关系解释了阿里为什么领投 3 亿美元:中文媒体的措辞是"阿里拟领投前员工AI 评测公司",新浪那篇标题更直白——"支持前实习生创业项目"。对阿里这是一石三鸟:留住人、UniPat 所有模型都建在 Qwen 上等于免费的生态背书、同时锁定一家评测数据供应商。

    由此产生一个本页 §10 公信力框架里还没有的问题:出题者同时参赛,而且裁判的技术口味有来处。UniPat 被描述为第三方评测公司,但它的基座模型来自阿里、资金来自阿里、团队出自阿里,而它的榜单正在给 Qwen 3.6 Plus 和竞品打分。这不需要作弊就有偏差:一个由通义 DeepResearch 出身的人设计的科研/agent 评测,天然会奖励那种解法(长程搜寻、工具循环、rollout 聚合)——正是 Qwen 系模型擅长的方向。这跟美国那边"客户引用自己供应商"是不同类型的问题,而且更难察觉。

    当前尚未构成闭环:它自建的 benchmark 是编码/GUI/视觉,模型打的是科研/数学,两边不重叠;真正的风险时点是它哪天用同一条 Evolving Polymathic Synthesis 流水线出一个科研 benchmark——那时训练集与测试集成为同分布产物,不是作弊,但评测会失去信息量。
    采用度的冷数据(2026-09-20 API 实测):HuggingFace 下载量 UniScientist 75次(3月发布至今)、UniMath 18次(7月发布至今),likes 15 和 2;HF 讨论帖 1 个和 0 个,那唯一一条还是来提醒它没标基座模型。Reddit(含 r/LocalLLaMA)和 Hacker News 均未搜到任何帖。中文侧有报道,但《AI 真能做研究吗…》同题同文出现在新浪财经"公司动态"栏目、品玩、钛媒体、知乎专栏——是公关分发;真正的编辑部自主报道只查到量子位一家。

    30B/3B激活这个尺寸本该最受本地部署社区欢迎,却没人跑、没有GGUF量化版、没有实测帖。合理的定性是"融资叙事资产"而不是"开源模型"——它们的作用是支撑25亿美元估值的技术背书。从生意角度这完全成立:UniPat 的客户是模型厂商和企业,下载量75次不影响它卖数据,量子位那一篇报道的价值可能比一万次下载更大。

    团队背景核实结果

    UniPat 创始人身份公开(李宽,前阿里通义AI实验室),是三家里唯一主动披露创始人身份并拿"大厂技术背景"做背书的。Humanlaya/原壤智能创始人姓名未在任何公开报道中披露,官网无团队页,GitHub组织成员列表不公开,只能确认投资方阵容。智衍慧生公开工商信息仅查到法定代表人,团队背景、产品细节完全没有公开报道,是三家里最低调的一家。

    被引用情况:还没跑通"外部采信"这一步

    UniPat/xbench/Humanlaya 系的 benchmark 没有查到被 DeepSeek、Qwen、智谱GLM、Kimi、MiniMax 等头部模型官方技术报告正式引用的证据。目前的"被引用"主要发生在自己人之间(UniPat×xbench联合发BabyVision,本质是同一个生态圈互相背书)。对比之下,C-Eval/CLUEWSC/CMMLU/OpenCompass 已被 DeepSeek-V3、Qwen 系列技术报告正式引用——这批新公司的公信力目前更多体现在融资市场(阿里/腾讯领投、25亿美元估值),而不是技术报告引用,这是两种完全不同的信任状态。

    2026-09-20 复核后这个结论仍然成立,并且可以给出更细的分级。查到的"被引用"只有四种,前三种都不算外部采信:①UniPat 在评别人——SaaS-Bench / RoadmapBench 榜上有 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro、DeepSeek V4 Pro、GLM 5.1、Kimi K2.6、Qwen 3.6 Plus、MiniMax M2.7,BabyVision 榜上有 Gemini3-Pro-Preview、GPT-5.2、Doubao-Seed-1.8、Qwen3VL-235B——方向是反的;②第三方聚合站转载(BenchmarkList 上有 RoadmapBench 和 BabyVision 的榜单页)——算半步;③生态圈内互相背书(BabyVision = xbench × UniPat,红杉同时投了两边);④真正的反证:Qwen3-Coder-Next 技术报告(2026-03)用的是 SWE-Bench Verified / Multilingual / Pro + TerminalBench 2.0,没有 UniPat 的任何 benchmark。

    10公信力

    被引用 ≠ 被信任:中美三层公信力结构对比

    Benchmark 的公信力不是单一维度,可以拆成三层,中美两地在每一层的成熟度都不一样:

    层级🇺🇸 美国🇨🇳 中国
    ① 跨厂商通用标准
    谁在维护,是否被所有lab写进model card
    MMLU/GPQA/SWE-bench Verified——起源学术机构,被OpenAI/Anthropic/Google/xAI跨厂商一致采用C-Eval/CLUE/OpenCompass/CMMLU——起源高校+国家级研究院,被DeepSeek-V3、Qwen系列技术报告正式引用,地位稳固
    ② 数据商自建榜单
    是否被除自己客户外的第三方采信
    SEAL/APEX-Agents/GDP.pdf/Riemann-bench已被Anthropic、OpenAI system card引用——但几乎都是"客户引用自己供应商",带明显选择性UniPat/xbench/Humanlaya系目前查不到被第三方模型公司技术报告引用的证据,公信力体现在融资市场而非技术报告
    ③ 大众/媒体人气榜
    面向公众横向对比,非学术/商业采信
    Chatbot Arena/LMArena——曾公信力最高,2025-26因"偏好优化刷票"争议有所下滑SuperCLUE、非线智能ReLE——持续追踪主流模型排名,公信力集中在消费者认知层面

    两地格局本质相同:真正跨厂商通用的始终是非商业化的学术标准,数据商榜单最多做"细分领域补位+销售背书"。差别在于成熟度——美国数据商榜单已经小范围打入头部lab的正式system card,中国这批2025年才起步的新公司,信任目前还停留在"资本市场买单"。

    一个判断行业进入新阶段的信号

    什么时候能看到非自己客户的第三方大模型公司在技术报告里引用 UniPat/Humanlaya/xbench 的榜单,会是中国数据商评测赛道从"融资叙事"跃迁到"行业采信"的实质性信号——目前还没有观察到。

    11去哪查

    Benchmark 聚合站导航

    Agent 专用、方法论最严谨

    HAL — Holistic Agent Leaderboard hal.cs.princeton.edu

    普林斯顿SAgE团队+ICLR 2026论文。只收9个真正的多步agentic benchmark(不收MMLU这类纯知识题),核心价值是同时记录模型和scaffold两个维度——每个"模型×scaffold"组合单独打分。9个模型×9个benchmark,21,730次rollout,约4万美元验证成本。目前已暂停接受新提交,转向"agent可靠性"研究(一致性/可预测性/鲁棒性/安全性/拒答率)。学术公信力扎实(Princeton+ICLR,OpenAI给过API credits支持),但还没被头部lab在自家system card里正式引用。

    综合性实时打分聚合站

    站点特点
    Artificial Analysis横向对比模型智能/速度/价格
    OpenRouter Benchmarks基于真实API调用流量,偏agent/生成类场景
    llm-stats.com300+模型排名
    BenchLM.ai追踪439个benchmark,八大分类
    Epoch AI Benchmarks收录第三方结果+自跑内部评测
    AIMultiple号称收录800+,覆盖面最广但深度参差

    GitHub 静态 curated 列表

    仓库特点
    philschmid/ai-agent-benchmark-compendium50+ agent benchmark,四大类分类最清晰
    panilya/awesome-ai-benchmarks100+ benchmark,覆盖面广
    supernalintelligence/Awesome-General-Agents-Benchmark专注通用agent能力
    benchflow-ai/awesome-evals"non-BS"精选资源
    12结论

    九个可以带走的判断

    1. Benchmark 是训练数据/RL环境这门 85 亿美元生意的销售触角,不是独立产物——打分器(grader/verifier)才是整条链路里最贵、最核心的部分,这决定了谁有动机做 benchmark、谁没有。
    2. 数据商榜单是销售漏斗,学术榜单是公共基础设施——前者的成功标准是"转化了多少客户",后者是"被多少论文/system card引用",中美格局本质相同,中国的差距在成熟度不在结构。
    3. 接近一半的benchmark需要专属harness,且大多是各家专属自建、不共享——只有 Harbor 生态是罕见的例外,正在被多个不同背景的数据商共同采用。
    4. Harness/scaffold选择对分数的影响,经常超过模型本身的能力差距(可达48个百分点)——已经是独立的学术研究方向(Harness-Bench等),而不是巧合发现。
    5. 科研类benchmark已经从"稀缺"变成"扎堆但碎片化"——2026上半年至少7-9个新的科研agent benchmark密集涌现(Meta、Microsoft、EPFL、上海AI实验室等背景各异),但没有一个成为跨实验室共同采用、写进system card的标准,瓶颈从"没人出题"变成了"没人形成共识",而且科研任务开放度高、rubric主观性强,让 §06 的harness敏感性问题在这个方向上表现得比coding类更极端(GAIA同题466道,跨榜单分数摆动44.8%到92.36%)。
    6. 被引用≠被信任,公信力要拆成三层看——通用标准层、数据商榜单层、大众人气层,中美两地在每一层的成熟度都不一样,笼统说"某某榜单权威"是不准确的。
    7. 中国新一批"评测优先"公司还没跑通"被第三方model card采信"这一步——目前的公信力来自融资市场(阿里/腾讯/红杉),不是技术报告引用,这是判断它们能不能真正站稳的关键观察点。而 UniPat 已经不是纯评测公司(它自己训 UniScientist / UniMath),"出题者同时参赛、且裁判的技术口味有来处"是 §09 新增的一类利益冲突,比美国那种"客户引用自己供应商"更难察觉。
    8. 中美两边在方法上已经收敛到同一个解法:rubric 化——把开放式任务拆成 N 条可独立判定的条目。但它的代价是把评测目标从"对不对"悄悄换成了"全不全":rubric RL 之后存在性条目上升,而事实正确性、简洁性、相关性、整体质量全部下降,无 rubric 的裁判甚至偏好训练前的基座模型。差距不在判分精度(单条判定已达人类专家一致性水平),而在"N条加总=质量"这个聚合假设。所以看任何 rubric 榜单,第一个该问的是判分器与人类专家的一致性数字——目前十家里只有四家公开。
    9. 只有外部真值能纠回这个替换,而湿实验目前不在任何前沿模型的 RL 回路里——三大 lab 把湿实验用在事后验证和数据回流两个位置(Anthropic 走得最远:自建湿实验室 + 资助外部验证),把物理实验当 RL 环境的只有 Periodic Labs、Lila 这类放弃了通用性的新公司,原因是时间尺度差3–5个数量级。因此带真值的科研 benchmark 必然小样本、慢、贵,它的定位应该是校准器而不是排行榜——一层大而廉价的 rubric 评测跑日常迭代,一层小而昂贵的真值评测定期校准前者,而中间那个校准层(用真值回归 rubric 权重)目前无人实现。