面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-23

英国AISI与EvalEval:让基准评测结果可复现

How UK AISI and EvalEval Are Making Benchmark Results Reproducible

评测与可靠性Hugging Face · 2026-09-22

全文中文翻译 · AI 生成,仅供学习交流

英国 AISI 与 EvalEval 如何让基准测试结果可复现

AI 部署越来越快,评估也越来越受重视,成了说明模型和系统性能的关键证据。可现实是,结果发布的格式、平台、渠道五花八门,往往缺了能让你复现的细节。重新跑一遍评估本身又贵得吓人。

EvalEval 想做的,是用一套共享的报告框架(schema)Every Eval Ever,加一个开放平台 Evaluation Cards,把这个生态改善一下。Evaluation Cards 把评估结果和解读结果需要的信息塞进同一个结构里。

这跟 AISI 的工作是一脉相承的。AISI 通过 OptStop 让评估更高效,通过 HiBayES 让评估在统计上更扎实,又在转写分析(transcript analysis)和能力探查(capability elicitation)等方向推进标准化。AISI 和 EvalEval 现在一起做的事,就是诊断评估报告里的缺口,再搭一套共享基础设施把这些缺口填上。

AISI 这次公开了什么

转写层面的透明度(transcript-level transparency)不光是复现的关键,做分析和诊断时也离不开它。合作进入新阶段,AISI 会把已报告的评估方法和发现在合适的时候放到 Evaluation Cards 上。这次公开的内容包括论文主实验中五个基准(benchmark)的已核验结果、上下文和配置信息,分别是 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0。

涉及六个前沿模型(frontier models),分别是 Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。还有两项网络安全评估的结果,Cyber CTFs 和 The Last Ones,用的是另一套模型,跟上面那批有部分重叠。这些数据跟 AISI 的论文《How Inference Compute Shapes Frontier LLM Evaluation》一并发布,那篇论文研究的是基准性能怎么受推理时算力(inference-time compute)和评估方案的影响。

Humanity's Last Exam 上的成绩会跟着评估方案和推理算力的变化而变化。每条曲线画的是在给定 token(词元)数以内被解决任务的累计占比,统计时每个任务取最早观察到的成功。模型每次尝试完后,如果能从 oracle(标准答案来源)拿到对错反馈,token 用得越多,解出的题就越多。

结果如果连同配置信息一起公开,研究者和从业者就能更仔细地看每项研究,也能在跨生态的范围内互相比较。对于那些缺细节的报告,AISI 这次公开的内容就成了已核验的参考点。比如,可以帮研究者看清配置选择会怎么影响报告出来的成绩。等用上 EEE 的评估者多起来,这种开放比较能撑起更大、更可靠的元研究(meta-research)。

> AISI 的 Terminal-Bench 2.0 结果,跟同模型在其他已报告评估、不同评估配置下的结果并列展示。

看到这一做法被采用,我们很兴奋。接下来希望能跟 AISI 以及其他 AI 评估机构一起,把评估的标准化和共享再往前推一推。

加入共同使命

- 模型开发者,把核验过的评估结果报上来。
- 评估开发者,按 Every Eval Ever 框架来报基准和运行数据。
- 评估、治理和政策研究者,按基准或模型去翻 Evaluation Cards,也可以用它看看整个评估报告的生态状况。

关于 EvalEval 联盟

EvalEval 联盟(EvalEval Coalition)是一个研究社区,专门为评估生态打造科学扎实的研究和能落地的部署基础设施。目标有三个,把评估科学做得更扎实,弥合评估适用性和效用上达不成共识的现状,再把对科学研究和政策分析真正重要的影响覆盖得更广。

联盟的旗舰项目有两个。Every Eval Ever,一套共享的框架加仓库,专门装评估结果。Evaluation Cards,把基准元数据、评估运行数据和模型元数据打包成可读的记录。两样东西合起来,让人更容易看清楚,看起来差不多的分数,背后可能是在差很远的条件下跑出来的。

关于英国 AI 安全研究所

英国 AI 安全研究所(UK AI Security Institute,AISI)归英国政府科学、创新与技术部管,是个研究机构。任务就是给政府提供对前沿 AI 风险的科学认知。AISI 做研究、搭基础设施,目的有三,搞清前沿 AI 的能力和影响,开发并测试缓解手段,给政策提供依据。