8 月 27 日,斯坦福大学和 Laude Institute 发布 Terminal-Bench-Science 0.1。[33] 70 个任务横跨生命科学、物理科学、地球科学、数学科学和工程科学,每个任务都由一位领域研究者亲手把自己的工作流改造成考题。[33] 结果:Anthropic 的 Opus 5 总通过率约 30%,已是全场最强。[33]
从编程基准到科学基准
Terminal-Bench-Science 的前身 Terminal-Bench,是软件工程 agent 的标杆评测。[28] Anthropic、OpenAI、Google DeepMind 都在用它定义和优化自家 agent 的能力。[28] 这一次,同一套思路被搬进了自然科学。[28]
为什么要单做一个科学版?因为大多数"AI for Science"基准考的是教科书知识,不是真实工作流。[28] 但真实科研恰恰发生在工作流里。[28] Terminal-Bench-Science 的做法是:任务来自研究实验室的真实计算流程,在容器化环境里运行,用确定性的 pytest 检查程序化判分。[28] 假设生成、文献综述这类开放题不收,因为它们无法被程序化地判分,所以不在考察范围内。[28]
任务难度是刻意校准过的:发布时的目标解题率只有 10% 到 20%。[28] 难任务才能暴露真实差距、推动能力边界。[32]
因为大多数"AI for Science"基准考的是教科书知识,不是真实工作流。
科学家如何坐上驾驶座?
这个基准最特别的地方,是它的生产机制。[28] 领域专家贡献自己研究里的工作流作为考题,前沿实验室拿这些题评测和改进 agent,变强的 agent 再流回研究者。[28] 这是一个设计好的反馈回路:科学家由此直接参与塑造 AI 的进化方向,而不只是旁观者。[28]
激励也直接:任务被合并的贡献者获得论文共同作者身份,目标投稿高影响力期刊。[28] 每个任务要经过领域、技术、终审三轮评审。[28] 合并之后还有义务:维护任务、协助分析 agent 的失败轨迹,直到基准正式发布。[28] 所以共同作者身份既是激励,也是质量约束。[28]
这套机制 5 月 20 日开放征集,8 月 17 日截止提交。[28] 最终版本瞄准 100 个以上任务,项目托管在斯坦福和 Laude Institute。[28] Snorkel AI、2077AI 等机构提供资金与算力支持。[28]
8 月 27 日,斯坦福大学和 Laude Institute 发布 Terminal-Bench-Science 0.1。
成绩单:谁是全科第一?
0.1 版的排行榜有几个值得注意的细节:Opus 5 在大多数科学领域领先,总通过率约 30%。[33] 但数学科学是例外,Fable 5 和 OpenAI 的 GPT-5.6 Sol 在那里领跑。[33] 工程任务上,SpaceXAI 的 Grok 4.6 是最好的模型之一。[33]
开源和效率维度也有看点:Z.ai 的 GLM 5.3 是最强开源模型。[33] Moonshot AI 的 Kimi K3 是除 Opus 5 之外,唯一同时站上成本和 token 效率两条帕累托前沿的模型。[33]
基准的尽头是工具吗?
Terminal-Bench-Science 定位为一个持续演化的基准,跟着前沿 AI 一起迭代。[30] 它的逻辑很直白:前沿实验室优化的是基准测量的东西,所以科学家出题,就是在给 AI 的下一步能力定目标。[28] 基准采用 Apache-2.0 许可开源,任务和评测代码都在 GitHub 上,0.1 版还在 Zenodo 留了存档。[27][30]
70 个任务、约 30% 的通过率,说明今天的 agent 离可靠执行科学工作流还有距离。[33] 但这个基准的野心不在打分,而在建立一个反馈回路:科学需求进,AI 能力出。[28] 回路能不能转起来,取决于有多少科学家愿意把自己的工作流交出来。[28]