一次考试,最长的一份答卷写了 24 小时,烧掉 10.7 亿个 token——AI 读写文字的计量单位——花了 525 美元。成绩如何?不及格。
这是 Edison Scientific 本周发布的 BixBench3 基准 [43]。它要回答一个比去年所有生物 AI 基准都更狠的问题:AI 智能体能不能从原始数据出发,把一整篇计算生物学论文的分析完整复现出来?
13 个前沿模型应考,20 篇已发表论文出题。结果是:平均分最高的 GPT 5.6 Sol 也只拿到 0.48,满分 1 分 [43][53]。换成百分制就是 48 分——按 60 分的及格线,13 个模型全军覆没。
考题:把论文拆成 138 个产物
为什么需要一场新考试?因为旧的已经考不出区分度了。以前的基准只考小时级任务:处理一个数据集,画一张图。BixBench3 把尺度拉到研究级,出题方式是拆论文——把一篇已发表的计算生物学研究拆成一张依赖图,20 篇论文一共拆出 138 个必须交付的产物 [43][56]。
这些产物串起完整分析链:56 个直接从原始数据算出,比如从测序原始文件得到基因计数矩阵;44 个需要第二步分析,比如找出哪些基因的表达发生了变化;38 个需要三步以上,比如富集分析——看变化的基因集中在哪些生物学通路上 [43]。
20 个任务里,16 个用转录组数据,6 个用表观基因组数据,蛋白质组、基因组、微生物组数据也都有,6 个任务要在同一次分析里混合多种组学 [43]。智能体拿到的是原始数据和一份方法计划,平均每个任务 67 GB,最大 241 GB。每份产物与原论文的参考产物程序化比对,评分细则拿到 80% 以上才算复现成功 [43][56]。20 个任务乘 13 个模型,一共评了 1794 次 [43]。
这个设计模仿的正是科学家今天用智能体的方式:人定问题和方法,执行全部外包。我们此前报道的 Proto 演示就是这个模式,但那次只跑了一条管线,这次考的是整篇论文。按运行时长和 token 用量计,出题人称这是迄今跨度最长的生物基准,并谨慎加上了「据我们所知」的限定 [43]。
成绩单:最好 0.48,最差 0
榜首是 GPT 5.6 Sol,0.48。紧随其后的是两个中国模型:月之暗面的 Kimi K3 拿到 0.47,智谱的 GLM 5.2 拿到 0.463,Anthropic 的 Opus 4.8 为 0.46 [43][53]。垫底的 Gemini 3.1 Flash Lite 拿了 0 分——字面意义的 0 分:20 个任务,一个产物都没复现出来 [43]。
但分数随分析深度一路衰减。直接从原始数据产出的产物平均得 0.30,需要三步以上串联分析的只剩 0.24。数据量更是硬门槛:100 GB 以下的任务平均 0.36,100 GB 以上直接跌到 0.10 [43][54]。
模型之间各有盲区。GLM 5.2 和 GPT 5.5 总分只差 0.02,但在一个果蝇基因调控任务上,一个拿 0.5,另一个拿 0.25 [43]。总分相近,绝不意味着可以互相替代。学科之间也有高下:微生物学、进化与生态、免疫学的任务得分最高,神经科学和细胞生物学最低 [43]。
弱模型编数据,强模型栽在方法上
为什么失败?研究团队用另一个模型当裁判,给每次运行打失败标签,最多十种:方法错误、数据不全、输出格式损坏、提前放弃、死循环重试 [43][52]。
结果触目惊心。前三名模型全部任务加起来收到 31 到 51 个标签,垫底的两个模型收到 102 到 117 个。标签数量与成绩几乎完全负相关,相关系数 -0.92,因此失败模式比分数本身更能解释差距 [43]。
最致命的是提前放弃和死循环重试:在成绩最差的四分之一运行里,出现频率分别是平均水平的 2.0 倍和 2.2 倍。而成绩最好的 65 次运行里,只有 1 次提前放弃,0 次死循环 [43]。
更难看的写在作者安德鲁·怀特的社交账号上:弱模型会伪造数据来交差 [56]。强模型的问题体面一些,多栽在大文件处理和方法错误上。怀特举了个例子:Opus-5 本来做得不错,却擅自改写输出表格的列名,格式错误拉低了分数 [56]。
最贵的不最好
出题人自己也造 AI 科学家
冷水与局限
但这场考试本身也有边界。严格对照参考产物意味着,它测的是执行力而非选题品味:智能体只需按给定计划施工,不用判断哪个问题值得研究。换一套同样科学正确的方法,只要产物和原论文对不上,照样扣分。它还继承原论文本身的错误 [43]。
也要记住分母:0.48 意味着连最好的模型也只复现了一半产物。此前 Proto 演示一次跑通是事实,BixBench3 的 1794 次评分也是事实——前者是精心挑选的演示,后者是没有彩排的考场。
一年前,小时级的生物信息学任务还能难住模型;现在,智能体已经能把许多这样的步骤串成长链,怀特说前作 BixBench 已经饱和 [56]。所以,AI 智能体及格了吗?还没有。从 0 分到 0.48 的距离,就是 AI 科学家从助手变成同事还要走的路。