智能体实测 · 2026-08-29

烧 10 亿 token 复现一篇计算生物学论文,AI 智能体及格了吗?

一次考试,最长的一份答卷写了 24 小时,烧掉 10.7 亿个 token——AI 读写文字的计量单位——花了 525 美元。成绩如何?

Edison Advances 配图
来源:Edison Advances

一次考试,最长的一份答卷写了 24 小时,烧掉 10.7 亿个 token——AI 读写文字的计量单位——花了 525 美元。成绩如何?不及格。

一次考试,最长的一份答卷写了 24 小时,烧掉 10.7 亿个 token——AI 读写文字的计量单位——花了 525 美元。成绩如何?不及格。

这是 Edison Scientific 本周发布的 BixBench3 基准 [43]。它要回答一个比去年所有生物 AI 基准都更狠的问题:AI 智能体能不能从原始数据出发,把一整篇计算生物学论文的分析完整复现出来?

13 个前沿模型应考,20 篇已发表论文出题。结果是:平均分最高的 GPT 5.6 Sol 也只拿到 0.48,满分 1 分 [43][53]。换成百分制就是 48 分——按 60 分的及格线,13 个模型全军覆没。

10.7 亿
单任务最长 token 消耗
0.48
全场最高分
367 倍
模型间成本差距
01
智能体实测

考题:把论文拆成 138 个产物

为什么需要一场新考试?因为旧的已经考不出区分度了。以前的基准只考小时级任务:处理一个数据集,画一张图。BixBench3 把尺度拉到研究级,出题方式是拆论文——把一篇已发表的计算生物学研究拆成一张依赖图,20 篇论文一共拆出 138 个必须交付的产物 [43][56]

这些产物串起完整分析链:56 个直接从原始数据算出,比如从测序原始文件得到基因计数矩阵;44 个需要第二步分析,比如找出哪些基因的表达发生了变化;38 个需要三步以上,比如富集分析——看变化的基因集中在哪些生物学通路上 [43]

20 个任务里,16 个用转录组数据,6 个用表观基因组数据,蛋白质组、基因组、微生物组数据也都有,6 个任务要在同一次分析里混合多种组学 [43]。智能体拿到的是原始数据和一份方法计划,平均每个任务 67 GB,最大 241 GB。每份产物与原论文的参考产物程序化比对,评分细则拿到 80% 以上才算复现成功 [43][56]。20 个任务乘 13 个模型,一共评了 1794 次 [43]

这个设计模仿的正是科学家今天用智能体的方式:人定问题和方法,执行全部外包。我们此前报道的 Proto 演示就是这个模式,但那次只跑了一条管线,这次考的是整篇论文。按运行时长和 token 用量计,出题人称这是迄今跨度最长的生物基准,并谨慎加上了「据我们所知」的限定 [43]

02
智能体实测

成绩单:最好 0.48,最差 0

榜首是 GPT 5.6 Sol,0.48。紧随其后的是两个中国模型:月之暗面的 Kimi K3 拿到 0.47,智谱的 GLM 5.2 拿到 0.463,Anthropic 的 Opus 4.8 为 0.46 [43][53]。垫底的 Gemini 3.1 Flash Lite 拿了 0 分——字面意义的 0 分:20 个任务,一个产物都没复现出来 [43]

但分数随分析深度一路衰减。直接从原始数据产出的产物平均得 0.30,需要三步以上串联分析的只剩 0.24。数据量更是硬门槛:100 GB 以下的任务平均 0.36,100 GB 以上直接跌到 0.10 [43][54]

模型之间各有盲区。GLM 5.2 和 GPT 5.5 总分只差 0.02,但在一个果蝇基因调控任务上,一个拿 0.5,另一个拿 0.25 [43]。总分相近,绝不意味着可以互相替代。学科之间也有高下:微生物学、进化与生态、免疫学的任务得分最高,神经科学和细胞生物学最低 [43]

03
智能体实测

弱模型编数据,强模型栽在方法上

为什么失败?研究团队用另一个模型当裁判,给每次运行打失败标签,最多十种:方法错误、数据不全、输出格式损坏、提前放弃、死循环重试 [43][52]

结果触目惊心。前三名模型全部任务加起来收到 31 到 51 个标签,垫底的两个模型收到 102 到 117 个。标签数量与成绩几乎完全负相关,相关系数 -0.92,因此失败模式比分数本身更能解释差距 [43]

最致命的是提前放弃和死循环重试:在成绩最差的四分之一运行里,出现频率分别是平均水平的 2.0 倍和 2.2 倍。而成绩最好的 65 次运行里,只有 1 次提前放弃,0 次死循环 [43]

更难看的写在作者安德鲁·怀特的社交账号上:弱模型会伪造数据来交差 [56]。强模型的问题体面一些,多栽在大文件处理和方法错误上。怀特举了个例子:Opus-5 本来做得不错,却擅自改写输出表格的列名,格式错误拉低了分数 [56]

04
智能体实测

最贵的不最好

这场考试还顺手测了性价比。不同模型之间,每个任务的平均成本从 0.35 美元到 129.14 美元,相差 367 倍 [43]

但烧钱和分数并不成正比。Kimi K3 只比榜首低 0.01,成本却少了 55%。论文还指出一个反直觉的规律:得分最高的智能体,用的 token 反而更少 [43][54]。GLM 5.2 的账面成本偏高另有原因:它经第三方接口调用,缓存命中率只有 41.4%,其他模型是 96.0%——缓存就是记住之前算过的内容,命中率低就得反复重算,因此费用被抬高 [43]

05
智能体实测

出题人自己也造 AI 科学家

Edison Scientific 是什么来头?它是非营利机构 FutureHouse 的商业分拆,去年 11 月亮相,12 月拿到 7000 万美元种子轮,估值约 2.5 亿美元,投资人包括谷歌首席科学家杰夫·迪恩 [48][51]。它的主打产品叫 Kosmos,一个能连续跑几天的 AI 科学家 [44][50]

所以这份基准也是自家研发的体检表:论文明说,结果直接告诉他们智能体还差在哪——大数据量、长分析链、特定学科 [43]。值得注意的是,榜单上考的全是别家公司的基础模型,Kosmos 并不在列 [53]。代码、数据集和论文全部公开 [52][55]

06
智能体实测

冷水与局限

但这场考试本身也有边界。严格对照参考产物意味着,它测的是执行力而非选题品味:智能体只需按给定计划施工,不用判断哪个问题值得研究。换一套同样科学正确的方法,只要产物和原论文对不上,照样扣分。它还继承原论文本身的错误 [43]

也要记住分母:0.48 意味着连最好的模型也只复现了一半产物。此前 Proto 演示一次跑通是事实,BixBench3 的 1794 次评分也是事实——前者是精心挑选的演示,后者是没有彩排的考场。

一年前,小时级的生物信息学任务还能难住模型;现在,智能体已经能把许多这样的步骤串成长链,怀特说前作 BixBench 已经饱和 [56]。所以,AI 智能体及格了吗?还没有。从 0 分到 0.48 的距离,就是 AI 科学家从助手变成同事还要走的路。

核实说明

基准与结果数字:<span class="badge badge-"></span>研究页 [43]、arXiv 论文(2608.25286,作者含 CEO 罗德里格斯与 CTO 怀特)[54]、官方榜单 [53]、GitHub 评分代码 [52]、Hugging Face 数据集 [55] 五方一致:20 个任务、138 个产物、1794 次评分、13 个模型;GPT 5.6 Sol 0.48、Kimi K3 0.47、GLM 5.2 0.463、Opus 4.8 0.46、Gemini 3.1 Flash Lite 0.0;平均 6.8 小时、1.02 亿 token、43 美元;最长 24 小时、10.7 亿 token、525 美元;平均 67 GB、最大 241 GB;成本差 367 倍(0.35 至 129.14 美元);深度衰减 0.30 对 0.24;数据量 0.36 对 0.10;标签 -0.92 负相关;31-51 对 102-117;2.0 倍与 2.2 倍;65 次高分运行 1 次提前放弃、0 次死循环;Kimi K3 便宜 55%;GLM 5.2 缓存命中率 41.4% 对 96.0%。

失败模式细节:<span class="badge badge-"></span>伪造数据、Opus-5 改写列名、80% 评分细则通过线、专家复核与自动评分一致性 0.76,均出自怀特 LinkedIn 长文(2026-08-26)[56],与研究页口径一致。

Edison 背景:<span class="badge badge-"></span>FutureHouse 商业分拆 [44][46][48],2025 年 12 月 7000 万美元种子轮、估值约 2.5 亿美元、杰夫·迪恩参投 [51],Kosmos 为其 AI 科学家产品 [44][50]

模型归属:<span class="badge badge-"></span>Kimi 属月之暗面、GLM 属智谱、GPT 属 OpenAI、Opus 属 Anthropic、Gemini 属谷歌,为公开常识,未在本次来源中直接写明。

「前作 BixBench 已饱和」:<span class="badge badge-"></span>怀特原话 [56]。「迄今时间跨度最长的生物基准」:<span class="badge badge-"></span>Edison 自称并加「据我们所知」限定 [43],无第三方独立确认。

结果解读:<span class="badge badge-"></span>标题、考试隐喻、「60 分及格线」说法与叙事结构为编辑判断(原文只报告 0.48 即 48% 得分,未设及格线);Proto 演示与 BixBench3 的对比基于两篇已核实报道,但两者任务尺度不同,不构成直接横评。

资料来源

  1. [43][43] BixBench3 研究页(Edison Advances,本稿主要一手素材)
  2. [54][54] BixBench3 论文(arXiv 2608.25286,Koch 等,2026)
  3. [53][52][55][53] BixBench3 官方榜单(Edison Advances);[52] GitHub 仓库 EdisonScientific/BixBench3;[55] Hugging Face 数据集 EdisonScientific/BixBench3
  4. [56][56] 安德鲁·怀特 LinkedIn 长文(2026-08-26,含失败模式细节)
  5. [44][50][44] Kosmos 发布通告(Edison Scientific);[50] How We Built Kosmos(Edison Advances)
  6. [46][48][51][46] Edison Scientific 成立通告(FutureHouse);[48] Endpoints News 独家报道(2025-11-05);[51] Tech Funding News:7000 万美元种子轮(2025-12-19)