近日,Arc 虚拟细胞计划团队与加州大学旧金山分校的 Hani Goodarzi 在《Cell》发表评论,官宣了这项赛事的设计逻辑。不过,今年的规则近乎苛刻:不提供任何挑战专属训练集,模型必须零样本(zero-shot)预测从未见过的细胞系在基因敲低后的反应。
没有训练集,怎么考?
简单来说,今年的考题是:给你一种陌生细胞在未受扰动时的基因表达"快照",再加一份待敲低的基因名单,预测敲低之后细胞会变成什么样。
具体而言,Arc 用 CRISPR 干扰(CRISPRi)结合 10x Flex 单细胞测序,在 6 条来自不同组织的癌细胞系上完成了 Perturb-seq 实验。其中 3 条进入验证阶段:参赛者拿到每条细胞系的非靶向对照表达谱,以及 300 个待预测的敲低基因标识。[14, 18]
剩下 3 条被严格扣留,10 月 22 日才放出测试输入,最终提交阶段没有任何成绩反馈。这一设计刻意把"接触目标细胞"和"接触该细胞的扰动结果"分开。模型无法靠在目标细胞系上刷题取胜,它必须学会扰动效应如何跨细胞情境迁移。
因此,零样本泛化直击药物研发最缺的能力:罕见细胞类型、无法体外培养的原代细胞、依赖体内微环境的组织状态,都没法"先做实验再预测"。
简单来说,今年的考题是:给你一种陌生细胞在未受扰动时的基因表达"快照",再加一份待敲低的基因名单,预测敲低之后细胞会变成什么样。
一场 5,000 人的考试,暴露了什么问题?
把难度调高,是因为第一届的结果喜忧参半。
2025 年的首届比赛要求预测 H1 人胚胎干细胞中单基因扰动的后果。比赛吸引 114 个国家超过 5,000 人报名,1,200 多支队伍提交结果,300 余支进入决赛。[1, 6]
冠军由 BioMap 研究的 BM_xTVC 队摘得,其 xTrimoSCPerturb 模型改进了 scFoundation 架构,并融合蛋白模型嵌入。亚军、四川大学的 XLearning Lab 思路反而朴素:把单细胞数据压缩成伪 bulk,再用残差学习预测扰动变化。[4]
但复盘并不全是好消息。问题出在哪?主办方承认,最强模型未能在所有指标上稳定跑赢朴素基线。有团队证明,一个在伪 bulk 数据上训练的简单回归模型,就能排到排行榜第 15 名左右。[1, 5]
比赛中途还出现了规则补丁:由于 MAE 指标实际失去区分度,头部队伍集中刷另外两项分数,组委会临时增设"通用奖"。新奖项改用 7 项指标综合评定,最终由 Altos Labs 的流匹配生成模型获奖。[2, 7]
所以今年,评分体系被重新设计。六项互补指标各自在"细胞情境均值"与"真实重复实验数据"之间归一化,总分是六项指标、多个细胞情境上的等权平均。刷单一指标不再奏效。[18]
其中 3 条进入验证阶段:参赛者拿到每条细胞系的非靶向对照表达谱,以及 300 个待预测的敲低基因标识。
细胞建模的 AlphaFold 时刻,还有多远
为什么要如此大费周章?答案指向药物研发的老伤口:进入临床的候选药物约 90% 最终失败,多数倒在疗效或安全性上。[6] 细胞在培养皿里的反应,常常无法外推到人体。2025 年 4 月,NIH 宣布优先发展人源研究技术、减少动物使用,计算模型被明确列入其中。[9]
Arc 自己的模型也在迭代:2025 年 6 月发布的 STATE,用近 1.7 亿个细胞的观测数据和超过 1 亿个细胞的扰动数据训练。2026 年 1 月,Arc 又推出开源模型 Stack,主打在新情境中的上下文学习。[16] 但 Arc 的对标对象并非某个具体模型:它看齐的是 CASP——那个最终催生出 AlphaFold 的蛋白质结构预测竞赛。[8]
评论写道,如果领域能把扰动谱分析这类基础实验搬进计算机,细胞建模或许将迎来自己的"AlphaFold 时刻"。但这个时刻的前提被定义得很克制:实验不会变得不再必要,模型的价值在于告诉研究者,哪些实验最值得做。
11 月 5 日提交截止。3 条从未露面的细胞系,将给出零样本时代的第一份答卷。