领域回顾 · 生物学 GPT · 2026

那些生物学的 GPT 们,现在都怎么样了

几年前那阵把什么都冠上"GPT"的热潮里,生命科学跟得最紧。喧嚣散场,这批模型没有走向同一个结局——它们分出了四种截然不同的命运。

缘起

同一套配方,四种命运

"GPT"火起来,已经是好几年前的事了。当年那阵把什么都冠上"GPT"的热潮里,生命科学是跟得最紧的领域之一——打开预印本网站,scGPT、ProtGPT2、MolGPT、DNAGPT、BioGPT……仿佛每个角落都长出了一个自己的"GPT"。它们背后其实是同一套配方:把"下一个词"换成"下一个基因、氨基酸、分子片段、核苷酸或原子",用自回归 Transformer 去建模一段生物学序列。当时的叙事是清一色的乐观:基础模型要"统一"每一个子领域了。

几年过去,喧嚣散场,正是回头盘点的好时候。有意思的是,这批模型并没有走向同一个结局——恰恰相反,它们分出了四种截然不同的命运。决定谁活下来的,从来不是名字里那三个字母。

4
命运分野
16
内嵌文献首页
'24–'26
证据年份跨度
1
同一套底层配方
01
命运其一 · 蛋白质

蛋白质:修成了正果

活得最好的,是蛋白质这一支。

道理不难理解:蛋白本就是 20 种氨基酸串成的序列,天生就是一种"语言",让语言模型来学,几乎是最顺理成章的迁移。而它们也确实交出了"能用"的答卷——不是停在论文里的漂亮指标,而是真的进了实验台。2024 年,有研究者用 ProtGPT2 和 ZymCTRL 从头设计出了能催化丙糖磷酸异构酶反应的全新酶,其行为和催化效率与天然酶相当[13];也有工作把蛋白语言模型接入自动化的"生物铸造厂",让蛋白的定向进化跑得更快、更准,直接指向工业应用[11]

De novo triosephosphate isomerases (ProtGPT2 / ZymCTRL)
[13] 从头设计丙糖磷酸异构酶(ProtGPT2 / ZymCTRL) bioRxiv · 预印本 · 2024
Protein LMs + automated biofoundry
[11] 蛋白语言模型 + 自动化生物铸造厂 Nature Communications · 2025

更重要的是,这一支还在健康地自我迭代,而不是原地吃老本。ProtGPT2、ProGen 之后,出现了用扩散机制来生成和预测序列的 DPLM[12],以及能直接从一段文字描述"读"出氨基酸序列的 ProtDAT[15]。2025–2026 年一项系统比较也给了它们公允的定位:相比结构扩散类模型,蛋白语言模型生成的设计更多样、更新颖,只是预测出的结构置信度略低一些——两条技术路线各擅胜场,而非谁淘汰谁[16][17]。对蛋白 GPT 来说,热潮退去留下的不是空壳,而是一整套还在长大的工具。

Diffusion protein language model (DPLM)
[12] 扩散式蛋白语言模型 DPLM arXiv · 预印本 · 2024
Text-to-sequence design (ProtDAT)
[15] 从文字描述生成序列的 ProtDAT Nature Communications · 2025
Structural vs sequence-based protein models
[16] 生成式蛋白模型系统比较:结构 vs 序列 bioRxiv · 预印本 · 2025
决定谁活下来的,从来不是名字里那三个字母,而是它到底解决了一个多真实的问题。
02
命运其二 · 单细胞

单细胞:从最耀眼到被冷静重估

命运反差最大的,是单细胞这一支。它当年最耀眼——scGPT 号称能一口气做细胞注释、多组学整合、扰动预测、调控网络推断,几乎覆盖了单细胞分析的所有主任务;如今,它也是被泼冷水最多的一个。

2024 年以来,一连串独立的系统评估给出了相当一致、也相当扫兴的结论:scGPT、Geneformer 这些单细胞基础模型,在零样本和扰动预测任务上并不能稳定胜过更简单的、任务专用的方法[1][4]。更尖锐的发现藏在稳健性里——模型在标准榜单上的高分,和它换个场景还灵不灵,其实是"脱钩"的:在多达 1600 多个数据集、6 类任务的考察下,榜单上的冠军一旦遇到数据分布变化就明显失稳,没有任何一个模型能全面领先[9]。还有工作把矛头指向更底层的问题,认为它们在把基因表达切成"词元"时丢掉了关键的生物学上下文,以致在某些场景连传统统计模型都不如[6]

Evaluating single-cell foundation models (Yale)
[4] 评测单细胞基础模型的实用性(Yale) Advanced Science · 2024
Zero-shot utility & robustness of scFMs
[9] 单细胞基础模型的零样本效用与稳健性 bioRxiv · 预印本 · 2026
Fundamental limitations in single-cell transcriptomics (UCSD)
[6] 单细胞转录组基础模型的根本局限(UCSD) bioRxiv · 预印本 · 2025

这并不意味着这一支就此出局——它反而催生了 BioLLM 这样的统一评测框架,让不同模型能被公平地摆在一起比较[5]。但如果说这几年单细胞 GPT 留下了什么最硬的教训,那就是它用真金白银的基准反复证明了一句话:"带 GPT"绝不等于"最先进"。

Standardized benchmark framework (BioLLM)
[5] 统一评测框架 BioLLM Patterns · 2025
03
命运其三 · 药物与分子

药物与分子:范式在延续,但“评测”出了信誉问题

分子这一支,活得不算差,却活得有点尴尬。

MolGPT 开创的思路仍在扩散——把分子写成 SMILES 字符串、教模型学会"分子的语法"再续写出新分子,这条路 2025–2026 年还在长出新变体,比如可控的 SMARTS 引导生成、图-motif 生成等等[20][24]。从这个角度看,范式是延续的,没有断档。

Controllable SMARTS-guided generation (VeGA-RX/SCX)
[24] 可控 SMARTS 引导生成 VeGA-RX / VeGA-SCX J. Chem. Inf. Model. · 2026
Graph-motif molecular generation (MetaMolGen)
[20] 图-motif 分子生成 MetaMolGen arXiv · 预印本 · 2025

但这几年这个领域最有分量的进展,其实是"反思"而不是"生成"。多篇 2025 年的工作集中揭穿了评测里的水分:生成模型产出的分子,有相当大一部分在现实中根本无法合成,漂亮的结构只是纸上分子[27];而"生成库开多大"本身就会严重扭曲模型排名,只有在十亿量级的设计库上比较,结论才相对可靠[29];一篇综述干脆点破——现行的基准常常系统性地夸大了这些模型"从头设计"出真正可成药分子的能力[26]。分子 GPT 没有退场,只是整个领域越来越清醒:能刷高的生成指标,离能进实验室、进临床,中间还隔着一条很宽的河。

Synthesizability in generative molecule design
[27] 生成分子的可合成性问题 ChemRxiv · 预印本 · 2025
Review: generative de novo drug design
[26] 综述:生成式从头药物设计的化学空间之旅 J. Chem. Inf. Model. · 2025
04
命运其四 · 临床与文本

临床与文本:被前沿通用大模型直接盖过

被超越得最彻底的,是临床文本这一支。

BioGPT 当年的立身之本,是"领域专用预训练"——用海量生物医学文本喂出来的模型,自然比通用模型更懂医学。这个逻辑在 2022 年是成立的。但风向变了:到 2026 年,多项研究发现,前沿的通用大模型(如 GPT-5.2、Gemini 3.1 Pro、Claude 等)在 MedQA、HealthBench 等医学基准上,已经反超了专门的临床 AI 工具[38];通用模型的零样本表现,常常追平甚至压过精心构建的领域专用模型[39]。换句话说,当通用底座本身足够强,"专门训练一个医学 GPT"的性价比就被大幅稀释了。

General LLMs outperform specialized clinical AI
[38] 通用大模型在医学基准上反超专用临床 AI Nature Medicine · 2026
Medical-domain vs general-purpose LLMs
[39] 医学专用 vs 通用大模型的对比分析 Journal of Polytechnic · 2026

当然,这不是盖棺定论。也有研究强调,在数据稀缺、任务复杂的临床场景里,经过微调的领域模型依然有它的价值[37]。但大趋势很清楚:曾经需要一个专门"医学 GPT"才能做的事,如今越来越多地被"直接调用最强的通用模型"取代了。

Guiding model choice in healthcare
[37] 医疗场景下的模型选择:大/小、零样本/微调 Mach. Learn. Knowl. Extr. · 2025
05
收束

尾声:留下来的不是名字,是判断力

把四种命运并排放在一起,图景就清楚了:蛋白这一支修成了正果,单细胞被冷静重估,分子在反思自己的评测,临床则被通用大模型盖过。

它们当年顶着同一个响亮的后缀出场,几年后却走向了完全不同的地方。这恰恰说明,"带不带 GPT"从来不是一条科学分界线,而只是一种命名习惯——真正影响它们命运的,是各自到底解决了一个多真实的问题、经不经得起严苛基准的反复捶打。

所以,"那些生物学的 GPT 们现在都怎么样了",答案不是一句简单的成或败。热潮会过去,名字会褪色,但它们共同验证过的那个朴素想法——只要一样东西能被写成序列,它就有可能被"生成"——留了下来,并且还在被 2025–2026 年那些千亿参数的新模型继续往前推。而对今天的读者来说,真正值得留下的,也不是数清有多少个"GPT",而是那份分得清"谁是真本事、谁只是蹭名"的判断力。

参考文献

说明:以下为正文引用文献,序号与正文中的 [N] 一一对应。年份、期刊与 DOI 依据检索所得的原始记录;标注为 preprint / bioRxiv / arXiv / ChemRxiv 的为预印本,尚未(或未在此处确认)经同行评审。其中文首页截图已随对应章节内嵌;[1]、[17]、[29] 三条无对应截图,仅列文字。