BioTender / 论文速递

Issue 28 · 2026-07-13 · AI × Biology

从头设计激酶调控蛋白
与生物LLM基础设施

今日速递 6 篇 3 方向 arXiv 4 + bioRxiv 1 + Nature 1
Bauer · Coventry · Baker et al.(华盛顿大学蛋白质设计研究所) bioRxiv · 2026.07.13

激酶催化域高度保守,是精准调控最难啃的靶点类别之一——大多数抑制剂会脱靶打到其他激酶。David Baker 实验室从头设计了 96 个基因编码微蛋白,直接结合并稳定 FAK(黏着斑激酶)的不同构象状态,靶点是激酶结构域本身,而非变构口袋。

96 个设计中 33 个成功调控了激酶活性;最强的 4 个中,两个以低纳摩尔 IC50 抑制 FAK,两个使活性提升超过 2 倍。在活细胞中表达后,体外观察到的抑制/激活效果原样保留——说明这些设计能真正重塑细胞内的信号通路,而非只是试管里的结合剂。团队进一步利用激酶结构相似性,把 FAK 抑制剂改造为 Src 激酶抑制剂,为跨激酶家族的基因编码选择性调控提供了可复制的平台。

Seo · Hwang · Lee et al. arXiv · q-bio.QM · cs.AI · cs.LG

生物 LLM(BioLM)需要真正理解生物学的训练语料,但分子数据库、蛋白质库、基因组注释、单细胞图谱、通路数据库分散在异构格式中,从未被整理成统一的语言模型训练语料。TheBioCollection 将这些资源转化为统一、可直接训练的 526 亿 token 规模语料,覆盖小分子、蛋白质、基因组序列、细胞与通路。

不止于简单整合——每条记录都用工具计算的生物学属性做了增强,并引入了现有语料几乎不覆盖的新指令任务。配套发布 TheBioCollection-Eval 评测集,覆盖识别、生成、预测三类能力。固定基座架构 Gravity-16B-A3B 不变,仅用该语料训练后,整体评测分数翻倍以上,且各领域均有提升,通用语言能力几乎不受影响。

Cheng · Ni · Qu · Liu et al. arXiv · cs.LG · q-bio.QM

蛋白质设计中最优长度往往未知、且与可设计性紧密耦合,但现有扩散/流模型通常要求采样前先指定长度,限制了对可行设计空间的探索。GPFlow(广义泊松流)通过学习非齐次广义泊松过程的速率函数,实现变长生成,并给出恢复联合多模态分布的种群级保证与 KL 散度上界。

在结构与序列设计、motif 支架、肽段协同设计等任务上全面验证,跨越欧氏、类别、黎曼多种模态。无条件设计中,GPFlow 相比固定长度基线提升结构可设计性、序列分布拟合度最优,并完美恢复长度分布;条件 motif 支架任务中在 16 项基于结构的设计任务里 10 项排名第一。

Motahharynia · Ghaffarzadeh-Esfahani · Sirous et al. arXiv · q-bio.QM · cs.AI · cs.LG

现有计算药物设计通常只针对靶点或分子属性生成分子,忽略了疾病背景对靶点行为和治疗结局的影响。DrugGen-2 在已获批药物-疾病-靶点关联数据集上微调 GPT-2,采用监督微调 + 组相对策略优化(GRPO)强化学习两阶段策略,奖励函数同时优化化学有效性、新颖性、多样性与预测结合亲和力。

在糖尿病肾病相关的 5 个蛋白靶点上评测,DrugGen-2 显著优于 DrugGPT 和前代 DrugGen:生成独特分子能力更强、与已获批药物结构相似度更高、各靶点预测结合亲和力均有提升。分子对接分析显示部分候选配体的预测亲和力超过依那普利等参照药物——将疾病特异性背景纳入分子生成,是 AI 辅助药物发现与老药新用的新工具。

Chen · Hu · Wang · Zhu et al. arXiv · cs.LG · cs.AI · q-bio.QM

抗体候选物按结合亲和力排序是治疗性抗体发现的关键环节,但现有方法将亲和力比较视为独立事件,忽略了其他已标注比较中蕴含的上下文信息,限制了对抗原特异性结合景观的捕捉能力。对许多靶抗原,往往已有少量实验表征的亲和力比较数据——这与上下文学习(ICL)范式高度契合。

AbICL 将预训练结构编码器与上下文排序头结合,用情景元训练策略使模型能在无需梯度更新的情况下利用支持样本做测试时适应。在 AbRank 基准上,AbICL 在几乎所有数据划分和评测基准上稳定优于现有排序基线;分析显示上下文示例的价值取决于其与目标推断任务的匹配程度,在分布偏移和细粒度亲和力判别场景下优势更明显。

Meyer · Friede · Grieve · König et al. Nature Reviews Drug Discovery · 2026.07.13

自适应设计、生物标志物导向入组、主方案、实时决策——现代临床试验正在拥抱各种创新策略,但也带来了设计理解与执行上的复杂性。这篇 Nature Reviews Drug Discovery 观点文章主张:仿真引导设计是应对这种复杂性的关键工具。

在真正入组患者之前,先通过仿真评估复杂试验的运行特性——I 类错误率与错误发现率控制、样本量所需的统计功效、每次期中分析的自适应决策概率;结合单次模拟试验的具体表现与汇总统计,可提前发现风险并优化设计。作者强调这不只是统计学家的工具,而是让临床团队、数据监察委员会、监管机构、申办方、患者代表共享同一套设计语言的沟通手段,并给出了确保仿真研究有效、透明、详尽、高效、可比的最佳实践建议。