BioTender / 论文速递

Issue 44 · 2026-08-29 · AI × Biology

从闭环药物优化,
到蛋白质组基础模型

今日速递6 篇3 方向bioRxiv 6
Joshua Almonte · Minh Triet Vu · Andrew Ahn · Erik H. ThiedebioRxiv 预印本 · 2026.08.27

这项工作把语言模型中的上下文学习迁移到多肽任务:将少量带标签的示例肽用甘氨酸间隔符串联成提示,再用单序列蛋白语言模型给查询肽评分。整个过程不进行梯度更新,也不需要任务专用微调或改动模型结构。

作者在合成模式补全、二级结构分类和MHC-II结合肽预测上测试了ESM-2与ProGen2,并观察到示例数量和模型规模增加时表现改善;正负示例提示的差分评分还能降低组成偏差。该研究是未经同行评审的bioRxiv预印本,结果显示的是低数据分类能力,并不等同于模型已获得通用的生物学任务理解。

Sameek Singh · Maja Wierzbinska · Konika Konika et al.bioRxiv 预印本 · 2026.08.27

CysLENS把共价片段化学蛋白组学与ESM-2定义的半胱氨酸微环境结合起来,综合接合强度、化合物相似性、立体选择性和既有证据,为半胱氨酸—化学型配对生成可解释排序。配套筛选覆盖940个片段、470对对映体,并量化超过4.5万个半胱氨酸位点。

框架在独立数据中比单用竞争比更能优先发现结构相似化合物的重复相互作用,并进一步筛到对DNMT1呈异构体偏好的候选,作者用裂解液、活细胞和浓度依赖实验补充验证。该研究是未经同行评审的bioRxiv预印本;排序可用于缩小配体化搜索空间,但其跨平台稳定性与候选的药理价值仍需进一步验证。

Han Wang · Dehua Lu · Weiping Lyu et al.bioRxiv 预印本 · 2026.08.27

RCDO将三维结构引导的生成模型、强化学习奖励与湿实验反馈接入同一迭代环路。每轮设计后,系统不仅吸收活性化合物的数据,也使用无活性或成药性失败的结果更新多层奖励,从而让后续生成更贴近真实优化约束。

作者除回顾性基准外,还报告了ROR1、NLRP3和NSD3三个前瞻性湿实验项目,并称在两到三轮设计中分别改善暴露、降低CYP2C19抑制或提升结合亲和力。该研究是未经同行评审的bioRxiv预印本;这些项目提供了有价值的闭环实验信号,但仍需完整候选结构、对照和独立复现来判断相对传统药化流程的净增益。

Ruoqiao Chen · Li Huang · Yu Qiao et al.bioRxiv 预印本 · 2026.08.28

InsilicoCell是一套多模态、多任务的预训练Transformer,试图在同一表示空间中连接细胞分子状态、分子相互作用与扰动响应。模型在七类任务、超过8800万条测量上进行监督式预训练,任务包括药物敏感性、药物诱导表达和药物—蛋白结合。

作者报告,统一模型优于对应的任务专用模型,并能迁移到未见实体、患者、空间及单细胞场景;用于多目标虚拟筛选时,还给出了c-Myc、抗纤维化和干性诱导候选的实验验证。该研究是未经同行评审的bioRxiv预印本;多源数据的重叠、任务间信息泄漏和外部前瞻验证将是评估其泛化能力的关键。

Sander Heyndrickx · Ralf Gabriels · Harikrishnan Ramadasan · Lennart Martens · Tine ClaeysbioRxiv 预印本 · 2026.08.28

OmicsFM把掩码丰度重建用于蛋白质组预训练,训练语料来自1,397个重新处理的PRIDE项目、48,837个质量过滤后的蛋白质组样本。模型强调模态无关设计,并把蛋白质组表示与体量更大的bulk及单细胞转录组基础模型进行比较。

作者报告,OmicsFM在留出项目上恢复了通路层面的分子关系,样本嵌入能保留跨研究结构,并可迁移到细胞类型分类、基因必需性和扰动响应预测;蛋白质组与转录组表示还呈现互补信息。该研究是未经同行评审的bioRxiv预印本,跨项目处理一致性和更广泛的外部验证仍决定其能否成为通用蛋白质组底座。

Jay Moran · Philip J. Freda · Attri Ghosh · Corey T. Walker et al.bioRxiv 预印本 · 2026.08.25

ASAREE不是再造一个通用Agent,而是提供用于比较Agent设计选择的开放实验沙箱。平台可创建Agent、连接MCP服务器和工具、用可视界面或Python SDK设计析因实验,并为每次运行保留完整来源记录和模型调用轨迹。

在一个多Agent机器学习流程的2×2×2实验中,更强模型、更高推理力度和critic Agent增加了运行时间、token、成本与特征数,却没有改善平均预测表现;最昂贵配置成本为基线的15.5倍、耗时为13.1倍。该研究是未经同行评审的bioRxiv预印本,结论来自单一示例流程,价值主要在于提供可复核的Agent评测方法,而非证明某种配置普遍最优。