Issue 42 · 2026-08-27 · AI × Biology
论文提出ORBIT评测框架,把蛋白适应度模型中的问题拆成三层:序列中是否存在不同阶数的相互作用、模型表征能否读出这些相互作用,以及下游预测能否真正恢复功能。作者先在已知交互阶数的合成景观上校准诊断方法,再分析实验测量的GB1适应度景观。
结果提示,专门加入残差交互token可以让二阶相互作用更早进入表征,但并未自动带来高阶恢复或最终预测优势;加深下游MLP反而更能改善三阶信息的可访问性与功能恢复。该文是未经同行评审的arXiv预印本,结论建立在有限蛋白景观和架构比较上,尚不能外推到所有蛋白语言模型。
作者用正交投影从蛋白语言模型嵌入中移除已知生化特征的线性效应,并把方法扩展到高阶项和交互项,再观察蛋白适应度分类性能如何变化。这个设计不试图把整个嵌入压缩成少数概念,而是定量追问:某类可解释生化属性究竟贡献了多少预测信息。
消融结果表明,移除这些特征对应的方向会降低仅依赖嵌入的下游分类器性能,也能解释其预测方差的一部分。该文是未经同行评审的arXiv预印本;投影揭示的是表征与已知特征的统计关联,不等同于模型已学到因果生化机制。
BixBench3把评测单位从单个问答或短脚本提升到完整研究级分析:Agent接收研究目标、方法指引和原始生物数据,需要连续完成处理并产出峰调用矩阵、差异表达表等可程序化核验的中间结果。基准包含20项任务和138个独立产物,并比较13个前沿模型。
作者报告最佳系统的总体得分仍不到满分的一半,数据规模增大和分析链条变长都会明显拖累完成质量;更高token消耗也不必然带来更好结果。该文是未经同行评审的arXiv预印本,分数受任务构造、工具环境与评分规则影响,但它为“Agent能否独立完成整项计算生物研究”提供了比聊天式基准更接近实际的压力测试。
这项工作用“给定蛋白序列并调用常用工具完成功能表征”作为可验证任务,对比跨机构联邦拓扑、经典强化学习策略、LLM驱动框架、模型选择和提示专业度。核心问题不是再证明Agent可以串联工具,而是衡量灵活推理、可重复性、延迟和成本之间的部署权衡。
作者观察到模型选择对质量的影响远大于联邦通信拓扑;在常规且可验证的蛋白表征任务上,确定性策略可以接近最佳LLM,同时更快、更一致,但缺少自然语言推理轨迹。该文是未经同行评审的arXiv预印本,实验聚焦单类蛋白功能任务,其部署建议尚需在开放式发现、错误工具输出和湿实验闭环中继续检验。
UTR-Diffusion面向5′UTR及其与CDS连接区的条件生成,在一个扩散框架内同时控制平均核糖体负载和最小自由能等连续目标,并支持固定核苷酸、保持氨基酸身份下的同义密码子调整以及密码子适应性控制。它试图把过去分散处理的翻译效率、局部结构和序列约束统一到同一次生成中。
作者报告模型能随目标值稳定移动生成分布、严格保留指定序列与氨基酸约束,并在计算基准上优于所选对照。论文是未经同行评审的bioRxiv预印本;现有证据主要来自预测指标和离线比较,生成序列能否在不同细胞背景中获得预期表达与稳定性仍需湿实验验证。
作者把大规模并行测序实验与卷积神经网络结合,测量并学习启动子邻近DNA序列对体外转录RNA产量的影响。研究使用约十万条随机寡核苷酸序列,同时量化DNA和RNA丰度,再用留出数据检验序列到产量的预测能力。
论文报告模型预测与实测RNA产量在留出集上的Pearson相关系数为0.94,并提出可在合成前对新设计进行产量排序。该稿已被CIBB 2026会议接收,但当前链接仍是arXiv版本;数据来自特定结构背景和实验体系,因此对不同启动子、模板长度及生产工艺的可迁移性仍需独立验证。