第 20 步,分数停在 0.6791,距离 0.68 的达标线只差 0.0009。这个分数叫界面置信分,衡量抗体和靶点是否真能结合,0 到 1,越高越可信——四舍五入,不就是 0.68 吗?
但智能体没有给自己放行:它按未取整的原始分数判定不达标,继续优化。三步之后,第 23 步,分数爬到 0.68004,它宣布达标,停了下来。
这是一场官方演示里的第一个任务。近日,斯坦福化学工程助理教授布莱恩·希宣布:他实验室的 AI 智能体 Proto 以插件形式上线了 ChatGPT,并放出两段演示对话 [38]。第一个任务:照着开源管线 Germinal 的配置,为 PD-L1 设计一个全新的纳米抗体。PD-L1 是癌细胞用来踩住免疫刹车的蛋白;纳米抗体只有常规抗体十分之一大小。指令还规定:只跑第一阶段,达标线 0.68,最多 60 步。
演示漂亮,但数字可信吗?我们拿到了演示的全部产物文件——轨迹表、结构文件、序列文件——逐一做了独立核对。一个智能体,从抗体写到 DNA——两个任务是希挑的:一个设计蛋白质,一个写作 DNA,正好覆盖生成式生物学的两条主线。放在平时,每条管线都得自己写代码、租显卡。
先翻仓库,再跑模型
Proto 是什么?它把自己定义为「生成式生物学的编程语言」:把 80 多种生物 AI 模型和计算工具封装成统一接口,智能体用自然语言就能调用 [30][32]。今年 6 月,它刚挂上预印本,代码开放 [31][33]。
接入 ChatGPT 意味着什么?不用装环境,不用租显卡,在对话框里就能开工。同一条推文还指向 OpenAI 的 Rosalind 工作台研究预览——我们此前报道过它——这个基于 GPT-Rosalind 模型的工作台,把「设计 PD-L1 纳米抗体」列为官方示例任务 [37]。
接到任务后,Proto 没有急着跑模型,先去翻了 Germinal 的仓库:抗体三段环的长度 11、8、18,框架四段 25、17、38、14,靶点上五个关键残基,达标线 0.68。这些数字我们逐一核对过,与仓库配置完全吻合 [29][36]。
Germinal 来头不小:斯坦福与 Arc 研究所合作开发的抗体设计管线,去年 9 月挂出预印本,今年 8 月又拿了《自然·方法》的研究亮点 [4][42]。论文报告每个靶点只测 43 到 101 个设计,实验成功率 4% 到 22%,做出的纳米抗体达到纳摩尔级结合力,PD-L1 正是它的示范靶点 [4][5]。
还有个插曲:Proto 自带的 Germinal 完整封装只能在本地跑,它就把管线拆成零件自己组装——AlphaFold2 的梯度后端负责优化,抗体版序列模型负责重写。组装方式与官方流程一致,相当于手工复刻了一条流水线。
23 步爬坡
第一阶段叫「幻觉设计」——这里的幻觉是褒义:让 AlphaFold2 反向想象出一个能贴住靶点的蛋白。界面置信分从第 1 步的 0.140 起步,第 6 步 0.374,第 11 步 0.531,第 17 步 0.614,一路爬到第 23 步达标。
过程中它两次自己纠错。第一次,模板文件传输被截断,它发现后推倒重来,声明半截轨迹不算数。第二次更微妙:输出里有个字段数值其实是损失函数,直接当成分数读会误判达标,它识别出来,改用真分数。
达标后进入第二阶段:抗体专用的序列设计模型 AbMPNN 重写三段环。40 条候选、温度 0.2,按困惑度——模型对序列的把握,越低越好——选出 2.553 的那条。37 个环位点里 29 个允许改,8 个已经贴住靶点的残基原样保留。
换模型,信心没了
最后一步,用 Biohub 今年发布的 ESMFold2 给抗体和靶点做复合物折叠。这个模型的论文发现,多跑循环次数对抗体-抗原对接特别有帮助 [9][15],所以智能体把循环开到 20 次、扩散采样开到 100 步、独立样本 5 个。
结果出来了:结构置信分 0.783,但界面置信分只有 0.401。信心去哪了?AlphaFold2 阶段的 0.68,没有跨模型传递过来。智能体在总结里自己写明:两个预测都不构成实验上的结合验证。
还有个细节值得记录。折叠靶点本该检索同源序列做比对,但调用外部接口意味着把序列发出去。智能体在提交前拦下这一步,想找本地数据库,本地没有,最终改用无比对模式:序列不出工作区。
第二个任务:让 DNA 模型续写噬菌体
蛋白质之外,DNA 呢?第二个任务是用 Arc 研究所的 Evo 2 做「语义设计」:给一段有生物学含义的开头,让模型接着写。Evo 2 今年登上《自然》,训练数据覆盖近 9 万亿个碱基 [17][19]。
智能体没有随手找段序列。它从 NCBI 调出铜绿假单胞菌噬菌体 JBD30 的基因组,截取 1000 个碱基,切口精确停在一个叫 Aca1 的基因末尾。Aca1 是抗 CRISPR 系统的标配零件,负责给这套对抗细菌免疫的系统当开关 [24][28]。
Evo 2 用 70 亿参数的模型、温度 1.0、固定随机种子 20260827,独立续写 10 段,每段正好 2000 个碱基。我们在本地逐条验证:全部只含四种碱基,两两不同,种子序列与 NCBI 参考基因组完全一致。
我们核对了每个数字
冷水与局限
但冷水必须泼。所有结果都是计算机里的预测,没有一个分子进过实验室。这些设计真的能结合吗?Germinal 论文自己的数据摆在那里:计算达标的设计,实验成功率也只有 4% 到 22% [4]。官方演示天然展示成功案例,平均水平的运气不会写进推文。
日志本身也不能照单全收。智能体声称 60 步上限「正好等于」仓库默认设置,实际默认是 65 步;它还声称沿用了仓库的学习率退火设置,而默认配置里这项是关的 [36]。两处都不影响结果,但说明转述必须核对——哪怕转述者是 AI。
两段英文指令,没有一行代码,一个智能体从抗体写到 DNA,两条真实管线在 ChatGPT 的对话框里跑完了。放在三年前,这是一个计算生物学家几周的工作量。但「跑完」和「跑对」之间,隔着培养皿——智能体把这句话写进了自己的总结,这或许是整份日志里最可靠的一句。