智能体实测 · 2026-08-29

ChatGPT 上线生物 AI 模型入口插件——Proto,一个智能体,从抗体写到 DNA

第 20 步,分数停在 0.6791,距离 0.68 的达标线只差 0.0009。这个分数叫界面置信分,衡量抗体和靶点是否真能结合,0 到 1,越高越可信——四舍五入,不就是 0.68 吗?

Arc 研究所 配图
来源:Arc 研究所

第 20 步,分数停在 0.6791,距离 0.68 的达标线只差 0.0009。这个分数叫界面置信分,衡量抗体和靶点是否真能结合,0 到 1,越高越可信——四舍五入,不就是 0.68 吗?

第 20 步,分数停在 0.6791,距离 0.68 的达标线只差 0.0009。

但智能体没有给自己放行:它按未取整的原始分数判定不达标,继续优化。三步之后,第 23 步,分数爬到 0.68004,它宣布达标,停了下来。

这是一场官方演示里的第一个任务。近日,斯坦福化学工程助理教授布莱恩·希宣布:他实验室的 AI 智能体 Proto 以插件形式上线了 ChatGPT,并放出两段演示对话 [38]。第一个任务:照着开源管线 Germinal 的配置,为 PD-L1 设计一个全新的纳米抗体。PD-L1 是癌细胞用来踩住免疫刹车的蛋白;纳米抗体只有常规抗体十分之一大小。指令还规定:只跑第一阶段,达标线 0.68,最多 60 步。

演示漂亮,但数字可信吗?我们拿到了演示的全部产物文件——轨迹表、结构文件、序列文件——逐一做了独立核对。一个智能体,从抗体写到 DNA——两个任务是希挑的:一个设计蛋白质,一个写作 DNA,正好覆盖生成式生物学的两条主线。放在平时,每条管线都得自己写代码、租显卡。

0.0009
距达标线的差距
23 步
爬坡到达标
70 亿
Evo 2 模型参数
01
智能体实测

先翻仓库,再跑模型

Proto 是什么?它把自己定义为「生成式生物学的编程语言」:把 80 多种生物 AI 模型和计算工具封装成统一接口,智能体用自然语言就能调用 [30][32]。今年 6 月,它刚挂上预印本,代码开放 [31][33]

接入 ChatGPT 意味着什么?不用装环境,不用租显卡,在对话框里就能开工。同一条推文还指向 OpenAI 的 Rosalind 工作台研究预览——我们此前报道过它——这个基于 GPT-Rosalind 模型的工作台,把「设计 PD-L1 纳米抗体」列为官方示例任务 [37]

接到任务后,Proto 没有急着跑模型,先去翻了 Germinal 的仓库:抗体三段环的长度 11、8、18,框架四段 25、17、38、14,靶点上五个关键残基,达标线 0.68。这些数字我们逐一核对过,与仓库配置完全吻合 [29][36]

Germinal 来头不小:斯坦福与 Arc 研究所合作开发的抗体设计管线,去年 9 月挂出预印本,今年 8 月又拿了《自然·方法》的研究亮点 [4][42]。论文报告每个靶点只测 43 到 101 个设计,实验成功率 4% 到 22%,做出的纳米抗体达到纳摩尔级结合力,PD-L1 正是它的示范靶点 [4][5]

还有个插曲:Proto 自带的 Germinal 完整封装只能在本地跑,它就把管线拆成零件自己组装——AlphaFold2 的梯度后端负责优化,抗体版序列模型负责重写。组装方式与官方流程一致,相当于手工复刻了一条流水线。

Arc 研究所 配图
来源:Arc 研究所
02
智能体实测

23 步爬坡

第一阶段叫「幻觉设计」——这里的幻觉是褒义:让 AlphaFold2 反向想象出一个能贴住靶点的蛋白。界面置信分从第 1 步的 0.140 起步,第 6 步 0.374,第 11 步 0.531,第 17 步 0.614,一路爬到第 23 步达标。

过程中它两次自己纠错。第一次,模板文件传输被截断,它发现后推倒重来,声明半截轨迹不算数。第二次更微妙:输出里有个字段数值其实是损失函数,直接当成分数读会误判达标,它识别出来,改用真分数。

达标后进入第二阶段:抗体专用的序列设计模型 AbMPNN 重写三段环。40 条候选、温度 0.2,按困惑度——模型对序列的把握,越低越好——选出 2.553 的那条。37 个环位点里 29 个允许改,8 个已经贴住靶点的残基原样保留。

03
智能体实测

换模型,信心没了

最后一步,用 Biohub 今年发布的 ESMFold2 给抗体和靶点做复合物折叠。这个模型的论文发现,多跑循环次数对抗体-抗原对接特别有帮助 [9][15],所以智能体把循环开到 20 次、扩散采样开到 100 步、独立样本 5 个。

结果出来了:结构置信分 0.783,但界面置信分只有 0.401。信心去哪了?AlphaFold2 阶段的 0.68,没有跨模型传递过来。智能体在总结里自己写明:两个预测都不构成实验上的结合验证。

还有个细节值得记录。折叠靶点本该检索同源序列做比对,但调用外部接口意味着把序列发出去。智能体在提交前拦下这一步,想找本地数据库,本地没有,最终改用无比对模式:序列不出工作区。

04
智能体实测

第二个任务:让 DNA 模型续写噬菌体

蛋白质之外,DNA 呢?第二个任务是用 Arc 研究所的 Evo 2 做「语义设计」:给一段有生物学含义的开头,让模型接着写。Evo 2 今年登上《自然》,训练数据覆盖近 9 万亿个碱基 [17][19]

智能体没有随手找段序列。它从 NCBI 调出铜绿假单胞菌噬菌体 JBD30 的基因组,截取 1000 个碱基,切口精确停在一个叫 Aca1 的基因末尾。Aca1 是抗 CRISPR 系统的标配零件,负责给这套对抗细菌免疫的系统当开关 [24][28]

Evo 2 用 70 亿参数的模型、温度 1.0、固定随机种子 20260827,独立续写 10 段,每段正好 2000 个碱基。我们在本地逐条验证:全部只含四种碱基,两两不同,种子序列与 NCBI 参考基因组完全一致。

05
智能体实测

我们核对了每个数字

这份演示日志里的关键数字,我们都做了独立核对:23 行轨迹数据与日志逐步吻合;结构文件两条链的序列与日志一致;折叠文件的平均置信分 78.7,与日志的 0.783 对得上——因此,日志的主体可信。

作者名单更有意思:Germinal 的通讯作者是希 [5],Evo 2 的核心团队有他 [19],Proto 干脆就是他实验室的作品 [38]——所以这场演示,是同一个人把自己的三件工具串成了一条流水线。

06
智能体实测

冷水与局限

但冷水必须泼。所有结果都是计算机里的预测,没有一个分子进过实验室。这些设计真的能结合吗?Germinal 论文自己的数据摆在那里:计算达标的设计,实验成功率也只有 4% 到 22% [4]。官方演示天然展示成功案例,平均水平的运气不会写进推文。

日志本身也不能照单全收。智能体声称 60 步上限「正好等于」仓库默认设置,实际默认是 65 步;它还声称沿用了仓库的学习率退火设置,而默认配置里这项是关的 [36]。两处都不影响结果,但说明转述必须核对——哪怕转述者是 AI。

两段英文指令,没有一行代码,一个智能体从抗体写到 DNA,两条真实管线在 ChatGPT 的对话框里跑完了。放在三年前,这是一个计算生物学家几周的工作量。但「跑完」和「跑对」之间,隔着培养皿——智能体把这句话写进了自己的总结,这或许是整份日志里最可靠的一句。

核实说明

文件与日志一致性:<span class="badge badge-"></span>轨迹文件 23 步数值与日志逐步吻合(第 23 步界面置信分 0.68004、结构置信分 0.877、平均位置误差 6.51、损失 1.433;第 20 步 0.6791);AF2 结构文件链 B 序列与日志的幻觉序列完全一致;折叠文件两条链分别与靶点和最终序列一致,平均置信分 78.7 与日志 0.783 吻合;Evo 2 产物 11 条序列(1 条 1000 碱基种子加 10 条 2000 碱基续写),种子与 NCBI 参考基因组 NC_020198.1:18293-19292 完全一致,续写两两不同、只含四种碱基。

演示来源:<span class="badge badge-"></span>布莱恩·希推文宣布 Proto 接入 ChatGPT 并放出两段演示的分享链接(用户提供推文文本,发布于本文写作前约 14 小时);Proto 出自希领导的进化设计实验室,希为斯坦福化学工程助理教授、Arc 研究所驻院创新研究员 [38];OpenAI 的 Rosalind 工作台研究预览基于 GPT-Rosalind 模型,官方示例任务包含 PD-L1 纳米抗体设计 [37];Germinal 获《自然·方法》研究亮点(2026 年 8 月 6 日)[42]

Germinal 配置:<span class="badge badge-"></span>三段环长度 11/8/18、框架 25/17/38/14、五个热点残基、达标线 0.68、40 条候选、温度 0.2、零骨架噪声、三次循环,均与仓库配置一致 [29][36];两处小出入:仓库默认第一阶段为 65 步(日志称 60 步「正好等于」默认),学习率退火默认关闭(日志称沿用)——不影响结果,正文已写明。

工具真实性:<span class="badge badge-"></span>Germinal(bioRxiv 2025.09.19.677421,实验成功率 4-22%)[4][5];ESMFold2(Biohub 2026 年发布,循环次数提升抗体-抗原对接)[9][15];Evo 2(Arc 研究所,《自然》发表,70 亿参数版本)[17][19][20];Aca1 与 JBD30(2021 年 JBC 论文、PDB 7VJN)[23][24];Proto(2026 年 6 月预印本,开放源码,80 多种工具)[30][31][32][33]

智能体行为(自我纠错、拦截外部接口、组装管线):<span class="badge badge-"></span>仅见于对话日志自述,无独立佐证,但产物文件与其描述一致。

布莱恩·希关联:<span class="badge badge-"></span>Germinal 通讯作者 [5][42]、Proto 出自其实验室 [38]、Evo 2 核心团队 [19]

结果解读:<span class="badge badge-"></span>所有分子均为计算预测,无实验验证;标题与叙事结构为编辑判断。

资料来源

  1. [4][5][42][4][5] Germinal 预印本(bioRxiv 2025.09.19.677421)及作者信息;[42] 《自然·方法》研究亮点(2026-08-06)
  2. [9][15][9] ESMFold2 预印本(bioRxiv 2026.06.03.729735);[15] Biohub 发布新闻(2026-05-27)
  3. [17][19][20][17] ArcInstitute/evo2 仓库;[19] Evo 2《自然》论文(s41586-026-10176-5);[20] Evo 2 7B 模型页
  4. [23][24][28][23] PDB 7VJN(JBD30 Aca1 晶体结构);[24][28] Aca1/Aca2 论文(JBC,2021)
  5. [29][36][29] Germinal 仓库 pdl1.yaml 配置;[36] Germinal 仓库 vhh.yaml 配置
  6. [30][31][32][33][30] Proto 官方文档;[31] Proto 预印本(bioRxiv 2026.06.22.733870);[32] proto-client SDK;[33] proto-language 仓库
  7. [37][38][37] OpenAI 开发者博客:Rosalind 工作台研究预览;[38] Arc 研究所 Proto 发布新闻(含作者与希的职务信息)
  8. 用户提供的 Proto 对话日志、五个结果文件与布莱恩·希推文文本(本稿主要一手素材)