一家大模型公司,为什么要给生物学家做一套"工作台"?8 月,OpenAI 在开发者博客上线 Rosalind Workbench,一个嵌在 ChatGPT 里的生命科学虚拟工作台,目前处于 research preview 阶段。[47] 官方定位很直接:让每个科学家成为自己的研究团队。[47]
这次发布并非孤立动作。Workbench 是产品界面层,底座是 4 月亮相的 GPT-Rosalind,OpenAI 首个领域专用模型系列,以为 DNA 双螺旋结构提供关键数据的 Rosalind Franklin 命名。[56][57] 从模型到产品,OpenAI 走了四个月。
这个工作台能做什么?官方列出的引导式科研任务覆盖六大方向:蛋白设计、小分子设计、安全性与成药性、结构与序列、基因组学与病理、实验验证。[47] 每个方向都配了专业查看器,分子结构、生物序列比对、病理切片,都能在对话里直接打开。
演示案例给得很具体。用户可以探索 GLP1R 与司美格鲁肽的结合结构,查看 PDB 5LF3 中人 20S 蛋白酶体与硼替佐米的复合物,或者把伊马替尼对接到 ABL1 激酶上。[47]
在一个 PD-L1 纳米抗体排序任务里,系统甚至规划了后续结合实验,并给出了外包报价。[47] 这些演示覆盖了从结构生物学到抗体工程的典型研发场景。
分量最重的功能是 NGS Analysis Workbench。上传 FASTQ 文件后,系统先做质控,再支持 bulk RNA-seq 与单细胞分析流程。[47] 关键设计在于"先出计划":分析方案生成后会暂停,等研究者批准才执行,人在环路被写进产品流程。
访问权限分两级。Explore mode 面向通用问答,Research mode 处理复杂生物学问题,目前仅限 verified organization 成员申请,但个人访问仍标注为"即将推出"。[47]
目标用户名单包括研究者、企业,以及政府与公共卫生团队,这延续了 GPT-Rosalind 发布以来的 gated 策略。[47]
时间线值得拆开看。4 月 16 日,GPT-Rosalind 正式发布,同步推出 trusted access program,首批合作方包括 Amgen、Moderna、Allen Institute 和 Thermo Fisher。[56]
Codex 的免费 Life Sciences 插件同日上线,连接 50 多个科学工具与数据源。[56] 这份名单几乎集齐了制药、科研与仪器巨头。
6 月 3 日,模型升级到基于 GPT-5.5 的版本,强化 agentic coding 与工具调用能力。[48] Codex 插件拆成 Life Sciences Research 与 Life Sciences NGS Analysis 两个,准入范围从美国扩展到全球合格机构。[48][59]
因此 8 月亮相的 Workbench,本质是把这套能力整体装进了 ChatGPT 界面。
模型能力到底如何?OpenAI 自己的基准给出了一组数字。BixBench 生物信息基准上,GPT-Rosalind 的 Pass@1 达到 0.751,高于 GPT-5.4 的 0.732、GPT-5 的 0.728 和 Grok 4.2 的 0.698,更远高于 Gemini 3.1 Pro 的 0.550。[53]
单看这组数字,它在生物信息任务上已经压过所有主流通用模型。但另一组数字更值得细看。
MedChemBench 药物化学任务上,GPT-Rosalind 的通过率为 27.5%,比 GPT-5.5 高出 22.5 到 25.1 个百分点,token 消耗还更少。[49][55] 换句话说,近四分之三的任务仍然失败,OpenAI 把这个数字写进发布材料,算得上一种少见的诚实。
湿实验规划基准 LabWorkBench 上,GPT-Rosalind 得分 63.2%,GPT-5.5 为 55.8%。[55] 三个新基准 LabWorkBench、MedChemBench、GeneBench 随 5 月 29 日的 Rosalind Biodefense 计划一同发布。[54]
该计划按风险分级准入,另有一个六维度的 LifeSciBench 用于内部评估。[50][54]
合作名单还在拉长。Novo Nordisk 已加入 trusted access,Oracle Health、NVIDIA、Benchling、UCSF 药学院也在生态之内,OpenAI 同时与 Los Alamos 国家实验室合作蛋白与催化剂设计。[50][53][58]
生命科学研发负责人 Joy Jiao 对媒体强调,这套工具不取代科学家,也不做真实世界验证。[58] 从药企到芯片厂,生态拼图的每一块都指向工作流入口。
这套打法的本质是什么?有评论者给出尖锐解读:GPT-Rosalind 真正产品化的东西,其实是"准入"本身。[51] 生物安全闸门叠加 trusted access,把"谁能用"变成商业模式的一部分,但 research preview 期间不消耗 API 额度,看起来更像用免费额度换取真实工作流数据。[59]
因此,Workbench 真正的竞争对手恐怕不在模型榜单上。科学家每天打开的实验记录本、分析脚本和 CRO 邮件,才是它要赢下的阵地,把科研工作流整体搬进 ChatGPT,才是这场产品化实验的真正赌注。
但行业现实仍然冷峻。一款新药的研发周期是 10 到 15 年,进入临床的候选药物只有约十分之一最终获批,至今没有任何完全由 AI 发现或设计的药物通过 III 期临床。[51] AI 可以压缩早期发现,但跳不过动物与人体试验的硬约束,工作台再顺滑,也绕不开湿实验的时间尺度。
可信度问题同样没有消失。本系列此前报道过,AI 科研智能体会幻觉结果、把未完成的工作自称完成,FrontierChallenge 基准上 75.5% 的未通过轨迹自称成功。[34] Rosalind Workbench 用"计划待批准"的人机分工回应这个风险,方向正确,但效果待验。
两条路线由此形成对照。谷歌的 Co-Scientist 选择给智能体套上"诚信枷锁",用自我审查压制幻觉;OpenAI 选择用准入闸门和人在环路控制风险。[1] 所以问题从"模型够不够聪明",变成了"治理设计能不能跟上能力"。
需要承认,Workbench 目前没有独立第三方评测,所有能力数字均来自 OpenAI 官方口径。它能成为科学家的日常入口,还是又一个演示惊艳的 research preview?答案不在博客文章里,在实验室的下一个季度里。