AI 制药观察 · 2026-08-27

给 129 个 AI 制药基准做"体检":一个上线刚满月的网站,照出了这个行业的评测焦虑

打开 o3dc.org,这个网站做的第一件事,是给收录的基准做"体检"。

Insilico Medicine 新闻稿 配图
来源:Insilico Medicine 新闻稿

打开 o3dc.org,这个网站做的第一件事,是给收录的基准做"体检"。

页面加载的几秒内,它逐个调用 GitHub API,检查收录的每个基准背后仓库的最后一次代码提交时间。哪个基准还在维护,哪个已经一年多没人动过,页面上一目了然。

这个网站叫 O3DC Benchmark Index。背后的联盟全称 Open Drug Discovery & Development Consortium,开放药物发现与开发联盟。2026 年 7 月 25 日,它上线第一批 66 个条目。此后一个月,几乎每隔一两天就有新增,最新一批就在 8 月 24 日。目前收录总数是 129 个。

它的目标写得很直白:把 AI 药物发现领域所有开放的评测基准(benchmark),放进同一个地方。这件事为什么现在才有人做?又为什么是一家公司在做?

129
O3DC 收录基准数
13 个月
TDC 主仓库停更时长
303
DDB 号称收录基准数
01
AI 制药观察

每个基准都配一句"坏话"

129 个基准被分成 10 类。从 ADMET 性质预测、分子对接、结合亲和力,到蛋白结构预测、逆合成、靶点发现、临床试验结果预测。

但数量最多的类别有些出人意料:"LLM 与智能体",24 个,占 18.6%。这个细节后文还会用到。

真正让 O3DC 区别于普通导航站的,是每个条目都带一句"已知缺陷"(caveat)。而且措辞相当不客气。

被引用最多的 MoleculeNet,得到的评语是"被引用最多,也被批评最多"。理由很具体:多个任务数据量太小、标签噪声高、随机划分泄漏严重。PDBbind 被直接称为"该领域最大的数据泄漏源头"。经典虚拟筛选基准 DUD-E 的条目则提醒:模型只看配体特征,就能把活性分子和诱饵分子分开,根本不需要看蛋白。所以用它验证基于结构的方法前,必须先做一个纯配体对照。

这些判断不是站长拍脑袋。以 PDBbind 为例。O3DC 引用的 LP-PDBBind 研究显示,多个已发表的打分函数换到无泄漏分层后,皮尔逊相关系数会掉约 0.2。

所以 O3DC 做的事情更像建档案:每个基准测什么、谁在维护、代码在哪、还在不在更新,以及——它有什么毛病?

02
AI 制药观察

被引用最多的基准,仓库已经 13 个月没更新

为什么需要这样一张地图?因为 AI 药物发现的评测体系,碎得超乎想象。

这个领域不缺基准,缺的是秩序。TDC 一个平台就集成了 60 多个 AI 就绪数据集。Polaris 是阿斯利康、默克、诺华、辉瑞等药企组成的跨公司联盟,主打严格的策展标准。CASP 每两年做一次盲评,SGC 的 CACHE 挑战则专门盲测计算找苗头化合物的能力。它们各据一方,散落在几十个 GitHub 仓库、联盟官网和早已冻结的挑战页面里。

更麻烦的是什么?基准会"死",而引用它的论文不会停。

O3DC 的实时检查机制把这件事量化了。本文写作时(2026 年 8 月 25 日)抽查了几个条目:TDC 主仓库最后一次代码提交停在 2025 年 7 月 13 日,距今超过 13 个月。Polaris 的仓库也接近一年没有更新。相比之下,开放 ADMET 数据计划 OpenADMET 的仓库 8 天前还在提交代码。

成百上千篇下游论文仍在报告 TDC 的 ADMET 数字。因此 O3DC 在该条目里专门提醒:一定要用官方提供的数据划分,不要自己重新划分。划分保真度,直接决定结果的可比性。

03
AI 制药观察

站长是谁?邮箱暴露了答案

O3DC 把自己包装成开放的社区倡议:任何人都可以提交基准、纠正条目、参与讨论,加入联盟"不收费用,没有排他"。

但页面上有一个不太起眼的细节。提交基准和加入联盟的表单,联系邮箱挂在 insilicomedicine.com 的域名下。具体地址是 mmaigym@insilicomedicine.com。

MMAI Gym 是英矽智能(Insilico Medicine,HKEX: 3696)的大模型训练平台,发布于 2026 年 1 月 22 日。官方说法是,要把任意通用大模型训练成"药物研发级别"的科学引擎。理由很直接:未经专门训练的前沿模型,在关键药物发现任务上的失败率高达 75%–95%。

4 月 14 日,英矽智能又基于 MMAI Gym 一口气开放了三个排行榜门户。其中一个叫 DDB(Drug Discovery Benchmark),用 303 个基准给全球前沿大模型排名。目前的榜首是 Claude Opus 5,综合得分 65.4。Grok 4.5 与 GPT 5.5 同为 60.4。

因此,O3DC 更像是一盘棋的第三步。MMAI Gym 负责训练模型,DDB 负责给模型排名,O3DC 负责把全行业的基准登记在册——包括英矽智能自己的 6 个。

英矽智能 CEO Alex Zhavoronkov 今年 8 月有句话可以当作注脚:"我们的护城河,是连接 AI 和真正药物的那座桥。"桥的另一头,显然也包括评测标准本身。

不过,一家公司给全行业建"开放"索引,天然存在张力。索引里既有 TDC、Polaris 这样的社区老牌,也有英矽智能自家、且没有公开仓库的 6 个条目。裁判员与运动员的边界,只能靠治理来维持。这或许正是 O3DC 把讨论区和纠错入口放在首页的原因。截至发稿,英矽智能并未在官方渠道明示与 O3DC 的关系,以上归属判断基于公开痕迹。

04
AI 制药观察

给基准做索引的站,自己也在碎片化

O3DC 不是唯一想做这件事的网站。

独立站点 BioBenchmarks 同样在给基准建目录:141 个基准、2413 条直达链接。它还给每个倡议打分——ProteinGym 97.5 分,英矽智能的 DDB 拿到 87.6 分。而 DDB 自己则是第三种口径:不评基准,直接用基准评模型。

三个"总索引",三种立场:社区治理、独立打分、模型排名。给基准做索引的网站,如今自己也需要一个索引了吗?

这听起来像玩笑,背后却是实打实的口径问题。什么算一个基准、什么算过时、缺陷由谁认定,三个站给出的答案并不一样。O3DC 收录 129 个,BioBenchmarks 收录 141 个,DDB 号称 303 个。数字的差异,本身就是定义的差异。

O3DC 收录 129 个,BioBenchmarks 收录 141 个,DDB 号称 303 个。
05
AI 制药观察

评测的重心,正在从"做题"转向"干活"

O3DC 的分类分布本身就是一个行业信号。

24 个智能体类基准里,大多数诞生于 2025 年之后。FutureHouse 的 LAB-Bench 让模型和人类专家比实验设计。更多新基准则直接考察智能体端到端完成筛选、优化、文献调研的全流程。评测的问题已经从"模型会不会做题",变成"智能体能不能干活"。

但基准的维护速度,跟不上模型的迭代速度。TDC 的仓库 13 个月没有更新,而这一年里前沿模型换了好几代。用一年前的考卷考今天的模型,分数还有多少意义?这是整个行业都要回答的问题。

O3DC 上线刚满一个月。它的讨论区能否真正活跃、社区治理能否制衡站长自身的商业利益、129 这个数字能否覆盖长尾的工业界基准,现在都还没有答案。它解决了"找得到"的问题,但"信不信"仍要回到每个条目末尾那句"已知缺陷"——而这只是开始。

---

资料来源

  1. O3DC Benchmark Index(o3dc.org)站点页面及公开数据文件(data/benchmarks.json,2026-08-25 抓取):收录数、分类、联盟、caveat 引文、收录时间、联系邮箱
  2. GitHub API 实时查询(2026-08-25):mims-harvard/TDC、polaris-hub/polaris、OpenADMET/openadmet-toolkit、maabuu/posebusters、OATML-Markslab/ProteinGym 等仓库的 pushed_at 时间
  3. Insilico Medicine 官方新闻稿:Science MMAI Gym 发布(2026-01-22,insilico.com);MMAI Gym 扩展三大排行榜门户(2026-04-14,EurekAlert);DDD Benchmark as a Service 发布(insilico.com);Liquid AI 合作(insilico.com)
  4. DDB 排行榜(ddb.insilico.com):303 个基准、Insilico Score 排名数据
  5. BioBenchmarks(biobenchmarks.com,v2.8.0):141 个基准、2413 条直达链接、倡议打分
  6. Insilico Medicine LinkedIn(2026-08-10):Alex Zhavoronkov "Our moat is the bridge that connects AI to real medicines"
  7. MMAI Gym 论文:arXiv:2603.03517 / OpenReview