网易首页 > 网易号 > 正文 申请入驻

GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

0
分享至


新智元报道


AlphaFold之后的最大震撼来了。

刚刚,OpenAI 总裁 Greg Brockman转发的一条消息,足以引爆整个科技与医药圈。

知名科学家 Andrew Aiginin 在X上发布了激动人心的消息——

在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强AI!


不仅拿到了跑分第一,Astra 还在短短 1 小时内,直接手搓出了复杂的抗体机理交互式可视化页面。

一直以来,圈内都有一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」

比如 AlphaFold 之于蛋白质折叠,LLM通常只被当成写代码和读文献的辅助工具。

但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!

它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。

而这一切并非偶然。构建该测试基准的顶尖 AI 制药团队Insilico Medicine在 arXiv 上放出一篇21页重磅论文。


标题:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

论文:https://arxiv.org/pdf/2608.18940

这篇论文,不仅首次揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更向我们展示了:从小分子化学合成,到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界!

AlphaFold 之后的科学范式转移,或许才刚刚开始。

37.98分!GPT-6登顶权威「DDD基准测试」

实测结果显示:GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。


AI 学者 Rim Shayakhmetov 发出难以置信的惊叹:

「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」


没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。

发现抗体只是开始,「成药」才是真正的死亡之谷

要理解 GPT-6 Astra 这一成绩的含金量,我们首先得弄懂一个医药界的残酷现实。

Andrew写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」

这句话,道出了全球无数新药研发人员的血泪史。

在过去,当我们谈论抗体药物研发时,大家最关注的是「结合力」。

通俗点说,就是这个抗体能不能精准地像钥匙插进锁孔一样,识别并结合到病毒或癌细胞的靶点上。

早期的AI模型(比如AlphaFold)已经在「预测结合」这件事上做得非常出色了。

但是!能结合 ≠ 能变成药。

这就好比谈恋爱。男女双方看对眼了,一见钟情,这只是第一步。你们能不能走进婚姻的殿堂?能不能经受住柴米油盐的考验?

在药物研发中,这个「柴米油盐的考验」被称为「成药性」。


现实中,无数看似结合力极强的「完美抗体」,一旦进入真实的生理环境或工业生产环节,就会暴露出致命缺陷:

它会不会聚集成团?

它的结构稳不稳定?

它到底能不能表现得像一款真正的「药」?

这些属性统称为抗体可开发性。

这是整个生物制药界的「死亡之谷」。

它导致了一个极其惨烈的局面:全球每年有成千上万个抗体分子在实验室里表现优异,但最终倒在了「成药性」的评估阶段。

药企为此烧掉了几十亿美金,耗费了几年甚至十几年时间,最终颗粒无收。

而今天,GPT-6 Astra 宣布,它能比目前世界上任何其他前沿模型,更精准地预测这些成药性特征。

揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试

有人可能会问:这会不会又是一个「刷榜」成绩?

绝对不是。

Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。

在他们发布的论文中,我们看到了这个测试体系多么硬核。

虽然推文讨论的是「大分子抗体」,但这篇论文展示了该团队在「小分子化学」领域建立评测标准的恐怖深度。了解了这个背景,你才会明白 Astra 的夺冠有多么不可思议。

在论文中,研究团队聚焦了另一个制药界的世纪难题:单步逆合成。



简单来说,逆合成就是「化学界的倒推法」——给你一个目标药物分子,你需要倒推出可以用哪些现成的、便宜的化学原料来合成它。

过去的 AI 评测是怎么做的?

给 AI 一个目标分子,AI 吐出一个合成路径,如果跟已有的专利数据库(比如 USPTO)里的一模一样,就算 100 分。

但这在真实世界里几乎行不通。因为合成路径天生就是「一对多」的,传统的「单一标准答案」评估法,极大地限制了 AI 探索未知的能力。

为此,Insilico 团队构建了令人发指的测试环境:

1.URSA-expert-2026 基准:这是一个包含 100 个由机器生成、并由顶尖人类化学专家手动确认合成可及性的全新分子数据集。它与任何公开的训练数据完全隔离,彻底杜绝了模型「背题」的可能性。

2.ChemCensor 打分系统:他们不看模型是不是完美复刻了专利,而是开发了 ChemCensor 框架,从「反应中心映射」、「官能团兼容性」等最底层的化学物理规则出发,去判断模型生成的反应是否具备真正的化学合理性)。

正是在这种「剥壳见骨」的物理/化学规律考核下,传统的 LLM几乎都失败了。

在早期的 Top-1测试中,哪怕是强如 GPT-5.5、Gemini 3.1 Pro,其表现依然无法超越最顶尖的专用传统化学模型(如 MHNreact、LocalRetro)。

「大力出奇迹」的通用 LLM ,似乎碰壁了。

4500万数据,LLM被「逼出」科学直觉的?

通用 LLM 拼不过专用模型,那该怎么办?

论文给出的答案震撼了业界——不要换模型,换一种激发通用模型潜力的方法。

研究团队在论文中提出了三大杀招,彻底解锁了大模型在化学领域的封印:

第一招:Top-K 提示词范式

既然逆合成是「一对多」,那就不要让 LLM 只猜一次。

团队在 Prompt 中明确要求:「给我 15 种不同的答案」。

奇迹出现了,仅仅是切换到 Top-K模式,几乎所有的大模型(GPT-5.5, Claude Opus系列)在化学合理性和多样性上都迎来了爆发式增长。


Gemini 3.1 Pro 在 Top-15 模式下性能飙升,直接成为最强 LLM 基线。

这证明,大模型是有科学知识的,只是过去的提问方式不对。

第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)

为了训练出专门针对化学限制对齐的语言模型(C3LM),团队不惜算力,利用虚拟合成引擎和 ChemCensor 框架,硬生生构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。


第三招:强化学习中的新颖性奖励


在微调 C3LM 模型时,他们引入了 GRPO 强化学习算法。

奖励函数极其刁钻:模型给出的合成路径不仅要符合 ChemCensor 的化学合理性,而且如果模型能想出一种连 4500 万训练集里都没有、但依然合理的全新反应,将会获得额外的巨大奖励。

结果是什么?

经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中,终于一举击败了 MHNreact 等所有传统专用 SSRS 模型!

数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。


论文的核心结论是:大语言模型不仅能处理自然语言,只要给予正确的环境和激励,它们完全可以掌握最深奥的化学键、官能团和合成逻辑!

降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管

如果你看懂了上面这篇论文,你就会明白 Bogdan 博士为什么会把 GPT-6 Astra 的成绩和这篇论文联系在一起。

在这篇论文中,Insilico 团队费尽九牛二虎之力,用 4500 万条数据微调、用强化学习对齐、用 Top-K提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。

然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!

这绝对是降维打击。

过去,我们要解决抗体稳定性问题,需要专业团队设计专门的三维图神经网络。

而现在的 GPT-6 Astra,它的通用世界模型中似乎已经内化了物理、化学、生物的底层逻辑。

它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样,「直觉」判断出一个蛋白质分子在溶液中为什么会聚集。

此外,Astra 展现出的工程效率同样令人胆寒。

Andrew Aiginin 提到:「顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」

在传统药企,做这样一个系统,整个流程少说也要两三周。

现在,1个小时,一个人,一个通用大模型,就能解决了。

AlphaFold 之后,真正的范式转移

GPT-6在抗体基准上的跑分第一,宣告着通用大模型已经显出AGI雏形,在人类最顶尖智力活动中取得的实质性统治。

这个榜单第一,宣告了这个新时代的到来——

未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的ASI提出正确的 prompt。

小分子逆合成被突破了,大分子抗体成药性被突破了。

从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。

参考资料:

https://arxiv.org/html/2608.18940

https://x.com/gdb/status/2098167375342239957

https://x.com/andrewaiginin/status/2098078245350518884

编辑:Aeneas 大卫

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
胡塞武装终于见识到了什么叫真正的“收网”。

胡塞武装终于见识到了什么叫真正的“收网”。

回京历史梦
2026-09-10 17:53:27
泰国高僧贪腐被捕,和女助理在法堂淫乱,一顿饭要十个菜

泰国高僧贪腐被捕,和女助理在法堂淫乱,一顿饭要十个菜

韬闻
2026-09-12 13:17:44
《交锋》金丽娜做梦都不想到,林看山看上的不是她,而是她素未谋面的姑姑和姑父

《交锋》金丽娜做梦都不想到,林看山看上的不是她,而是她素未谋面的姑姑和姑父

小七追剧站
2026-09-11 17:22:38
这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

宇宙时空
2026-05-26 18:20:10
对肺非常好的4种蔬菜,白露后多吃,润肺排毒,营养实惠,正当时

对肺非常好的4种蔬菜,白露后多吃,润肺排毒,营养实惠,正当时

高中医健康说
2026-09-12 14:15:03
当年沙俄抢走我国海参崴,承诺1995年归还,为何这一承诺至今仍未兑现?

当年沙俄抢走我国海参崴,承诺1995年归还,为何这一承诺至今仍未兑现?

品点历史
2026-09-11 07:25:27
统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

统一台湾后需多少驻军?香港人口753万,驻军约6000人,澳门人口68万,驻军不足千人,台湾面积是香港的32倍,保守估计,台湾驻军需6-8万人

扶苏聊历史
2026-09-10 15:51:48
2027年1月正式生效!农村种地迎来大变,每一户农民都要读懂

2027年1月正式生效!农村种地迎来大变,每一户农民都要读懂

爱下厨的阿椅
2026-09-11 06:17:41
交锋:直到马憩车祸重伤,才知要他命的是当年生死与共的谢逢时

交锋:直到马憩车祸重伤,才知要他命的是当年生死与共的谢逢时

乡野小珥
2026-09-12 11:44:14
9月12日,人社部与财政部正式公布关于2026年调整退休人员基本养老金的通知文件了吗?

9月12日,人社部与财政部正式公布关于2026年调整退休人员基本养老金的通知文件了吗?

扶苏聊历史
2026-09-12 14:41:28
遭183次水刑、裸体拘押,“9·11”案主犯还没判

遭183次水刑、裸体拘押,“9·11”案主犯还没判

中国新闻周刊
2026-09-11 13:48:59
为中国辩经的西方大儒,9月激增233% !

为中国辩经的西方大儒,9月激增233% !

环球策论
2026-09-11 13:09:19
王思雨为何单身不将就?择偶标准曝光,清醒独立令人敬佩

王思雨为何单身不将就?择偶标准曝光,清醒独立令人敬佩

体育见习官
2026-09-12 15:18:16
同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

同学聚会问我退休金,我故意说2300元,没想到,第二天接到了25个电话……

品读时刻
2026-09-11 09:04:29
77年,北京市公安局长因大肆迫害开国元勋被捕,狂言:这辈子值了!

77年,北京市公安局长因大肆迫害开国元勋被捕,狂言:这辈子值了!

舆图看世界
2026-09-11 08:10:03
火化工作人员说出大实话:人死后,骨灰根本不需要保存!

火化工作人员说出大实话:人死后,骨灰根本不需要保存!

阿甘天天传
2026-09-04 11:54:49
小米18 Fold刚官宣首发长鑫LPDDR6,拆机却发现是SK海力士:到底怎么回事?

小米18 Fold刚官宣首发长鑫LPDDR6,拆机却发现是SK海力士:到底怎么回事?

小8说科技
2026-09-10 00:02:51
最高院:女方同意性行为但中途或事后撤回,男方仍可能构成强奸!

最高院:女方同意性行为但中途或事后撤回,男方仍可能构成强奸!

周军律师聊案子
2026-09-11 11:47:38
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
52:0!秘鲁日裔总统宣布加入美同盟,国会要求必须给个解释

52:0!秘鲁日裔总统宣布加入美同盟,国会要求必须给个解释

温读史
2026-09-12 15:40:57
2026-09-12 16:36:50
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16166文章数 67062关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

时尚
本地
旅游
手机
军事航空

专栏|一位“皮笑肉不笑”初学者的自述

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

旅游要闻

呼和浩特:工业文旅赋能“世界乳都”建设

手机要闻

华为三折叠新机Mate XT 2开售即售罄 起售价19999元

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版