网易首页 > 网易号 > 正文 申请入驻

刚刚,Claude四周重写30个生物模型,ScienceIDE已规模化训练AI科学家

0
分享至

就在刚刚,Anthropic 发布了一项引发关注的研究:在不到四周时间里,Claude 优化了 30 多个开源生物分子模型。

其中包括 AlphaFold3、Boltz-2、Chai-1、ESMFold2、RFdiffusion 等已经广泛使用的科学模型。

结果显示,在允许少量数值精度变化的情况下,任务平均加速约 4 倍;在要求输出完全一致时,平均加速接近 2 倍。相关代码也同步开源。



更值得关注的是完成这项工作的方式。

代码优化主要由 Claude 自己完成,背后监督它的是两名 Anthropic 技术人员。他们理解生物建模,但并不具备传统意义上的推理优化或 GPU kernel 工程背景。

这件事的意义不难理解。科学家每天使用的计算工具变快、变省,同样的时间和预算就能支撑更多数字实验。让 AI 加速已有的科学软件,是加速科学研究最直接的一条路径。

不过,这份报告回答了 "AI 能不能做到",却留下了另一个问题:

AI 写出的科学代码,距离充分发挥硬件性能,还有多远?

几乎在同一时间,一个开源项目试图回答 Claude 留下的问题:如果 AI 能优化科学代码,如何让这种能力被持续学习、复用,并迁移到更多科研领域?

9 月 17 日,AItonomy Foundation 发布了它的第一个开源项目 ScienceIDE,赞助方为 PhAI Labs 与阿里 Qwen。这是一套把世界上的科学代码库转化为可执行、可验证学习环境的基础设施。

  • 技术报告:ScienceIDE: Turning World’s Scientific Codebase into Agent Learnable Environments
  • arXiv链接:https://arxiv.org/abs/2609.19134
  • 开源代码:https://github.com/aitofound/ScienceIDE
  • 模型:https://huggingface.co/collections/AItonomy/scienceide-model-series
  • 项目页:https://aitonomy.org/projects/scienceide



图 1:ScienceIDE 把科学工作与智能体学习连接起来。下图左下为环境与任务分布,右下为 ScienceIDE-Hard 评测结果。

一段跑得通、却慢了三倍的代码

在筹备这个项目的过程中,团队在等离子体物理与天体物理的代码上做过一次实验,结果指向了上面那个问题。

实验的对象是 PLUTO。

这是等离子体物理和天体物理领域一套广泛使用的高性能科学计算代码,代表性论文发表于 2007 年,至今已有近二十年。它覆盖流体力学、磁流体力学、相对论流体力学与相对论磁流体力学等多个物理系统,支持不同的坐标几何、物理模块与数值算法。这样的代码库本身就可以被看作一种计算物理基础设施。

它的复杂度不体现在代码量上。以其中的流体和磁流体计算为例,Godunov 型激波捕捉格式需要把空间重构、网格界面的黎曼求解器和时间推进组织成完整的计算流程,每一步都有自己的数据依赖、访存模式和数值稳定性要求。磁流体模拟还要处理磁场无散条件,约束输运与散度清理等方法把额外的物理约束直接带进了数值实现。这些都不是工程细节,而是必须在迁移中被保住的科学内容。

PLUTO 团队自己也在做 GPU 化。2025 年发表的 gPLUTO 论文介绍了一套以 C++ 完全重写、通过 OpenACC 实现 NVIDIA GPU 加速的新实现。

AItonomy 的团队则尝试在 M1 Ultra、A100 和 H100 上重新实现 PLUTO 的磁流体力学模块。在 A100 的一次测试中:

  • AI 生成的第一版实现已经能够运行,并在当时检查的算例上得到符合预期的物理结果;
  • 但相对团队使用的 128 核 CPU 节点配置,它的速度提升还不到 5 倍;
  • 随后,团队用一两天时间与 AI 一起分析瓶颈,调整数据布局、内存访问、kernel 组织以及不必要的数据搬运。在不改变所求解物理问题的前提下,这套 GPU 实现的速度又提高到第一版的接近 3 倍。

也就是说,AI 已经把代码 "写出来" 之后,仍然留下了数倍的性能空间。

对于复杂的科学计算代码,一次性生成的实现距离充分利用硬件,往往还有很长一段路。而要继续挖掘这部分空间,AI 必须能够测量、诊断、修改、验证,再根据结果继续迭代。

这不是 "换个更好的提示词" 能解决的问题。数据布局应如何匹配线程访问?相邻线程能否形成合并访存?哪些中间结果值得缓存,哪些可以重算以减少内存流量?kernel fusion 能否减少启动开销,又会不会增加寄存器压力、影响 occupancy?这些都需要通过 profiling 和实际运行来判断。

GPU 的理论峰值算力只是起点。科学代码的实际性能,取决于数值算法、数据移动和并行执行方式能否与硬件匹配。

跑得通,不等于算得对

性能优化始终伴随着另一个问题:改写后的程序,还能否可靠地回答原来的研究问题?

这件事在 Anthropic 自己的报告里有一个很好的例证。

为了测试优化的极限,他们让 Claude 在单个 8 卡 B300 节点上预测 31,000 到 70,000 token 以上的完整病毒衣壳和蛋白区室。推理全部跑通了,这本身就是此前需要多节点集群才能做的事。但报告写得很直接:这些结构没有被正确预测。报告分析指出,预测结构发生坍塌,模型在训练上下文近两个数量级之外缺乏泛化能力。

程序能跑,不代表科学上正确。判断一个科学结果对不对,要拿它去和科学参考答案比对,而不是看程序有没有报错退出。

放到科学代码加速这件事上,这条判据是很具体的。质量与能量的守恒误差是否可控?磁场散度是否满足所选数值方法的要求?激波位置、波传播速度和关键物理量是否与参考结果一致?不同的科学问题,验收标准也不一样。

不把这些定下来,一个程序完全可以通过少算几步、降低分辨率或跳过重要过程变快,同时失去原来的用途。ScienceIDE 把这一点称为科学等效性,并把它写成了任务是否算完成的判据。

把科学代码库变成可以学习的环境

如果一次成功的优化只是一个交付物,那它就只能被使用,不能被学习。ScienceIDE 想解决的是后一件事。

科学代码库本身已经保存了大量人类知识,但这些知识分散在源代码、编译配置、测试算例,以及研究者没有写下来的经验里。要让 AI 从中学习,需要把它们组织成能够执行、能够反馈、能够判定结果的环境。

具体做法是:由领域专家定义科学算例与验收标准,再与 AI 一起把代码库整理成可执行环境。在这些环境里,AI 完成任务、运行程序、检查科学结果,而经过验证的交互经验被用于评测、监督微调和强化学习。



ScienceIDE 的目标,是把科学代码库保存的大量可执行的领域知识组织成智能体能够执行、获得反馈并学习的环境。

目前论文报告的集合包含来自 27 个科学代码库的 64 个环境、2,812 个任务,以及 1,076 项可执行的科学检查,覆盖天体磁流体、空间等离子体、海洋气候、引力 N 体、光子学与电磁、材料、量子、相对论、粒子探测器、免疫学等方向。任务被分为加速、修复、发现、复现、集成、标定、实现七类。



图 2:ScienceIDE 的环境与任务分布,以及七类任务的划分。

需要说明的是,当前任务主要集中在代码修复与功能实现,加速类任务目前还只有初步实例。团队表示正在这套基础上继续拓展真实的性能优化问题,目标是建立完整的任务闭环:固定科学问题、输入规模和硬件预算,让 AI 理解与修改实现,通过科学检查判断结果是否合格,再在统一条件下衡量运行时间与资源消耗。

最强的模型,也只做到 67%

为了衡量这类任务的难度,团队从中挑出 85 个难任务作为公开评测集 ScienceIDE-Hard,来自 PLUTO、Athena++、MITgcm、LAPS、PHANTOM 等环境,包含 52 个修复任务和 33 个实现任务。判定标准是在任务的验收条件下与私有科学参考答案一致,而不是执行成功。

参评的是来自 8 家厂商的 15 个模型,通过 Codex、Claude Code 或 Gemini CLI 执行,每个 episode 一小时预算。结果是:



图 3:ScienceIDE-Hard 评测结果。

最强的 Claude Fable 5.1 做到 67.1%,Claude Opus 5 为 64.6%,GPT-6-astra 为 63.1%。而一半以上的前沿模型停在 30% 以下。

真正的科学任务,远没有被解决。

科学不只是 AI 的应用场景,也可能是训练场

这项工作还有另一侧结果。

团队用这些经过验证的科学交互轨迹做监督微调,训练并开源了 PhAI-IDE-4B、9B、72B 三个规模的模型。结果显示,提升的不只是科学任务本身,代码、推理、知识三类通用基准同时受益。

例如在 72B 上,APPS Introductory 从 0.609 提升到 0.672,LiveCodeBench Execution 从 0.539 提升到 0.594;在 9B 上,BBH Word Sorting 从 0.240 提升到 0.576。



图 4:科学轨迹监督微调带来的通用能力迁移。

这组结果指向一个判断:科学不只是 AI 的应用场景,也可能是推高智能上限的训练场。与常规的代码任务相比,科学任务天然更长程,也更依赖对物理约束与数值行为的理解。

一个非营利组织,和一份公开的邀请

AItonomy Foundation 是一个注册在硅谷的非营利组织,愿景是加速 AI 与科学之间的闭环。

按照其官网的表述,这两个方向都依赖可靠的反馈。模型提出的假设,需要通过计算或实验接受检验;科研过程中产生的数据、操作记录与失败尝试,也需要经过整理和验证,才能成为模型的学习材料。论文能够传递研究成果,却往往难以完整保留得出成果之前的判断、调整与试错。

ScienceIDE 尝试把这些过程组织起来。科研人员可以从自己熟悉的代码库和典型算例出发,参与定义任务与验收标准,让专业判断成为可重复使用的科学检查。目前参与的研究者来自伯克利、CMU、康奈尔、加州理工、哈佛、MIT、牛津、UCL、普林斯顿、斯坦福等二十余所机构,以个人身份参与。

值得一提的是,团队公开表示希望把 Anthropic 此次开源的 36 个优化包整理成 ScienceIDE 环境。这些包附带参考实现和可度量的验收标准,条件接近理想。如果这件事成立,社区将不只是使用这批优化的结果,而是能够在这类工作上训练和评测模型。

结语

文章开头的问题是:AI 写出的科学代码,距离充分发挥硬件性能,还有多远?

PLUTO 那次实验给出的答案是数倍。而要把这数倍拿到手,靠的不是更强的一次生成,是测量、诊断、修改、验证,再迭代。

Anthropic 的报告证明了模型有能力做这类工作。ScienceIDE 想回答的是下一个问题:怎样让这种能力持续积累,把一次次成功的优化,变成 AI 可以反复学习、验证,并迁移到新问题上的经验。

人类几十年积累的科学软件,本身就是一座尚未被充分利用的富矿。而它此刻正迎来一位新的学习者。

Anthropic 原文:https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
惨烈!8月中型SUV销量榜,Model Y夺冠,途观L第5,豹5第21名

惨烈!8月中型SUV销量榜,Model Y夺冠,途观L第5,豹5第21名

沙雕小琳琳
2026-09-18 01:28:31
实探鸿蒙智行门店:仍在销售问界车型,但面临“二选一”抉择,销售人员称“赛力斯渠道独立是为推轿车、MPV做准备”

实探鸿蒙智行门店:仍在销售问界车型,但面临“二选一”抉择,销售人员称“赛力斯渠道独立是为推轿车、MPV做准备”

每日经济新闻
2026-09-18 22:06:23
杀疯了!89天暴跌89%!近6天又跌25%,2.3万股民深套,谁在疯狂砸盘?

杀疯了!89天暴跌89%!近6天又跌25%,2.3万股民深套,谁在疯狂砸盘?

趋势清风侠
2026-09-20 12:30:26
武大诬告事件女主杨某媛西班牙读博被网友扒出,后续发展看爽我了

武大诬告事件女主杨某媛西班牙读博被网友扒出,后续发展看爽我了

浪花妈妈
2026-09-19 22:18:14
下周一可能要上涨的两大板块!

下周一可能要上涨的两大板块!

时尚的弄潮
2026-09-20 08:08:23
马士基26艘大船订单落地!

马士基26艘大船订单落地!

中国航务周刊
2026-09-20 12:31:30
学医后才知道,吃甲钴胺最危险信号,不是手脚麻,而是出现4症状

学医后才知道,吃甲钴胺最危险信号,不是手脚麻,而是出现4症状

白宸侃片
2026-09-20 14:28:04
新疆维吾尔自治区常务副主席张迎春已任自治区党委副书记

新疆维吾尔自治区常务副主席张迎春已任自治区党委副书记

澎湃新闻
2026-09-19 21:30:27
微博大V再爆料:西贝已起诉罗永浩,案件即将开庭

微博大V再爆料:西贝已起诉罗永浩,案件即将开庭

三言科技
2026-09-20 15:08:29
歌手许嵩结婚,新娘是00后主持人!其背后公司正在IPO,2年向同一艺人支付超6.8亿元,业界推测可能就是许嵩

歌手许嵩结婚,新娘是00后主持人!其背后公司正在IPO,2年向同一艺人支付超6.8亿元,业界推测可能就是许嵩

21世纪经济报道
2026-09-19 23:32:40
特朗普说禁就禁:CNN记者现场被没收记者证,只留证件套

特朗普说禁就禁:CNN记者现场被没收记者证,只留证件套

澎湃新闻
2026-09-20 12:38:12
王源演唱会结束一看手机“天塌了”:几万人面对面建群,结果触发安全风控机制,只剩他一个人

王源演唱会结束一看手机“天塌了”:几万人面对面建群,结果触发安全风控机制,只剩他一个人

大风新闻
2026-09-20 14:30:04
苹果硬件主管:看到iPhone贴膜,我浑身难受

苹果硬件主管:看到iPhone贴膜,我浑身难受

字节漫游指南
2026-09-20 00:08:08
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
苹果硬件负责人:看到有人给iPhone贴膜,我浑身不自在

苹果硬件负责人:看到有人给iPhone贴膜,我浑身不自在

薛定谔的BUG
2026-09-20 09:48:22
恭喜有老房子的人!中央部委发布通知,你的房产要更值钱了

恭喜有老房子的人!中央部委发布通知,你的房产要更值钱了

林子说事
2026-09-20 07:57:27
领先国际一代,南方六代机发动机喷口变了,“脖子”也更粗

领先国际一代,南方六代机发动机喷口变了,“脖子”也更粗

三叔的装备空间
2026-09-19 23:01:38
中国男篮怎么啦,日本男篮领先35分时,对方替补球员冲中国队做哭鼻子动作嘲讽

中国男篮怎么啦,日本男篮领先35分时,对方替补球员冲中国队做哭鼻子动作嘲讽

尘语者
2026-09-20 11:22:26
2-0后!意甲大黑马诞生:5轮13分+追平国米罗马,26年前曾夺冠

2-0后!意甲大黑马诞生:5轮13分+追平国米罗马,26年前曾夺冠

体育知多少
2026-09-20 06:40:56
12306:已拒绝出票133.1万张

12306:已拒绝出票133.1万张

每日经济新闻
2026-09-19 18:13:40
2026-09-20 16:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14032文章数 142735关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

村民称自家菜地焚烧1平方米杂草要被罚500元 官方通报

头条要闻

村民称自家菜地焚烧1平方米杂草要被罚500元 官方通报

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

伪造票据洗白药品 回流药黑色产业链曝光

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

旅游
艺术
手机
公开课
军事航空

旅游要闻

何以中国·运河之光|运河通到家门口 渔家吃上“旅游饭”

艺术要闻

列维坦罕见的静物花卉,寓意很好!

手机要闻

iPhone 18 Pro系列全渠道开售,京东落地3000+服务站一站式换机成首发新选择

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗称已向美政府传达7项谈判条件

无障碍浏览 进入关怀版