网易首页 > 网易号 > 正文 申请入驻

让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远?

0
分享至



近两年,AI for Science 持续升温。大模型在蛋白质折叠、数学推导、材料模拟等科研任务中不断交出亮眼答卷,各类评测榜单上前沿模型分数屡创新高。GPT、Claude 等主流模型搭配 harness,看似已经具备比肩科研人员的能力。

但一个关键问题是:AI 完成一项科研任务,究竟意味着它会做研究,还是只是擅长执行人类已经设计好的研究方案?

为衡量 AI 的科学自主性——在没有人类方法论指导的情况下,AI 能自主完成多少真实科研工作。清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发了一个名为 ASI-Bench 的全新测试基准,试图专门测量这其中的差别。

这里的 ASI 指的是人工超级智能(Artificial Superintelligence)。在研究团队看来,通往 ASI 的关键,不只是让 AI 更擅长解决已有问题,而是让它能够走出现有人类知识和既定研究流程,探索未知、创造新知识,并把新的想法转化为可以验证的科研结果。

因此,与其不断给 AI 出更难的题,研究团队采用了另一种办法:针对同一个科研项目,逐步减少人类提供的方法和操作步骤,观察 AI 的能力会从哪里开始下降。

实验结果显示,18 种模型与智能体系统组合在获得完整方法指导时,平均得到 50.91 分;拿走具体步骤,只留下方法名称,平均分降到 29.10;连方法名称也拿走,只给研究目标和原始数据,平均分进一步降到 26.62。

也就是说,真正让 AI 成绩大幅下降的,并不是要求它自主选择研究方法,而是当人类撤掉具体操作步骤、只保留方法提示时。

同一个科研项目,让 AI 做四遍

与此前评测相比,ASI-Bench 试图测量的不是某一种单独的能力。比如,Humanity’s Last Exam(HLE)主要考察高难度知识与推理,Terminal-Bench 更侧重工具使用和长程任务执行,ScienceAgentBench 则关注数据驱动的科学分析。这些基准分别覆盖了科研能力的一部分,但大多在固定任务说明下进行,很难进一步判断 AI 的成功有多少依赖于人类已经提供的研究方法。

ASI-Bench 的不同之处,是把人类指导程度本身变成一个变量。研究团队为每个任务准备了 B1 到 B4 四个不同的指导条件。四个版本使用相同的研究目标、输入数据、输出要求和评分标准,唯一变化的是:人类告诉 AI 的提示越来越少。

B1 最接近一份完整的研究说明书。研究方法、公式、实现步骤甚至部分参数选择都会直接提供,AI 主要负责把方案正确实现出来;到了 B2,详细步骤被拿掉,只保留方法层面的提示。也就是说,人类告诉 AI 应该走哪条技术路线,但如何把方法变成一套可运行的方案,需要它自己完成。

B3 则进一步撤掉方法提示,只留下研究目标、数据、约束和需要提交的结果,模型必须自行判断应该采用什么方法,并完成后续实现和验证。B4 与 B3 基本相同,但会额外加入一些事实正确、却与当前任务无关的信息,用来观察 AI 是否容易被干扰。

B1 到 B3 之间的分数差距越大,说明系统越依赖人类提供的研究方案。


(来源:上述论文)

为了让这种比较尽量可靠,研究团队最初收集了 1,300 多个候选科研问题,经过 5 轮、超过 1,100 次人工评审和 2,000 多次修订,最终精选出 60 道完整科研项目,覆盖数学、物理、化学、生物、天文、材料、地球科学、医学/生物统计、计算机、机器人、电子工程 11 个基础与工程学科。

开发过程中,研究团队还进行了超过 1,500 次沙盒运行,检查参考结果能否复现、评分是否稳定,以及是否存在信息泄漏或可以绕过正常研究过程的“捷径”。整个基准的构建和验证累计投入超过 3.1 万个人工小时,以尽可能确保这 60 个任务真正测到的是科研能力,而不是模型对题目的投机适配。

也正是在这套逐步撤掉提示的设置下,一个颇为反直觉的结果出现了:AI 的最大性能断层,并没有发生在完全需要自己选择研究方法的 B3,而是在更早的 B1 到 B2 之间。

AI 自主科研,卡的不只是模型能力

研究团队随后测试了 18 种 harness 与模型的组合。使用的 harness 包括 Codex、Claude Code、Kimi Code、MiMo Code 和 OpenHands,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等模型。

结果显示,随着人类指导逐渐减少,AI 的科研表现明显下降:B1 平均得分为 50.91,B2 降至 29.10,B3 进一步降到 26.62,加入干扰信息后的 B4 为 26.99。


(来源:上述论文)

最明显的结果出现在 B1 到 B2 之间。从 B1 到 B2,研究目标和方法都没有改变,人类只是撤掉了具体的实现步骤,平均成绩就从 50.91 降到了 29.10,下降了 21.82 分。相比之下,从 B2 到 B3,连应该采用什么方法也不再告诉 AI,成绩却只下降了 2.48 分。

即使是本次测试中表现最好的配置也存在明显差距。Codex 搭配 GPT-5.6 Sol(ultra)在 B1 中得到 71.78 分,到了需要自行选择方法的 B3 仍有 51.60 分,是所有组合中唯一超过 50 分的 B3 成绩,但相比 B1 依然下降了约 20 分。

也就是说,AI 最大的性能下降,并没有发生在需要自己选择研究方法的时候,而是发生在人类不再提供具体研究流程、只告诉它该用什么方法之后。

除此之外,论文还发现了几个比较有意思的现象。

首先,更强的推理确实能够提升自主科研表现,但代价不低。在 Codex 框架下,GPT-5.6 Sol 从 xhigh 提升到 ultra 后,B3 得分由 40.86 升至 51.60,增加了 10.74 分,说明增加推理预算确实有助于 AI 在缺少方法指导时完成更复杂的研究任务。

其次,Agent 框架也会显著影响模型最终表现。同一个底层模型换用不同 harness,成绩可能相差不少。例如,MiMo V2.5 Pro 搭配 MiMo Code 时总体得分为 16.17,换成 Claude Code 后升至 23.25;Kimi K2.7 也从 19.72 提升到 27.34。这意味着,科研能力并不是模型单独决定的,而是模型和系统共同作用的结果。

计算成本的结果同样有些反直觉。获得完整方法学指导的 B1,反而是成本最低的设置。 B1 平均每个任务消耗约 435 万 token,运行 37.8 分钟。由于研究方法、实现步骤和参数选择都已基本明确,AI 只需要按照既定流程执行,不必进行大量搜索和试错。

到了 B2,人类只告诉 AI 应该采用什么方法,却不再提供具体实现步骤,成本反而升至最高:平均每个任务消耗 691 万 token、运行 49.7 分钟,较 B1 分别增加 59% 和 32%。原因在于,AI 一方面受到既定方法的约束,另一方面又必须自行补齐求解、参数设置和调试等大量细节,因此需要更多探索和迭代。

相比之下,完全撤掉方法提示的 B3、B4,平均 token 消耗约为 540 万和 570 万,反而低于 B2。这说明,不完整的人类指导未必能够降低科研成本,有时反而会增加额外的搜索负担。

这给正在推进 auto research 的团队一个重要信号:与其只给 AI 一个方向,再让它自行补全后续流程,不如要么提供足够完整的指导,让 AI 高效执行;要么减少路线限制,让系统自行探索并完成研究。


(来源:上述论文)

当然,ASI-Bench 的意义并不只是给不同模型排出名次,而是为不同类型的 AI 科研系统提供了一套更有针对性的能力检验方式。

对于新的基础模型或推理系统,ASI-Bench 尤其是 B3 这类“只给目标、不提供方法”的低指导条件,可以进一步检验模型是否真正具备更强的科学推理和自主研究能力。

对于 AI Scientist 或 AI for Science 系统,B1–B4 也可以作为一套诊断工具:B1 到 B2 降幅大,说明系统依赖完整操作流程;B2 到 B3 降幅大,则说明方法选择仍是短板;B3 与 B4 的差异,则反映系统面对干扰信息时的鲁棒性。

对于 Agent 或 Harness 开发者,同一底层模型搭配不同框架的表现差异,也能帮助判断性能提升究竟来自模型本身,还是任务规划、代码执行等系统设计。

目前 ASI-Bench 仍远未饱和,18 组配置在 B3 上平均只有 26.62 分,最高为 51.60。因此,未来任何在低指导条件下取得的稳定提升,都可以作为衡量 AI 自主科研能力进展的重要参照。

但真实科研远比这 60 个任务复杂,研究团队也因此把 ASI-Bench 设计成一个持续更新的开放基准,未来还会不断加入新的学科和任务。它更像是一把动态的尺子,用来观察随着人类指导逐渐减少,AI 能否越来越独立地完成方法选择、研究执行和结果验证。至于这是否意味着 AGI 或 ASI 正在到来,单一评测显然无法回答,但至少它把“AI 到底能不能自己做研究”这个过去较为模糊的问题,变成了一个可以持续比较的指标。

1.https://arxiv.org/abs/2608.17271

2.任务贡献:https://asibench.apexin.ai/submit

3.GitHub:https://github.com/apexin-ai/ASI-Bench

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

扶苏聊历史
2026-09-02 18:25:39
孙宇晨聊天记录曝光,瓜越扒越多!

孙宇晨聊天记录曝光,瓜越扒越多!

互联网品牌官
2026-09-02 15:41:41
西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

民间胡扯老哥
2026-09-02 07:18:33
泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

扶苏聊历史
2026-09-02 15:26:46
西藏台记者抵达国门核心受灾区域,生成了灾后对比图

西藏台记者抵达国门核心受灾区域,生成了灾后对比图

大风新闻
2026-09-02 22:18:11
苹果新CEO上任首日!新iPhone被曝恢复赠送充电头、有线耳机 官方回应

苹果新CEO上任首日!新iPhone被曝恢复赠送充电头、有线耳机 官方回应

快科技
2026-09-02 00:50:09
连续6天重击基辅,俄乌冲突新阶段:俄罗斯无人机能力大增,启动“全天候消耗方案”?

连续6天重击基辅,俄乌冲突新阶段:俄罗斯无人机能力大增,启动“全天候消耗方案”?

红星新闻
2026-09-02 15:19:43
年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

念洲
2026-09-02 09:55:08
碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

赶鸭子上架
2026-09-02 12:37:08
爷爷谢贤去世1月后,谢振轩悉尼被偶遇,与46岁女子恋情真相大白

爷爷谢贤去世1月后,谢振轩悉尼被偶遇,与46岁女子恋情真相大白

小鱼爱鱼乐
2026-09-02 16:45:02
景甜事件炸裂后续!孙宇晨2019年聊天曝光,代孕搞"三权分立"防女方架空,原来是早有预谋?

景甜事件炸裂后续!孙宇晨2019年聊天曝光,代孕搞"三权分立"防女方架空,原来是早有预谋?

可达鸭面面观
2026-09-02 18:32:18
原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

离离言几许
2026-09-02 01:50:44
乌克兰安全局与乌国防部情报总局在基辅发生交火,乌官员回应:需要彻查

乌克兰安全局与乌国防部情报总局在基辅发生交火,乌官员回应:需要彻查

环球网资讯
2026-09-02 22:09:06
极目深度 最后一茬西瓜终于卖完了,河南瓜农面临“选择困难症”:明年继续种瓜,还是改种别的?

极目深度 最后一茬西瓜终于卖完了,河南瓜农面临“选择困难症”:明年继续种瓜,还是改种别的?

极目新闻
2026-09-02 19:26:26
普京欲发布动员令,俄罗斯11万中产阶级闻风而逃?

普京欲发布动员令,俄罗斯11万中产阶级闻风而逃?

高博新视野
2026-09-01 18:56:12
六年级第一天!詹姆斯开车送女儿上学并寄语:做你自己就足够耀眼

六年级第一天!詹姆斯开车送女儿上学并寄语:做你自己就足够耀眼

罗说NBA
2026-09-02 06:27:36
外媒:看完中国战斗机,埃及要增购24架“阵风”战斗机,为什么没买中国战斗机?

外媒:看完中国战斗机,埃及要增购24架“阵风”战斗机,为什么没买中国战斗机?

蓝星杂谈
2026-09-02 09:38:10
2026年小学入学人数大降:河南山东近乎腰斩,北方七省超40%

2026年小学入学人数大降:河南山东近乎腰斩,北方七省超40%

老郭在学习
2026-09-02 08:19:50
谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

闻识
2026-09-02 11:17:04
皇马将西藏与尼泊尔并列拒绝改正

皇马将西藏与尼泊尔并列拒绝改正

第一财经资讯
2026-09-02 00:11:54
2026-09-02 23:51:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17180文章数 515197关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

房产
数码
亲子
旅游
公开课

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

数码要闻

华为Watch 6系列手表海外发布

亲子要闻

4万余场亲子活动、“京小宝”2.0版可预约,北京托幼服务升级

旅游要闻

忻州荷花开 遍地是吾乡

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版