网易首页 > 网易号 > 正文 申请入驻

GPT-6发布,AGI来没来不知道,但AI4S真的飞升了

0
分享至

今天,AI科技圈全体狂欢。

凌晨,OpenAI发布了新一代旗舰模型GPT-6 Astra,号称地表最强AI大模型。


它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。

OpenAI副总裁Greg Brockman称这是一次“世代跃迁”,甚至表示它开启AGI的新时代。

目前,绝大多数的报道都是代码、视频生成能力,但关于AI怎么做科学研究这块,几乎没人细讲。

但如果把视线从AGI叙事上移开,再看一眼GPT-6 Astra的能力数据,会发现一个更值得AI4S关注的变化。

AI模型正在跨过一道新的门槛。

这一次,真正值得细读的,不是它离AGI还有多远,而是它已经开始具备什么样的科学能力。

Greg Burnham将其描述为:“一个时代的结束,另一个时代的开始。”


科研Agent,能力更强了

首先,需要介绍一下Terminal-Bench这个基准。

它已成为AI智能体能力评估的重要标杆,几乎所有前沿实验室都在使用它来追踪和比较各自智能体的性能。

Terminal-Bench Science 0.1,则被称为“科学版Terminal-Bench”,专门测试智能体能否用代码和终端工具完成科研工作流的评测

它一共包含70个由领域研究人员策划的任务,覆盖生命科学、物理科学、地球科学、数学科学和工程科学五大领域。

在这个基准上,Astra以64.6%的成绩刷新了SOTA,作为对照的Claude Fable 5.1,是52.6%。


不仅如此,Astra跑出这个成绩所用的预估API成本,还比对照组低了约31%。

也就是说,这不只是能力上的领先,还是效率上的领先。

放回AI4S的场景里理解一下,以前“文献调研→提出假设→跑模拟→核对数据→给出下一步建议”这条链条,是分成好几轮对话,靠人工衔接。

现在,这条链条理论上已经能被一个Agent自己串起来跑完。

一位科学家直接用Astra做出了一个复杂的生物医学应用,专门用来分析流式细胞术的数据。

流式细胞术是免疫学里最基础的技术之一,让科学家能一次性分析血液、组织或者其他样本里,成千上万甚至几百万个单细胞,用带荧光标记的抗体,把特定的细胞类型揪出来,顺便测一下它们表达了什么蛋白质。

以前该领域一直被商业软件占领。


这位科学家表示,他们实验室这么多年,每年都要为分析这类数据的商业软件,掏出几千美元的订阅和授权费。

现在,他把所有订阅全取消了。因为他用Astra几乎已经自己搭出了一个功能齐全、研究级别的同类应用。


而且他还补了一句,这个UI/UX,已经比他用过的很多商业工具都要好。

以前我们聊AI4S,聊的还是AI能不能帮科学家提效。这个案例已经不是提效了,这是一个科学家,靠自己写Prompt,把一整个商业软件公司,给绕过去了。

那些靠卖分析软件订阅费吃饭的公司,这一刻,可能真的要开始睡不着觉了。

不仅如此,Agent成本大幅下降意味着,原来只有大药企、头部实验室才能使用的科研Agent能力,中小型团队可能也开始玩得起了。


科研跑分:从能聊到能考

官方报告中,专门给出了Advancing scientific discovery(推进科学发现)这一章。
在这一章,GPT-6 Astra拿了一系列SOTA(最佳表现)。

GPQA Diamond能够测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra在对比测试中取得了96.0%的新高分。


HealthBench Professional是用于评估大语言模型在真实临床工作场景中表现的基准,GPT-6 Astra得分最高63.4%,比上一代Sol的60.5%又高了一截。




这两个还算是传统项目,大家都在卷。真正有意思的是接下来这几个,之前很少有模型愿意测试的难度极高的垂类基准。

  • LifeSciBench:评估AI在整个生命科学研究中的实用性。

  • GeneBench-Pro:专注于计算生物学与基因组学中的高阶统计推理能力。

  • MedChemBench:专注于药物化学中的推理与决策能力。

GPT-6 Astra分别在三个基准中,拿到了60.3%、37.8%、49.3%的分数,都略有提升,同时成本大幅度下降。

但这里有个细节,OpenAI在脚注里写了一句:Claude Fable 5和5.1,没有被放进这几项的对比里。

理由是,它们在这些题目上,大部分选择了直接拒答。

不是答错,而是拒答。两个模型的表现,其实是两条完全不同的安全路线。

Anthropic一条更保守,碰到敏感的生化类问题,宁可不答也不冒险;而OpenAI一条选择在监管框架内,尽量把答案给出来。

这对之后科学家怎么选AI模型,这应该会有实实在在的影响。


桌面操作能力,史诗级提升

还有一组数据,容易被忽略,但对AI4S行业的冲击可能是最直接的。

ScreenSpot-Pro,测的是Agent在不借助外部工具的情况下,直接识别并操作屏幕上的界面元素。

Astra拿到92.7%,对照的GPT-5.6 Sol是76.9%。


OSWorld 2.0,测的是Agent在真实桌面环境里完成任务的能力,Astra拿到72.6%,Sol是65.7%,Claude Opus 5是70.2%。


BenchCAD,测的是操作专业软件完成实际工作,Astra拿到95.9%,Sol是83.3%。

说明Agent已经能像人一样,直接用鼠标键盘操作那些从来没开放过API、只能靠人工点来点去的老旧专业软件。

不管是ChemDraw、LIMS系统,还是实验室里Excel记录流程。

官网给的两个具体科研场景。

第一个测序,让Astra直接进到专业生物信息学软件MultiQC里,核查基因测序的质量,把遗传变异可视化出来,帮研究者判断接下来该往哪个方向继续深挖。

第二个追踪细胞,GPT-6 Astra 在 Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。

这才是这次AI for Science真正的跨越。

以前AI在科研里扮演的角色,更像是一个博学的学士,本质上还是问答形式。

现在它开始变成一个愿意动手干脏活累活的实验室助理,自己打开软件、自己检查数据、引导科学家做出判断。

如果通用Agent已经不需要专门适配API,直接看屏幕操作就能完成任务,那垂直工作台集成的含金量,正在被悄悄稀释。


回到开头那句话。

一个时代结束,另一个时代开始。我觉得这句话放在这里,倒也没那么标题党。

以前我们说AI4S,除开基础大模型外,聊得更多是垂直平台怎么把专业软件的接口打通,集成到一个工作台中。

这是一道很深的护城河,因为大多数科研软件压根没开放过API,得靠人一点点适配。

但这次Astra展示的东西,不仅是模型能力的大幅提升,还在展示:不需要平台开放接口,AI直接看屏幕操作就行了。

当通用大模型的科学能力每往前挪一步,垂直AI4S平台就必须回答一个问题——你比它多做对了什么。

是数据的专有性,是流程的领域know-how,还是验证环节的不可替代性?

这个问题AI4S行业迟早要正面回答。

真正能留下来的,可能只有最稀缺的能力。一方面,手里有没有别人拿不到的专有数据;另一方面,是否具有基于物理世界的验证能力,这还是AI模型的短板。

至于AGI来没来,交给别人吵去吧。

— The End—


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
汽车离加油站20多米燃油耗尽,请加油员手动灌油被拒,无奈花350元叫拖车,加油站道歉:签字备案后可借散装油

汽车离加油站20多米燃油耗尽,请加油员手动灌油被拒,无奈花350元叫拖车,加油站道歉:签字备案后可借散装油

极目新闻
2026-10-07 16:00:12
祁连县把泼天的流量接成了脏水

祁连县把泼天的流量接成了脏水

陈宜之
2026-10-07 16:26:38
央视曝光全是假的!88元“进口奶粉”,成本才2块钱,电商都在售

央视曝光全是假的!88元“进口奶粉”,成本才2块钱,电商都在售

听风喃
2026-10-06 18:39:29
何超莲34岁生日全家福曝光!老公零点庆祝,丸子头短裤嫩回24岁

何超莲34岁生日全家福曝光!老公零点庆祝,丸子头短裤嫩回24岁

手工制作阿歼
2026-10-07 17:43:54
尴尬!C罗声明已发17小时,0个葡萄牙队友公开支持他,热苏斯赢了

尴尬!C罗声明已发17小时,0个葡萄牙队友公开支持他,热苏斯赢了

风过乡
2026-10-07 20:25:05
有人高速开出时速30km,有人遇“龟速车”与大货车长时间并排行驶!多地交警喊话“龟速车”

有人高速开出时速30km,有人遇“龟速车”与大货车长时间并排行驶!多地交警喊话“龟速车”

红星新闻
2026-10-07 18:58:47
为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

好爸育儿
2026-10-07 11:07:25
诺贝尔化学奖揭晓,两位化学家共同获奖

诺贝尔化学奖揭晓,两位化学家共同获奖

澎湃新闻
2026-10-07 18:14:07
日本诺奖再添一人,25年兑现一个“狂言”

日本诺奖再添一人,25年兑现一个“狂言”

难得君
2026-10-07 19:19:17
残雪再次领跑赔率榜!诺贝尔文学奖明晚揭晓,会花落中国作家吗?

残雪再次领跑赔率榜!诺贝尔文学奖明晚揭晓,会花落中国作家吗?

都市快报橙柿互动
2026-10-07 20:16:54
男子高速上开智驾后睡着,旁边车辆多次按喇叭提醒,“开始堵车他才醒来”,杭州交警:罚款200元、驾驶证记3分

男子高速上开智驾后睡着,旁边车辆多次按喇叭提醒,“开始堵车他才醒来”,杭州交警:罚款200元、驾驶证记3分

封面新闻
2026-10-07 18:20:13
中国学者得不了诺贝尔奖的根本原因是:诺贝尔奖含“金”量太低

中国学者得不了诺贝尔奖的根本原因是:诺贝尔奖含“金”量太低

必记本
2026-10-06 17:31:43
缅北木姐地图上密密麻麻红点全是电诈窝点,警方:2024年抓获807人,拔掉最后一颗“钉子”,真正意义完成对缅北四个方向电诈窝点全面清剿

缅北木姐地图上密密麻麻红点全是电诈窝点,警方:2024年抓获807人,拔掉最后一颗“钉子”,真正意义完成对缅北四个方向电诈窝点全面清剿

扬子晚报
2026-10-07 16:11:40
答案来了,韦世豪被红牌罚下为什么还笑?球迷:坚决支持!

答案来了,韦世豪被红牌罚下为什么还笑?球迷:坚决支持!

我就是一个说球的
2026-10-07 19:57:12
在泰国曼谷失联的上海音乐教师已安全回国,我使馆:赴泰中国公民要“对自己和家人负责,切勿因盲目冲动、轻信许诺而令家人亲属担忧牵挂”

在泰国曼谷失联的上海音乐教师已安全回国,我使馆:赴泰中国公民要“对自己和家人负责,切勿因盲目冲动、轻信许诺而令家人亲属担忧牵挂”

都市快报橙柿互动
2026-10-07 16:02:23
库里16+5勇士26分大胜湖人 布朗尼生日仅4分伦德博格17+9

库里16+5勇士26分大胜湖人 布朗尼生日仅4分伦德博格17+9

醉卧浮生
2026-10-07 12:31:44
2026诺贝尔化学奖给了法国95岁学者和日本75岁学者,日本出身的诺奖得主已有28位

2026诺贝尔化学奖给了法国95岁学者和日本75岁学者,日本出身的诺奖得主已有28位

知识分子
2026-10-07 18:05:36
前美国军控特使爆料:苏联曾把鼠疫做成武器,伊尔库茨克实验室在名单里

前美国军控特使爆料:苏联曾把鼠疫做成武器,伊尔库茨克实验室在名单里

西虹市闲话
2026-10-07 16:24:18
俄疑发生鼠疫,美国驻俄使馆发布警告:在俄公民立即离开

俄疑发生鼠疫,美国驻俄使馆发布警告:在俄公民立即离开

爆角追踪
2026-10-07 12:50:26
央视明示:此前在南海“瘫痪”4天的美军驱逐舰,疑似是被055大驱高速拉爆的!

央视明示:此前在南海“瘫痪”4天的美军驱逐舰,疑似是被055大驱高速拉爆的!

天下布武
2026-10-07 15:13:22
2026-10-07 21:59:00
智药局 incentive-icons
智药局
我们更懂药物创新
1355文章数 233关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

迟到25年95岁科学家终于获诺奖 他的研究拯救无数家庭

头条要闻

迟到25年95岁科学家终于获诺奖 他的研究拯救无数家庭

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

房产
亲子
本地
旅游
公开课

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

亲子要闻

看样子孩子很不满意

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

“县”在出发|泡火山温泉、吃地热蒸蛋,腾冲热海客流随天气回暖,昆明游客:山水环境特别好

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版