网易首页 > 网易号 > 正文 申请入驻

《细胞》重磅:告别“纸上谈兵”!首个开源AI衰老模型基准测试LongevityBench诞生,轻量级模型完胜千亿级通用大模型

0
分享至

*仅供医学专业人士阅读参考

在衰老研究领域,人工智能(AI)已经成为不可或缺的工具。但AI真的懂衰老吗?目前,大语言模型(LLM)已经能够做到回答大量的生物医学问题,但这些回答可能来自早就存在的论文、数据库或互联网文本,并不意味着它们真的具备从原始实验数据中推导真实科学结论的能力。

但从今天开始,我们真正拥有了能判别AI是否“懂衰老”的工具。

今日,《细胞》杂志以封面研究的形式发表了英矽智能领衔,与Liquid AI、巴克衰老研究所、哈佛医学院及布莱根妇女医院合作的重磅论文[1],该研究首次推出了开源的AI衰老研究工具包,包括全球首个开源衰老生物学多组学评估基准测试 LongevityBench,并证实经过特定领域数据微调的轻量级模型Longevity-LLMs(0.6B–9B参数)不仅能精准解读复杂的多组学实验数据,更在多项衰老相关核心推理任务中全面击败了Gemini-3.1-Pro、Claude Opus-4.6及GPT-5等前沿千亿级通用大模型。


《自然》杂志配发评论称[2],这将为下一代AI模型的发展提供重要的参考依据。


“大”模型或许不是衰老研究的出路

人类衰老是引发心血管疾病、神经退行性病变、癌症及代谢紊乱等绝大多数重大慢性疾病的核心风险因素。过去二十年间,随着多组学(Omics)高通量检测技术的爆发,科学界积累了海量的DNA甲基化、转录组学、蛋白质组学及临床生化指标数据。然而,如何从这些浩如烟海、高度异构的原始实验测量数据中,准确推导出系统性的衰老生物学机制与治疗靶点,始终是制约长寿医学(Longevity Medicine)发展的核心痛点。

LLM在医学文献总结、临床问答及科研辅助中展现出惊人潜力。然而,当前绝大多数生物医学AI 基准测试(Benchmark)仅停留在自然语言文本问答层面。这种评估模式存在致命缺陷:AI极易通过预训练语料库中的文本记忆(Memorization)直接“背出答案”,而非真正具备理解原始实验数据的生物学推理能力。

面对严谨的经验生物学,通用大模型常因“缺乏对底层生物特性的内化”而给出看似流畅却违背事实的伪结论(即AI幻觉),这严重威胁了科学研究的严谨性。

为了系统评估AI是否真正具备解读原始生物学数据的能力,研究团队打造了LongevityBench (LB)基准测试集。该基准包含17项评估任务,横跨5大生物数据领域:临床生化、表观遗传学、转录组学、蛋白质组学、遗传学与基因互作,并设计了4种问题格式和25457个结构化prompt,评估了18款主流通用大模型(包括Gemini-3.1-Pro、Claude Opus-4.6、GPT-5/5.2、DeepSeek-V3.2/R1、Kimi-K2.5、Grok-4.3)对多组学年龄预测、死亡风险评估及基因调控的推理能力。

遗憾的是,没有任何一个通用大模型能够在所有任务上全面领先,如临床生化任务中,Gemini-3.1-Pro展现出商业模型中的最高水准,但表现仍不如该领域的经典机器学习模型。

在表观遗传与转录组任务中,由于prompt输入的是动态抽样的多组学特征,通用大模型的推理极其不稳定。

从组学数据预测年龄是最困难的任务。例如在DNA甲基化样本年龄对比任务中,表现最好的通用模型Kimi-K2.5一致性指数(Concordance)仅为0.69;而在蛋白质组学年龄对比中,蛋白质时钟的一致性达0.749,而通用大模型最佳者仅为 0.703(Gemini-3.1-Pro),GPT-4.1的表现甚至与随机盲猜无异。


通用大模型在很多任务的表现不尽如人意

此外,研究者发现通用大模型对提问方式高度敏感,不同的问题表达形式会显著影响结果,说明通用大模型在结构化生物数据推理上仍然面对相当的稳定性问题。

“大”模型,看来并不是衰老科研AI最好的出路。

“专模”专用,性能更佳

那么如何提升模型对衰老生物学数据处理的表现呢?

研究团队基于Qwen3/3.5及Liquid AI的LFM2开源基座,微调训练了5款参数量仅在0.6B至9B之间的轻量级专用模型Longevity-LLMs(L-LLMs)。

在与通用大模型的比较中,L-LLMs取得了瞩目的成绩。9B参数的L-Qwen3.5-9B在测试中性能最佳,综合排名列总榜第一;仅0.6B参数的L-Qwen3-0.6B也名列第六,超越了大部分千亿/万亿参数的通用大模型。


L-LLMs表现极佳,L-Qwen3.5-9B断层第一

举例来说,在血浆蛋白质组Profile条件生成任务中,通用大模型的Jaccard相似度接近0,且预测的蛋白质高度局限于少数常见热点蛋白,仅覆盖47%的蛋白词汇表;L-LFM2-2.6B平均Jaccard相似度提升至0.17,且涵盖了2583种独特蛋白质,覆盖了91%的蛋白质词汇表。这表明L-LLMs真实内化了底层组学数据的完整统计分布,而非简单记忆论文热点。

研究者对L-Qwen3.5-9B进行了1922个prompt的特征消融测试,删除特定面板数据会使模型的预测性能显著下降,证实其预测严格依赖于真实的生物学信号分布。

以上结果足以说明,通过特定领域的结构化组学数据微调,轻量级模型无需依赖庞大的算力,即可高效适配复杂的生物多组学任务。

全新的科研综合智能体


研究团队还公开发布了结合L-LLMs与衰老时钟(Biolearn)、基因集富集分析(GSEA)等工具的科研综合智能体接口Longevity Claw,形成了从接受数据、调用工具、分析整合、自动化汇总到形成下一步行动的完整科研工作流。

研究者将Longevity Claw应用于14个衰老标志分类,开展无预设答案的治疗靶点探索。模型需要为候选靶点输出包含信心度、可药用性、安全性、新颖性、商业潜力与机制清晰度6个维度的自动化评分。

经过6轮独立重复与去重,Longevity Claw最终输出了328个候选靶点,与2022年发表在Aging上的基于PandaOmics AI平台的独立数据集相比[3],核心靶点集展现出了高达5.6倍的显著统计学富集度。6轮筛选中5次提名的KDM1A,已经在秀丽隐杆线虫研究中被证实具备抗衰和抗肿瘤的双重潜力。

小结

LongevityBench、Longevity-LLMs及Longevity Claw的开源发布,标志着生物医药AI评估与应用进入了全新的阶段。该研究证明了在多组学推理任务中,经过领域强化训练的轻量级模型能够以更低的算力成本和更高的隐私安全性,达到甚至超越千亿级通用大模型的性能水准。

作为专注于生成式AI驱动药物研发与抗衰老生物学的先锋企业,英矽智能已经取得了相当的成绩,其提出的全球首个AI驱动新药Rentosertib在针对特发性肺纤维化(IPF)的IIa期临床试验中,。

随着这套开源AI工具包的发布,全球科研人员将能够更好地利用多组学数据与领域大模型,共同推动长寿医学与新药研发的变革。

欢迎大家关注我们在小宇宙上的播客栏目——药研片语,

欢迎大家前去收听并与我们交流~

参考资料:

[1]Zhavoronkov, Alex, et al. "An Open Benchmark and Language Models for AI in Aging Biology." Cell, vol. 189, 2026, pp. 1–15. ScienceDirect,https://doi.org/10.1016/j.cell.2026.08.026.

[2]https://www.nature.com/articles/d41586-026-02913-7

[3]Pun, Frank W., et al. "Hallmarks of Aging-Based Dual-Purpose Disease and Age-Associated Targets Predicted Using PandaOmics AI-Powered Discovery Engine." Aging, vol. 14, no. 6, 2022, pp. 2475–506. https://doi.org/10.18632/aging.203960.


本文作者丨代丝雨

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
颠覆认知!科学家发现:最佳休息方式非睡眠,10分钟帮你恢复精力

颠覆认知!科学家发现:最佳休息方式非睡眠,10分钟帮你恢复精力

39健康网
2026-07-07 18:02:55
北京知青寻找女儿四十年,2018年他意外发现女儿和他住同一个小区

北京知青寻找女儿四十年,2018年他意外发现女儿和他住同一个小区

牛魔王与芭蕉扇
2024-12-03 16:45:47
《兰香如故》林锦岐误以为她攒功劳想做妾,许兰香却反手要了脱籍文书!一家三口终于摆脱奴籍,太爽了

《兰香如故》林锦岐误以为她攒功劳想做妾,许兰香却反手要了脱籍文书!一家三口终于摆脱奴籍,太爽了

喵喵的追剧笔记
2026-09-18 12:14:23
敬一丹当天在哈尔滨开颅手术,包ICU专机回京

敬一丹当天在哈尔滨开颅手术,包ICU专机回京

雪中风车
2026-09-16 15:23:29
赛前放狠话!张本智和直言日本亚运夺冠胜率更高,点出取胜关键

赛前放狠话!张本智和直言日本亚运夺冠胜率更高,点出取胜关键

体育见习官
2026-09-18 15:58:59
1945年,毛泽东在酒会上偶遇江青前夫,握着他的手说:“和为贵”

1945年,毛泽东在酒会上偶遇江青前夫,握着他的手说:“和为贵”

雍亲王府
2026-08-29 07:25:11
敬一丹离世刚5天,知情人曝富豪丈夫王梓木现状,一点都不意外

敬一丹离世刚5天,知情人曝富豪丈夫王梓木现状,一点都不意外

翰飞观事
2026-09-18 19:16:21
知情人士:沙特国家石油公司下月将不向欧洲买家交付原油

知情人士:沙特国家石油公司下月将不向欧洲买家交付原油

新京报
2026-09-19 18:07:28
从F-15被击落看沙特军队战斗力水平

从F-15被击落看沙特军队战斗力水平

龙牙的一座山
2026-09-19 10:14:40
美军狂射339枚导弹!地面部队杀入伊朗,伊反舰导弹直面美航母

美军狂射339枚导弹!地面部队杀入伊朗,伊反舰导弹直面美航母

乐界品鉴官
2026-09-16 17:00:24
新款宝马X3强势来袭,售价跳水极具竞争力,豪华气派上档次

新款宝马X3强势来袭,售价跳水极具竞争力,豪华气派上档次

生活魔术专家
2026-09-19 11:26:19
山东海归女硕士面试考第一,体检完因“专升本”被取消资格,聊城文旅局承认失误但改变不了结果

山东海归女硕士面试考第一,体检完因“专升本”被取消资格,聊城文旅局承认失误但改变不了结果

山西经济日报
2026-09-18 11:37:05
许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

椰黄娱乐
2026-09-16 10:20:02
自动气象站:环境数据的智能采集与传输

自动气象站:环境数据的智能采集与传输

测控技术有限公司
2026-09-08 11:45:38
31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

扬子晚报
2026-09-17 20:39:38
娃哈哈被查封,震惊行业

娃哈哈被查封,震惊行业

李东阳朋友圈
2026-09-18 11:19:09
外媒:谷歌证实其AI模型曾在测试中侵入3家公司的系统

外媒:谷歌证实其AI模型曾在测试中侵入3家公司的系统

环球网资讯
2026-09-19 15:51:37
《交锋》最狠的棋局曝光:马憩留下那缕棉絮,根本不是失误,而是把朱应甲往死里逼的三层杀招

《交锋》最狠的棋局曝光:马憩留下那缕棉絮,根本不是失误,而是把朱应甲往死里逼的三层杀招

老吴教育课堂
2026-09-19 12:50:08
价值27500元,这个号码的5元纸币,你能找到吗?

价值27500元,这个号码的5元纸币,你能找到吗?

小陈收藏社
2026-09-19 18:10:03
“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

熙熙说教
2026-09-10 13:21:21
2026-09-19 18:48:49
奇点网 incentive-icons
奇点网
链接全球创新医疗
3349文章数 72572关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

市委书记称"债都是前面欠的 凭什么让我还" 党报表态

头条要闻

市委书记称"债都是前面欠的 凭什么让我还" 党报表态

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

蔡卓妍小腹凸起疑怀孕?本人没回应

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

亲子
手机
旅游
数码
公开课

亲子要闻

来自国内外的28个肾移植患儿家庭齐聚上海,共赴第三届全球肾移植儿童欢乐行

手机要闻

苹果首次回应iPhone Duo折痕问题:并未消失 但已设法让用户逐渐忘记它的存在

旅游要闻

2026年南湖映月·金秋游园活动9月21日启幕 游园预约已上线

数码要闻

二向箔充电器!酷态科推出6号氮化镓电能卡AIR三体联名版:透明外壳

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版