撰文丨王聪
编辑丨王多鱼
排版丨水成文
如果能在不进行真实实验的情况下,就能预测出某种药物会对特定类型的癌细胞产生什么影响——哪些基因会被激活,哪些通路会被抑制,甚至细胞是否会死亡——这将对新药研发和个性化医疗带来怎样的革命?
2025 年 6 月,Arc 研究所在其官网和预印本平台 bioRxiv 发布了虚拟细胞模型——State,该虚拟细胞模型基于 1.67 亿个细胞的观察数据以及超过 1 亿个细胞的扰动数据进行训练,这些数据涵盖了 70 种细胞系,旨在预测各类干细胞、癌细胞和免疫细胞对药物、细胞因子或基因扰动的响应。此外,该研究还提出了一个全面的评估框架——Cell-Eval,可用于对虚拟细胞模型的性能评估。
2026 年 8 月 31 日,该论文经过同行评议,在国际顶尖学术期刊Cell正式上线,论文题为:Predicting cellular responses to perturbation across diverse contexts with State。State模型的性能与灵活性为扩展开发细胞状态的 AI 模型奠定了基础。
![]()
大约 90% 的进入临床试验的候选药物最终会失败,原因在于疗效不佳或产生了意外的副作用。研究人员在实验室或患者身上测试的每种药物,本质上都是为以特定方式干扰细胞而量身定制的探针。因此,一个高度预测性的虚拟细胞(Virtual Cell)模型,能够帮助研究人员发现新药物,这些药物能够使细胞从“患病状态”转换到“健康状态”,同时减少脱靶效应,从而提高临床试验的成功率。
然而,预测细胞对之前未曾见过的干扰的反应,并非易事。
为什么预测细胞反应这么难?
在深入了解State之前,我们需要明白一个核心问题:为什么预测细胞反应如此具有挑战性?
如果你身处一个巨大的体育馆演唱会中,每个观众(就像是每个细胞)看起来相似但其实各不相同,当歌手喊出“举起你们的双手”(施加扰动),有的观众举的得高,有的观众举得低,还有观众根本没动,他们举手的时间也各不相同,这些个体的差异就像是细胞异质性,只是细胞异质性的程度要大得多。
更麻烦的是,不同实验室的实验条件、测序深度、试剂批次等技术因素也会引入大量噪声。就像用不同品牌的相机拍同一个场景,得到的照片色调可能完全不同。
传统的分析方法往往假设同类型细胞的反应是一致的,或者无法有效区分真正的生物信号和技术噪声。结果就是,很多深度学习模型在实际应用中并不比简单的线性模型表现更好。
State 的独特之处:多尺度架构
State的设计灵感来源于一个深刻的洞察:要理解细胞行为,必须在多个层面上同时建模。
第一层:基因水平,State为每个基因学习一个嵌入向量,捕捉基因在不同实验条件下的功能关系。
第二层:细胞水平,通过State 嵌入模型(State Embedding,SE),将单个细胞的转录组状态压缩成一个紧凑的表示向量。这个 SE 模型是一个强大的双向 Transformer,它在1.67 亿个人类细胞的观测数据(来自多个公开数据库)上进行了预训练,学会了识别真正重要的基因表达模式,过滤掉技术噪声。
第三层:群体水平,这是 State 最创新的部分——State转换模型(State Transition,ST)。ST 模型是一个基于自注意力机制的 Transformer,它在超过 1 亿个细胞的扰动数据(来自大规模单细胞测序)进行了训练,它不是单独看一个细胞,而是同时观察一组相同条件下的细胞。通过分析这些细胞之间的差异和共性,ST 模型能够精确地分离出真正的扰动效应和背景噪声。
![]()
State 的表现有多强?
为了评估State的性能,研究团队开发了一套全面的评估框架——Cell-Eval,从三个维度衡量模型的性能:
1. 基因表达计数:预测的准确性;
2. 差异表达基因(DEG):能否正确识别哪些基因被上调或下调;
3. 扰动效应大小:能否准确估计扰动的整体强度。
在化学药物扰动数据集(Tahoe-100M)上,State区分不同扰动效应的能力提升了66%,预测基因表达变化的皮尔逊相关系数提升了 91%。
在细胞因子信号扰动数据集(Parse-PBMC)上,State区分能力提升了 29%,相关性提升了 48%。
在基因编辑扰动数据集(Replogle-Nadig)上,State区分能力提升了 10%,相关性提升了 10%。
State在预测扰动效应大小时表现出色,在 Tahoe-100M 数据集上达到了 0.9 的斯皮尔曼相关系数,这意味着它能几乎完美地对不同药物的作用强度进行排序。
值得一提的是,Arc 研究所于近日启动了第二届虚拟细胞挑战赛(Virtual Cell Challenge 2026),此次挑战赛将对生物学泛化能力提出更高要求:在多个独立的细胞环境中实现零样本预测,并使用 Cell-Eval 来评估不同虚拟细胞模型的性能。
![]()
零样本预测:真正的“黑马”能力
State最令人兴奋的能力之一是零样本预测——即在完全没有见过某个细胞类型受扰动数据的情况下,预测该细胞会如何反应。如果你正在开发一种新药,想了解它对某种罕见癌细胞的效果,但你没有资源去做大规模实验。这时,State 就能派上用场了。
该研究显示,当使用 SE 时,State 在完全未见过的细胞情境中的预测能力显著提升。例如,它可以模拟一种药物对从未见过的 A549 肺癌细胞的治疗效果,并通过与已知基因扰动数据的对比来揭示药物的作用机制。
研究团队使用了一个具体案例来验证这一点:对于 MEK 通路抑制剂曲美替尼(trametinib),State 模拟的药物效应与真实实验数据高度一致,并且成功识别出了该通路的核心成员基因(PTPN11、RAF1、SHOC2)作为最相似的基因扰动。
实际应用:从理论到临床
发现细胞类型特异性药物反应
State能够识别出哪些药物对不同细胞类型有特异性的影响,在实验中,研究团队让 State 预测 5 种不同癌细胞系对 700 多种药物扰动的反应,结果发现 State 能够准确捕捉到每种细胞系的独特性反应模式。例如,对于 FDA 批准的黑色素瘤药物曲美替尼,State 在没有见过 C32 细胞任何剂量数据的情况下,成功预测了该细胞的特异性基因表达变化,而简单的平均基线方法则完全失效。
预测细胞存活率
更令人惊讶的是,State不仅能预测基因表达变化,还能间接预测细胞存活率。研究团队训练了一个回归模型,利用 State 预测的基因表达谱来估算细胞活力,结果与实际测量的细胞存活率高度相关(皮尔逊相关系数 0.52),远优于简单基线方法(0.2-0.31)。
模拟组合药物治疗
State甚至可以模拟两种药物联合使用的效果。研究发现,在某些情况下,药物组合的效应并不是简单相加,而是存在协同或拮抗作用。例如,当以阿比特龙(abiraterone)作为第一种药物时,State 预测的第二种药物效应与已知的药物组合数据库(DrugComb)中的协同评分高度吻合。
跨模态迁移学习
State还有一个令人惊叹的能力:它可以从药物扰动数据中学到的基因调控关系,迁移到基因扰动场景中。即使没有接受过基因扰动数据的训练,State 也能预测特定基因敲除后的细胞反应,并且这些预测与 DepMap(癌症依赖图谱项目)的实际生存数据显著相关。
State 的理论基础:最优传输
除了出色的实证表现,State还有坚实的理论基础。研究团队证明,在一定的正则条件下,State 可以学习到连续最优传输(Optimal Transport)映射,这使得它能够在理论上保证找到连接未扰动和扰动细胞群体的最佳变换方式。
这一发现意味着 State 不仅是一个“黑箱”预测器,它还具备数学上的可解释性和理论保证。
当然,State 并非完美无缺,目前它只能预测一组高变基因的表达变化,而非全基因组范围。此外,在完全未见过的数据集上进行零样本预测时,性能仍然受限,因为不同实验之间存在太多变量。
研究团队指出,随着更大规模扰动图谱的建立,State 的性能有望进一步提升。同时,State 的注意力机制也显示出对细胞群体异质性的敏感性,这为理解基因调控机制提供了新的可能性。
通往“虚拟细胞”的关键一步
State代表了向构建“虚拟细胞”——一个能够探索所有可能细胞状态的 AI 模型——迈出的重要一步。它不仅改进了现有方法的预测能力,还引入了能够有效利用日益增长的单细胞扰动数据集的架构。
在未来,这样的模型可能会彻底改变药物发现流程,帮助研究人员在计算机上快速筛选候选药物,预测可能的副作用,甚至为个体患者定制治疗方案。虽然距离真正的“数字孪生”还有很长的路要走,但 State 无疑让我们看到了这条道路上的曙光。
![]()
该研究的核心贡献:
提出多尺度架构 State,实现细胞扰动反应的精准预测;
开发 Cell-Eval 评估框架,提供全面、生物可解释的评价指标;
展示了零样本预测能力,可在未见过的细胞情境中发挥作用。
验证了模型在药物机制发现、组合疗法设计等实际应用中的潜力。
论文链接:
https://www.cell.com/cell/fulltext/S0092-8674(26)00921-9
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.