网易首页 > 网易号 > 正文 申请入驻

聚类分析:健康研究者的传统与新方法概览

0
分享至

Cluster analysis: an overview of traditional and novel approaches for health researchers

聚类分析:健康研究者的传统与新方法概览

https://doi.org/10.1093/eurjcn/zvag100




学习目标

  • 理解随着人工智能的发展,聚类分析在历史上的进步。

  • 理解不同聚类方法的优点和缺点。

  • 理解降维(DR)技术与聚类分析之间的区别和相互关系。

  • 理解进行一项聚类分析所涉及的关键步骤。

引言

心血管疾病(CVD)研究常常受到高度异质性患者群体的挑战,这使得精准决策和个性化护理变得复杂。¹ 传统的分组方法,例如按年龄、性别或单一临床指标进行分层,往往难以完全捕捉患者特征的多维复杂性。例如,关于心房颤动(AF)的研究进一步表明,常用的

风险评分往往表现不佳,因为它们未能捕捉到AF异质性的病理生理学特征。²,³ 更具体地说,据报道,使用CHA₂DS₂和CHA₂DS₂-VASc进行血栓栓塞事件风险分层,在某些队列中仅显示出中等的预测能力,这反映在C指数上。² 重要的临床特征常常被排除在这些简单的风险分层方案之外,遗漏了潜在的相关因素。⁴ 结果,即使在同一风险组内的患者中,在临床

表现、疾病进展、护理需求和治疗反应方面也观察到显著差异。⁵ 因此,彻底捕捉患者群体中每个个体的特征和潜在模式,对于制定量身定制的护理计划至关重要。

聚类分析作为一种广泛使用的探索性和假设生成方法,可能为克服上述局限性提供一种有前景的途径。它能够在没有预定义标签的情况下,揭示潜在模式并建立更加同质的患者亚组。⁵ 与传统风险分层方法不同,聚类分析可以同时整合大量临床、人口统计学和行为变量,使研究人员能够发现更准确地代表真实世界患者异质性的潜在表型。在过去几十年中,这些方法已被越来越多地应用于识别患者亚组,⁶ 增强心血管表型的特征描述,³ 并探索心理特征分类的模式。⁷ 这些应用不仅丰富了临床理解,而且还提供了一种有效的方式来支持基于聚类信息的个性化护理,并改善患者的疾病结局。随着人工智能(AI)和先进计算方法的快速发展,聚类技术已经发生了实质性的演变。通过将降维(DR)和数据可视化技术与经典的传统聚类算法(如层次聚类和K均值聚类),以及诸如深度学习算法等先进聚类方法相结合,聚类分析处理复杂数据集和揭示更深层结构模式的能力已得到显著增强。因此,本文旨在为健康研究者提供聚类分析的概述,包括其历史和概念基础、不同的聚类分析方法、DR技术,以及在异质性人群中使用时的实施步骤。

聚类分析的基础与历史发展

什么是聚类分析?
聚类分析指的是一系列统计技术的集合,用于根据个体之间的相似性或差异性将数据集划分为若干个子组。其核心原则是“构建的分组使得同一聚类成员之间的关联程度强,而不同聚类成员之间的关联程度弱”。⁸ 同一聚类内的个体共享高度的内部相似性,而不同聚类中的个体则显示出有意义的差异性。事实上,聚类分析是无监督机器学习的核心方法。与强调预测并需要标记数据的监督机器学习不同,利用聚类分析的无监督机器学习不依赖外部标签,因为它们基于数据本身的特征来探索内在结构。通过在数据中识别无需预定义类别的自然分组,聚类可以利用数据中的隐藏关系揭示疾病机制、基因型或表型。⁹ 这使得它在心血管健康研究中特别有价值,例如识别心血管表型³和心理特征模式,⁷ 在这些领域中,复杂的临床信息通常包含传统方法无法捕捉的潜在结构。

聚类分析的历史发展
随着用于识别相似性的新方法的引入,聚类分析已经发生了显著演变,随后

随着时间的推移不断改进,并经过调整以处理更大的数据集和复杂的数据类型。最早的算法之一,K均值聚类(K代表聚类数量),自20世纪50年代以来已被广泛用于数据聚类。¹⁰ 大约在同一时期,基于模型的聚类方法被开发出来,为聚类提供概率框架并促进统计推断。¹¹ 在20世纪60年代,层次聚类被开发出来,用于构建由树状图(一种显示聚类序列的聚类树,每个聚类都是数据集的一个分区)表示的聚类层次结构,¹² 随后是20世纪90年代基于密度的带噪声应用空间聚类(DBSCAN),它处理不同密度的数据并应对数据中的噪声。¹³ 大数据和AI的快速发展进一步推动了聚类技术的进步。一些聚类方法越来越多地整合降维(DR)技术和数据可视化技术,以解决传统聚类方法的局限性(例如处理高维数据时的局限性)。同时,一些先进的聚类方法,如深度学习和拓扑数据分析(TDA),使研究人员能够分析更复杂的健康数据,并深入识别具有临床意义的患者亚组。

传统聚类方法及其局限性

传统聚类方法
传统的聚类方法通常可以分为两类:基于算法的方法和基于模型的方法。

基于算法的聚类
基于算法的聚类的核心原理是直接根据数据点之间的相似性或距离来划分聚类。在心血管疾病(CVD)研究中,最常用的基于算法的聚类类型是层次聚类、划分聚类(例如K均值聚类)和基于密度的聚类。图1总结了这三种聚类分析方法的核心原理、优点和缺点。9,14 这些方法经常被用于研究患者表型或识别心脏研究中的聚类。15–17


基于模型的聚类
基于模型的聚类的原理与基于算法的聚类不同。基于模型的聚类假设数据是由一个概率模型生成的,这意味着每个聚类被视为一个统计分布,个体根据其属于各组的概率被分配到聚类中。14 常用的方法包括高斯混合模型(GMM)、潜在剖面分析(LPA)和潜在类别分析(LCA)。图1展示了基于算法的聚类与基于模型的聚类之间的区别,包括基于模型的聚类的优势和挑战。基于模型的聚类的一个关键优势是它能够提供模型拟合指数,帮助研究人员确定最佳聚类数量。它还可以估计个体属于特定聚类的概率,从而提供比基于算法的聚类更高的可解释性。在实践中,GMM和LPA通常用于连续变量,而LCA更适合分类变量。

传统聚类方法的局限性
尽管传统聚类方法已在心血管健康研究中得到广泛应用,但仍存在若干局限性。一些聚类方法在处理高维数据集(如电子健康记录或遗传数据)时往往表现不佳,在这些数据中,冗余或不相关的变量可能会掩盖有意义的模式。此外,传统聚类技术可能难以处理一些整合了多种类型信息的多模态数据,例如临床变量、影像数据、可穿戴设备数据和遗传数据。这些挑战推动了某些聚类分析辅助工具的发展,如降维(DR)技术和由AI支持的更先进的聚类方法。

AI中聚类方法的演变
降维技术
在研究中,患者层面的数据通常是复杂的,包含多种变量,如人口统计学特征、临床测量值和实验室结果,从而导致高维状态(每个变量代表数据集的一个

维度)。在聚类分析或其他AI算法中,高维数据集不仅会减慢计算处理速度,还可能引入干扰模型学习的冗余或不相关特征。为了解决这个问题,在聚类分析之前会采用降维(DR)技术,以减少特征数量,同时保留主要信息。它们还可以将高维数据映射到低维嵌入空间(2D/3D空间),从而实现数据可视化并揭示隐藏结构。¹⁸

在健康研究中,最常用的三种降维方法是主成分分析(PCA)、t分布随机邻域嵌入(t-SNE)以及均匀流形近似与投影(UMAP)。主成分分析主要应用于降维、数据可视化和特征提取。¹⁹ 尽管PCA更像是一种经典统计方法而非AI技术,但作为最早和最经典的降维工具,它至今仍被广泛使用。它运行速度快,计算效率高,并具有很强的可解释性,但无法有效捕捉变量之间的非线性关系。³,²⁰ 相比之下,t-SNE和UMAP是典型的机器学习方法。t分布随机邻域嵌入是一种非线性降维技术,旨在可视化复杂的高维数据。它的工作原理是将具有相似特征的数据点在低维空间(通常为二维或三维)中放置在彼此附近,这

使得研究人员能够直观地可视化数据中潜在的数据结构或局部聚类。²¹ 均匀流形近似与投影是一种更先进的降维方法,与t-SNE相比,它能更好地保留全局结构,同时在非常大的数据集上运行得更快。²¹,²² 这三种降维方法的比较如图2所示。总之,在聚类之前选择降维方法应取决于数据集特征(例如大小、结构)、研究目标(例如降维与可视化)以及可用的计算专业知识。


然而,一些研究人员错误地将降维与聚类混为一谈,或互换使用它们。为了阐明它们的区别和互补作用,图3说明了降维技术、聚类和数据可视化是如何相互作用的。

聚类分析可以应用于原始数据或降维后的数据,具体取决于数据的维度或复杂性。当变量数量相对较少且数据集不包含过多噪声或冗余时,聚类方法可以直接应用于原始数据。否则,需要对原始数据进行降维。为了可视化整体数据结构,使用降维技术将数据转换为适合绘图的2D/3D嵌入空间,其中聚类标签内的数据点用颜色编码。²² 如果降维算法很好地保留了数据结构,并且聚类算法有效地发现了子组,那么可视化图上相同颜色的点将清晰地聚集在一起,形成不同的区域。¹⁵ 相反,如果图上的颜色混合在一起,这可能表明:(i) 聚类算法表现不佳,(ii) 在降维过程中丢失了关键信息,或 (iii) 数据集不包含明确定义的分组。在这种情况下,可能需要修改设置或尝试替代算法。


先进的无人监督机器学习方法
上述描述的聚类方法通常被认为是传统的统计或经典的无监督机器学习方法。23 近年来,随着AI的发展,更先进的技术

已经出现,例如TDA、23 张量分解和深度学习。拓扑数据分析是一种数据驱动的方法,旨在捕捉

复杂、高维和嘈杂数据集中的潜在模式。此外,TDA提供了直观的可视化,并促进了变量与组/变量之间关系的解释,因为它将个体表示为网络中的节点,并连接那些具有相似特征的节点。然而,与更成熟的聚类方法相比,目前可用于实施TDA的用户友好工具较少。24 张量分解非常适合多模态和多维数据集。23 深度学习是当前用于特征学习的最先进方法。例如,结合堆叠去噪自编码器的深度学习架构可以以无监督的方式学习预测性患者表征。25 然而,深度学习模型计算量大,需要大型数据集进行训练,并且在模型可解释性方面通常面临重大挑战。23 这些先进的聚类方法已被提出,但对其的具体讨论超出了本文的范围。因此,仅提供简要介绍。

如何实施聚类分析?
步骤1:选择合适的聚类方法
选择合适的聚类方法应以样本量、变量特征和研究目标为指导,同时还要考虑上述聚类方法的优缺点。例如,大型数据集非常适合划分方法,如K均值,而中小型数据集更适合层次聚类。从数据特征的角度来看,连续变量可以使用

层次聚类、GMM或LPA进行分析,而分类变量更适合LCA或其他划分聚类方法。对于含有异常值或噪声的数据集,基于密度的聚类更加稳健,因为它会明确地将噪声点标记出来。

可解释性和可理解性是其他重要的考虑因素。层次聚类通过树状图为研究人员提供直观的见解。基于模型的聚类通过提供模型拟合指数和后验概率(个体属于特定聚类的概率)来增强模型的可解释性。拓扑数据分析通过直观地展示变量与患者亚组之间的关系,提供了高可解释性。对于高维或多模态数据集,TDA、张量分解和深度学习可能是有效的,尽管这些方法需要更高水平的计算专业知识。图4概述了研究人员如何考虑哪种聚类分析方法最合适。


尽管本文未讨论许多其他聚类方法,但聚类方法的选择最终不仅取决于数据集和研究目标,还取决于研究人员的分析技能和领域知识,这可能会引入主观性。14

步骤2:确定最佳聚类数量
确定最佳聚类数量是聚类分析中的一个核心问题,因为聚类结果高度依赖于所选择的聚类数量。常见的方法包括轮廓分析、肘部法,以及其他指标,如组内平方和(WSS)。在K均值聚类中,随着K的增加,每个

聚类内的WSS会减少。通过绘制带有SSE值的肘部图,可以识别出一个“肘点”,它表明最合适的聚类数量(图5)。


在轮廓分析中,轮廓分数通过测量组内相似性和组间分离度来进一步评估聚类性能。轮廓分数范围从-1到1。值越接近1,表明组内相似性越高,聚类之间的分离越清晰26(图5)。此外,轮廓宽度是整体聚类有效性的重要指标。为了可视化个体样本的轮廓宽度分布,会使用轮廓图。15 根据Singh等人15的研究,有效的轮廓图具有以下特征:(i) 大多数或所有轮廓宽度(“扇叶高度”)大于0,以及 (ii) 相对较长且均匀的“扇叶高度”,表明聚类内的样本紧密聚集。许多负的轮廓宽度值表明聚类解决方案较差。

在层次聚类中,聚类数量是基于对树状图的检查来选择的。27 应注意聚类合并时的高度,因为较大的垂直距离表明更大的差异性。

对于基于模型的聚类,使用统计模型拟合指数,如BIC、AIC和熵,通常较低的BIC和AIC值以及较高的熵值表明更好的模型拟合。28 此外,还会检查对数似然值:稳定增加并收敛的值表明模型正在逐步识别出更合适的参数估计。29

最后,如前所述,降维和可视化工具也可以提供有价值的补充见解,以判断聚类方法是否成功识别出有意义的分组。

步骤3:聚类结果的验证执行验证步骤是为了确认所选聚类数量的合适性。30 因此,上述用于确定最佳聚类数量的验证指标也可以用来评估模型性能。敏感性分析也可以用来评估聚类结果的稳健性。此外,Sekula及其同事31开发了一个R包,用于确定最佳聚类算法和最佳聚类数量,特别适用于基因组数据分析。该包通过比较多种聚类方法和聚类数量,并整合统计和生物学验证指标,帮助用户选择最合适的聚类方案。因此,这个R包可以

同时用于性能评估和方法选择。此外,Saito及其同事3应用了外部验证,并在一个独立队列中重现了类似的结果。

软件聚类分析可以使用不同的软件程序进行。许多聚类算法可在广泛使用的软件编程环境中获得,如R和Python,它们为降维和聚类分析提供了大量的包。例如,R包,如stats、cluster和mclust,支持一系列聚类方法,包括层次聚类、K均值和基于模型的聚类。Mplus是一款特别适合基于模型的聚类的软件,因为它提供了灵活的建模选项和内置的模型拟合指数。虽然大多数传统聚类方法可以在个人电脑上运行,但更先进的聚类方法或处理极大型数据集可能需要更大的计算资源或硬件加速器,如图形处理单元。33

报告
首先,报告数据集的特征很重要,包括样本量和变量类型,以及任何预处理程序,如归一化(将不同变量的值缩放到一个共同或可比较的范围)和降维技术。聚类方法和算法参数,包括聚类数量、距离度量和初始化方法,也应予以报告。例如,在K均值聚类中,应报告聚类数量(K)、初始化方法(随机或基于层次聚类或其他聚类方法)、nstart(随机初始化运行次数)和最大迭代次数。此外,应明确说明用于确定最佳聚类数量的方法,如轮廓分数、肘部法或模型拟合指数(例如AIC、BIC和熵)。最后,应报告验证程序,如内部验证、敏感性分析,或使用独立数据集进行的外部验证。

结论
聚类分析是一种强大的方法,可以帮助研究人员揭示心血管疾病(CVD)患者的异质性。尽管存在局限性,例如选择聚类数量时的主观性、不同方法学选择导致的结果变异性,以及解释结果需要临床专业知识,但它对于识别隐藏的患者亚组并实现个性化护理和精准医学仍然具有价值。随着大数据、电子健康记录和机器学习技术的快速发展,聚类分析可以作为理解复杂异质性数据并利用这些资源的垫脚石。通过将聚类分析与监督机器学习方法相结合,研究人员可以构建预测模型,用于实时患者模式识别,并更好地实现精准护理的潜力。

原文链接:https://doi.org/10.1093/eurjcn/zvag100

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

都市快报橙柿互动
2026-10-05 00:27:48
事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

孤城落日
2026-10-05 16:53:01
特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

台州交通广播
2026-10-05 08:37:45
深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

无情有思可
2026-10-05 16:13:32
《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

喵喵的追剧笔记
2026-10-05 19:09:22
广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

极目新闻
2026-10-04 22:59:09
国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

先锋新闻
2026-10-05 15:17:26
中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

职场资深秘书
2026-10-05 14:17:32
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

史海流年号
2026-10-03 15:16:56
央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

黄河新闻网吕梁
2026-10-05 16:52:56
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

南方都市报
2026-10-05 18:58:05
乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

极目新闻
2026-10-05 22:19:09
出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

掠影后有感
2026-10-05 09:20:34
空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

王老师你还好吗
2026-10-05 14:48:03
“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

都市快报橙柿互动
2026-10-05 19:13:23
市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

揭秘世间万象
2026-10-05 19:31:03
大唐不夜城人均消费一块五引质疑

大唐不夜城人均消费一块五引质疑

热点追踪人
2026-10-05 15:04:00
2026-10-05 22:47:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
家居
亲子
数码
教育

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

教育要闻

聪明的父母,大多是“农民思维”

无障碍浏览 进入关怀版