Quasi-Bayesian sequential deconvolution
准贝叶斯顺序反卷积
https://arxiv.org/pdf/2408.14402
![]()
![]()
摘要
密度反卷积是一个逆问题,其目标是从被加性噪声污染的观测数据中估计一个概率密度。该问题传统上在静态或批量设置下进行研究,但如今越来越多地出现在流式数据场景中,而现有的频率学派和贝叶斯方法在其中面临巨大的计算瓶颈。我们基于牛顿递归算法,开发了一种用于序贯密度反卷积的拟贝叶斯非参数方法。所得估计量易于评估,且可扩展至大规模数据集,因为其每个观测值的计算成本在新数据到达时保持不变。拟贝叶斯解释使得不确定性量化成为可能:局部和均匀中心极限定理分别给出了渐近置信区间和置信带。在频率学派的数据生成模型下,我们证明了所提估计量的L1一致性,并表明其渐近等价于在未受污染变量被直接观测时所能获得的估计量。此外,在额外的正则条件下,我们推导了一个L1-沃瑟斯坦收敛速率,并证明了其以显式速率与狄利克雷过程混合模型下的贝叶斯非参数后验均值估计量融合。合成数据实验,以及一项按采集顺序排列的流式细胞术应用,展示了与贝叶斯非参数和傅里叶反卷积方法相当的准确性,同时提供了显著的计算优势。
关键词:可信带;牛顿算法;拟贝叶斯学习;序贯密度反卷积;沃瑟斯坦距离
第1章 引言
1.1 背景与动机
![]()
当观测数据因潜在信号的测量误差而变得模糊或失真时,密度反卷积问题就会出现(Buonaccorsi, 2010; Yi et al., 2021)。该问题传统上在静态或批量设置下进行研究,但在自然科学和社会科学中有着广泛的应用,包括医学成像、生物信息学、基因组学、化学、光谱学、天文学和计量经济学。随着这些领域中流式数据的日益普及,以及社交媒体分析、遥感、电子商务和隐私保护数据分析等新兴应用的出现,对在线或序贯方法的需求日益增长,以便在新观测数据到达时能够及时进行推断并快速适应。尽管现有的频率学派和贝叶斯方法原则上可以适用于流式数据,但它们通常会因重复优化或后验模拟而带来巨大的计算成本。此外,目前尚无一种原则性的序贯密度反卷积方法能够同时具备理论保证和经过实证的有效性。我们通过一个专为流式数据设计的可扩展且具有理论基础的框架来填补这一空白。
1.2 我们的贡献预览
![]()
![]()
![]()
![]()
我们通过合成数据和真实数据分析来说明所提出的方法。在合成数据实验中,我们考虑了在拉普拉斯(普通光滑)和高斯(超光滑)噪声分布下的高斯位置-尺度混合模型。我们将所得估计与基于狄利克雷过程混合模型的贝叶斯非参数方法(分别使用序贯蒙特卡洛和批量算法实现)的估计进行比较,发现两者的实证表现相当,但我们的方法在计算上具有显著优势。然后,我们分析了关于分化小鼠胚胎干细胞中报告基因荧光强度的流式细胞术数据。通过保留采集顺序并考虑数据流的嵌套前缀,该应用展示了随着观测数据的逐步获得而进行的序贯学习。所得估计与前述序贯贝叶斯非参数估计以及批量岭正则化傅里叶反卷积估计进行了比较。
1.3 相关工作
我们的工作与关于预测性或递归推断的日益增长的文献相关,这些文献被称为“后贝叶斯”框架。该文献包括了关于预测分布和鞅后验的最新进展(Cappello,2018;Hahn等,2018;Fong等,2023;Fong和Yiu,2024;Holmes和Walker,2023;Agnolettto等,2025;Battiston和Cappello,2025;Fortini和Petrone,2025;Yung等,2025),以及关于广义贝叶斯更新的研究(Bissiri等,2016;Knoblauch等,2022)。尽管这些贡献提供了重要的见解,并将广泛的方法统一在共同的拟贝叶斯视角下,但它们迄今为止都集中在直接问题上,即被观测到的情况。相比之下,我们的工作处理的是逆问题,即仅有被污染的 可用,从而将预测推断的范围扩展到了一类新的问题上。
1.4 论文结构
第2节介绍用于密度反卷积的拟贝叶斯学习模型,第3节发展序贯估计和不确定性量化,第4节建立所得估计量的渐近频率学派保证。第5节和第6节分别介绍合成数据和真实数据分析。第7节在讨论中总结了未来研究的方向。补充材料包含证明和额外的数值说明。
第2节 拟贝叶斯密度反卷积
2.1 密度反卷积的学习过程
在贝叶斯框架中,似然函数和先验共同指定了一个模型,由此产生的预测分布决定了学习过程,即在数据逐步可用时推断如何更新。预测框架则颠倒了这一视角,通过一个预测分布序列直接指定学习过程;参见 Fortini and Petrone (2025)及其中的参考文献。在适当的条件下,该序列隐式地同时确定了先验和对应的(随机)目标参数。预测分布描述的是学习机制而非数据生成过程,因此观测值不必是独立的。我们采用这一框架来处理密度反卷积问题。
![]()
![]()
2.2 学习过程(2)-(4)的拟贝叶斯性质
![]()
![]()
![]()
第3节 序贯估计与不确定性量化
3.1 预备知识
![]()
![]()
3.2 渐近可信区间
![]()
![]()
![]()
![]()
第4节 频率学派性质
4.1 预备知识
![]()
![]()
![]()
4.3 与狄利克雷过程混合模型的融合
![]()
![]()
![]()
![]()
![]()
![]()
![]()
第5节 合成数据分析
5.1 单峰示例
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
5.2 双峰示例
![]()
![]()
关于双峰示例的更详细分析,包括蒙特卡洛可信区间和可信带以及拟贝叶斯方法与贝叶斯方法之间的比较,参见 C.1.2。第二个合成数据双峰示例在 C.1.3 中研究。C.1.2–C.1.3 中的分析均在拉普拉斯和高斯噪声分布下进行。
第6节 真实数据分析
我们考虑了 Torregrosa-Cortés 等(2023)关于分化小鼠胚胎干细胞中中胚层转录因子 Brachyury 表达的流式细胞术数据。在流式细胞术中,细胞逐个通过激光束,发射光和散射光被转换为每个检测器通道的数字强度测量值。标记细胞的荧光既包含目标报告信号,也包含内在的背景成分(即自发荧光),后者可能掩盖低表达水平。因此,实验中包含单独的标记和未标记细胞群体,后者表征背景分布(Torregrosa-Cortés 等,2023)。这产生了一个反卷积问题,旨在恢复潜在报告信号的群体分布。由于细胞被连续记录,我们保留了它们的采集顺序,并将观测数据作为序贯数据进行处理,而不是作为任意排序的静态样本。实验设置的更多细节见 C.2.1。
![]()
关于流式细胞术数据的更详细分析,包括对高斯、拉普拉斯和四分量高斯混合噪声分布的敏感性分析(后者最初由 Torregrosa-Cortés 等(2023)提出),参见 C.2.1;对于这些分析,我们还报告了带有重建(代理)版本报告基因荧光样本直方图的图。另外两项关于恒星金属丰度数据和有功功率输出数据的真实数据分析分别在 C.2.2 和 C.2.3 中给出。
第7节 讨论
尽管我们的分析集中在单变量观测值上,所提出的拟贝叶斯序贯方法自然可以推广到多变量设置。牛顿递归更新的结构保持不变,但每次更新的计算成本随维数增加而增加,主要原因是数值积分的复杂性增大。我们预期局部中心极限定理及相关的可信区间在高维情形下仍然成立,一致性、融合等渐近频率学派性质也依然成立。然而,多变量设置中的不确定性量化带来了额外的挑战:特别是,构造均匀可信带变得更加复杂,因为其宽度通常随维数增加而增加,可能限制可解释性和覆盖精度。
![]()
一个自然的推广涉及未知的噪声分布。关于在静态或批量设定下信号和噪声联合估计的最新进展表明,递归策略可以适用于这种情况。拟贝叶斯序贯实现是未来研究的一个重要方向,也与流式设置中隐私保护推断有关,其中噪声是通过已知或部分已知的扰动机制有意引入的(Dwork 等,2010;Cardoso 和 Rogers,2022;He 等,2024)。
原文链接:https://arxiv.org/pdf/2408.14402
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.