Understanding High-Dimensional Bayesian Optimization
理解高维贝叶斯优化
https://arxiv.org/pdf/2502.09198
![]()
![]()
摘要
近期有研究报告称,简单的贝叶斯优化方法在高维现实世界任务中表现良好,这似乎与先前的研究和业内共识相矛盾。本文对此进行调查。我们识别出高维贝叶斯优化中出现的潜在挑战,并解释近期方法为何成功。我们的实证分析表明,由高斯过程初始化方案引起的梯度消失在高维贝叶斯优化失败中扮演了主要角色,而促进局部搜索行为的方法更适合该任务。我们发现,高斯过程长度尺度的最大似然估计足以实现最先进的性能。基于此,我们提出了一种名为MSR的简单MLE变体,利用这些发现在一组全面的现实世界应用中达到了最先进的性能。
我们通过有针对性的实验来展示和验证我们的发现。
1. 引言
贝叶斯优化(BO)已广泛应用于优化航空航天工程 [Lukaczyk et al., 2014]、药物发现 [Negoescu et al., 2011]、机器人学 [Lizotte et al., 2007; Calandra et al., 2016; Rai et al., 2018; Mayr et al., 2022] 或金融 [Baudiš & Pošík, 2014] 等领域中出现的昂贵评估黑箱函数。
尽管贝叶斯优化在低维设置中已被证明可靠,但高维空间因维数灾难(COD)而具有挑战性,维数灾难要求随着问题维度的增加,数据点呈指数增长以保持相同的精度。已有几种方法将贝叶斯优化扩展到高维空间,但需对目标函数附加假设以降低数据需求,例如可加性(Duvenaud et al., 2011; Kandasamy et al., 2015; Hoang et al., 2018; Han et al., 2021; Ziomek & Ammar, 2023; Bardou et al., 2024)或存在低维活性子空间(Wang et al., 2016; Nayebi et al., 2019; Letham et al., 2020; Papenmeier et al., 2022)。若无此类假设,过去普遍认为采用高斯过程(GP)代理模型的贝叶斯优化在常见评估预算下仅限于约20维(Frazier, 2018; Moriconi et al., 2020)。最近,Hvarfner et al. (2024) 和 Xu & Zhe (2024) 报告称,简单的贝叶斯优化方法在高维真实世界基准测试中表现良好,往往超越更复杂算法的性能。
由于其诸多有影响力的应用,高维贝叶斯优化(HDBO)近年来已成为活跃的研究领域(Binois & Wycoff, 2022; Papenmeier et al., 2023)。尽管边界已被显著推进,但性能提升的原因并非总能被彻底查明。例如,在BODi(Deshwal et al., 2023)和COMBO(Oh et al., 2019)算法中,后续研究发现这些方法受益于其评估中普遍存在的特定基准结构(Papenmeier et al., 2023)。类似地,Nayebi et al. (2019) 的一项评估表明,一些先前方法的性能对搜索空间中最优值的位置敏感。
本文的动机源于近期对更严格审视和探索性研究的呼吁(Herrmann et al., 2024)。通过详尽实验,我们首先识别高维中出现的潜在挑战,然后考察最先进的高维贝叶斯优化方法,以理解它们如何缓解这些障碍。基于这些见解,我们提出了一种更简单的方法,即使用高斯过程长度尺度的最大似然估计(MLE),称为MLE缩放与RAASP(MSR)。我们证明,MSR足以实现最先进的高维贝叶斯优化性能,而无需像最大后验(MAP)估计那样指定长度尺度的先验信念。我们注意到,实践者通常不拥有此类先验,而是依赖基准测试的经验性能。具体而言,我们改变了长度尺度的初始化方式,以避免高斯过程似然函数中容易在高维空间出现但至今在贝叶斯优化中被忽视的梯度消失问题。
此外,我们提供的经验证据表明,在极高维问题(约1000维)上,良好的贝叶斯优化性能归因于局部搜索行为,而非代理模型的良好拟合。总结而言,我们做出以下贡献:
我们识别出高维贝叶斯优化(HDBO)中出现的潜在挑战,并解释近期方法为何成功。我们表明,梯度消失和局部搜索行为在HDBO中至关重要。
我们发现,高斯过程长度尺度的最大似然估计(MLE)足以实现最先进的性能。我们提出了一种名为MSR的简单MLE变体。
我们在一个全面的真实世界应用集合以及一系列针对性实验上评估了MSR,这些实验说明并证实了我们的发现。
2. 问题陈述与相关工作
![]()
本文聚焦于直接在搜索空间中操作的高维贝叶斯优化(HDBO)。其他HDBO方法包括线性(Nayebi et al., 2019; Wang et al., 2016; Letham et al., 2020; Papenmeier et al., 2022; 2023)或非线性(Tripp et al., 2020; Moriconi et al., 2020; Maus et al., 2022; Bouhlel et al., 2018; Chen et al., 2020)嵌入,以从低维子空间映射到输入空间。
输入空间中的高维BO
在文献中,直接在三维搜索空间 X X中操作的高维贝叶斯优化(HDBO)通常被认为由于维数灾难(COD)而不可行。已有众多方法被提出,通常利用对目标函数 f f的假设,例如可加性(Kandasamy et al., 2015; Gardner et al., 2017; Wang et al., 2018; Mutny & Krause, 2018; Ziomek & Ammar, 2023)或轴对齐性(Eriksson & Jankowiak, 2021; Hellsten et al., 2023; Song et al., 2022),这些假设在满足时能简化问题并提高样本效率。其他方法则识别搜索空间中与优化相关的区域,例如使用信任域(TRs)(Regis, 2016; Pedrielli & Ng, 2016; Eriksson et al., 2019)或通过划分空间(Wang et al., 2020)。
![]()
3. 维数灾难的各个方面
本节讨论维数灾难如何影响高维贝叶斯优化(HDBO)以及缓解这些挑战的技术。
3.1. 模型拟合中的梯度消失
![]()
![]()
![]()
![]()
缓解梯度消失的方法。应对梯度消失的一种策略是用最大后验估计(MAP)替代 MLE,通过对长度尺度选择一个偏好长长度尺度的超先验:
![]()
![]()
![]()
![]()
3.2. 采集函数的梯度消失
![]()
![]()
缓解AF梯度消失的方法。
![]()
随着维度的增加或长度尺度的减小,AF最大化器选择的多起始点GD例程的起始点越来越可能来自RAASP样本。图4(右图)说明了这一点。此处,我们从具有不同维度( x -轴)和长度尺度( y -轴)初始化的GP中抽取实现。对于每个实现,我们使用RAASP采样最大化AF,并绘制所有候选点中来自RAASP样本且具有最大采集值的候选点百分比。百分比越高表示采样越“局部”。我们进一步对5次随机重启进行平均。具有最大采集值的RAASP候选点百分比随输入维度的增加而增加,随长度尺度的减小而减小。同时,这些候选点保持接近初始候选点。这显示在图4(左图)的右下角,该图显示了使用RAASP采样时AF最大化器候选点移动的平均距离。使用RAASP采样时,候选点移动了正距离,由灰色区域的缺失所体现。这表明梯度消失问题有所缓解。我们将此归因于候选点是在接近当前最优观测值的地方生成的,在那里AF不太可能是平坦的。
![]()
![]()
![]()
3.3. 拟合GP时的偏差-方差权衡
GP模型通常通过最大化MLL来拟合,要么使用无偏MLE估计,要么使用MAP,后者在一个或多个GP超参数上放置超先验。
MLE表现出较高的方差和对噪声的敏感性,尤其是在高维空间中使用稀疏数据拟合模型时。另一方面,MAP在长度尺度估计上具有较低的方差,但代价是存在偏差,除非有准确的先验信息可用。MLL由下式给出:
![]()
第一个和第二个项通常被称为数据拟合项和复杂度惩罚项(Williams & Rasmussen, 2006)。更多细节请参见附录A。本节探讨这两种常用的GP模型拟合方法之间的偏差-方差权衡。
![]()
![]()
![]()
![]()
MAP。MAP允许纳入关于超参数合理取值的先验信念。然而,实践者通常并不具备此类先验信息,因此转而采用据报告在基准测试中表现良好的超先验。Karvonen & Oates (2023)批评这是一种“武断的”超参数确定方式。
![]()
4. 讨论
![]()
![]()
我们还与SAASBO(Eriksson & Jankowiak, 2021)、TuRBO(Eriksson et al., 2019)和Bounce(Papenmeier et al., 2023)进行了比较。SAASBO的计算运行时间较长。因此,我们仅对其运行500次迭代,并终止超过72小时的运行。这就是为什么SAASBO在Ant和Humanoid上的评估次数较少。
我们的基准测试包括由Eriksson & Jankowiak(2021)引入的124维软约束版Mopta08基准(Jones, 2008)、180维Lasso-DNA(Šehić et al., 2022)、388维SVM(Eriksson & Jankowiak, 2021)、60维Rover(Eriksson et al., 2019),以及Hvarfner et al.(2024)使用的两个888维和6392维的Mujoco基准。前四个基准是无噪声的,而其他的则存在观测噪声。
![]()
![]()
![]()
![]()
![]()
RAASP降低方差。
图9显示了DSP的一个令人惊讶的行为。正如人们所预期的那样,估计的长度尺度在优化开始时通常接近超先验的众数。然而,随后它们在所有基准测试(除了6392维的Humanoid基准)上都收敛到更高的值。此外,与先验众数的偏差在较低维基准中更为明显,这与我们在第3.3节中对偏差-方差权衡的分析一致。在其执行开始时,使用带有缩放初始长度尺度的MLE的BO算法(‘MLE (scaled)’)使用的长度尺度比所有其他方法都长。在高维Ant和Humanoid问题上,由此产生的估计值变化显著,这支持了我们在第3.3节中的分析,即MLE与MAP相比具有相对较高的方差。
MSR获得的长度尺度介于DSP和“不使用RAASP采样的MLE”(绿色点,大多数基准中的‘MLE (scaled)’)的值之间。Ant是一个例外,MSR有时产生比DSP更短的长度尺度。总体而言,作为MSR和‘MLE (scaled)’之间唯一区别的RAASP采样,获得了更一致的长度尺度估计。
![]()
![]()
关于流行的HDBO基准的注释。在图9中,所有方法在Mopta08和Lasso-DNA基准上收敛到相似的长度尺度。这可能归因于这些流行基准的特定属性,如我们在附录D中所讨论的。简而言之,这些基准具有简单的结构,有利于长长度尺度的模型,这带来了算法可能“过拟合”于这些基准的风险。
5. 结论与未来工作
我们的分析揭示了高维贝叶斯优化(HDBO)中的潜在挑战,同时为提高HDBO方法提供了实用见解。我们证明了常见的拟合高斯过程(GP)的方法在高维中会导致梯度消失。我们提出了一种最大似然估计(MLE)的初始化方法,该方法在已有的HDBO基准测试上取得了最先进的性能,而无需最大后验估计的假设。最后,我们提供的经验证据表明,将MLE与随机轴对齐子空间扰动(RAASP)采样相结合,可以降低长度尺度估计的方差,并产生更接近DSP所学习到的值,这为在HDBO中包含RAASP采样提供了新的论据。
在未来的工作中,我们将继续仔细审查流行的基准测试,并提出保留真实世界应用特征的新颖且具有挑战性的基准测试。此外,本工作强调了数值稳定性对于高维贝叶斯优化(BO)性能的重要性。因此,我们建议从这一角度出发来开发模型和采集函数(AFs)。
我们的工作侧重于GP代理模型,但我们将探索我们的发现在多大程度上可以推广到其他代理模型,如随机森林或贝叶斯神经网络。
最后,我们将探索如何通过将MSR与信任域(TRs)(Eriksson et al., 2019)、自适应子空间嵌入(Papenmeier et al., 2022)或加性结构(Duvenaud et al., 2011)相结合,利用我们的发现来改进已有的HDBO技术的性能。
原文链接:https://arxiv.org/pdf/2502.09198
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.