网易首页 > 网易号 > 正文 申请入驻

LLM驱动的贝叶斯优化:偏好引导科学发现框架

0
分享至

LLM驱动的贝叶斯优化:偏好引导科学发现框架

UNLEASHING LLMS IN BAYESIAN OPTIMIZATION:

PREFERENCE-GUIDED FRAMEWORK FOR SCIENTIFICDISCOVERY

https://arxiv.org/pdf/2605.17976



摘要

科学发现日益受到昂贵实验和有限资源的约束,凸显了在人工智能驱动的科学中实现高效优化的必要性。贝叶斯优化虽因平衡探索与利用而被广泛采用,但在高维设置中常表现出冷启动性能缓慢和可扩展性差的问题,这限制了其在现实世界科学问题中的适用性。为克服这些挑战,我们提出了LLM引导的贝叶斯优化(LGBO),这是首个将大语言模型的语义推理持续整合到优化循环中的LLM偏好引导贝叶斯优化框架。与以往仅将LLM用于热启动初始化或候选点生成的工作不同,LGBO引入了一种区域提升偏好机制,将LLM驱动的偏好嵌入每一次迭代,以稳定且可控的方式偏移代理模型的均值。理论上,我们证明在最坏情况下LGBO的表现不会显著差于标准贝叶斯优化,而在偏好与目标一致时则能实现显著更快的收敛。实验上,LGBO在物理、化学、生物学和材料科学的各种干燥基准测试中一致优于现有方法。尤为突出的是,在一项新的Fe-Cr电池电解液湿实验室优化中,LGBO在6次迭代内达到最佳观测值的90%,而标准贝叶斯优化和现有LLM增强基线则需要10次以上。综合来看,这些结果表明LGBO为将LLM整合到科学优化工作流程中提供了一条有前景的方向。

1 引言

传统实验方法长期推动着科学发现。然而,其劳动密集和耗时的特性持续限制着新见解出现的速度。为缓解这些瓶颈,自驱动实验室将机器人执行与人工智能相结合,实现了系统化、高通量的探索。在这些平台中,贝叶斯优化已成为一种强大策略,在平衡探索与利用的同时,提供了有原则的不确定性量化。

贝叶斯优化已在多个科学领域取得成功,但面临两个众所周知的挑战。第一,早期实验数据的稀缺使得冷启动优化缓慢且低效。第二,高维参数空间带来维度灾难,进一步限制了可扩展性。这些问题往往在最需要贝叶斯优化的场景——即探索性、高成本的科学任务中——阻碍了其应用。已提出了多种加速策略,包括迁移学习、嵌入方法和自适应划分。然而,这些方法均未完全解决冷启动瓶颈。

近期尝试将大语言模型引入贝叶斯优化。第一类工作利用LLM进行预热,让模型在优化循环开始前提出初始设计点。当任务与模型知识良好对齐时,此策略可提供强先验,从而加速原本缓慢的冷启动阶段。第二类工作利用LLM在循环过程中提出候选点,然后由标准采集函数进行重新排序或筛选。这些方法展示了语言先验的潜力,但也存在一个关键局限:LLM的引导仅被松散地嵌入优化循环中——要么仅在初始化时注入一次,要么在后续被采集函数覆盖。这引出了一个核心问题:

我们能否设计一个在整个优化过程中更充分整合LLM偏好的贝叶斯优化框架,而非将其局限于预热初始化或辅助候选点提案?

为此,我们提出了LLM引导的贝叶斯优化(LGBO)框架。LGBO不将LLM局限于一次性建议,而是将其视为专家先验,在整个采集过程中提供偏好和方向性引导。这使得优化器在LLM推理具有信息性时能够加以利用,同时在信号较弱或存在噪声时保持鲁棒性。

我们还在多样化的科学优化任务中评估了这一框架。结果表明,当LLM引导具有信息性时,能够大幅加速贝叶斯优化,而在信号较弱时性能仍具有竞争力。此外,我们提供了确保框架一致性的理论保证。我们的贡献如下:

  1. 我们提出了一种LLM偏好贝叶斯优化框架,通过持续偏好引导将LLM专业知识融入贝叶斯优化,超越了现有的热启动或候选点提案范式。

  2. 我们提供了理论保证,表明对齐的LLM引导能够显著加速收敛,即使在误导性引导下,额外代价也具有可证明的上界。

  3. 我们在广泛的科学优化任务套件上验证了该框架,涵盖多种干燥基准测试和一项湿实验室电解液优化实验,证明了其通用性和实用价值。

2 相关工作

在本节中,我们回顾现有研究并分析其局限性。我们首先介绍将大语言模型融入贝叶斯优化的方法,然后转向人在回路的贝叶斯优化方法,其中专家偏好引导搜索过程,最后讨论这两条线索如何与我们的框架相关联。

2.1 贝叶斯优化中的大语言模型

在回顾LLM如何被整合之前,先回顾一下什么是贝叶斯优化会有所帮助。贝叶斯优化提供了一种在直接测试目标昂贵且耗时的情况下搜索最佳解决方案的方法。其核心思想是将真实目标视为一个“黑箱”:我们可以尝试不同输入并观察输出结果,但我们不知道其精确公式。为使搜索更高效,贝叶斯优化构建一个代理模型——通常是高斯过程——基于已测试过的点来近似该黑箱。在每一步中,该代理模型会随新观测结果而更新,并且定义在代理模型上的采集函数会提出下一个待评估的点。随后从真实黑箱中获得新的输出结果,之后代理模型再次更新,循环往复。

近期,研究探索了利用大语言模型来辅助这一贝叶斯优化过程。LLAMBO利用LLM通过信息丰富的初始点来热启动优化,并基于过往评估生成候选样本。然而,每次迭代的最终决策仍然由代理模型上的标准采集函数做出,使得LLM的推理仅被间接涉及。后续研究在领域特定设置中探索了类似思路。ADO-LLM将LLM辅助的候选点提案应用于模拟电路设计,ReasoningBO则强调了上下文推理如何丰富候选点生成。最近,LLINBO提出了一个更为系统的“LLM在回路中”的框架,专门针对贝叶斯优化的早期探索阶段设计,以解决冷启动问题。此外,在科学发现领域之外,其他领域也涌现出若干LLM-贝叶斯优化方法。例如,BOPRO是一种通过上下文学习将大语言模型作为隐式贝叶斯先验的方法。相比之下,CAKE则利用LLM构建针对特定任务定制的核函数,从而在复杂输入空间上实现结构化且数据高效的优化。

然而,在上述所有框架中,LLM都被视为辅助组件而非回路中的有机组成部分,其引导仅被部分且间接地纳入。这一差距推动了将不断演化的模型偏好持续且系统地嵌入优化回路的开发需求。

2.2 贝叶斯优化中的人类专家

一个自然的灵感来源是人在回路的贝叶斯优化,其中算法利用了专家通常更容易提供偏好或定性指导而非精确数值标签这一事实。早期关于基于偏好的贝叶斯优化的研究形式化了如何将此类比较判断整合到采集策略中。更近期的系统通过建模专家可靠性或通过定向查询逐步获取知识来扩展这一思路,表明即使在不完整或有噪声的情况下,专家反馈也能显著提高样本效率。

ColaBO提供了一个通用框架,其中专家指定一个偏好,优化器根据沿这些采样路径识别出的最佳候选与该偏好的对齐程度,对采样路径进行重新加权。该设计对输入通常稳定且在初始化时一次性给出的人类专家有效。然而,当将LLM作为专家时,出现了两个挑战。首先,由于ColaBO仅接受初始偏好,它无法自然地整合优化过程中更新的引导,使得LLM持续推理的能力未被充分利用。其次,如果偏好随时间被修正,所需的采样路径重新加权将需要持续更新,这可能引入不稳定性甚至发散。这些因素使得ColaBO不太直接适用于LLM引导的贝叶斯优化,并表明需要能够以稳定方式嵌入不断演化的模型偏好的框架。

3 LLM引导的贝叶斯优化

我们提出LLM引导的贝叶斯优化(LGBO),这是一个以稳定且易处理的方式将大语言模型整合到贝叶斯优化中的框架。其关键挑战在于如何在不牺牲数学严谨性的前提下融入外部偏好:标准贝叶斯优化纯粹依赖于数据驱动的后验分布,而针对人类专家的基于偏好的扩展则假设反馈是稀疏的、稳定的或一次性的。相比之下,LLM引导是迭代的、粗略的,且可能带有噪声。直接将此类信号注入采集函数可能使优化循环失稳。

LGBO通过区域提升偏好(region-lifted preference)机制应对这一挑战,该机制将LLM建议转化为轻量级先验,从而偏移代理模型的均值,但保持其协方差不变。这种设计使得语义引导能够持续地被纳入,同时保留贝叶斯优化的统计特性。第3.1节提供标准贝叶斯优化和已有专家引导贝叶斯优化的预备知识,第3.2节介绍作为LGBO框架核心部分的区域提升偏好,第3.3节详述优化循环,第3.4节给出理论保证。

3.1 预备知识

我们首先回顾贝叶斯优化的基本设定以及融入外部偏好所面临的挑战。


3.2 核心工具:区域提升偏好







3.3 LGBO 框架

LGBO 在连续循环中将这些区域提升偏好整合到贝叶斯优化中。LLM 的输出并非直接改变采集函数,而是在每次迭代中重塑代理模型。这既保持了鲁棒性,又允许语义引导随实验数据一同演化。

从热启动到持续引导。先前的方法以有限的方式使用 LLM:要么提供一次性的初始化,要么提供辅助候选点而后由采集函数进行筛选。在两种情况下,引导仅与优化循环松散地连接。LGBO 与这些方法不同,它将 LLM 偏好嵌入到每一次迭代中。在每一次迭代中,代理模型不仅受新收集的实验数据的影响,还受更新的 LLM 偏好的影响,这些偏好通过区域提升先验被系统地纳入。这种设计使得语义信号(如领域启发式或定性趋势)能够在整个过程中塑造代理模型,确保 LLM 推理与数据同步演化,并成为优化循环中持久的一部分。

工作流程。LGBO 循环如图 1 所示,遵循标准贝叶斯优化的结构,但有一个关键修改:在每次迭代中注入区域提升更新。该过程始于初始化阶段,LLM 基于先验知识提供起始点。每次评估之后,高斯过程代理模型被重新训练,并以结构化提示词查询 LLM,该提示词包含固定组件(领域知识、约束条件和所需输出格式)以及一个动态用户提示词,其中汇总了实验历史及上一轮的推理轨迹。随后模型输出一个带置信度分数的点或区域,该输出被转换为区域提升偏好,并作为均值偏移应用于代理模型的均值,同时保持协方差不变。随后采集函数(如 EI 或 UCB)基于此更新后的代理模型选择下一个实验。通过重复这一循环,LGBO 持续整合语义引导,同时采集函数对决策制定保持完全控制。完整的提示词规范见附录 B。


语义引导的优势。这种设计使得 LGBO 能够利用纯数据驱动方法无法触及的 LLM 推理的某些方面。例如,模型可以突出由化学直觉(如“较高温度和较低浓度可能加速反应产率”)或跨领域类比(如在材料成分之间建立相似性)所建议的区域。通过将此类区域信号嵌入代理模型,LGBO 将探索引导至具有科学意义的区域,同时不放弃贝叶斯优化的统计严谨性。

保证。我们的框架提供了两种互补的保证:在引导不相关或具有误导性的最坏情况下,所引发的提升仅会放大代理模型的范数界,因此遗憾值仍保持在标准贝叶斯优化的常数倍以内;当引导与真实目标一致时,有效半径缩小,从而产生更严格的遗憾界(见第 3.4 节)。因此,LGBO 被证明是安全的,同时在偏好具有信息性时能够显著加速收敛。

3.4 理论保证


这种“冻结提升”设定是一个合理的抽象,因为在科学优化任务中,具备领域知识的 LLM 往往表现出结构上连贯的行为:一旦模型识别出与接近最优或高质量区域相关的特征,其建议区域倾向于聚集在相似区域附近,而非在迭代间剧烈波动。因此,固定方向可作为稳定类别区域偏好的代表性替代,同时避免了分析完全自适应序列的技术复杂性。



4 实验

我们在两种设置中评估 LGBO:干燥实验,使用预先收集的公共数据集;以及湿实验,在实际实验室中进行。干燥实验提供有限的设计-响应配对集合,可从中确定离线最优值。虽然该最优值可能与底层物理系统的真实全局最优值不一致,但它可作为算法比较的一致参考。相比之下,湿实验涉及一项正在进行中的任务,数据有限、存在测量噪声且最优值未知,代表了优化必须在实验室约束下进行的现实场景。

4.1 实验设置

基线方法。采用两种代表性方法进行比较:(i) GPBO,使用Matérn-5/2核的标准高斯过程贝叶斯优化框架;(ii) LLAMBO(Liu等),一种最先进的LLM增强贝叶斯优化方法,利用语言模型进行热启动初始化和候选点生成。

实现细节。所有方法使用相同的代理模型(带Matérn-5/2核的高斯过程)和对数 q E I 采集函数。高斯过程超参数在每次迭代后通过边际似然重新优化。每次运行以两次初始评估开始:GPBO使用Sobol初始化,而 LLAMBO和 LGBO为公平起见共享相同的LLM建议点。结果以五次随机种子的均值±方差偏差报告。对于基于LLM的方法,我们使用 Intern-S1-241B,一个科学领域的预训练大模型(Bai等,2025)。提示词的设计使得任务特定目标或种子不被暴露,确保LLM无法依赖记忆的知识。

干燥实验数据集。使用四个基准数据集来评估跨科学领域的通用性。详细规范见附录C:


4.2 干燥实验

图2展示了LNP3的主要结果。性能轨迹(左图)显示LGBO收敛更快且达到比两种基线更高的最终目标值:GPBO受困于冷启动,而LLAMBO改善了早期进展但很快趋于平稳。轨迹热图(右图)进一步显示,LGBO在随机种子间的收敛一致性远高于其他方法,而GPBO和LLAMBO表现出较大的变异性。这种稳定性并非偶然:通过区域提升持续纳入具有领域信息的LLM偏好,LGBO保持了连贯的搜索方向,避免了无信息性的探索。为完整起见,附录D.1提供了采样点的配对图,显示LGBO避免了大范围的无信息探索区域,与其降低的方差和更快的收敛一致。


在其他基准测试中(图3),LGBO一致地实现了更强的性能。在HPLC上,任务噪声很高,所有方法波动均较大,但LGBO仍保持了最高的最终性能。在Cross-barrel上,低维设计空间使GPBO表现尚可,但LGBO达到了最佳的韧性,并在最优值附近进行了更有效的探索。在Concrete上,LGBO和LLAMBO均受益于LLM热启动,但LGBO进一步更快地逃离局部最优,最终获得更高的抗压强度。综合来看,这些结果突显了LGBO在含噪、简单和实际工程设置中的鲁棒性和通用性。


湿实验。在Fe-Cr电解液优化中(图4),LGBO快速识别出有前景的区域,并在第六次迭代时超过最佳观测值的90%,而基线方法需要更多的评估次数。随着优化的推进,LGBO稳步改进其代理模型并集中于高性能区域,获得了更高的最终性能和更低的运行间方差。相比之下,GPBO和LLAMBO探索分散且往往次优的区域;后者进一步受限于采集函数筛选,当高斯过程代理模型较粗糙时,该方法无法利用LLM引导。综合来看,这些结果表明LGBO能够有效地将领域知识转化为加速且更可靠的收敛。


4.3 消融实验

为厘清LGBO中不同组件的贡献,我们在HPLC数据集上进行了两项消融实验,该数据集作为主要结果之外的代表性基准。

不同LLM骨干网络。为评估鲁棒性,我们将Intern-S1替换为不同规模和能力的骨干网络:Intern-S1-mini-7B,以及两个更大的通用大语言模型,Qwen3-235B-Instruct和Qwen3-235B-Thinking。如图5所示,较大的模型表现出更强的稳定性,且当在科学领域进行预训练时稳定性进一步增强。同时,Thinking变体倾向于达到更高的最终值但收敛更慢,很可能是因为在严格提示下,其指令遵循能力较Instruct模型更弱。这些结果表明LGBO不绑定于特定LLM:更大的模型或经过领域预训练的模型可以提供更丰富的引导,但框架本身仍广泛适用于不同的骨干网络。

随机区域提升。我们将LLM建议替换为大小和置信度匹配的随机提升区域。为消除热启动效应,LGBO也使用与GPBO相同的Sobol点进行初始化。如图5所示,随机引导不仅阻止了早期的快速收敛,还迫使优化器花费更多轮次进行探索。这证实了LGBO的优势来源于LLM提供的信息性语义线索,而非仅仅来自提升机制本身。

关于初始化。LGBO和LLAMBO均从相同的LLM建议初始化点开始,这是近期文献中的常见做法。然而,LLAMBO并未达到与LGBO相同的加速效果,这表明增益并非仅来自初始化,而是来自LGBO对LLM偏好的持续整合。

5 结论

本文介绍了LLM引导的贝叶斯优化,一个偏好驱动的框架,通过新颖的区域提升偏好机制将LLM整合到贝叶斯优化中。LGBO在提供持续引导的同时,保留了贝叶斯优化的严谨性。我们建立了遗憾界,表明LGBO在最坏情况下与贝叶斯优化相当,并在引导一致时加速收敛。消融研究证实其增益源于通过区域提升持续纳入LLM偏好,且该框架广泛适用于不同的LLM骨干网络。在四个干燥基准测试和一个新的湿实验室Fe-Cr电解液任务中,LGBO相比GPBO和LLAMBO实现了更快的收敛、更低的方差和更强的鲁棒性,展示了其在科学发现中的前景。

原文链接:https://arxiv.org/pdf/2605.17976

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
重磅引援!广东男篮有意签下NBA悍将,场均17+10,亚帅获内线强援

重磅引援!广东男篮有意签下NBA悍将,场均17+10,亚帅获内线强援

精彩时代脉搏
2026-10-05 19:49:47
中国最“硬核”老板:不上市、不贷款、不欠薪,但年入1784亿!

中国最“硬核”老板:不上市、不贷款、不欠薪,但年入1784亿!

坠入二次元的海洋
2026-10-03 10:22:14
中国大满贯捷报:女单爆大冷,国乒劲敌0-3完败,陈熠晋级

中国大满贯捷报:女单爆大冷,国乒劲敌0-3完败,陈熠晋级

衔春信
2026-10-05 11:32:18
与欧豪分手8年后,38岁的马思纯近况曝光,丝毫不意外

与欧豪分手8年后,38岁的马思纯近况曝光,丝毫不意外

神颜贩卖机
2026-10-05 19:09:58
退休后,永远不要在熟人面前,说以下6句话,切记切记!

退休后,永远不要在熟人面前,说以下6句话,切记切记!

东林夕亭
2026-10-05 08:21:49
亚运冠军成绩被取消!疑日本选手举报,中国姑娘一觉醒来变金银!

亚运冠军成绩被取消!疑日本选手举报,中国姑娘一觉醒来变金银!

装满幸福
2026-10-05 12:05:58
为什么说“蔚小理”的淘汰赛,已经提前开始了?

为什么说“蔚小理”的淘汰赛,已经提前开始了?

生活魔术专家
2026-10-04 12:42:52
连赢张本智和却屡输外战!国乒名将一轮游止步WTT中国大满贯64强

连赢张本智和却屡输外战!国乒名将一轮游止步WTT中国大满贯64强

全言作品
2026-10-05 00:20:54
36.59万!大众新车官宣:10月4日,正式开售

36.59万!大众新车官宣:10月4日,正式开售

3C毒物
2026-10-04 15:01:44
如果人民公社活到今天,农村早就不用振兴了?

如果人民公社活到今天,农村早就不用振兴了?

游文刀
2026-09-25 12:53:10
Netflix上线布拉德·皮特1亿美元科幻片,被认为严重被低估

Netflix上线布拉德·皮特1亿美元科幻片,被认为严重被低估

报错免疫体
2026-10-04 13:39:47
初步调查显示,迪拜航空袭击者系单独作案,29岁来自阿曼,原计划杀死机长并驾机撞向以色列特拉维夫的摩天大楼

初步调查显示,迪拜航空袭击者系单独作案,29岁来自阿曼,原计划杀死机长并驾机撞向以色列特拉维夫的摩天大楼

都市快报橙柿互动
2026-10-05 00:27:48
董卿带父亲北京看展!背驼腿粗有了小肚腩,一身行头15万太壕气了

董卿带父亲北京看展!背驼腿粗有了小肚腩,一身行头15万太壕气了

神颜贩卖机
2026-10-04 12:09:57
蔡天凤案将审讯45天,三名凶手均不承认故意杀人,邻居称闻到浓烈烹煮恶臭

蔡天凤案将审讯45天,三名凶手均不承认故意杀人,邻居称闻到浓烈烹煮恶臭

汉史趣闻
2026-10-04 17:06:06
为什么无底线善意反而会招来杀身之祸

为什么无底线善意反而会招来杀身之祸

风铃草语
2026-10-03 07:14:12
太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

荆楚寰宇文枢
2026-09-30 22:26:52
小米新机突然官宣:10月12日开售,国补2299元

小米新机突然官宣:10月12日开售,国补2299元

搞机小帝
2026-10-04 21:47:21
真不能怀疑小孩胡说八道的本事,网友:要是信儿子,这个家就得散

真不能怀疑小孩胡说八道的本事,网友:要是信儿子,这个家就得散

户外阿毽
2026-10-03 11:11:33
被骂上热搜后,悉尼妹用一件T恤回击了所有人

被骂上热搜后,悉尼妹用一件T恤回击了所有人

热搜摘要官
2026-10-04 23:34:54
还是凯特好命,戴安娜一辈子只戴过两顶王冠,其中一顶还是娘家的

还是凯特好命,戴安娜一辈子只戴过两顶王冠,其中一顶还是娘家的

毒舌小红帽
2026-10-05 21:29:36
2026-10-05 22:48:49
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

房产
教育
时尚
数码
艺术

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

教育要闻

聪明的父母,大多是“农民思维”

帆布鞋,今年这样穿酷极了!

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

无障碍浏览 进入关怀版