网易首页 > 网易号 > 正文 申请入驻

具身智能体接口:面向具身决策的大语言模型基准测评

0
分享至

Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making

具身智能体接口:面向具身决策的大语言模型基准测评

https://proceedings.neurips.cc/paper_files/paper/2024/file/b631da756d1573c24c9ba9c702fde5a9-Paper-Datasets_and_Benchmarks_Track.pdf



摘要
我们旨在评估大语言模型(LLM)在具身决策中的表现。尽管已有大量工作利用LLM在具身环境中进行决策,但我们仍缺乏对其性能的系统性理解,因为LLM通常被应用于不同领域、服务于不同目的,并基于不同的输入和输出构建。此外,现有评估往往仅依赖最终成功率,难以指出LLM缺少何种能力及问题所在,这进而阻碍了具身体体有效且有选择地利用LLM。为弥补这些局限,我们提出一个通用接口(EMBODIED AGENT INTERFACE),支持对各类任务及基于LLM的模块的输入输出规格进行形式化。具体而言,它使我们能够统一:1)涵盖状态目标和时延扩展目标在内的广泛具身决策任务;2)四种常用的基于LLM的决策模块:目标解释、子目标分解、行动排序和转移建模;以及3)一套细粒度指标,将评估分解为错误类型,如幻觉错误、可供性错误和各类规划错误。总体而言,我们的基准测试为不同子任务提供了对LLM性能的全面评估,指出了LLM驱动的具身AI系统中的优势与不足,并为在具身决策中有效且有选择地使用LLM提供了洞见。

1 引言

大语言模型(LLM)已成为构建具身决策智能体的强大工具,能够遵循人类指令(如“清理冰箱”、“打磨家具”)并通过一系列行动在各种数字和物理环境中实现指定目标。尽管已有许多关于其成功的报道,但我们对LLM在具身决策中的全部能力和局限性的理解仍然有限。现有评估方法因三个关键局限而无法提供全面洞见:缺乏1)具身决策任务,2)LLM可对接或为之实现的模块,以及3)超越单一成功率的细粒度评估指标的标准化。本文提出EMBODIED AGENT INTERFACE以应对这些挑战。

(1)目标规格的标准化:我们期望具身体体实现目标。然而,即使对于相似任务,目标的规格和智能体成功评估的标准在不同领域之间差异显著。例如,BEHAVIOR [4]侧重于实现满足某些状态目标的状态(如图1中的“not_stained(fridge)”),而VirtualHome [5]则通过对行动施加时序顺序约束来使用时延扩展目标。我们在附录C.1中扩展讨论了这一点。我们的EMBODIED AGENT INTERFACE实现了一种通用的以对象为中心的状态和行动表示,其中对象状态、关系和行动以抽象语言术语表示(见图1)。我们的创新在于将目标描述为线性时序逻辑(LTL)公式,该公式定义轨迹上的任务成功标准。LTL能够同时支持基于状态和时延扩展的目标规格,并允许替代性的目标解释。


(2)模块和接口的标准化:现有的基于LLM的具身体体框架通常基于额外知识和外部模块的可用性做出不同假设。例如,Code as Policies [6]和SayCan [2]在给定一组原始技能的情况下利用LLM进行行动排序,而LLM+P [7]则利用LLM进行目标解释,并使用PDDL规划器在给定领域定义的情况下生成计划;Ada [8]利用LLM以PDDL生成高层次规划领域定义,并使用低层规划器生成控制命令。因此,它们为LLM模块定义了不同的输入输出规格,使得比较和评估变得困难。在EMBODIED AGENT INTERFACE中,基于我们的以对象为中心和基于LTL的任务规格之上,我们形式化了基于LLM的具身决策中的四个关键能力模块,如图1所示:目标解释、子目标分解、行动排序和转移建模。我们形式化了LLM可用于与环境中的其他模块对接的输入输出规格。这种模块化接口自动支持不同基于LLM的模块和外部模块的集成。图2展示了四个能力模块的输入和输出形式。以子目标分解为例,该模块接收初始状态(例如,冰箱最初是脏的)和任务目标(例如,清洁冰箱),并要求LLM生成子目标轨迹(例如,首先布料被浸湿,然后被智能体持有,然后智能体在冰箱旁边,最后冰箱干净)。正式定义和符号参见表1。


(3)具有广泛覆盖面的细粒度评估指标的标准化:当前对LLM用于具身决策的评估过于简化,通常只关注单一任务的成功率。近期工作LOTA-Bench [9]旨在分解评估,但仅限于生成行动序列,并不支持细粒度规划错误的分析。我们的EMBODIED AGENT INTERFACE利用以对象为中心的状态和行动的分拆表示,实现了一套细粒度评估指标,旨在自动定位不同类型的错误,如幻觉错误、不同类型的规划错误(例如,对象可供性错误、错误的行动顺序)。图3展示了GPT-4o在两个模拟器的四个不同能力模块上所犯的各类错误。具体来说,我们评估每个模块的两个方面:轨迹评估,检查生成的计划是否可在模拟器中执行;以及目标评估,确保计划实现正确结果。目标评估适用于目标解释、行动排序和子目标分解,而轨迹评估适用于行动排序、子目标分解和转移建模。


我们在两个具身决策基准测试上实现了EMBODIED AGENT INTERFACE:BEHAVIOR [4]和VirtualHome [5],并评估了18种不同的LLM。图3可视化了5个代表性LLM在Behavior中不同任务上的性能。我们的关键发现包括:

• 大多数LLM难以将自然语言指令忠实地转化为环境中接地状态(对象、对象状态和关系)。它们有时会将中间子目标预测为最终目标的一部分,例如,对任务“喝水”预测状态open(freezer)。

• 推理能力是LLM应改进的关键方面。轨迹可行性错误很常见(45.2%),其中很大一部分是缺失步骤(19.5%)和多余步骤(14.2%)错误,通常是由于忽视前提条件所致。例如,LLM可能忽略智能体的坐或躺状态,未能在执行其他行动前包含站立行动。它们有时也无法理解在从封闭对象内取物之前需要先打开该对象。当LLM为已实现的目标输出行动时,经常发生多余步骤错误。

• 轨迹评估性能随轨迹序列长度增加而下降;目标评估性能(即评估执行一个计划是否能实现任务目标)在环境变得更加复杂(涉及更多种类的对象和状态特征)时下降。

• LLM错误不仅包括对不存在对象和行动的幻觉,还包括严重的报告偏差。它们常常忽略语言中省略的常识性前提条件。例如,“把火鸡放在桌子上”应被解释为“把火鸡放在盘子上,再把盘子放在桌子上”。

• 子目标分解虽然旨在简化规划,但在抽象空间中与行动排序一样复杂,因为LLM必须以声明方式将目标分解为可行的步骤。

• 我们进一步通过敏感性分析、流水线式与模块化对比以及重规划,对模块的鲁棒性提供了定量分析。这些分析旨在识别集成基于LLM的模块与外部模块的潜在途径。

• o1-preview显著优于其他模型,尤其是在BEHAVIOR模拟器上(74.9%对比64.2%)。它在VirtualHome上的目标解释以及BEHAVIOR和VirtualHome上的行动排序、转移建模和子目标分解方面均表现出色。Claude-3.5 Sonnet在BEHAVIOR上的目标解释和VirtualHome上的转移建模方面表现强劲,而Mistral Large在VirtualHome上的行动排序方面表现良好。

2 基于LTL的具身体体接口








3 数据集标注与基准实现

标注。聚焦于复杂的长时程任务,我们根据任务长度和场景复杂性选择BEHAVIOR(B)和VirtualHome(V)作为我们的评估模拟器。我们在附录M.1中包含了不同模拟器的比较和详细的选择考虑。表2展示了我们的标注。除了目标和轨迹标注外,我们引入了目标行动标注,以反映那些没有后效的必要行动,例如任务“抚摸猫”中的目标行动touch,详见附录M.3。在我们所处理的VirtualHome任务子集中,80.7%的任务类别包含行动步骤长于10的指令,且33%的指令步骤长度超过10。


我们选择BEHAVIOR作为另一个评估模拟器,因为其任务复杂性高。BEHAVIOR的BDDL目标可能包含量词,例如 (forpairs (?jar ?apple) (inside ?apple ?jar)),这需要被翻译为仅含原子命题的接地目标,例如 and ((inside apple_1 jar_1) (inside apple_2 jar_2))。可能存在不同的接地目标满足同一个BDDL目标,例如 ((inside apple_2 jar_1) (inside apple_1 jar_2))。我们称它们为目标选项。一般而言,一个BDDL目标对应多个目标选项。每个任务的平均接地目标数量为6.7,且每个任务平均有4,164.4个目标选项。我们在附录M.2中展示了目标选项的数据分布和其他统计信息。

模拟器上的实现。由于BEHAVIOR没有行动转移模型层,我们实现了一个带有行动转移模型层的符号模拟器。我们的实现EvalGibson提供了30种行动,智能体可用这些行动来改变对象的状态。实现细节见附录N.1。我们还修订了VirtualHome模拟器以支持准确评估,详见附录N.2。每个大型模型的评估设置详见附录O。

4 结果

我们在两个基准模拟器BEHAVIOR和VirtualHome上,对18个开放权重和专有LLM在四个具身体体能力模块上进行了评估。表3给出了总览。表4、表5、表6和表7对四个代表性LLM在四个能力模块上的表现进行了细分分析。图5展示了不同类型错误的示例。我们从整体分析开始。





模型比较。如图3所示,整体表现最好的模型是o1-preview、Claude-3.5 Sonnet和Gemini 1.5 Pro,其中o1-preview在除对象状态外的所有方面均领先,而Gemini 1.5 Pro在对象状态推理能力上领先。在所有开放权重模型中,表现最佳的模型是Llama-3-70B和Mistral-Large-2402,但与商业模型之间仍存在性能差距。

能力比较。o1-preview展现出对其他模型的明显优势,尤其是在BEHAVIOR模拟器上,其达到74.9%,而对比为64.2%。它在多个领域领先,包括VirtualHome上的目标解释以及BEHAVIOR上的行动排序和转移建模。此外,它在BEHAVIOR和VirtualHome两个模拟器的子目标分解上均表现优异。相比之下,Claude-3.5 Sonnet在BEHAVIOR上的目标解释和VirtualHome上的转移建模方面表现出色,而Mistral Large在VirtualHome上的行动排序方面表现突出。Mixtral-8x22B在开放权重LLM中的转移建模方面表现出色,Llama-3-70B Instruct在目标解释方面表现突出。

我们还观察到不同模拟器之间存在性能差距。模型在BEHAVIOR上的轨迹可行性得分显著低于VirtualHome,但在目标解释上取得更高得分。这是因为BEHAVIOR任务的时域范围更长(平均14.6步),而VirtualHome目标具有更大的状态空间需要搜索(如“工作”),详见附录L.2。这显示了轨迹评估性能与序列长度之间,以及目标评估性能与环境复杂度之间的负相关关系。我们进一步进行了系统分析,以发现目标成功率的共因,包括任务目标数量(特别是节点目标)、真实行动长度和任务对象长度,详见附录E.5。

对象状态 vs 关系。关系型目标通常比对象状态目标更难推理。空间关系在目标解释任务中的召回率显著较低(表4),且目标满足率较低(表5)。一些非空间关系(例如,hold)对LLM来说甚至比空间关系更难预测,如转移建模准确率所示(表6):例如,holding(toothbrush)应是刷牙的前提条件。

报告偏差与不精确的物理表达。给定任务“serve a meal”(提供一餐),所有LLM都预测了错误的目标 ontop(chicken, table),而非 ontop(chicken, plate),这是由于自然语言中常用的表达方式“把鸡肉放在桌子上”。同样,对于任务“cleaning sneakers”(清洁运动鞋),所有LLM的预测中都缺失了目标状态 onfloor(gym_shoe, floor),因为聊天模型将 onfloor 空间关系视为会话语言中的隐含信息而忽略。然而,这种精确的物理关系对于具身任务规划至关重要。

4.1 能力模块分析


转移建模。表7显示了逻辑形式准确率的整体表现。为进行系统评估,我们进一步将任务划分为五个不同的能力类别,这些类别需要对不同类型对象状态和关系的转移建模(见附录F.3)。总体而言,我们揭示了不同模型之间表现的显著差异;关系型前提条件和效果通常比对象状态型更难预测。例如,Claude-3 Opus模型在对象状态上表现出色(VirtualHome上为63%),但其在空间关系上的表现较弱。此外,在聚焦于对象属性的任务中,模型在推理对象朝向方面普遍表现不佳(例如,智能体应面向电视才能观看)。我们还提供了一个敏感性分析工具,以可视化不同的转移建模错误如何导致下游规划错误(见附录F和E.4)。我们发现LLM倾向于在效果中夸大对象状态,而在前提条件中低估它们。相反,它们在前提条件中夸大空间关系,在效果中低估它们。因此,在许多情况下,即使下游规划器成功生成了一个计划,该计划在实际环境中也可能不可行。

对具身体体系统设计的启示。我们通过敏感性分析(附录F)、模块化与流水线式对比实验(附录G)和重规划(附录H),进一步研究了基于LLM的能力模块的潜在集成及其鲁棒性。我们观察到轨迹可行性相似,尽管不同模块组合存在误差累积,这显示了模块组合的潜力。我们还比较了针对具身决策任务的不同提示策略,并在附录I中总结了最佳实践。

5 相关工作

近期具身决策工作一直在使用LLM执行各种任务,我们在附录P中包含了全面总结,也可参见表8快速了解。LLM还可通过思维链提示或流水线查询同时组合多个上述模块,例如目标解释与行动排序的组合[13–32]、目标解释与子目标分解的组合[2, 27, 33]、行动排序与子目标分解的组合[27, 34, 18, 35]、行动排序与转移建模的组合[8, 28, 32, 36, 37, 13, 38]。我们的工作旨在标准化LLM与各种决策模块之间的接口,以支持无缝集成、模块化评估和细粒度指标,旨在为更有效和有选择地在具身决策中使用LLM提供启示。我们在附录P中提供了关于智能体接口[39–43, 18, 44, 42, 45]和模拟基准的额外相关工作。


6 结论与未来工作

我们提出了一个系统性评估框架 EMBODIED AGENT INTERFACE,用于对LLM在具身决策中的表现进行基准测试。它聚焦于:1)使用LTL公式标准化目标规格;2)通过标准接口和四个基础能力模块统一决策任务;以及3)提供全面的细粒度评估指标和自动错误识别。我们指出了当前LLM在解释复杂目标和推理中各类错误方面的局限性,并进一步将错误归因于多种共因,包括轨迹长度、目标复杂性、空间关系目标等。

局限性与未来工作:我们当前的评估仅限于可用抽象语言术语描述的状态、行动和目标,输入环境由对象的关系图抽象表示。未来工作应将其扩展到包括感官输入和执行输出,可能通过将研究的模型类别扩展到视觉-语言模型(VLM)来实现,我们在附录K中进一步讨论。扩展的其他方面包括记忆系统(情景记忆和状态记忆)的集成、几何推理和导航。

原文链接:https://proceedings.neurips.cc/paper_files/paper/2024/file/b631da756d1573c24c9ba9c702fde5a9-Paper-Datasets_and_Benchmarks_Track.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

都市快报橙柿互动
2026-10-05 00:27:48
事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

孤城落日
2026-10-05 16:53:01
特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

台州交通广播
2026-10-05 08:37:45
深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

无情有思可
2026-10-05 16:13:32
《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

喵喵的追剧笔记
2026-10-05 19:09:22
广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

极目新闻
2026-10-04 22:59:09
国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

先锋新闻
2026-10-05 15:17:26
中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

职场资深秘书
2026-10-05 14:17:32
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

史海流年号
2026-10-03 15:16:56
央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

黄河新闻网吕梁
2026-10-05 16:52:56
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

南方都市报
2026-10-05 18:58:05
乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

极目新闻
2026-10-05 22:19:09
出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

掠影后有感
2026-10-05 09:20:34
空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

王老师你还好吗
2026-10-05 14:48:03
“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

都市快报橙柿互动
2026-10-05 19:13:23
市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

揭秘世间万象
2026-10-05 19:31:03
大唐不夜城人均消费一块五引质疑

大唐不夜城人均消费一块五引质疑

热点追踪人
2026-10-05 15:04:00
2026-10-05 22:47:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
健康
旅游
本地
教育

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

刷酸祛痘,为什么有人翻车?

旅游要闻

甜城两日,溯脉千年 国庆长假仅余两日,何不向内江而行?

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

聪明的父母,大多是“农民思维”

无障碍浏览 进入关怀版