网易首页 > 网易号 > 正文 申请入驻

具身智能体接口:面向具身决策的大语言模型基准测评

0
分享至

Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making

具身智能体接口:面向具身决策的大语言模型基准测评

https://proceedings.neurips.cc/paper_files/paper/2024/file/b631da756d1573c24c9ba9c702fde5a9-Paper-Datasets_and_Benchmarks_Track.pdf



摘要
我们旨在评估大语言模型(LLM)在具身决策中的表现。尽管已有大量工作利用LLM在具身环境中进行决策,但我们仍缺乏对其性能的系统性理解,因为LLM通常被应用于不同领域、服务于不同目的,并基于不同的输入和输出构建。此外,现有评估往往仅依赖最终成功率,难以指出LLM缺少何种能力及问题所在,这进而阻碍了具身体体有效且有选择地利用LLM。为弥补这些局限,我们提出一个通用接口(EMBODIED AGENT INTERFACE),支持对各类任务及基于LLM的模块的输入输出规格进行形式化。具体而言,它使我们能够统一:1)涵盖状态目标和时延扩展目标在内的广泛具身决策任务;2)四种常用的基于LLM的决策模块:目标解释、子目标分解、行动排序和转移建模;以及3)一套细粒度指标,将评估分解为错误类型,如幻觉错误、可供性错误和各类规划错误。总体而言,我们的基准测试为不同子任务提供了对LLM性能的全面评估,指出了LLM驱动的具身AI系统中的优势与不足,并为在具身决策中有效且有选择地使用LLM提供了洞见。

1 引言

大语言模型(LLM)已成为构建具身决策智能体的强大工具,能够遵循人类指令(如“清理冰箱”、“打磨家具”)并通过一系列行动在各种数字和物理环境中实现指定目标。尽管已有许多关于其成功的报道,但我们对LLM在具身决策中的全部能力和局限性的理解仍然有限。现有评估方法因三个关键局限而无法提供全面洞见:缺乏1)具身决策任务,2)LLM可对接或为之实现的模块,以及3)超越单一成功率的细粒度评估指标的标准化。本文提出EMBODIED AGENT INTERFACE以应对这些挑战。

(1)目标规格的标准化:我们期望具身体体实现目标。然而,即使对于相似任务,目标的规格和智能体成功评估的标准在不同领域之间差异显著。例如,BEHAVIOR [4]侧重于实现满足某些状态目标的状态(如图1中的“not_stained(fridge)”),而VirtualHome [5]则通过对行动施加时序顺序约束来使用时延扩展目标。我们在附录C.1中扩展讨论了这一点。我们的EMBODIED AGENT INTERFACE实现了一种通用的以对象为中心的状态和行动表示,其中对象状态、关系和行动以抽象语言术语表示(见图1)。我们的创新在于将目标描述为线性时序逻辑(LTL)公式,该公式定义轨迹上的任务成功标准。LTL能够同时支持基于状态和时延扩展的目标规格,并允许替代性的目标解释。


(2)模块和接口的标准化:现有的基于LLM的具身体体框架通常基于额外知识和外部模块的可用性做出不同假设。例如,Code as Policies [6]和SayCan [2]在给定一组原始技能的情况下利用LLM进行行动排序,而LLM+P [7]则利用LLM进行目标解释,并使用PDDL规划器在给定领域定义的情况下生成计划;Ada [8]利用LLM以PDDL生成高层次规划领域定义,并使用低层规划器生成控制命令。因此,它们为LLM模块定义了不同的输入输出规格,使得比较和评估变得困难。在EMBODIED AGENT INTERFACE中,基于我们的以对象为中心和基于LTL的任务规格之上,我们形式化了基于LLM的具身决策中的四个关键能力模块,如图1所示:目标解释、子目标分解、行动排序和转移建模。我们形式化了LLM可用于与环境中的其他模块对接的输入输出规格。这种模块化接口自动支持不同基于LLM的模块和外部模块的集成。图2展示了四个能力模块的输入和输出形式。以子目标分解为例,该模块接收初始状态(例如,冰箱最初是脏的)和任务目标(例如,清洁冰箱),并要求LLM生成子目标轨迹(例如,首先布料被浸湿,然后被智能体持有,然后智能体在冰箱旁边,最后冰箱干净)。正式定义和符号参见表1。


(3)具有广泛覆盖面的细粒度评估指标的标准化:当前对LLM用于具身决策的评估过于简化,通常只关注单一任务的成功率。近期工作LOTA-Bench [9]旨在分解评估,但仅限于生成行动序列,并不支持细粒度规划错误的分析。我们的EMBODIED AGENT INTERFACE利用以对象为中心的状态和行动的分拆表示,实现了一套细粒度评估指标,旨在自动定位不同类型的错误,如幻觉错误、不同类型的规划错误(例如,对象可供性错误、错误的行动顺序)。图3展示了GPT-4o在两个模拟器的四个不同能力模块上所犯的各类错误。具体来说,我们评估每个模块的两个方面:轨迹评估,检查生成的计划是否可在模拟器中执行;以及目标评估,确保计划实现正确结果。目标评估适用于目标解释、行动排序和子目标分解,而轨迹评估适用于行动排序、子目标分解和转移建模。


我们在两个具身决策基准测试上实现了EMBODIED AGENT INTERFACE:BEHAVIOR [4]和VirtualHome [5],并评估了18种不同的LLM。图3可视化了5个代表性LLM在Behavior中不同任务上的性能。我们的关键发现包括:

• 大多数LLM难以将自然语言指令忠实地转化为环境中接地状态(对象、对象状态和关系)。它们有时会将中间子目标预测为最终目标的一部分,例如,对任务“喝水”预测状态open(freezer)。

• 推理能力是LLM应改进的关键方面。轨迹可行性错误很常见(45.2%),其中很大一部分是缺失步骤(19.5%)和多余步骤(14.2%)错误,通常是由于忽视前提条件所致。例如,LLM可能忽略智能体的坐或躺状态,未能在执行其他行动前包含站立行动。它们有时也无法理解在从封闭对象内取物之前需要先打开该对象。当LLM为已实现的目标输出行动时,经常发生多余步骤错误。

• 轨迹评估性能随轨迹序列长度增加而下降;目标评估性能(即评估执行一个计划是否能实现任务目标)在环境变得更加复杂(涉及更多种类的对象和状态特征)时下降。

• LLM错误不仅包括对不存在对象和行动的幻觉,还包括严重的报告偏差。它们常常忽略语言中省略的常识性前提条件。例如,“把火鸡放在桌子上”应被解释为“把火鸡放在盘子上,再把盘子放在桌子上”。

• 子目标分解虽然旨在简化规划,但在抽象空间中与行动排序一样复杂,因为LLM必须以声明方式将目标分解为可行的步骤。

• 我们进一步通过敏感性分析、流水线式与模块化对比以及重规划,对模块的鲁棒性提供了定量分析。这些分析旨在识别集成基于LLM的模块与外部模块的潜在途径。

• o1-preview显著优于其他模型,尤其是在BEHAVIOR模拟器上(74.9%对比64.2%)。它在VirtualHome上的目标解释以及BEHAVIOR和VirtualHome上的行动排序、转移建模和子目标分解方面均表现出色。Claude-3.5 Sonnet在BEHAVIOR上的目标解释和VirtualHome上的转移建模方面表现强劲,而Mistral Large在VirtualHome上的行动排序方面表现良好。

2 基于LTL的具身体体接口








3 数据集标注与基准实现

标注。聚焦于复杂的长时程任务,我们根据任务长度和场景复杂性选择BEHAVIOR(B)和VirtualHome(V)作为我们的评估模拟器。我们在附录M.1中包含了不同模拟器的比较和详细的选择考虑。表2展示了我们的标注。除了目标和轨迹标注外,我们引入了目标行动标注,以反映那些没有后效的必要行动,例如任务“抚摸猫”中的目标行动touch,详见附录M.3。在我们所处理的VirtualHome任务子集中,80.7%的任务类别包含行动步骤长于10的指令,且33%的指令步骤长度超过10。


我们选择BEHAVIOR作为另一个评估模拟器,因为其任务复杂性高。BEHAVIOR的BDDL目标可能包含量词,例如 (forpairs (?jar ?apple) (inside ?apple ?jar)),这需要被翻译为仅含原子命题的接地目标,例如 and ((inside apple_1 jar_1) (inside apple_2 jar_2))。可能存在不同的接地目标满足同一个BDDL目标,例如 ((inside apple_2 jar_1) (inside apple_1 jar_2))。我们称它们为目标选项。一般而言,一个BDDL目标对应多个目标选项。每个任务的平均接地目标数量为6.7,且每个任务平均有4,164.4个目标选项。我们在附录M.2中展示了目标选项的数据分布和其他统计信息。

模拟器上的实现。由于BEHAVIOR没有行动转移模型层,我们实现了一个带有行动转移模型层的符号模拟器。我们的实现EvalGibson提供了30种行动,智能体可用这些行动来改变对象的状态。实现细节见附录N.1。我们还修订了VirtualHome模拟器以支持准确评估,详见附录N.2。每个大型模型的评估设置详见附录O。

4 结果

我们在两个基准模拟器BEHAVIOR和VirtualHome上,对18个开放权重和专有LLM在四个具身体体能力模块上进行了评估。表3给出了总览。表4、表5、表6和表7对四个代表性LLM在四个能力模块上的表现进行了细分分析。图5展示了不同类型错误的示例。我们从整体分析开始。





模型比较。如图3所示,整体表现最好的模型是o1-preview、Claude-3.5 Sonnet和Gemini 1.5 Pro,其中o1-preview在除对象状态外的所有方面均领先,而Gemini 1.5 Pro在对象状态推理能力上领先。在所有开放权重模型中,表现最佳的模型是Llama-3-70B和Mistral-Large-2402,但与商业模型之间仍存在性能差距。

能力比较。o1-preview展现出对其他模型的明显优势,尤其是在BEHAVIOR模拟器上,其达到74.9%,而对比为64.2%。它在多个领域领先,包括VirtualHome上的目标解释以及BEHAVIOR上的行动排序和转移建模。此外,它在BEHAVIOR和VirtualHome两个模拟器的子目标分解上均表现优异。相比之下,Claude-3.5 Sonnet在BEHAVIOR上的目标解释和VirtualHome上的转移建模方面表现出色,而Mistral Large在VirtualHome上的行动排序方面表现突出。Mixtral-8x22B在开放权重LLM中的转移建模方面表现出色,Llama-3-70B Instruct在目标解释方面表现突出。

我们还观察到不同模拟器之间存在性能差距。模型在BEHAVIOR上的轨迹可行性得分显著低于VirtualHome,但在目标解释上取得更高得分。这是因为BEHAVIOR任务的时域范围更长(平均14.6步),而VirtualHome目标具有更大的状态空间需要搜索(如“工作”),详见附录L.2。这显示了轨迹评估性能与序列长度之间,以及目标评估性能与环境复杂度之间的负相关关系。我们进一步进行了系统分析,以发现目标成功率的共因,包括任务目标数量(特别是节点目标)、真实行动长度和任务对象长度,详见附录E.5。

对象状态 vs 关系。关系型目标通常比对象状态目标更难推理。空间关系在目标解释任务中的召回率显著较低(表4),且目标满足率较低(表5)。一些非空间关系(例如,hold)对LLM来说甚至比空间关系更难预测,如转移建模准确率所示(表6):例如,holding(toothbrush)应是刷牙的前提条件。

报告偏差与不精确的物理表达。给定任务“serve a meal”(提供一餐),所有LLM都预测了错误的目标 ontop(chicken, table),而非 ontop(chicken, plate),这是由于自然语言中常用的表达方式“把鸡肉放在桌子上”。同样,对于任务“cleaning sneakers”(清洁运动鞋),所有LLM的预测中都缺失了目标状态 onfloor(gym_shoe, floor),因为聊天模型将 onfloor 空间关系视为会话语言中的隐含信息而忽略。然而,这种精确的物理关系对于具身任务规划至关重要。

4.1 能力模块分析


转移建模。表7显示了逻辑形式准确率的整体表现。为进行系统评估,我们进一步将任务划分为五个不同的能力类别,这些类别需要对不同类型对象状态和关系的转移建模(见附录F.3)。总体而言,我们揭示了不同模型之间表现的显著差异;关系型前提条件和效果通常比对象状态型更难预测。例如,Claude-3 Opus模型在对象状态上表现出色(VirtualHome上为63%),但其在空间关系上的表现较弱。此外,在聚焦于对象属性的任务中,模型在推理对象朝向方面普遍表现不佳(例如,智能体应面向电视才能观看)。我们还提供了一个敏感性分析工具,以可视化不同的转移建模错误如何导致下游规划错误(见附录F和E.4)。我们发现LLM倾向于在效果中夸大对象状态,而在前提条件中低估它们。相反,它们在前提条件中夸大空间关系,在效果中低估它们。因此,在许多情况下,即使下游规划器成功生成了一个计划,该计划在实际环境中也可能不可行。

对具身体体系统设计的启示。我们通过敏感性分析(附录F)、模块化与流水线式对比实验(附录G)和重规划(附录H),进一步研究了基于LLM的能力模块的潜在集成及其鲁棒性。我们观察到轨迹可行性相似,尽管不同模块组合存在误差累积,这显示了模块组合的潜力。我们还比较了针对具身决策任务的不同提示策略,并在附录I中总结了最佳实践。

5 相关工作

近期具身决策工作一直在使用LLM执行各种任务,我们在附录P中包含了全面总结,也可参见表8快速了解。LLM还可通过思维链提示或流水线查询同时组合多个上述模块,例如目标解释与行动排序的组合[13–32]、目标解释与子目标分解的组合[2, 27, 33]、行动排序与子目标分解的组合[27, 34, 18, 35]、行动排序与转移建模的组合[8, 28, 32, 36, 37, 13, 38]。我们的工作旨在标准化LLM与各种决策模块之间的接口,以支持无缝集成、模块化评估和细粒度指标,旨在为更有效和有选择地在具身决策中使用LLM提供启示。我们在附录P中提供了关于智能体接口[39–43, 18, 44, 42, 45]和模拟基准的额外相关工作。


6 结论与未来工作

我们提出了一个系统性评估框架 EMBODIED AGENT INTERFACE,用于对LLM在具身决策中的表现进行基准测试。它聚焦于:1)使用LTL公式标准化目标规格;2)通过标准接口和四个基础能力模块统一决策任务;以及3)提供全面的细粒度评估指标和自动错误识别。我们指出了当前LLM在解释复杂目标和推理中各类错误方面的局限性,并进一步将错误归因于多种共因,包括轨迹长度、目标复杂性、空间关系目标等。

局限性与未来工作:我们当前的评估仅限于可用抽象语言术语描述的状态、行动和目标,输入环境由对象的关系图抽象表示。未来工作应将其扩展到包括感官输入和执行输出,可能通过将研究的模型类别扩展到视觉-语言模型(VLM)来实现,我们在附录K中进一步讨论。扩展的其他方面包括记忆系统(情景记忆和状态记忆)的集成、几何推理和导航。

原文链接:https://proceedings.neurips.cc/paper_files/paper/2024/file/b631da756d1573c24c9ba9c702fde5a9-Paper-Datasets_and_Benchmarks_Track.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
森保一谈采用四后卫:为了备战亚洲杯,要增加战术变化

森保一谈采用四后卫:为了备战亚洲杯,要增加战术变化

懂球帝
2026-10-05 22:51:07
孙宇晨被枪击或是谣言,但是币圈华人大佬们的结局却早已注定

孙宇晨被枪击或是谣言,但是币圈华人大佬们的结局却早已注定

北欧模式
2026-10-05 22:56:27
中国工程界最大乌龙! 我国耗资三亿修建发电厂, 10年后竟便宜给了羊

中国工程界最大乌龙! 我国耗资三亿修建发电厂, 10年后竟便宜给了羊

抽象派大师
2026-09-30 05:15:19
TA:葡萄牙似乎已为后C罗时代做好准备,看上去这是绝佳告别时机

TA:葡萄牙似乎已为后C罗时代做好准备,看上去这是绝佳告别时机

天光破云来
2026-10-05 15:38:16
微信转账限额规定

微信转账限额规定

匹夫来搞笑
2026-09-30 06:58:09
高市新内阁遭“当头一棒”:日农相被曝曾声称“不支持我的市政预算全被砍”被围攻

高市新内阁遭“当头一棒”:日农相被曝曾声称“不支持我的市政预算全被砍”被围攻

环球网资讯
2026-10-05 15:13:44
冠心病最怕的早餐!医生反复提醒:宁可不吃,也别碰这4种早餐

冠心病最怕的早餐!医生反复提醒:宁可不吃,也别碰这4种早餐

任医生聊健康
2026-10-04 18:50:06
首秀22+4!滑翔飞扣!中国男篮的希望之星...

首秀22+4!滑翔飞扣!中国男篮的希望之星...

左右为篮
2026-10-05 08:33:29
景甜 运动装好身材

景甜 运动装好身材

小椰的奶奶
2026-10-05 17:55:23
为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

小椰的奶奶
2026-09-12 18:15:02
大闸蟹堆成山、价往下掉:不是螃蟹不香了,是“面子生意”退潮了

大闸蟹堆成山、价往下掉:不是螃蟹不香了,是“面子生意”退潮了

阿莱美食汇
2026-10-05 10:33:13
突发意外!梅德韦杰夫击球误伤观众被判负,德约晋级中网决赛

突发意外!梅德韦杰夫击球误伤观众被判负,德约晋级中网决赛

南方都市报
2026-10-05 23:14:26
浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

懂球帝
2026-10-04 21:21:28
血糖高不能喝牛奶,再三提醒:要想保护胰岛,牢记4吃、3不吃

血糖高不能喝牛奶,再三提醒:要想保护胰岛,牢记4吃、3不吃

普陀动物世界
2026-10-04 12:15:28
暴涨35%!华为儿童手表销量狂飙 小天才有压力了

暴涨35%!华为儿童手表销量狂飙 小天才有压力了

快科技
2026-10-04 14:59:06
中网|郑钦文解读观众什么行为会干扰她

中网|郑钦文解读观众什么行为会干扰她

北青网-北京青年报
2026-10-05 19:54:02
中国大满贯捷报:女单爆大冷,国乒劲敌0-3完败,陈熠晋级

中国大满贯捷报:女单爆大冷,国乒劲敌0-3完败,陈熠晋级

衔春信
2026-10-05 11:32:18
河南第一酒神一顿喝7斤白酒,喝出8条人命,如今却成反酒斗士!

河南第一酒神一顿喝7斤白酒,喝出8条人命,如今却成反酒斗士!

丁睋解说
2026-10-05 18:46:31
第一次感受到了风油精的“洪荒之力”,几块钱一瓶,能解决这么多事

第一次感受到了风油精的“洪荒之力”,几块钱一瓶,能解决这么多事

抠搜侠
2026-08-07 13:59:21
可乐再次被关注!医生发现:脂肪肝者喝可乐,不用多久或有6变化

可乐再次被关注!医生发现:脂肪肝者喝可乐,不用多久或有6变化

路医生健康科普
2026-08-20 07:30:10
2026-10-06 00:12:49
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
亲子
房产
时尚
旅游

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

工程车小故事:铲石子

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

秋天外套不用买太多,这三件基础款一定要准备好,简约又不挑年纪

旅游要闻

“请珍爱生命,勿擅自进入”,一景区公告:核心区内所有旅游经营活动已停止,不听劝的,将依法处理

无障碍浏览 进入关怀版