网易首页 > 网易号 > 正文 申请入驻

阿里开源LoopArena,比拼五大模型Loop Engineering能力!海外博主直呼「太需要了」

0
分享至

智猩猩AI整理

编辑:知知

代码已经交给 Agent 写了,开发者却还得守在一旁:看进度、补要求,再时不时追问一句「接下来呢?」

最近,Loop Engineering在 AI 开发者中热了起来。它要做的,就是把这份持续安排工作的职责也交给系统:人来确定目标和要求,由 Loop 根据执行反馈,组织 Agent 一轮轮往下做。

那么,负责控制这个 Loop 的模型,该选谁?

阿里巴巴 DreamX 团队开源的LoopArena,把这个问题变成了一项专门的 Benchmark。

GPT、Claude、DeepSeek 等五个模型同台,执行编程的 Agent 保持不变,比较的正是模型在长程 Loop 中的控制能力。

这项工作论文登上 Hugging Face Daily Papers 当日榜首。


Daily Papers 主理人Ahsen Khaliq(AK)随后在 X 上分享了这项工作。DAIR.AI、Rohan Paul 等海外 AI 媒体和博主也迅速跟进。


海外博主Shashank Ashtikar在转发 DAIR.AI 的介绍时直言:“太需要这样的工作了!”


他认为,许多组织和团队已经在交付 Loop,却一直缺少真正评估它们的办法。看到 LoopArena,他的评价很直接:“太棒了!”

另一位博主 Brain Cramps 则把 LoopArena 列入了自己整理的「将影响 AI 领域的七件事」


从 Terminal-Bench 4.0 到 DeepSWE,最近的新模型发布,越来越看重 Agent 处理复杂任务的表现。榜单值得看,跑榜的账单也不轻:仅在 Terminal-Bench 4.0 的公开榜单上,就有多组评测记录的总费用达到数千美元,个别接近一万美元

针对 Loop 中的下一步控制决策,LoopArena 则准备了轻量的 Type I 评测,无需在评测时重新运行 Coding Agent。按其 arXiv 论文公布的结果,一个模型测完整套 Type I,估算模型调用成本最低只需 0.31 美元。

上手也很轻便:环境和模型接口准备好后,跟着仓库里的快速示例,5 分钟即可上手 Type I 评测。



  • 论文题目:

    LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

01

从写 Prompt,

到设计持续工作的 Loop

过去,开发者和 Coding Agent 的配合,常常是一问一答。交代任务,检查结果,再决定下一句该怎么说。Agent 负责写代码,人负责把整个过程往前推。

Addy Osmani 在讨论 Loop Engineering 的文章中,将开发者的职责描述为设计一套能持续给 Agent 安排工作的系统。人确定目标和验收要求,Loop 根据运行反馈接着安排工作。

比如,要给一个已有项目增加新功能。前期需要找对实现位置;功能写好后,要检查它是否影响原有行为;到了交付前,还要确认验证结果覆盖了任务要求。同一个目标,推进到不同阶段,需要的下一步并不相同。

这些判断需要跟着代码和运行反馈更新。就好比一位技术负责人(Tech Lead),要看懂当前进展,判断接下来该推进实现,还是先补上验证。

LoopArena 关注的,就是模型在这个位置上究竟表现如何。

已有的编程评测让我们了解一套 Coding Agent 完成任务的能力。LoopArena 将其中的外层控制单独拿出来比较,让研究者可以有针对性地评测负责这一角色的模型。

对于已经在搭建 Agent 工作流的团队,这样的比较很实用。选哪个模型来负责后续安排,设计的控制策略有没有效果,都可以放进同一套评测里检验。

02

同一个 Coding Agent,

五个模型轮流指挥

研究者将编程执行与外层控制解耦:负责读代码、修改仓库、运行测试的 Coding Agent 称为Worker;在长程 Loop 中读取进展、决定后续安排的模型称为Controller。后者是 LoopArena 要评测的对象。

在模型对比中,团队固定 Qwen3.7-Plus 作为 Worker,同时统一工具、任务环境、执行预算与评测方式,只更换 Controller。


图 1|LoopArena 论文主原理图。Controller 根据运行反馈指导 Worker,任务结果由统一的评测器检验。

这套分工在运行时很直观。Worker 完成一轮工作后,系统会整理进展和相关执行记录,交给 Controller。Controller 据此决定下一轮要推进什么、需要补充哪些验证,或者是否可以结束。

如果继续工作,它就给 Worker 一份具体安排。论文称之为 Loop Contract:说明下一轮的目标、要保留的已有行为,以及完成这一轮的条件。新的执行结果回来后,Controller 再作判断。

Controller 不直接改代码,它的决策通过 Worker 落地。上一轮安排带来了什么结果,下一轮还要根据反馈调整。在这样的连续交互中,模型指导任务的表现就可以被观察和评测。

任务结束时,评测器检查实际代码与行为。这让控制决策和最终任务结果联系起来,模型给出的建议也有了执行层面的检验。

这种固定 Worker、比较 Controller 的做法,也让 X 用户 cixier 留下了一句直白的评价:“Worker 锁死、只考 Controller,这才像在测 agent。”

首批评测覆盖 GPT-5.5、Qwen3.7-Plus、Claude Opus 4.8、DeepSeek-V4-Flash 和 GLM 5.2。

在完整任务评测中,GPT-5.5 排名第一,Qwen3.7-Plus 紧随其后。完整成绩和实验设置已经公开,社区可以沿用这套条件,接入自己的模型进行比较。

03

从下一步决策,

到完整任务,都能测

一次控制判断和一整段连续工作,可以放在不同的评测中考察。LoopArena 设计了三类评测,让研究者按自己的问题选择投入。

Type I:下一步,怎么选?

模型阅读一个控制点的任务进展,从候选指令中选择接下来的安排。题目的答案有实际执行结果作依据:在构建基准时,团队已经运行过候选方案,比较了它们带来的后续结果。

等到评测新模型时,这部分执行不必重做。模型只需完成控制决策,就能得到成绩,适合快速考察下一步判断。

Type II:从中途接手,继续往下带。

评测从准备好的中间状态开始,让 Controller 指导 Worker 完成接下来的一个阶段。代码会真实执行,反馈也会持续更新,多轮控制的过程保留在这段工作里。

研究者可以直接观察模型如何应对运行中的新情况,不必为每次尝试都重复前面已经完成的开发工作。

Type III:从开始到交付,全程参与。

任务从原始仓库状态启动,覆盖调查、实现和验证,直到决定结束。Controller 要根据整个过程的进展持续安排工作,最后接受完整任务的验收。


图 2|LoopArena 论文原图。单次决策、任务切片与完整任务,分别对应不同的研究需求和评测投入。

04

想研究长程控制,

预算也能更从容

对学生和小团队来说,长程 Agent 研究有个很实际的门槛:一个新想法,往往要等整套任务跑完,才能知道有没有效果。模型调用的账单也跟着每一轮尝试增加。

LoopArena 的 Type II 为此提供了一个低成本入口。它取自对应的完整任务,并与 Type III 一一配对,让团队可以直接检查:少跑前面一段,能否仍然得到有参考价值的模型比较?

在论文实验中,Type II 的平均估算模型推理成本比配对的完整任务降低约六成,同时,模型排序与完整任务评测高度一致。

这对日常研究意味着,可以先用任务切片比较不同模型、尝试新的控制方法,再把选中的方案放到完整任务上评测。同一份预算,就有机会支持更多轮想法验证。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
WTT中国大满贯,2026国庆假期开赛!首次开放后台探访权益,门票6588元,享受VIP“粉丝见面会”待遇

WTT中国大满贯,2026国庆假期开赛!首次开放后台探访权益,门票6588元,享受VIP“粉丝见面会”待遇

开成运动会
2026-09-11 08:40:40
韩媒嘲讽长鑫HBM3良率仅25%:4个里3个是废品!拿什么追SK海力士;星宇股份又出错,外包报酬支付总额约2.44万亿元;iPhoneDuo被炒至9.9万

韩媒嘲讽长鑫HBM3良率仅25%:4个里3个是废品!拿什么追SK海力士;星宇股份又出错,外包报酬支付总额约2.44万亿元;iPhoneDuo被炒至9.9万

雷峰网
2026-09-11 08:30:02
股价暴跌64%,知名黄金品牌疑“跑路”,网店已下架所有产品

股价暴跌64%,知名黄金品牌疑“跑路”,网店已下架所有产品

21世纪经济报道
2026-09-11 14:55:16
原河南省数据局副局长田凯被查

原河南省数据局副局长田凯被查

峰哥跑交通
2026-09-11 16:38:04
俄方为台湾人士放映《粉碎军国主义日本》,民进党当局果然跳出来了

俄方为台湾人士放映《粉碎军国主义日本》,民进党当局果然跳出来了

环球网资讯
2026-09-11 16:54:29
今年上海毕业季反常:大批高材生不进大厂,纷纷抢这碗饭

今年上海毕业季反常:大批高材生不进大厂,纷纷抢这碗饭

老做体育解说
2026-09-04 01:05:18
于文文自曝很难对男生有心动的感觉,调侃自己得了“不心动病”

于文文自曝很难对男生有心动的感觉,调侃自己得了“不心动病”

韩小娱
2026-09-09 08:06:33
准备战斗!中美终极对决提前到来,美国放大招了

准备战斗!中美终极对决提前到来,美国放大招了

兵国大事
2026-09-11 01:10:05
原来张子宇背后靠山,不是母亲不是宫鲁鸣,而是担世界杯解说的她

原来张子宇背后靠山,不是母亲不是宫鲁鸣,而是担世界杯解说的她

洲洲影视娱评
2026-09-11 15:25:03
章若楠回应被夸漂亮,直言大家卸了妆都长一样,自己也是被包装过

章若楠回应被夸漂亮,直言大家卸了妆都长一样,自己也是被包装过

芊手若
2026-09-11 14:22:08
听劝买LG电视却永不联网,两年后他发文感谢

听劝买LG电视却永不联网,两年后他发文感谢

碳基打工人
2026-09-10 16:08:17
本田急了!骂日本供应商: 你降成和中国一样低的价格, 我能不买

本田急了!骂日本供应商: 你降成和中国一样低的价格, 我能不买

兵鉴史
2026-09-10 22:31:46
张继科谈刘翔事件:不能胡说!刘翔是帮助国家拿到奥运冠军的英雄

张继科谈刘翔事件:不能胡说!刘翔是帮助国家拿到奥运冠军的英雄

大鱼简科
2026-09-11 17:18:43
总额超千万!澳门十三皇宫一次性购入13辆尊界S800典藏大观

总额超千万!澳门十三皇宫一次性购入13辆尊界S800典藏大观

快科技
2026-09-09 12:06:23
官方:墨西哥传奇马克斯正式就任国家队主帅

官方:墨西哥传奇马克斯正式就任国家队主帅

懂球帝
2026-09-11 14:27:17
直到刘翔离开,人们才知道43岁刘翔私下竟然这么壕,难怪底气十足

直到刘翔离开,人们才知道43岁刘翔私下竟然这么壕,难怪底气十足

探索新高度
2026-09-11 16:22:07
日本管天管地,管到解放军头上,中方懒得多费口舌,反手拉了清单

日本管天管地,管到解放军头上,中方懒得多费口舌,反手拉了清单

司马平邦
2026-09-11 17:07:31
中国周边生变,3国确定派兵,中导系统已就位?普京无法置身事外

中国周边生变,3国确定派兵,中导系统已就位?普京无法置身事外

桑启红原
2026-09-11 14:50:11
糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

磊子讲史
2026-09-11 16:21:43
苹果折叠屏一出来,全世界突然变了一个模样

苹果折叠屏一出来,全世界突然变了一个模样

大白聊IT
2026-09-11 00:50:56
2026-09-11 17:52:49
智猩猩
智猩猩
AI 技术内容与服务平台
98文章数 4关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

时尚
手机
数码
旅游
军事航空

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

手机要闻

网友调侃iPhone 18系列发布:iPhone都已成年了 我还在用正太苹果

数码要闻

240Hz跑出1000Hz效果!英伟达发布G-SYNC Pulsar新固件:动态清晰度暴增

旅游要闻

文化中国行·长江文化探访丨龙兴古镇焕新引多元业态 将打造古装短视频拍摄基地

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版