网易首页 > 网易号 > 正文 申请入驻

对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线

0
分享至


当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。

作者丨张 璐

编辑丨马晓宁

过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。

然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。

更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。

评估贵,精炼也贵,两笔账算下来,技能优化的效率就成了绕不开的瓶颈。

针对这一痛点,来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队,在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种全新的破解思路。


论文链接:https://arxiv.org/abs/2609.11682

COBRA-Skills 摒弃了盲目堆叠 Token 的演化路线,巧妙地将技能优化转化为一个带预算控制的情境多臂老虎机(Contextual Bandit)问题。

它在真实评估前增加了一道“收益预判”机制,确保只有最具潜力或探索价值的候选技能才会进入实际演练,并结合精细化算子迭代种群。凭借这套高效的筛选策略,COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。

AI 科技评论近日独家对话了论文第一作者卢平琛。在交谈中,他向我们还原了团队如何将“情境多臂老虎机”引入 Agent 技能演化,以及这套低成本范式背后的真实踩坑经历与工程抉择。

01


双轮闭环:

经典算法“筛选” + 进化算子“重构”

COBRA-Skills 的设计可以概括成:老虎机负责“选”,进化负责“改”,两者形成一个持续运转的闭环。

具体而言,系统维护着一个固定规模的技能种群。在日常迭代中,流程分为三步:

1.筛选评估。由老虎机算法为种群中的每个技能打分,挑选出得分最高者;

2.实战检验。目标智能体搭载该技能在优化集上执行任务,并返回对应的奖励与执行轨迹;

3.反馈更新。将评估结果写入历史数据,用于更新打分模型。此外,种群会定期触发进化更新,淘汰低分技能并生成新技能填补空缺。


这两大机制紧密结合。老虎机依据历史数据预测技能潜力,而进化生成的新技能则会回流至老虎机的候选池;反过来,进化机制所依赖的改进证据,来自执行老虎机精细挑选后的技能后留下的执行轨迹。

02


引入“老虎机”,

将 Token 消耗拦在评估之前

论文第一作者卢平琛在接受AI科技评论采访时透露:

在最开始复现同类工作时,我们发现总 Token 量看似还好,但账单却高得吓人。

团队深入分析后发现,核心瓶颈在于教学模型(Teaching Model,如 GPT-5.5 类高阶模型)调用次数过多,且单次调用的上下文极长。因此,团队在设计初期就明确将目标定为控制实际经济成本(Cost),而非简单统计 Token 数量。

两层 MLP 收益预测:为未评估技能精准打分

最直接的做法,是基于历史评估数据,预判候选技能在未评估时的预期得分。

COBRA-Skills 借助一个轻量级的两层 MLP 来实现这一点:先将每个技能转化为语义嵌入向量,再由 MLP 输出一个标量奖励预测值。

随着评估数据的积累,预测精度会稳步提升。每完成一次技能评估,最新的“技能—奖励”数据就会被纳入历史库,用于重新拟合预测模型。

然而,单纯依赖预测收益往往会带来局限。若某种技能当前的预测得分最高,算法就容易陷入对它的持续选择,导致其他有潜力的技能永远得不到评估机会。这便是经典的“探索与利用”困境。

LinearUCB 空间探索:破除“只选高分”的贪婪困境

在探索策略的选择上,团队曾经历过严谨的实证对比。

据卢平琛介绍,团队最初曾尝试过 NeuralUCB,但发现其特异性筛选能力较弱。

比如连续两轮选中同一个技能,系统对该技能不确定性的衰减幅度与其他技能几乎没有区别;此外,NeuralUCB 的计算量极其庞大,在做对角化近似时还会牺牲部分精度。

相比之下,LinearUCB 则展现出了极高的性价比与精准度。仿真实验表明,以技能嵌入向量为输入、对应奖励为输出时,LinearUCB 能非常灵敏地识别出哪些语义区域已被充分探索,进而精准压低该区域的探索奖励,实现了轻量与高效的兼得。

因此,团队最终采用了 “神经网络预测收益 + LinearUCB 量化探索” 的轻量高效组合。

最终优先级分数 = 预测奖励 + 探索奖励

在运行逻辑上,系统每轮仅挑选得分最高者送入评估,而综合分值垫底的技能则会在后续进化中被淘汰。

这种设计将有限的评估预算精准引导至两类技能:要么预测表现极佳(利用),要么信息增量巨大(探索)。至于那些既无性能优势、又处于已探明区域的低质技能,则会被彻底过滤,不再浪费任何 Token。


图:LinearUCB 探索系数v对系统平均性能的影响分析(当v=0.1时达到最优性能 73.5%)

03


基于轨迹证据演化,

告别全局重写的盲目消耗

老虎机算法解决了“选谁评估”的效率问题,但候选技能本身并不会凭空变强。

真正推动技能质变的是进化机制。它立足于评估所产生的实战证据,负责对候选技能进行持续的生成、重组与精炼。

攒够证据再动刀,避免频繁消耗 Token

为了避免高频调用高昂的 LLM 去频繁重写技能,进化机制并非逐轮触发,而是采用了对数调度策略,例如在第 3、6、9、13、19……次迭代时按需触发。

据卢平琛介绍,随着演练推进,老虎机本身已能建立起相对准确的预测逻辑,老虎机的预测结果也能逐渐收敛到好的候选技能上,因此后期并不需要高频补充新技能。

这种“前期密集、后期稀疏”的演化节奏,让团队得以在积攒了足够的实战轨迹证据后才精准“动刀”,从而大幅降低了 Teaching Model 的调用频次与 Token 消耗。

三种演化算子:保守微调与结构保护

每次进化更新时,算法淘汰评估得分最低的m个技能,并由以下三种算子生成新技能填补空缺:

1.再生算子(Regeneration):直接从初始无技能的执行轨迹中归纳全新的独立策略,不依赖现有父代,为种群引入全新的探索方向。

卢平琛提到:

若整个框架只能保留一个算子,再生算子无疑是绝对核心,因为初始技能种群正是基于它构建而来的。

2.轨迹变异(Rollout Mutation):针对当前轮次评估的技能,采样其最新的成功与失败案例,仅做局部的针对性修正。

3.交叉重组(Crossover):对比历史高绩效与低绩效技能,以其中一个高分技能为“骨架”,吸收成功经验并规避已知失败模式。该过程无需目标智能体重新评估,属于“零成本”重组。

除了算子设计,团队在技能的修改幅度上也展现出了极强的工程克制。

不同于许多同类工作让 LLM 对技能进行全局重写或过度融合,团队在实验中发现,大面积修改极易破坏原技能中已生效的优良结构,从而引发性能震荡。

卢平琛强调:

对于轨迹变异与交叉重组算子,我们以现有技能或高分技能为骨架,进行少量、保守的局部修改,这样才是稳定可控的。

04


实测验证:

性能全面超越,优化开销直接腰斩

为了全面验证 COBRA-Skills 的泛化能力,论文在 6 个异构的智能体基准上进行了评估。这些任务覆盖的维度相当广泛:

  • SearchQA:开放域问答;

  • SpreadsheetBench:电子表格自动化操作;

  • DocVQA:文档图像理解;

  • LiveMath:研究级复杂数学推理;

  • SocialMaze:社会推理与隐藏角色推断;

  • ALFWorld:具身环境中的多步决策。

这些任务不仅横跨单轮与多轮交互,更涵盖了外部文件处理、工具调用以及与持久化环境的持续互动。

在实验配置上,团队选用了三个不同能力梯队的目标模型(Qwen3.6-35B-A3B、GPT-5.4-Nano、Gemma-4-26B-A4B-it),并统一采用 GPT-5.5 作为教学模型。

所有方法均共享同一个 100 例的留出测试集,且该测试集全程严格绝缘于技能的构建与筛选过程。

突破性能上限,中小模型“补强效应”尤为突出

在三个不同能力梯队的目标模型上,COBRA-Skills 均取得了最高平均性能。相比无技能基线,它在 Qwen、GPT-Nano 和 Gemma 上分别大幅提升了 13.1、26.9 和 22.5 个百分点。数据表明,优质技能对于能力相对较弱的小模型,具有更显著的“补强效应”。


图:COBRA-Skills 与主流方法在不同目标模型上的平均性能(上)及性能与优化成本对比(下)

对比实验还显示,即便仅做初始化、不做后续优化的“证据锚定技能基线”,其表现也能稳定超出无技能基线,而 COBRA-Skills 则在此基础上实现了进一步的跨越。

值得一提的是,在三个目标模型的实验结果种,COBRA-Skills 并非在所有单项基准上都拔得头筹(例如在Qwen3.6-35B上,SearchQA 上略低于 SkillOpt;在Gemma4-26B上,DocVQA 上优势不明显)。但它的核心优势在于极高的综合鲁棒性。无明显短板,也没有在任何模型上失灵。


表:COBRA-Skills 与主流方法在 6 个 Benchmark 上的详细性能对比数据

在复杂的异构任务场景中,这种“不偏科”的综合稳定性,远比单一任务上的单点突破更具实用价值。

教学 Token 节省八成,50 样本撬动高稳定泛化

在成本控制上,与最强基线 SkillOpt 相比,COBRA-Skills 的总优化成本降低了 55%–58%,教学模型的 Token 消耗大幅缩减了 67%–80%,每单位性能提升的成本降低了 60%–69%。


表:COBRA-Skills 与主流方法在 Token 消耗、优化总成本及单位性能成本上的量化对比

传统方法往往依赖庞大的样本集进行训练与验证。例如在 SearchQA 上,SkillOpt 官方配置包含 400 个训练样本和 200 个验证样本;SpreadsheetBench 的 Trace2Skill 也使用了 200 个样本。相比之下,COBRA-Skills 在所有基准上统一仅使用 50 个优化样本。

针对这 50 个样本的设计考量,卢平琛解释道:

样本太少(如 20 个)会导致分数反馈剧烈震荡,而 50 个样本能提供非常稳定的反馈信号。在具体进化时,我们每次从 50 个样本中随机抽取 8 条执行轨迹作为证据;C₅₀⁸构成了极其庞大的组合空间,既保证了证据的针对性,又为技能生成保留了丰富的多样性与探索空间。

这 50 例样本在“评估可靠性”与“任务覆盖度”之间取得了极佳平衡:每个候选技能均在这 50 例上完整评估,以获取可靠的排序信号;同时,样本完整保留了基准任务的真实构成,能暴露出多样化的重复模式供技能归纳。样本少不等于信息少,关键在于利用效率。


论文还设计了两组消融实验:

1.w/o Bandit(移除老虎机):保留进化机制,但候选筛选改为随机选择,平均性能下降 2.2 分。

2.w/o Evolution(移除进化):保留老虎机机制,但在固定的 30 个技能池中挑选,不生成新技能,平均性能下降 2.4 分。

两者均造成 2 分以上的性能衰退,可见选择性评估分配与候选空间演化互为补充、缺一不可。

此外,论文还设置了 Best-of-30 基线(用同样的证据锚定机制生成 30 个技能,全量评估后取最优解)。结果显示,Best-of-30 比完整方法低了 2.5 分。


图:消融实验与 Best-of-30 结果对比(上表)及 36 组跨模型技能迁移矩阵热力图(下图)

无惧接口切换、离线自教学与跨模型迁移

论文从三个层面进一步验证了方法的泛化韧性。

1.框架适配:将 Qwen 移植至 Claude Code 和 Codex 框架下运行,COBRA-Skills 依然分别取得 68.2 和 72.4 的最高平均分,证明其效果不依赖特定的智能体接口。


表:COBRA-Skills 在 Claude Code 与 Codex 框架下的跨平台适配性能对比

2.自教学进化:若以目标模型自身取代 GPT-5.5 进行技能生成与精炼,系统平均分仅由 73.5 微降至 72.5,却实现了成本减半,且性能远超同等设置下的 SkillOpt(68.4),展现了离线低成本自教学的巨大潜能。


图:迭代收敛过程(左)及自教学模式下的性能与成本对比(右)

3.跨模型复用:将 GPT-5.5 优化的技能库迁移至其他目标模型,36 次迁移中 34 次成功超越基线。这有力地说明,COBRA-Skills 提取的是高泛化性的任务层解题范式,而非与特定模型绑定的 Prompt 技巧。

05


大模型负责创造,

经典算法负责控本

过去一段时间,Agent 领域隐约浮现出一种“大模型全包”的迷信:从任务理解、技能生成,到诊断反思与重写进化,全盘交给 LLM 端到端解决。但这篇论文用一组直观的账单数据,直白地戳破了这种“全能幻觉”。

大模型固然具备惊人的符号生成与语义理解能力,但在处理带预算约束的序列决策、估计统计不确定性,以及计算“算力回报率”这类问题时,它不仅价格昂贵,而且缺乏天然的概率把控力。

COBRA-Skills 最耐人寻味的设计,恰恰在于它的“复古”。团队没有强求大模型凭空判断哪个技能更有价值,而是优雅地引入了决策理论中经过数十年验证的“上下文老虎机”。

这种“传统 ML 负责量化与控本,LLM 负责生成与提纯”的范式融合,为下一代 Agent 的架构设计提供了清晰的示范。

06


独家对话:专访第一作者,

拆解工程边界与落地未来

AI科技评论:在跨模型迁移实验中,36 次迁移有 34 次成功超越了基线,但有 2 次表现欠佳。这两次“例外”是什么原因造成的?

卢平琛:这两次例外的幅度其实都很小,分别只比对应的无技能基线低约 0.3 和 1.7 个百分点。一个更可能的原因是,不同模型的能力结构、推理习惯和错误模式并不完全一致,因此在一个模型上优化出的 Skill,未必能完全匹配另一个模型最需要的指导方式。当然,这其中也包含少量的随机因素。但总体来看,超过 94% 的成功率证明,优化出的技能抓取的是通用的任务级策略,具备极强的跨模型通用性。

AI科技评论:从工程落地的角度看,目前 COBRA-Skills 最大的局限性是什么?

卢平琛:目前我们主要聚焦于任务层(Task-level)的技能演进化。从技能自身的结构来看,我们尚未覆盖过于复杂的多技能联动场景。比如像 Claude Code 提出的某些 Skill 结构中,会在执行 SQL 的同时动态调用 Python 脚本,或者通过索引去关联其他 SQL 技能。这种跨工具、多层级的复杂技能联动结构,是我们目前尚未覆盖、也是下一步需要探索的方向。

AI科技评论:如果将这种“老虎机 + 进化”的思路延伸到其他场景(如 Agent 工具调用、RAG 检索等),你觉得哪种最有可能率先落地?

卢平琛:RAG 领域的相似度检索最有可能率先落地。因为 Skill 的标准结构本身就包含 Title(标题)、简短 Description(描述)以及 Body(正文)三部分。在实际业务中,大量 Agent 正是依赖那句简短 Description 进行索引与匹配的,这与我们当前的优化框架天然契合。

AI科技评论:如果用一句话来概括这篇论文最核心的贡献,你会怎么总结?

卢平琛:高效、低成本地优化 Agent 的 Skill,让智能体演化不再被昂贵的账单拖垮。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

我爱英超
2026-09-23 16:16:17
亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

国乒二三事
2026-09-23 06:51:57
广东省省长会见刘庆峰、王兴兴

广东省省长会见刘庆峰、王兴兴

极目新闻
2026-09-23 08:00:50
湖南邵阳“远洋捕捞”上海老板,“交一个亿,不然就判你!”

湖南邵阳“远洋捕捞”上海老板,“交一个亿,不然就判你!”

周军律师聊案子
2026-09-22 14:59:30
侵略者现身亚运会!韩国舆论彻底炸锅,中韩绕不开的那段历史

侵略者现身亚运会!韩国舆论彻底炸锅,中韩绕不开的那段历史

冷桂零落
2026-09-20 15:51:38
33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

扬子晚报
2026-09-23 15:56:49
“黑老大”黄大发被判处死刑立即执行

“黑老大”黄大发被判处死刑立即执行

扬子晚报
2026-09-23 12:45:41
李乐成任安徽省委书记,周祖翼任河南省委书记,赵龙任福建省委书记

李乐成任安徽省委书记,周祖翼任河南省委书记,赵龙任福建省委书记

新京报政事儿
2026-09-23 11:06:09
亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

林子说事
2026-09-23 04:09:43
赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

懂球帝
2026-09-23 14:00:09
亚运会惊天逆转,日本组合挽救三赛点,松岛辉空拖张本美和后腿

亚运会惊天逆转,日本组合挽救三赛点,松岛辉空拖张本美和后腿

南海浪花
2026-09-23 11:33:41
野村报告:10万亿化债,效果几何?

野村报告:10万亿化债,效果几何?

罗sir财话
2026-09-22 14:35:32
奥运冠军张家齐上热搜!收入去向成谜,“我不是爸妈养大的,我是队里养大的”

奥运冠军张家齐上热搜!收入去向成谜,“我不是爸妈养大的,我是队里养大的”

上观新闻
2026-09-23 11:31:40
从卖产品到帮人做生意:xTool跑出中国出海新范式

从卖产品到帮人做生意:xTool跑出中国出海新范式

霞光社
2026-09-23 13:18:29
亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

侧身凌空斩
2026-09-23 15:40:55
不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

全景体育V
2026-09-22 19:39:04
豆包上车,熟悉的助手接下新的任务

豆包上车,熟悉的助手接下新的任务

晚点LatePost
2026-09-18 20:59:57
哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

户外阿毽
2026-09-23 15:23:41
特朗普:从“泽连斯基没有牌”到请求乌克兰停火

特朗普:从“泽连斯基没有牌”到请求乌克兰停火

名人苟或
2026-09-23 15:29:18
2026-09-23 18:35:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

家居
本地
亲子
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

媒体:举报“炒菜锅洗拖把”幼师的担心不能成真

教育要闻

最新!全国化学奥赛北京队名单来了!26人进入决赛,来自这11所学校

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版