网易首页 > 网易号 > 正文 申请入驻

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

0
分享至



2026 年,AI 领域正在发生一个很容易被普通用户忽略、却可能相当深刻的变化。过去几年,行业讨论 AI 能力时,最常见的问题一直是:模型有多大?推理有多强?下一代模型又提升了多少?但到了今年,越来越多注意力开始从 “模型本身” 移向模型周围的整个系统。2 月,OpenAI 就开始以Harness Engineering为题讨论如何通过环境、规则、验证机制和工程约束让 Agent 更可靠; 7 月,OpenAI 更是直接披露 Codex 每周用户已经超过 500 万,其中超过 100 万人的使用场景已经走出传统编程。Harness 这个「模型外部运行框架」也越来越频繁地进入企业 AI 的讨论中。

这一变化背后其实藏着一个比 “哪个模型更强” 更本质的问题:一个 AI 系统的能力,究竟有多少存在于模型的大脑里,又有多少存在于组织这个大脑工作的方式里?

我们可以做一个很简单的类比。如果语言模型是一名员工,那么过去提升 AI 的主流路线,是不断把这名员工送去培训:给它更多数据、更好的反馈、更昂贵的训练,最后真正改变它 “大脑里的参数”。这就是包括知识蒸馏、后训练在内的许多传统能力迁移方法。但另一条路线是:完全不改变这个员工本身,而是给它设计一套更好的工作制度。

  • 复杂任务先自动分类;
  • 容易算错的部分交给计算器;
  • 需要长期记忆的信息写进表格;
  • 固定规则直接写成程序;
  • 最后再设置检查清单,防止答案格式出错。

在这个过程中,员工的大脑一点没有变,但整个系统却突然变得可靠得多。从这个角度出发,来自 Salesforce AI 和 UIUC 的研究人员在最新的研究中,探索了这个问题的更激的进版本:

能不能让一个更强的 AI,自动为一个更弱的 AI 设计这套 “认知外骨骼”,从而在完全不训练弱模型的情况下,把自己的部分能力迁移过去?

论文把这个问题称为 Strong-to-Weak Scaffolding。这一概念,也正是 「AI4AI」 最本质的样貌和雏形。



  • 论文标题:AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
  • 论文链接:https://arxiv.org/pdf/2608.12307

实验给出的答案相当惊人:在主实验中,一个原本平均准确率只有0.488的 GPT-5.4-mini,在强模型自动设计的 Harness 加持下,最佳结果达到0.912,已经接近翻倍;57 次针对 GPT-5.4-mini 的自动构建实验全部超过原始模型,而最佳方案甚至远远超过了不加 Harness、直接裸跑的众多更强模型。

但这篇工作的意义并不只在于让模型表现翻倍。真正有意思的是:研究人员进一步拆开了这将近 100% 的提升,试图去回答究竟是什么被 “迁移” 了。这其中隐藏的秘密,可能比单纯的分数更加值得我们挖掘。

一、不重训小模型,

而是让强模型给它设计工作方式

文章中整个实验的设置其实非常像现实中的 “师傅带徒弟”。

研究人员首先准备一个较弱的Target AI「目标模型」,它是真正负责回答问题的 “执行者”。然后再给一个更强的Builder AI「构建模型」一个开放的编程环境。Builder 不负责最终考试,而是负责观察 Target 到底为什么会犯错,并围绕它设计 Harness。

所谓 Harness,其实可以理解成包在模型外面的一整套工作机制:

  • 可以判断问题属于什么类型;
  • 可以针对不同问题选择不同 Prompt;
  • 可以写 Python 程序处理部分推理;
  • 可以建立显式的状态和规则;
  • 可以做答案检查和格式修正;
  • 甚至可以发现某些任务根本没必要让模型自己 “想”,直接写一个可靠算法就能解决。

在这其中最关键的一点是,Builder始终不能看到最终测试题。研究人员只随机开放每个 Benchmark 的5% 数据作为 Validation Set。Builder 可以在这少量样本上不断测试 Target、分析错误、修改代码和 Harness;等到 Builder 认为系统设计完成之后,整个 Harness 会被冻结,然后直接拿去跑此前完全没有见过的 Hidden Test Set。

所以,对于 Builder AI,它所构建的 Harness 不能只是简单的让 Target AI “背答案”。它真正需要做的,是从少量案例中发现:

这个任务到底有什么结构?这个小模型到底弱在哪里?哪些思考应该继续交给它,哪些思考应该被搬到系统外面?



图 1:AI4AI 的整套设计流程:Builder AI 并不直接解决问题,而是给 Target AI 搭建脚手架以减轻其认知负担,从 Harness 角度实现最基本的 AI4AI 能力迁移。

二、用心智理论度量 AI 的认知负担分配

文章选择了四个 Theory-of-Mind「心智理论」Benchmark:BigToM、Hi-ToM、MMToM-QA 和 MuMA-ToM。可以把 Theory of Mind 简单理解成:理解别人 “知道什么、相信什么、想要什么” 的能力。

举个例子:小明把钥匙放进抽屉,然后离开房间;小红趁他不在,把钥匙移到了柜子里。问题不是 “钥匙实际上在哪里”,而是:小明回来以后,会去哪里找?人类必须同时区分 “真实世界” 和 “小明脑中的世界”。而更困难的问题甚至会继续套娃:

小红认为,小明以为,小红知不知道钥匙的位置?

这类任务既包含可以形式化的状态追踪,也包含递归信念、隐含意图、对话理解甚至 Bayesian Goal Inference,因此很适合观察:AI 到底能把多少思考外包给程序,又有多少真正需要语言模型自己完成。

论文随后让不同强度的 Builder,在 Cursor、Claude Code、GPT Codex 等 Agentic Coding Environment 中自由设计 Harness,并进行了72 次实验构建,从效果、稳定性、验证预算、Harness 技巧、平台差异、Target 差异、Builder 推理强度、认知负担以及残余错误等多个角度进行了拆解分析。



表 1:以 GPT-5.4-mini 为 Target AI 的实验结果摘要及对比



图 2:全量主实验结果

三、给小模型换工作方式比直接上强模型还有效

我们先来看最简单的一组数字:

  • GPT-5.4-mini 什么都不加,直接回答四个任务,平均准确率是0.488
  • 所有自动构建 Harness 的实验平均表现为0.763(最佳一次0.912),相对原模型提升约86.7%
  • 作为对比,更强的 GPT-5.4 在没有 Harness 时只有0.619。

也就是说,在这些任务上,一个被好好 “组织起来” 的较弱模型,可以明显超过一个裸跑的更强模型。更重要的是,这并不是碰巧撞中了一个特别好的 Run。针对 GPT-5.4-mini 的57 次 Scaffold Run 全部都能超过原始 Baseline,11 种 Builder Configuration 平均也全部产生正向提升。

当然,这并不意味着 Harness 已经彻底取代人工设计。论文还拿它和此前人工设计的 UserHarness 进行了比较:GPT-5.4-mini + Human-Inspired Harness 可以达到 0.939。自动 Harness 的最佳 0.912 已经相当接近,但在几个真正复杂的 Benchmark 上仍然存在明显差距。也正是这个差距,让文章后面的分析变得尤其重要。

四、应该把哪些东西从 AI 的大脑里搬进 Harness?



表 2:模型使用的 Harness 技巧统计以及对 Target AI 带来的效果提升

发现一:最有效的 Harness,并不是让弱模型思考得更久

一种最自然的猜测是:小模型不够聪明,那强模型帮它写一个超级 Prompt,让它多做 Chain-of-Thought、多采样几遍、多自我检查,是不是就行了?

实验的结果却并非如此,而是指向了另一件事:Builder AI 最常采用的措施,首先是一些听起来甚至有点 “朴素” 的工程手段:答案格式约束、Greedy Decoding、任务 Routing、结构化输入输出。而真正区分优秀 Harness 的,则往往是更进一步的东西:Deterministic Solver、Structured Extraction、Polarity Logic,以及显式的状态追踪等等。

换句话说,好的 Builder 并不是不断告诉弱模型 “请再认真想一遍”,而是会进一步问 “这里为什么还需要你想”。如果某段推理其实存在稳定规律,就把它写成代码;如果某个步骤只是在机械地记录谁看到了什么,就把状态显式存起来;如果问题可以先分成四类,就不要要求模型每次重新理解整个任务。

论文还发现,Harness 中由外部代码和规则直接完成的工作比例,与最终准确率存在很强的正相关(r=0.72);相反,单纯 “代码写得更多” 与准确率的关系非常弱,只有约(r=0.22)。

这两组数字放在一起看,我们不难发现:

有效的 Harness 不是给模型增加更多思考,而是在删除那些本来就不应该由概率模型承担的思考。



图 3:Builder AI 将任务结构外化从而降低 Target AI 的认知负担,这种认知负担的转移是 AI4AI 通过 Harness 成功提升小模型能力的关键

发现二:真正发生的不是知识迁移,而是认知结构迁移

这是整篇文章最值得细想的核心。传统蒸馏的逻辑,是让老师把知识教进学生的大脑。但这里 Target AI 的参数从头到尾根本没有变化。强模型真正留下来的反而可能是一个分类器,一组规则,一套状态表示,若干程序,以及一整套约束弱模型如何工作的流程等等。

也就是说,被迁移的并不是某个问题的答案,也不完全是语言层面的知识,而更接近于:

强模型把自己对 “这个任务应该怎样思考” 的理解,编译成了一套小模型能够执行的外部结构。

论文把这一现象称为Cognitive-Load Reduction「认知负担降低」:即一部分工作被彻底 Offload 给程序和工作流;剩下仍然需要模型处理的问题,也会被 Harness 重新组织成范围更小、输入更清晰、输出更受约束的子任务。

从这个角度看,Strong-to-Weak Scaffolding 很像给弱模型制造了一副 “认知外骨骼”:外骨骼并没有让人的肌肉本身突然变强,但它改变的是原本需要肌肉独自承担的负荷,现在却被整个 Harness 系统重新分配了。



图 4:在不同 Benchmark 上对于残存错误的统计分析

发现三:不是所有思考,都同样容易被编译成规则

这篇文章也没有得出一个过度乐观的结论,因为并不是所有智能都能轻易写进 Harness。其实四个 Benchmark 之间就已经出现了非常明显的差异。

例如在 BigToM 中,大约94%的任务最终可以被 Harness 通过固化工作流处理。正是因为这个任务存在很多稳定的 “谁看到了什么、谁没有看到什么” 的规律,因此 Builder 很容易把它们编译成程序。但到了 Hi-ToM,这一比例降低到约51%。而更加开放、依赖对话和社会推理的 MuMA-ToM 只剩下约36%。

这实际上也划出了一条非常有意思的边界:AI 推理中,一部分困难来自 “计算和组织不可靠”;另一部分困难则来自问题本身真的需要理解和推断。

前者非常适合被 Harness 消灭,但是后者却不会因为多写几百行代码就自动消失。论文对于残余错误的分析也印证了这一点:Hi-ToM 中随着 belief recursion 越来越深,准确率明显下降;MMToM 中更复杂的 Bayesian goal inference 依然困难。因此,这篇研究真正提出的不是代码可以替代推理,而是一个更加精细的问题:

未来的 AI 系统,应该学会判断哪些认知和推理活动应该交给模型,哪些应该被编译成工具、状态和规则,通过 Harness 来自动化。





图 5:Builder AI 可以不断让 Harness 自我进化,提高 Target AI 的下游任务表现。但是这个表现好坏与 Builder AI 进行 Harness 进化的轮数并不成正比,反而和推理强度正相关

发现四:强模型真正的价值,体现在更会看懂任务

Builder AI 在构建 Harness 的过程中可以不断自我反思进化,重跑 Validation。直觉上,测试次数越多,应该越容易找到一个好的方案。但实验并没有发现这样的关系。

最终完整测试集表现与Validation 最佳成绩高度相关;但是与 Builder 一共进行了多少次 Refinement 的相关性只有(r=0.17)。相反的,当研究人员固定 Builder 为 Opus-4.7,只提高 Builder 自己的 Reasoning Effort 时,不同平台上 Builder AI 搭建的 Harness 质量都呈现持续上升趋势。

这意味着强 Builder AI 的优势似乎并不主要来自更勤奋地试错,而是要更快地发现这个任务到底有什么可以被利用的结构。

这其实给 “推理算力应该花在哪里” 提供了一个非常不同的视角:与其让弱模型在未来的每一道题上都重复进行昂贵而不稳定的思考,不如让强模型先进行一次更昂贵的元推理,即

先想清楚以后应该怎么想

然后把再这个结论固化进 Harness。






表 3:相同 Builder AI 在面对不同 Target AI 时,Harness 对小模型带来的收益往往由其已有的能力决定:已有能力越强 Harness 越有可能成为束缚

发现五:越弱的模型,越可能从好的 Harness 中受益

文章进一步换掉 Target AI,用本身表现已经更强的 Gemini-3.5-flash 再次进行实验。一个非常清晰的规律便出现了:Target原本留下的 Headroom 越大,Harness 能够实现的提升也往往越大。

论文在不同 Target×Benchmark 条件下得到的相关性约为 (r=0.75)。对于 GPT-5.4-mini,很多 Builder 可以产生 0.2、0.3 甚至更大的提升;而当 Target 本身已经非常擅长某些任务时,复杂 Harness 的收益会迅速缩小,个别任务甚至会出现轻微退步。

这其实非常符合现实中的组织经验。一个已经能够独立处理任务的专家,被强行塞进十层审批、二十张表格和固定流程里,未必会工作得更好。Harness 本质上也是一种约束:

对于能力不足者,它是脚手架;对于已经足够强的人,它也可能变成束缚。

因此,未来优秀的 Harness 不会是一个对所有模型都固定不变的 “超级 Prompt”,而需要动态判断这个模型在哪些地方需要帮助,哪些地方应该放手。

五、AI4AI 打开了一条模型与环境共同进化之路

启示一:未来评价 AI,将不会只看裸模型

过去 Benchmark 默认测量的是:

给模型一道题,它能不能答对?

但 Agent 时代之后,一个部署中的 AI 几乎从来都不是单独存在的。它有 Memory,有 Tool,有 Context Management,有 Verification,有 Skills,有 Router,还有各种确定性的代码。因此更加现实的问题可能逐渐变成:

给定一个模型和一套可塑造的运行环境,这整个系统最终能够做到什么?

这篇工作的结果尤其在向我们揭示着:Model Capability 和 System Capability 已经越来越不是同一个概念。一个 0.49 的模型的确可以存在于一个 0.91 的系统里。

启示二:AI 未必自己干活,也可以负责设计别人如何干活

如果这种 Strong-to-Weak Transfer 能够在更多真实任务中成立,那么它会带出一种很有意思的 AI 分工方式:最昂贵、最强大的模型不一定需要处理每一个请求,而是可以承担一种更像架构师的角色:分析任务、发现规律、设计流程、编写工具、建立检查机制,然后把大量日常执行交给更加便宜的小模型。

这篇论文并没有直接证明这种架构在真实产业中一定更省钱,但它提供了一个非常值得研究的可能性:

昂贵智能的一次性思考,能否被固化成基础设施,再由廉价智能反复执行?

如果答案最终是肯定的,那么未来 AI Scaling 的经济学就不再只是每一个问题都调用多强的模型;而是会变成:哪些昂贵的认知工作,可以只做一次。

启示三:AI4AI 的下一阶段,是 AI 开始设计 AI 的生存环境

AI4AI 经常让人联想到一个非常宏大的叙事:AI 自动训练 AI、AI 自动写 AI、甚至 AI 自动改进 AI。但这篇工作的切入口其实更加朴素,也可能更加现实。它没有修改模型参数,没有训练出一个新的基础模型,也没有展示某种无限递归式的自我提升,而是只多做了一层:

让一个 AI 不再直接解决问题,而是观察另一个 AI 怎样解决问题,然后改变后者工作的环境。

但恰恰是这一层变化最值得重视。因为一旦 AI 不仅能够在既定系统里行动,而且开始能够修改系统本身,智能体优化的对象就从 “答案” 逐渐上升到了 “产生答案的机制”。

论文最后因此提出了一种很值得期待的方向:未来的模型和 Harness 可能不再彼此独立。更好的模型可以设计更好的 Harness,更好的 Harness 又能帮助模型更稳定地发挥能力,二者进入持续的Co-evolution「共同进化」。

六、结语

过去十年的 AI Scaling,主要发生在模型参数内部。而 Agent 时代真正值得关注的下一场 Scaling,也许会越来越多地发生在模型之外:工具如何组织,记忆如何保存,任务如何拆解,错误如何验证,推理如何被编译,强模型又如何把自己的结构性认知沉淀给下一层 AI。

如果说传统蒸馏是在试图把一个更聪明老师的 “知识” 装进学生的大脑,那么 Strong-to-Weak Scaffolding 提出的另一种可能是:

学生不一定需要先拥有老师的大脑。老师也可以先给学生造一个更聪明的世界。

而这也正是AI4AI atTest-Time最值得继续追问的方向。

作者简介

钱成目前是 UIUC 三年级博士生,导师为季姮教授。本科毕业于 THU,师从刘知远教授。他的研究主要聚焦于 LLM Agent,尤其关注推理,工具,用户与创造力等方向。曾发表 ToolRL、UserRL 工作,论文 Google Scholar 累计引用 3600+。他曾获 Capital One Fellowship,任 ACL/EMNLP AC,及 NAACL 2027 SRW PC。他还牵头组织了 ICLR26/COLM26/AIAS26 Lifelong Agent Workshop,并长期担任 NeurIPS、ICLR 等国际会议 Reviewer。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
蕾丝女神:不是镂空,是光线与阴影之间为你留出的可调节透光边界

蕾丝女神:不是镂空,是光线与阴影之间为你留出的可调节透光边界

疾跑的小蜗牛
2026-09-01 20:00:15
婚姻里最让人寒心的事是什么?网友:因为一顿饭离婚了!

婚姻里最让人寒心的事是什么?网友:因为一顿饭离婚了!

夜深爱杂谈
2026-09-02 19:58:04
基层医院发不出工资上热搜,真实情况超乎大家想象,最铁的饭碗不好端了

基层医院发不出工资上热搜,真实情况超乎大家想象,最铁的饭碗不好端了

Mr王的饭后茶
2026-09-02 15:38:02
2年1900万续约,塞克斯顿:踏上球场我的能量就能感染全队

2年1900万续约,塞克斯顿:踏上球场我的能量就能感染全队

日常碎碎念啊
2026-09-02 19:33:41
让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

冷观互联网
2026-09-01 16:23:40
8月最后一天,俄罗斯连遭羞辱,被印度教训后,又被欧盟踩了面子

8月最后一天,俄罗斯连遭羞辱,被印度教训后,又被欧盟踩了面子

那场烟花雨淋湿了梦境了
2026-09-01 16:09:42
破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

影孖看世界
2026-09-01 16:30:00
王玉雯瘦到肋骨清晰可见上热搜,评论区吵成了两个世界

王玉雯瘦到肋骨清晰可见上热搜,评论区吵成了两个世界

萧狡科普解说
2026-09-02 08:14:11
上合十国领导人全都在场,莫迪发言很不客气,当场对巴基斯坦发难

上合十国领导人全都在场,莫迪发言很不客气,当场对巴基斯坦发难

共工之锚
2026-09-02 00:25:29
预估19万左右!广汽新车官宣:9月2日开启预售

预估19万左右!广汽新车官宣:9月2日开启预售

科技阿维
2026-09-02 20:12:26
北京女子状告开发商,赢下2600万元官司,200万元律师费仅付30万后失联遭律所起诉,代理人:律师费过高

北京女子状告开发商,赢下2600万元官司,200万元律师费仅付30万后失联遭律所起诉,代理人:律师费过高

极目新闻
2026-09-02 09:10:08
反转!王钰栋留洋计划遇阻,真实原因曝光

反转!王钰栋留洋计划遇阻,真实原因曝光

徽派体育
2026-09-01 18:25:21
“乌克兰将封锁俄罗斯领空”?普京回应

“乌克兰将封锁俄罗斯领空”?普京回应

凤凰卫视
2026-09-02 16:48:08
旺旺,背刺打工人

旺旺,背刺打工人

果壳
2026-09-01 21:45:00
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

垚垚分享健康
2026-08-26 16:21:31
热议!近期《重案六组》翻拍,李诚儒回应:他们请了我,我没去

热议!近期《重案六组》翻拍,李诚儒回应:他们请了我,我没去

西昆仑Bruce
2026-09-01 18:29:49
英超五强转会评级:曼城居首,阿森纳存隐患

英超五强转会评级:曼城居首,阿森纳存隐患

林间小温柔
2026-09-02 18:06:57
用她的画法画她:网友这招,比骂街管用百倍

用她的画法画她:网友这招,比骂街管用百倍

浯江孤舟
2026-09-01 11:02:49
深绿高官即将赴陆,绿营向大陆提要求,却被大陆反将一军,不一般

深绿高官即将赴陆,绿营向大陆提要求,却被大陆反将一军,不一般

史行途
2026-09-02 19:51:55
泽连斯基警告“俄罗斯领空不再安全”,普京回应:这是“国家恐怖主义”

泽连斯基警告“俄罗斯领空不再安全”,普京回应:这是“国家恐怖主义”

红星新闻
2026-09-02 11:56:38
2026-09-02 20:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

房产
艺术
教育
时尚
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

教育要闻

随州一中2026年秋季开学典礼隆重举行

中国农村,挤满了花钱干农活的外国佬

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版