网易首页 > 网易号 > 正文 申请入驻

智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

0
分享至


新智元报道


当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为人工智能领域的「The Next Big Thing」。

自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——「投入多少能源,就将转化多少智力」。自主研究正是衡量智能体自主研究能力重要维度之一。

普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是「搜索得还不够久或者证据难找」,而是:

智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么,是如何让智能体在复杂约束中持续接近正确答案。

智源研究院发布的AREX正是围绕这一核心问题提出的。它抓住了自主研究中的关键突破口——「发现—验证不对称性」:完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。

验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解「已经知道什么、还缺少什么,以及下一步应该研究什么」,从而让每一轮研究都更加精准、更具方向性。

这一思想的前瞻性在Jeff Dean近日创立的Discovery Loop公司得到印证:未来的人工智能不仅需要更强的推理能力,更需要通过持续的实验、反馈和修正形成自主发现能力。

AREX对「求解—验证」双循环的探索,体现了智源研究团队在自主研究方向上的前瞻性,也反映出通过闭环迭代推动智能持续进化,正在成为人工智能发展的重要趋势。

项目主页:

https://vectorspacelab.github.io/arex-model/

模型权重:

https://huggingface.co/collections/BAAI/arex

体验链接:

https://arex-research.com

AREX旨在训练能长期运行、

自我验证、持续修正的研究型智能体

AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。

面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。

这一过程可以递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的「自我改进」,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。

它不再只是一个「搜索后回答」的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。AREX通过双循环框架打通「找到答案」与「改进答案」的闭环AREX的整体方法,可以概括为一套双循环递归求解框架。内层循环负责「研究」,外层循环负责「改进」。

二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。


内层循环Research Loop:内层循环负责完成一轮相对完整的研究。在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解。

如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。

外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。

如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。因此,外层循环不是简单地说「答案还不够好,再试一次」,而是明确告诉内层循环:已经解决了什么,接下来只需要解决什么。这让每一轮递归都能继承已有成果,而不是从头开始。

机制分析:

长程研究状态维护带来的性能提升

AREX的推理机制包含两个循环:内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。

其中,自主上下文更新(ACU)是关键。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。

受控实验显示,AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。



训练消融进一步说明,AREX的提升来自多个环节共同作用。渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。

这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。

AREX让自主研究智能体

在长程任务中持续自我进化

长程研究不「失忆」:将「历史包袱」转化为「进度路标」。长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。

AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新并不是普通摘要,而是一份「研究进度表」,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。

构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。

为此,AREX设计了一套可验证的自主研究任务生成方法:先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,然后再把这些约束改写为无法通过关键词直接命中的开放式问题。这样生成的任务,迫使模型必须真正去搜索、比对和验证,而不是在文本表述里「找答案」。

随后,强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。但凡出现直接猜答案、忽略观察、证据不足或结论与证据矛盾等情况,整条轨迹都会被剔除。最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。

分阶段训练与关键步骤强化:使模型掌握自我改进的连贯策略。在获得高质量训练数据之后,训练顺序同样关键。AREX没有将所有轨迹简单混合训练,而是采取了分阶段策略。模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,AREX还会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。

AREX也不会把长轨迹中的每一步都同等对待。真正决定研究是否能够取得突破的,往往是少数关键转折点,例如找到关键证据、否定错误候选、切换搜索方向,以及更新研究状态。这些关键步骤会在训练中被重点关注,并在强化学习阶段继续优化模型的研究策略。

因此,AREX的自我改进能力并不是「多搜几轮」自然涌现的结果,而是由可验证任务设计、高质量轨迹筛选、分阶段训练和关键步骤强化共同塑造出来的。它的目标是让智能体更接近真正的研究者:能够判断何时坚持当前方向,何时及时掉头,何时停下来确认答案。

实验评估:

AREX以10B激活参数达到自主研究前沿水平

为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。


信息深度:在多跳信息中持续挖掘

BrowseComp和xbench-2510的任务设计颇为苛刻:问题往往嵌入了多个相互约束的条件,正确答案隐藏在分散的网页与间接证据之中,模型需要沿着线索逐级深入挖掘。AREX-Base在BrowseComp上达到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同时超过GLM-5与Qwen3.5-397B。

在xbench-2510 上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。结果表明,AREX能力提升并非来自更多轮次的搜索堆砌,而是源于更稳定的研究状态维护——模型能够保留已验证信息、排除错误候选,并持续围绕尚未解决的约束推进。

信息广度:在大规模信息空间中全面覆盖

WideSearch-en考察的是另一项能力:在大规模搜索空间中尽可能完整地找到目标条目,并完成去重、核验与汇总。AREX-Base在该基准上取得了82.0 Item-F1,为论文对比范围内的最高结果,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。结果表明,AREX不只擅长「挖深一个答案」,也能管理大范围搜索任务,在长程检索中持续维护已覆盖范围和剩余空白。

深度与广度的结合:可迁移的研究方法论

DeepSearchQA同时要求多步检索、证据推理与答案完整性,是深度与广度的综合测试。AREX-Base在这里取得了89.9 F1,超过GPT-5.4与DeepSeek-V4-Pro和Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。这说明AREX学到的不是某个特定领域的搜索技巧,而是一套可迁移的研究方法论:检索、比较、验证、修正、聚合。

端到端能力:从搜索到完整研究流程

GAIA和HLE with tools进一步要求模型将搜索与规划、推理、工具调用结合起来。AREX-Base在三项测试上分别取得85.4、71.0和52.4。在GAIA上,它超过Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集测评下,它超过GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。这说明AREX的能力可以从搜索任务迁移到完整智能体工作流:模型不仅能找到信息,还能规划行动、调用工具、验证中间结论,并组织最终答案。

总体性能对比:开源前沿、闭源旗舰与同量级模型

与开源前沿模型相比,AREX-Base在双方均报告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部领先。与DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。

与Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上领先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。测评结果显示AREX不是「所有单项都领先」,而是以10B激活参数,在深搜、广搜、端到端智能体和工具推理之间取得了均衡的综合竞争力。

与闭源旗舰模型相比,面对GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等闭源旗舰,AREX-Base同样进入多个高难度基准的竞争区间。它在BrowseComp上与GPT-5.4几乎持平,在DeepSearchQA上超过GPT-5.4,在WideSearch-en上超过GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。这表明AREX已经能够在关键自主研究任务上与闭源旗舰模型正面竞争,尤其在大范围信息覆盖任务中优势更明显。

与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。

AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B、Quest-35B和Tongyi-DeepResearch-30B;AREX-Base则在DeepSearchQA和HLE文本子集上超过MiroThinker-H1,并在xbench-2510上与其接近。这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。

AREX研究平台:

将自主研究能力封装为日常研究工具

AREX LLMs解决的是智能体如何开展长期、可靠的自主研究,而AREX Research Platform在此基础上,将这一能力封装为面向科研与产业用户的日常研究工具。

学术与产业界每天都会产生大量新增信息——论文、技术报告、会议talk、开源发布与行业分析。而当前的信息分发机制多以发布时间或热度作为排序维度,而非依据用户的具体研究关注点进行组织。高价值信息被碎片化地呈现,使用者往往需要在多个来源之间自行拼接背景,信息获取成本高、效率低。

AREX平台以模型驱动的内容获取与研究智能体为核心,针对三类不同的信息形态提供独立入口:资讯持续追踪指定领域内的每日动态,论文筛选高关注度的研究工作并支持深度理解,播客从长时段访谈中提取关键观点与行业趋势。三者均由AREX智能体驱动,既支持广域浏览,也支持针对细分方向的定制化配置。


AREX首页(最终效果以上线版本为准)

定制化资讯服务:在信息组织方式上,AREX平台支持用户指定关注方向(如Coding Agent、芯片行业进展等),并据此生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

与传统「源订阅」相比,这一机制以「用户关注点」作为过滤维度,使信息流由「按热度排序」转向「按相关性组织」,从而降低无关信息干扰,提升信息获取的针对性。


AREX资讯定制

自由的可扩展性:此外,AREX平台在信息发现与自主研究之间提供直接衔接。每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。

智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(例如「该方向是否有后续讨论」、「所选benchmark是否权威」、「相关观点在其他访谈中是否出现过」)启动检索、对比、分析与综合,输出完整的知识脉络。


聊一聊

平台承担内容发现,智能体承担理解与分析,二者在统一上下文下衔接。这一设计是AREX区别于单纯资讯工具的核心所在。

当前版本的AREX Research Platform覆盖科研工作流中的「信息获取」与「认知构建」两个阶段,即帮助用户发现相关信息并理解其研究背景。智源研究院后续将能力延伸至研究执行阶段,由提供参考信息进一步发展为支持方案产出。

重点方向是端到端自主科研,包含以下三个环节:方案设计——智能体在理解问题与现有方法后,自主提出创新方案、实验设计、对比策略;工程实现——智能体直接生成可运行的代码框架、训练配置、评估脚本,并接入计算资源执行;性能调优——智能体分析实验结果,识别瓶颈,自动迭代超参、调整结构,持续优化迭代。

最终实现:用户定义研究问题,由AREX自主完成探索、实验与优化,并交付可验证的研究结果。

AREX当前已开放BETA版测试,欢迎大家体验并反馈:arex-research.com

编辑:桃子



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

大鱼简科
2026-06-10 09:48:18
理想新车官宣:9月2日,正式上市

理想新车官宣:9月2日,正式上市

科技堡垒
2026-09-02 11:40:58
离谱!大叔受不了漏尿,干脆用强力胶把DD封住??医生最终掏出10厘米胶棒...

离谱!大叔受不了漏尿,干脆用强力胶把DD封住??医生最终掏出10厘米胶棒...

英国那些事儿
2026-09-01 00:29:43
泽连斯基警告所有航企不要飞越俄罗斯,普京回应

泽连斯基警告所有航企不要飞越俄罗斯,普京回应

参考消息
2026-09-02 16:00:34
美国人警告菲律宾:中国准备彻底拿下黄岩岛,下一个就轮到巴丹

美国人警告菲律宾:中国准备彻底拿下黄岩岛,下一个就轮到巴丹

小梊搞笑解说
2026-09-01 15:31:07
中国性价比超低的4所211高校,被过度吹捧,实则严重“溢价”!

中国性价比超低的4所211高校,被过度吹捧,实则严重“溢价”!

教育导向分享
2026-09-02 11:55:37
40年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

40年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

点点细语
2026-09-02 17:00:29
今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

拾光纪闻
2026-09-02 05:27:55
流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

奇思妙想生活家
2026-08-30 09:33:02
中国把28纳米卖到全球断不了货,日本商社看傻眼:这局谁卡谁?

中国把28纳米卖到全球断不了货,日本商社看傻眼:这局谁卡谁?

乌克兰小静
2026-08-26 01:04:42
催人泪下!吉隆泥石流救援现场出现猴群,来到遭受泥石流侵蚀的区域,下方就是救援人员

催人泪下!吉隆泥石流救援现场出现猴群,来到遭受泥石流侵蚀的区域,下方就是救援人员

火山詩话
2026-09-01 06:14:24
“上大学第一天,儿子就跑回家了,”家长无奈发视频:又得接送4年

“上大学第一天,儿子就跑回家了,”家长无奈发视频:又得接送4年

泽泽先生
2026-09-02 13:36:10
奥拉迪波公开信致联盟各队总经理:请求你们再给我一次机会

奥拉迪波公开信致联盟各队总经理:请求你们再给我一次机会

北青网-北京青年报
2026-09-02 09:06:04
景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

梨莱
2026-08-30 22:56:54
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

音乐时光的娱乐
2026-08-26 02:44:53
官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

小徐讲八卦
2026-09-02 15:06:59
因果终会来!潇洒一生的郑少秋, 熬到79岁才"离开" 遗憾终无法填

因果终会来!潇洒一生的郑少秋, 熬到79岁才"离开" 遗憾终无法填

杰丝聊古今
2026-08-30 00:29:06
印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

有牙的兔纸
2026-08-29 18:39:05
三地政府主要领导调整

三地政府主要领导调整

新浪财经
2026-09-01 17:30:51
已确认!星宇启动被调查,常州女首富麻烦了!

已确认!星宇启动被调查,常州女首富麻烦了!

财经要参
2026-09-02 12:00:06
2026-09-02 18:11:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16089文章数 67023关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

教育
房产
时尚
游戏
军事航空

教育要闻

成都南华实验学校2026年秋季开学典礼:养正立身 勤学启新

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

《巫师3》杀穿科隆!新DLC愿望单碾压科隆所有展出游戏

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版