网易首页 > 网易号 > 正文 申请入驻

HyperEyes:并行多模态搜索智能体的效率革命

0
分享至



现有的开源多模态搜索智能体普遍受困于「裁剪 - 再搜索」的串行处理模式,面对多目标时往往陷入交互冗长、错误级联累积的泥沼。

为此,小红书研究团队提出了一款全新架构的模型:HyperEyes。通过统一定位与搜索的动作空间、构建并行可学习数据以及双粒度效率感知强化学习的全栈设计,HyperEyes 成功实现了从「搜得更深」到「搜得更宽」的并行多模态搜索范式跃迁。





  • 论文地址:https://arxiv.org/abs/2605.07177
  • 代码地址:https://github.com/DeepExperience/HyperEyes

背景:多模态搜索智能体的「串行困局」

当前主流的 Agent 在面对包含多个实体的复杂图片时,往往只能采用笨拙的「N 轮串行调用」策略。

这种传统的处理路径带来了三重难以逾越的困境:首先是极大的交互冗余,原本一句话的多实体查询被迫退化为多次单实体搜索,导致延迟剧增;其次是错误放大的多米诺骨牌效应,前置定位一旦发生偏差,后续的搜索结果将被全部污染;最后是模型训练中普遍存在的奖励偏差与「信用分配」问题。

现有模型往往仅以「最终答案对错」作为唯一奖励标准,这不仅会导致智能体为了追求表面准确率而养成「暴力多搜」的坏习惯,引入更多噪声;更致命的是,这种粗粒度的稀疏奖励会带来粗暴的「连坐惩罚」—— 在那些最终失败的探索轨迹中,原本正确、富有逻辑的中间推理和工具调用也被一并全盘否定,导致模型根本无法从失败中有效汲取局部经验。

方法:从动作空间、数据到 RL 的「全栈式」效率重塑



为了让智能体真正具备「一次出手,多目标并发」的内生能力,HyperEyes 研究团队在动作空间、数据合成与强化学习三个维度上进行了彻底的底层重构。

传统的智能体通常将「视觉裁剪」和「网络搜索」作为两个独立的步骤,而HyperEyes 打破了这一隔离,提出了「统一定位即搜索」(UGS)的动作空间重构方案。它将视觉定位框直接作为检索动作的内嵌参数,使得一次函数调用就能并发携带多个目标框。这一设计从物理层面彻底打通了单轮交互内多目标并发的通路。

然而,空有架构还不够,开源社区长期缺乏「并行搜索」的训练语料。为此,研究团队设计了一套精密的合成流水线。他们首先将多类图片拼接,合成出必须同时进行定位与检索才能解答的视觉查询;接着基于图谱随机游走,构造出多约束的交集问题并严格剔除捷径解;最后,通过渐进式拒绝采样(PRS)技术,在严格的递增轮次预算下,提纯出 3 万条「零冗余」的并行行为种子数据,完美解决了模型 SFT 冷启动的难题。

在最核心的强化学习(RL)对齐阶段,HyperEyes 彻底颠覆了传统 RL 的「唯结果论」范式。传统的稀疏奖励往往会引发双重隐患:缺乏效率约束的奖励机制会纵容模型养成「冗余试错」的惰性,以牺牲推理速度为代价换取准确率;更糟糕的是,在处理长周期任务时,粗暴的结果导向会带来极其不公平的「连坐惩罚」—— 即便是一次堪称完美的中间推理过程,也会因为最终环节的失误被彻底抹杀,导致模型在复杂探索中迷失方向。



针对这一问题,团队创新性地提出了「宏观 + 微观」的双粒度效率感知强化学习框架。在宏观轨迹层面,系统引入了 TRACE(动态参考的成本效率奖励)机制。这并不是一个一刀切的步数死命令,而是一把「自我超越」的动态标尺。系统会将模型当前的工具调用表现与标尺对比,只有比标尺更高效才能获得奖励。在每个 Epoch 结束后,系统会自动用本轮表现最好、步数最少的轨迹去刷新并收紧标尺。这就像跳高比赛,横杆随着模型能力的提升越调越高,逼迫模型不断挤出水分。

而在微观 Token 层面,为了精准抢救失败轨迹中的「正确中间过程」,HyperEyes 引入了 OPD(策略内蒸馏)机制。这一机制只在轨迹最终答错时才会启动,届时会引入一个 235B 的满血版教师模型,为失败轨迹中的每一步提供稠密的 Token 级监督信号,精准打捞那些原本正确的中间规划。

这种「仅在失败时蒸馏」的非对称设计,完美避免了对学生模型「高效并发」本能的覆盖。成功时由宏观奖励主导效率,失败时由微观蒸馏托底纠偏,宏微观的严丝合缝,彻底释放了多模态大模型的并发检索天性。

IMEB Benchmark:把「搜索效率」作为重要评估维度

现有多模态榜单普遍存在「只看准不看快」的弊端。为了纠正这一导向,团队发布了首个包含 300 条极具挑战性多实体视觉评测基准的 IMEB (Image Multi-Entity Benchmark)。

与之配套,团队还提出了「成本感知评分」 (CAS)。该评分标准在统一标尺下,将准确率、Token 消耗和工具调用轮次进行联合评估,把传统的答案质量换算为「单位延迟下的有效信息密度」,从根本上遏制了大模型靠堆砌算力暴力刷榜的行为。



实验结果与核心发现

在随后的 6 大主流基准测试中,HyperEyes 展现出了极具统治力的表现,实现了准确率与效率的 Pareto 占优。全面建立开源 SOTA 并非虚言 ——HyperEyes-30B 以64.0%的准确率超越同量级最强开源模型 VDR 达9.9%,而其平均工具调用轮次仅为 VDR 的不到五分之一(2.2 对比 11.6)。而其 235B 版本更是以仅1.1%的微弱差距逼近闭源旗舰 Gemini-3.1-Pro。



在极为严苛的 CAS 成本效率评分中,30B 版本的表现达到了次优开源模型的7.6倍,证明其每一单位算力输出的信息密度都极高。消融实验也证实了,这种底层的动作空间重构设计,对传统的「LLM 外挂裁剪」或「代码沙箱裁剪」构成了降维打击。



更有意思的是其面对噪声的强鲁棒性。在真假证据混合的干扰测试中,HyperEyes 这种「敢于少搜、一次看全」的并行策略,反而大幅规避了过度检索带来的幻觉陷阱。



在一个面对 6 人同框复杂问答的真实测试案例中,传统 Agent 因为「逐一裁剪 + 搜索」的笨拙逻辑将流程拖拽至 12 轮,最终因噪声累积而答错;而 HyperEyes 首轮即并发定位并检索了全部 6 人,仅用 3 轮便给出精准答案,直观地展现了什么叫「一次出手,看清全局」。



结语:多模态搜索智能体的下一站,是「效率即智能」

长期以来,大家普遍认为多模态搜索必须通过串行加深来保证准确度,而 HyperEyes 打破了这一固有惯性。它用翔实的实验证明了,在 Agent 训练中,「准确率」与「效率」完全可以协同进化。

随着多模态 Agent 逐渐步入电商比价、视觉检索、实时交互等真实的高并发业务场景,从「搜得更深」转向「搜得更宽」,必将成为下一代智能体角逐的核心竞争力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网力挺郑功成!养老金改革拨乱反正,公共福利不能任由强者通吃

全网力挺郑功成!养老金改革拨乱反正,公共福利不能任由强者通吃

百科密码
2026-09-17 19:10:03
4亿人都在用的豆包,今天成了全网最大的笑话

4亿人都在用的豆包,今天成了全网最大的笑话

财通社
2026-09-17 20:35:18
从“铿锵有力”到天人永隔,小伙记录母亲最后14天视频看哭网友,当事人:从发病到去世过程极快,母亲说没有什么遗憾或留恋

从“铿锵有力”到天人永隔,小伙记录母亲最后14天视频看哭网友,当事人:从发病到去世过程极快,母亲说没有什么遗憾或留恋

鲁中晨报
2026-09-17 15:27:04
中纪委再次放话!要求各地哪怕掉层皮,也要一抓到底!

中纪委再次放话!要求各地哪怕掉层皮,也要一抓到底!

职场资深秘书
2026-09-17 17:37:19
总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

巅峰高地
2026-09-17 17:10:29
日本亚运会,真是丢人丢到全世界了,还没有正式开幕,就已经遭到了多国代表团以及国际舆论的广泛批评

日本亚运会,真是丢人丢到全世界了,还没有正式开幕,就已经遭到了多国代表团以及国际舆论的广泛批评

扶苏聊历史
2026-09-17 17:25:16
韩媒:一旦开战,将对北京发起致命打击,大连、青岛都在列!

韩媒:一旦开战,将对北京发起致命打击,大连、青岛都在列!

兔兔侃娱乐
2026-09-16 20:43:14
不服就干!李在明打响反华第一枪,通告全球,妄想掐断中方退路?

不服就干!李在明打响反华第一枪,通告全球,妄想掐断中方退路?

卿羽飞本尊
2026-09-17 20:21:36
管家转卖雇主酒水获利243万元被判刑10年半,家属称将申诉

管家转卖雇主酒水获利243万元被判刑10年半,家属称将申诉

澎湃新闻
2026-09-17 16:58:28
“你想毁掉自己的职业生涯吗?”

“你想毁掉自己的职业生涯吗?”

中国新闻周刊
2026-09-17 16:50:58
影视飓风Tim称iPhoneDuo烫到握不住,苹果回应:博主单台设备测评片面,新设备到手后可能需要3至5天的适应期

影视飓风Tim称iPhoneDuo烫到握不住,苹果回应:博主单台设备测评片面,新设备到手后可能需要3至5天的适应期

19楼
2026-09-17 23:36:53
随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

随着日本0-2、波兰0-1,U20女足世界杯八强全诞生:2大亚洲劲旅在列

侧身凌空斩
2026-09-18 02:34:41
中方接收美国返还的58件文物,其中一尊来自山西天龙山石窟的菩萨像,是百余年前就遭到劫掠、流落海外的艺术珍品

中方接收美国返还的58件文物,其中一尊来自山西天龙山石窟的菩萨像,是百余年前就遭到劫掠、流落海外的艺术珍品

蓬勃新闻
2026-09-17 14:45:58
佛州38岁女子与宠物狗发生不当行为被捕,丈夫查监控抓现行

佛州38岁女子与宠物狗发生不当行为被捕,丈夫查监控抓现行

环球趣闻分享
2026-09-17 13:10:13
金与正:朝鲜拥核地位从物理和法律上永久固定!

金与正:朝鲜拥核地位从物理和法律上永久固定!

IN朝鲜
2026-09-17 12:19:36
知名抄手店退出外卖平台巨头 对话创始人:每单外卖平均亏1元,专心做好堂食让人们走进餐厅

知名抄手店退出外卖平台巨头 对话创始人:每单外卖平均亏1元,专心做好堂食让人们走进餐厅

红星新闻
2026-09-17 19:32:12
警报拉响!日本内阁大换血,极右翼正式入阁,扩军野心藏不住了

警报拉响!日本内阁大换血,极右翼正式入阁,扩军野心藏不住了

战友老邓
2026-09-17 14:07:33
苹果新品官宣,9月18日,正式发售

苹果新品官宣,9月18日,正式发售

科技堡垒
2026-09-17 11:07:17
实锤!杨景媛在西班牙读研被同校留学生线下证实是本人,爆料者疑似遭到威胁

实锤!杨景媛在西班牙读研被同校留学生线下证实是本人,爆料者疑似遭到威胁

Mr王的饭后茶
2026-09-17 23:33:07
男子救助摔倒老人反被索赔92万余元,老人家属主张男子驾驶电动三轮车产生的气流、噪声、惊吓等非接触因素可能致老人摔倒,法院:不予支持

男子救助摔倒老人反被索赔92万余元,老人家属主张男子驾驶电动三轮车产生的气流、噪声、惊吓等非接触因素可能致老人摔倒,法院:不予支持

都市快报橙柿互动
2026-09-17 19:02:19
2026-09-18 06:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14014文章数 142733关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

旅游
本地
房产
亲子
军事航空

旅游要闻

烟花+戏剧+赛事全拉满!长江口吴淞岸线带你解锁中秋国庆滨江新玩法

本地新闻

不止胖东来!许昌藏着半部三国史

房产要闻

突发!三亚安居房出台新政!

亲子要闻

小恐龙选择了紫色的旺旺碎冰冰

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版