网易首页 > 网易号 > 正文 申请入驻

Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

0
分享至



本项目主要贡献者包括郑元雷(华中科技大学 VLRLab)、付培(小米大模型 Plus),通讯作者为罗振波(小米大模型 Plus)、陈伟(华中科技大学 VLRLab)

在多页文档理解任务中,一个被广泛接受但很少被质疑的假设是:要理解一篇长文档,模型就应该尽可能多地「看」。

但如果换个角度想:人类阅读一份几十页的报告时,真的会逐页从头看到尾吗?显然不会。我们会先翻目录、扫标题,找到可能相关的部分,然后才精读。真正值得追问的问题是:为什么现有的文档理解模型,不能也这样做?

这正是 Doc-V* 想要回答的问题。

Doc-V* 由小米大模型 Plus 团队和华中科技大学 VLRLab 团队合作提出,一种从「静态阅读」到「主动探索」的多页文档理解新范式,通过交互式视觉推理让模型像人一样有策略地阅读长文档。

从结果上看,这条思路确实带来了实际收益:在统一使用 Qwen2.5-VL 7B 作为 backbone 的设定下,Doc-V* 相比 RAG 变体在多个多页文档问答基准上取得了 49.7% 的提升,且不依赖更大的模型或更长的上下文窗口。

这说明,与其给模型塞更多页面,不如让模型学会「在合适的时机获取合适的页面」。



  • 论文链接:https://arxiv.org/abs/2604.13731v1

重新审视「看全部页面」:静态输入范式的根本矛盾

现有方法在处理长文档时,面临一个根深蒂固的矛盾。

一类方法尝试将所有页面一次性输入模型,以保证信息完整,但随着文档长度增加,计算成本迅速上升,同时模型容易受到「中间信息遗忘」等问题影响。

另一类方法则依赖检索策略,仅选择部分页面作为输入,虽然在效率上有所改善,但其性能高度依赖检索结果 —— 一旦关键页面未被召回,后续推理便难以修正。

从根本上看,这两类方法都采用了一种「静态输入」范式:在推理开始前就固定输入内容,而缺乏在推理过程中动态调整信息获取策略的能力。

这种方式与人类处理长文档的习惯存在明显差异,也限制了模型在复杂多跳推理场景中的表现。

Doc-V* 的方法设计:从「静态阅读」到「主动探索」

Doc-V* 的核心思路可以用一句话概括:不要一次性把所有内容塞给模型,而是让模型自己决定看什么、什么时候看。

第一步是构建 Global Thumbnail Overview。在输入阶段,Doc-V* 并不会直接处理所有高分辨率页面,而是首先将每一页压缩为低分辨率缩略图,并按照网格形式排列。这使模型能够在较低成本下观察文档的整体结构,例如章节分布、图表位置以及高层语义区域。

这种设计的关键在于,它并不试图提供精细内容,而是提供一种结构性导航信号,帮助模型在后续步骤中更有针对性地选择页面。



图 1:Pipeline 示意,初始输入为 Question+Document Thumbnail。模型先获得文档的全局缩略图视角,再有针对性调用工具对文档作深入的探索。

第二步是两种交互式操作。在获得初步结构信息后,模型可以通过两类操作与文档进行交互:

  • :全局语义检索(粗粒度探索)



  • :精确页面获取(细粒度证据定位 ⭐)



基于结构线索的直接定位:从 thumbnail 中看到某几页包含表格 / 图表 / 标题,直接跳转这些页面进行精细分析;

② 邻接信息补全:表格跨页、图文分离、上下文延续,自动获取「前一页 / 后一页」补全语义;

③ 显式页码问题的精确响应:如:「第 3 页的表格中有多少个方法」?

这两种操作在功能上形成互补:前者用于覆盖潜在的相关区域,从全局范围内召回可能有用的页面;后者则更偏向于精细化定位,例如围绕某一已知页面获取其上下相邻页,或依据问题描述以及缩略图中的结构线索,直接定位到具体的证据页面。



图 2:Doc-V * 的数据构造以及训练方式

第三步是 SFT+GRPO 两阶段训练策略。在训练阶段,Doc-V* 采用了 SFT+GRPO 两阶段策略,使模型学会何时调用哪种操作、如何基于已有证据进行判断。

实验结果

实验结果首先验证了 Doc-V* 在标准多页文档问答任务上的有效性。

从主表结果可以看出,在统一 backbone(Qwen2.5-VL 7B)设置下,Doc-V* 相比基础模型以及其 RAG 变体均取得了稳定提升。RAG Top-5 相比原始模型在各数据集上已有一定增益,说明基于检索的页面筛选确实能够在一定程度上缓解长文档中的噪声问题。

然而,这种提升仍然受限于「静态检索」范式 —— 模型只能基于一次性召回的页面完成推理,一旦关键证据未被包含在 Top-K 中,后续过程缺乏纠错能力。



图 3:Doc-V * 在各个文档问答 Benchmark 上的结果对比。*

这说明,动态的证据获取机制确实能够弥补静态检索的固有缺陷,让模型在推理过程中持续修正自身判断。

进一步分析不同方法在「输入页面数量 — 性能」之间的关系,可以观察到一个值得关注的现象:对于基于 RAG 的方法,随着输入页面数量的增加,性能通常呈现出「先提升、后下降」的趋势。

初始阶段,增加页面数量能够提高召回率,使模型更有可能接触到正确证据,因此性能有所提升;但当输入页面继续增加时,大量无关或弱相关信息被引入,反而会干扰模型的注意力分配,使有效信号被稀释,最终导致性能下降。



图 4:不同方法在「输入页面数量 — 性能」关系上的对比。RAG 方法存在明显的性能拐点,随着 K 的增加,性能先升后降,并趋于输入所有页面的性能,而 Doc-V * 则不受 K 的影响。

这一现象在多个数据集(如 SlideVQA、LongDocURL、MMLongBench-Doc)上均有体现,说明其并非特定任务或模型的个例,而是检索式方法在长上下文场景中的普遍特征。

换言之,RAG 方法在「信息覆盖」与「信息干扰」之间存在一个敏感的平衡点,其性能高度依赖于 Top-K 的选择。

相比之下,Doc-V* 并未表现出类似的明显退化趋势。这主要是因为其输入并非一次性确定,而是在推理过程中逐步扩展:模型只在需要时引入新的页面,并结合已有证据进行判断,从而避免了无关信息的过度积累。



图 5:不同方法在 MMLongBench-Doc 数据集上的不同文档长度的表现对比。

除此之外,本文还对不同方法在不同文档长度上的表现进行了分析。随着文档整体长度增加,无论是 RAG 还是 All Pages 方法,其性能均呈现出整体下降趋势。

这进一步说明,面对越来越长的文档,「给更多内容」并不能解决问题,真正需要的是一种更智能的信息获取策略。

「信息获取 ≠ 信息堆叠」,当无关信息占据上下文时,模型反而更容易被「视觉上显眼但无关」的页面误导,忽略真正关键的证据页。



图 6:不同方法具体推理过程。

真正需要的是「策略驱动的信息获取」,Doc-V* 在其中做了一件关键的事情 —— 不是盲目读取内容,而是「先判断去哪里看」。

具体表现为一个非常接近人类的过程:先看缩略图(判断哪些页面「看起来可能有用」)→ 直接跳转到最可能包含答案的页面 → 基于最小但最相关的信息完成答案。

这背后其实是一个核心的转变:从「被动接收信息」→「主动决策信息获取路径」,从全局搜索 → 局部确认 → 逐步逼近答案,这正是人类阅读长文档时的真实行为。

从更大的视角看:文档理解的下一步

整体来看,Doc-V* 提供了一种不同于传统方法的视角:将多页文档理解问题从「静态建模」转化为「动态证据获取与整合」的过程。

通过引入缩略图导航、交互式操作以及工作记忆机制,模型能够在推理过程中不断修正自身判断,从而更有效地处理长文档中的复杂信息关系。

这种方法并不依赖于更大的模型或更长的上下文,而是通过更合理的信息使用方式,提高推理效率与结果可靠性。

对文档理解来说,真正重要的,也许从来不是「一次性看完所有内容」,而是能不能像人一样,在阅读过程中不断调整策略、主动寻找证据、逐步逼近答案。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
林豆豆有多美?1966年和毛主席在天安门的合影,22岁的她青春靓丽动人

林豆豆有多美?1966年和毛主席在天安门的合影,22岁的她青春靓丽动人

钟离踏忆
2026-09-09 06:45:08
钱学森晚年说了句大实话:中国丢掉这两样东西,后果不堪设想

钱学森晚年说了句大实话:中国丢掉这两样东西,后果不堪设想

别人都叫我阿腈
2026-07-25 15:35:12
2013年,只因 40 块停车费,停车管理员被年仅28岁的杨雪鸥驾驶牧马人越野车撞死

2013年,只因 40 块停车费,停车管理员被年仅28岁的杨雪鸥驾驶牧马人越野车撞死

民生故事会
2026-09-04 20:30:00
罗德里来了之后,巴萨真的不一样了!

罗德里来了之后,巴萨真的不一样了!

用冷眼洞悉世界
2026-09-14 21:09:10
招商银行原一正三副行长被调查

招商银行原一正三副行长被调查

地产微资讯
2026-09-14 18:36:22
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
94岁原中央保健局局长王敏清:50年没感冒,无三高,靠的就是这几招

94岁原中央保健局局长王敏清:50年没感冒,无三高,靠的就是这几招

新浪财经
2026-06-24 02:28:33
中越战争伤亡情况:解放军伤亡27000人,越南称6万人,三万去哪了

中越战争伤亡情况:解放军伤亡27000人,越南称6万人,三万去哪了

牛牛叨史
2025-02-21 15:44:06
首夺美网冠军!兹维列夫3-1击退谢尔顿,斩获生涯大满贯第2冠

首夺美网冠军!兹维列夫3-1击退谢尔顿,斩获生涯大满贯第2冠

全景体育V
2026-09-14 05:54:11
哈马斯的地道到底谁修的?挖到最深处,答案让所有人后背发凉

哈马斯的地道到底谁修的?挖到最深处,答案让所有人后背发凉

民间胡扯老哥
2026-09-08 06:45:58
2399元晾衣机塞进42英寸灯板,小米这次想抢阳台的活

2399元晾衣机塞进42英寸灯板,小米这次想抢阳台的活

算力游侠
2026-09-14 10:27:28
女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

背包旅行
2026-09-10 18:14:09
张一鸣:普通人一年能靠AI赚100万,但大多数人不到30天就放弃了

张一鸣:普通人一年能靠AI赚100万,但大多数人不到30天就放弃了

吃青菜长高
2026-08-25 05:23:07
1978 年《追捕》:删掉的 40 分钟里,藏着一个你从没见过的人

1978 年《追捕》:删掉的 40 分钟里,藏着一个你从没见过的人

情感大头说说
2026-09-14 02:17:55
印媒:巴基斯坦飞行员再爆料5月10日基地被炸,歼-10CE全程缺席

印媒:巴基斯坦飞行员再爆料5月10日基地被炸,歼-10CE全程缺席

止戈军是我
2026-09-12 17:10:05
3599元!突然上架的这全键盘手机,绝对是来捣乱的

3599元!突然上架的这全键盘手机,绝对是来捣乱的

刘奔跑
2026-09-13 00:03:59
张雪峰看景甜那一眼,我足足回拉了七次进度条, 结局早就被写好了

张雪峰看景甜那一眼,我足足回拉了七次进度条, 结局早就被写好了

八卦王者
2026-09-07 15:55:22
心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理观察局
2026-08-14 06:34:03
鲍尔默接受处罚却不认规避工资帽,媒体人点破真实原因

鲍尔默接受处罚却不认规避工资帽,媒体人点破真实原因

温柔且自由
2026-09-14 21:30:24
陈毅查出患癌后,沈阳军区司令员当面质问陈毅:我是不是得罪你了?

陈毅查出患癌后,沈阳军区司令员当面质问陈毅:我是不是得罪你了?

历史沉淀的理性
2026-09-07 06:45:29
2026-09-14 21:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13992文章数 142733关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

房产
教育
数码
手机
本地

房产要闻

网易房产|《让爱驻下》云首发!以一首歌,致敬广州赶路人

教育要闻

初三家长最容易做错的三件事

数码要闻

HKC惠科推出全球首款43.8英寸24:9显示器天启43H180C

手机要闻

堆料最激进的旗舰!荣耀Magic9系列三剑齐发

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

无障碍浏览 进入关怀版