ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GLaQ 用「视觉检索」取代自回归潜态:5 项细粒度视觉基准平均提升 5.99%-9.66%

GLaQ 用「视觉检索」取代自回归潜态:5 项细粒度视觉基准平均提升 5.99%-9.66% GLaQ 用「视觉检索」取代自回归潜态5 项细粒度视觉基准平均提升 5.99%-9.66%这篇论文提出一种让多模态模型在推理时直接「检索」原始图像证据的新方法取代过去靠自回归潜态一路「想下去」的做法在 5 项细粒度视觉理解基准上平均提升 5.99% 到 9.66%并在所有对比的视觉潜态推理方法中排第一。方法名叫 GLaQ取自 Grounding Latent Queries接地潜查询。多模态大模型已经从图像加文字的混合输入里完成不少推理任务。但有一个老问题一直没解决干净模型在推理时视觉细节会被「翻译」成文字而文字是有损的。论文瞄准的正是这个瓶颈。一、多模态推理的瓶颈细粒度视觉证据留不住思维链Chain-of-Thought大幅提升了多模态大模型的问题求解能力。模型先写一段中间推理再给出答案。问题在于这段中间推理是文字而图片里的很多关键证据是「只能看、很难说」的一只猫的耳朵位置、两块砖之间的缝隙、图表里某个数据点的确切坐标。当模型把这些视觉细节压缩进文字理由里细节就丢了论文把这称为信息瓶颈。你让模型描述一张零件图它可以写「左上角有一个缺口」但模型在后续推理里真正要用的是「缺口到底多大、边缘长什么样」这类像素级信息文字描述撑不住。越是细粒度的视觉理解任务这个瓶颈越致命。二、两条老路外部工具与自回归潜态为了绕开文字瓶颈之前的研究走了两条路各有各的代价。第一条路叫「带着图像思考」thinking-with-images推理过程中不把图像只当成一次性输入而是允许模型反复访问图像做裁剪、放大、画标注等操作。这样每一步推理都能重新「看到」新鲜证据。代价是要预先定义一堆工具推理时还要额外处理图像流程重、开销大。第二条路叫「连续视觉潜态推理」continuous visual latent reasoning把中间推理放到模型的隐藏状态里不写成文字用一个紧凑的潜向量序列携带视觉语义。这条路保留了图像的连续信息看起来很美。但它有一个隐藏的毛病潜态序列是按自回归方式逐个生成的每个潜态都依赖前一个这跟语言生成是同一套逻辑可视觉证据并不适合这么排队。论文用相似度图证明了这个问题自回归生成的潜态越往后越像形成一大块高相似区域。也就是说后面的潜态在重复前面已经有的内容而不是补充新的视觉细节。潜态序列越长重复越多信息增益越少这就是「想下去」的边际收益递减。三、GLaQ 的做法接地潜查询GLaQ 的思路是把「持续想下去」改成「按需查一次」。它用一个固定大小的查询块每个查询都直接「接地」在原始图像的视觉 token 上。也就是说模型不是用一个自回归链去推演潜态而是用一组上下文条件化后的查询去原始视觉表征里做一次集中的、协调的检索再把检索结果注入回生成阶段。这句话有点绕可以打个比方。自回归潜态就像一个人闭着眼睛在心里默背清单背到后面全是重复GLaQ 像一个人睁开眼睛直接看黑板需要什么信息就派一个查询去看一眼。查询块是固定容量的所以额外开销是「有界」的不管图像多大、任务多长接地检索的成本不会随着潜态数量无限增长这一点正好治了自回归潜态「越长越贵」的病。更关键的是因为查询直接对接原始视觉 tokenGLaQ 保留了整张图的完整上下文不需要外部视觉操作也不需要反复处理图像。论文把这种设计称为以接地换取补充潜态之间不再需要互相传递信息每个查询都直接从源头拿。四、训练局部视图自蒸馏加 DePO 强化学习光有架构还不够GLaQ 的训练用了两段式每一段解决一个具体问题。第一段是局部视图监督配合自蒸馏。为了让查询学会「检索有用的地方」训练时先给模型看图像的局部特写ROI 视图让查询在特写上学会关注哪些区域再把这份「注意力」蒸馏回全图通路。论文把它称为潜查询自蒸馏局部视图的监督信号被转移到全图推理路径上从而让全图推理也具备细粒度定位能力。第二段是强化学习。论文用 DePO一种在任务级奖励下的策略优化方法同时优化两类动作一类是文字 token 的生成一类是接地查询的取舍。消融实验显示在同样的训练数据、奖励和 rollout 设置下只做文字 token 的 GRPO 优化已经能带来实质提升而 DePO 在这个基础上再提升 0.52% 到 1.37%。这证明接地查询不是被动地放在那里而是可以当作可优化的潜动作接受任务级反馈来不断改进。五、实验结果5 项基准全涨吞吐还更快GLaQ 以 Qwen2.5-VL-7B 为骨干在 5 项细粒度视觉理解与感知基准上做了评测。结果是较基座模型平均提升 5.99% 到 9.66%在所有对比的视觉潜态推理方法中排名第一。拿最难的 V基准看GLaQ 较基座提升 8.90 个点同时端到端吞吐提升 7.62%。与另外两个代表方法对比V准确率较 DeepEyes 高 2.09 个点、较 HyLaR 高 4.19 个点吞吐较 DeepEyes 高 20.11%、较 HyLaR 高 5.70%。换句话说GLaQ 不是拿准确率换速度而是准确率更高、速度也更快把「准确性到效率」的前沿同时往前推。推理范式视觉证据如何访问推理时额外开销信息冗余情况外部工具带着图像思考裁剪、缩放、标注反复处理图像需要预定义工具流程重低但代价高自回归潜态潜态之间顺序传递随潜态数量增长后期状态重复信息增益递减GLaQ 接地潜查询查询直接检索原始视觉 token固定容量开销有界查询互补无重复链论文还单独验证了「接地」本身的价值控制变量下正是「潜查询重新获得对源 token 的直接访问」和「固定容量块内保持协调」这两点带来了全部提升。这指向一个明确结论显式的源图像接地可以替代自回归潜态构造成为连续视觉推理的一种新范式。六、意义与局限GLaQ 的意义有两层。第一层是效率它证明视觉推理不必依赖越来越长的自回归潜态链固定容量的接地查询块就能做到更高准确率而且开销有界这让长上下文多模态推理在工程上更可控。第二层是研究范式它把「连续潜态推理」从「按语言逻辑排队」拉回到「按视觉证据组织」源图像接地成为可解释、可优化的对象为后续工作打开了空间。局限同样明显。论文只在一个 7B 骨干上做了评测模型规模扩展后接地查询的收益是否保持还没验证。查询块是固定容量的任务复杂度变化时可能不够灵活。训练依赖辅助的局部视图监督如果能把对这种监督的依赖降下来方法会更实用。论文把这些都列进了未来方向模型规模扩展、自适应查询分配、以及减少对局部视图的依赖。对做多模态研究的人来说这篇论文值得记住一句话视觉推理的连续性不一定要靠「接着上一个想」也可以靠「直接看源头」。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进