随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。
但能够接收一整份文档,不等于能够正确使用其中的信息。
面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?
EMNLP 2026接收的论文新作“Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,从模型内部研究了这一过程。
从“装得下”到“找得到”
长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。
研究团队关注的问题是:当证据已经出现在输入中时,模型内部是否存在一组注意力头,负责将问题指向相关的文本或视觉内容?
团队将识别出的这类注意力头称为多模态检索头(MMRetHeads)。
怎么识别多模态检索头?
受QRHead启发,研究团队提出了MMRetHeads检测方法。
0
评论 (0)