来客网

多模态检索头首次被锁定

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。

但能够接收一整份文档,不等于能够正确使用其中的信息。

面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?

EMNLP 2026接收的论文新作“Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,从模型内部研究了这一过程。

从“装得下”到“找得到”

长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。

研究团队关注的问题是:当证据已经出现在输入中时,模型内部是否存在一组注意力头,负责将问题指向相关的文本或视觉内容?

团队将识别出的这类注意力头称为多模态检索头(MMRetHeads)。

怎么识别多模态检索头?

受QRHead启发,研究团队提出了MMRetHeads检测方法。

0

评论 (0)