来客网

清华唐杰团队揭示大模型记忆全景

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

近年来,大语言模型(LLMs)的突破很大程度上归功于Scaling Laws(参数、数据、算力)。

然而,在模型演进的过程中,一个同等重要的维度正变得愈发关键——记忆(Memory)。

从Transformer中伴随计算产生的KV Cache,到线性RNN/SSM的隐式状态压缩,再到近期大火的Titans、TTT(Test-Time Training)以及Engram等显式、可持久化记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。

基于此方向,清华大学唐杰教授团队、新加坡国立大学(NUS)以及Bosch AI联合发布了一篇针对大模型记忆架构前沿的详尽综述。文章不仅首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),还将零散的前沿工作统一到了一个连贯的理论框架下,为下一代更高效、可长效学习的LLM设计指明了方向。

这里需要特别澄清的是,本文探讨的“记忆”特指模型架构层面的内部记忆(Architectural-level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而非目前同样火热的、通过外部Agent框架(如外挂对话日志、本地文件检索引擎等)实现的Agent层面记忆。

背景:大模型记忆的范式转移

传统意义上,LLM的内部“记忆”往往是隐式的、作为计算的副产品存在的。Transformer的自注意力机制提供了一个基于内容的瞬时工作记忆(KV Cache),但其计算与存储开销随序列长度呈二次方增长,且严重依赖于上下文窗口的限制。

0

评论 (0)