2017 年夏天,Google 的 AI 研究人员发表了影响深远的论文《Attention Is All You Need》,提出了一种新的神经网络架构——Transformer。九年过去,Transformer 已经成为几乎所有主流大语言模型的核心架构。
“整个 AI 行业都建立在 Transformer 之上。”AI 初创公司 Subquadratic 联合创始人兼 CEO 贾斯汀·丹格尔(Justin Dangel)说,“它是计算机科学史上最重要的创新之一,也真正改变了世界。”
(来源:麻省理工科技评论)
但如今,Transformer 开始显露出局限。近几年,大语言模型的能力不断提升:推理模型开始兴起,模型一次能够处理的信息也越来越多。但这些进步并不完全来自 Transformer 本身的突破。很多时候,研究人员其实是在通过各种工程手段,绕开或弥补这一架构原有的问题。
于是,一个问题开始摆到台面上:Transformer 之后,下一代大模型会是什么样?
一批初创公司已经开始押注不同的技术路线,希望突破 Transformer 的能力边界。比起成熟的大企业,这些创业者包袱更少,也更愿意尝试激进的新方案。
Transformer 目前的问题首先出在它最核心的机制:注意力机制(让模型判断输入信息之间哪些部分彼此相关的一种计算方式)。目前,Transformer 最常用的是“稠密注意力”(dense attention)。简单来说,模型会把输入中的每个 token,都和其他 token 逐一进行比较。
0
评论 (0)