博主头像

斯坦福大学 CME295《Transformer 与大语言模型》课程 | 2026 年秋季学期 |

外来客 • 2026-09-29 11:27:15

分享
𝕏 f ◉
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers)

🎓 课程定位与考核机制

  • 核心目标:深入解析大语言模型(LLM)的底层架构、训练机制及适用边界,旨在系统性提升学员对人工智能技术的认知素养与技术理解力。
  • 受众范围:涵盖科研学者、个人开发者(特别是编码代理使用者)以及需要建立基础 AI 认知的职场人士,强调理论与实践结合。
  • 前置要求:学员需具备线性代数基础(尤其是矩阵运算能力)及机器学习基本概念(包括损失函数、神经网络原理及嵌入技术)。
  • 考核方式:课程不设常规作业,总成绩由期中与期末两次考试构成,各占 50% 权重;期中考试定于 10 月 23 日进行。
  • 教学安排:每周五下午 3:30 至 5:20 授课,共设 9 次讲座;课件提前一天发布以便学员预习与标注。
  • 资源支持:推荐教材《The Super Study Guide Transformers and LLMs》及最新更新的 Cheat Sheet(涵盖多语言版本);讲师课后留堂答疑,并支持通过 Canvas 平台或邮件列表进行私下咨询。

📜 技术演进与核心架构

  • 范式转变:2017 年论文《Attention is all you need》提出 Transformer 架构,确立了通过增加数据、算力及参数实现性能显著跃升的可扩展性路径,成为当前主流技术基石。
  • 应用里程碑:2022 年 ChatGPT 发布标志着 AI 从传统对话机器人向通用交互助手的转变;当前技术已延伸至具备自主行为能力的编码代理(Coding Agents)。
  • 架构转折点:Transformer 因具备高可扩展性和优异性能取代了 RNN,其核心在于摒弃隐藏状态传递,通过矩阵运算实现并行化计算,显著提升了模型训练与推理效率。
  • 后续展望:本次讲座仅为 Transformer 技术全貌的开端,重点厘清基础解码逻辑与历史定位;后续课程将聚焦于模型训练细节及智能代理(Agents)的实现原理,揭示技术如何从单一翻译任务扩展至多系统交互场景。

🧩 分词机制与 BPE 算法

  • 核心逻辑:将文本转化为模型可处理的数值向量,需通过词汇表(Vocabulary)确定不可分割的最小单元(Token),这是连接自然语言与数学计算的关键桥梁。
  • 方案对比:
  • 词级分词:简单直观但词汇量庞大,且无法有效关联同根词,存在未登录词风险。
  • 字符级分词:彻底规避未登录词问题,但序列长度过长导致计算效率低下,语义可解释性差。
  • 子词级分词(Subword):当前主流方案,平衡了词汇规模与序列长度,能利用词根知识并降低计算复杂度。
  • BPE 原理:字节对编码(Byte Pair Encoding)通过迭代合并训练数据中最高频的字符对来构建词汇表,使高频模式获得独立 Token 表示,优化存储与检索效率。
  • 特殊词元规范:BOS/EOS 用于标记生成起止,Padding 用于统一序列长度以适配硬件并行处理;现代模型还包含 User/Assistant 等角色标识以区分对话语境。

📊 关键事实与论据

  • 词表规模现状:当前大语言模型的词表大小通常在数十万级别(如 200,000),多语言支持可能增加单语言下的序列长度,但有助于跨语言语义协同。
  • Word2Vec 局限:基于代理任务(CBOW/Skip-gram)学习静态向量,存在一词多义混淆、忽略词序及无法处理未登录词等缺陷,难以捕捉动态上下文。
  • RNN 瓶颈:虽通过隐藏状态解决词序问题,但受限于长距离依赖遗忘和反向传播中的梯度消失,且串行计算导致训练效率低下,难以扩展至大规模数据。
  • 数学实现逻辑:自注意力公式为 $\text{softmax}(QK^T)V$。其中 $QK^T$ 计算相似度权重,Softmax 归一化系数,最终加权求和得到新的词元表示,实现了全局信息交互。

🧠 Transformer架构核心机制

  • 自注意力替代循环:摒弃 RNN 的隐藏状态传递,通过 Query、Key、Value 矩阵投影让 Token 直接与序列内所有其他 Token 交互,实现上下文感知表示。
  • 位置编码策略:将可学习的 Token 嵌入与位置嵌入相加。位置嵌入可采用学习法或正弦/余弦函数生成;后者利用不同频率组合精确表征相对距离,且能泛化至训练时未见的更长序列。
  • 编码器与解码器分工:编码器通过自注意力层和前馈神经网络提取源语言的上下文表示;解码器结合掩码自注意力(仅关注已生成 Token)和交叉注意力(Query 来自解码器,Key/Value 来自编码器),以自回归方式逐词生成目标语言。
  • 位置信息缺失修复:纯自注意力机制本身不感知词序,需引入额外机制(如位置编码)来修复该缺陷,确保模型理解序列中的顺序关系。

🛠️ 关键训练技巧与维度

  • 残差连接:采用 $x + f(x)$ 结构直接传递特征,缓解深层网络梯度消失问题,优化反向传播路径,提升深网训练稳定性。
  • 多头注意力:并行学习多组投影矩阵,使模型能从不同子空间捕捉语言模式,最终通过线性层映射回原始维度($D_{model}$),增强表征能力。
  • 正则化手段:使用 Dropout 随机丢弃单元以防过拟合;应用 Label Smoothing 将目标标签概率软化(如 90% 给正确词,10% 分散至其他词),提升模型泛化能力及 BLEU 指标。
  • 归一化处理:引入 Layer Normalization 稳定激活值分布,加速收敛;注意力计算中除以 $\sqrt{d_k}$ 以控制方差,防止点积结果过大导致梯度问题。

📌 核心结论与组件权重

  • 关键组件:自注意力层是 Transformer 的核心“秘方”,负责上下文交互;前馈神经网络承载模型大部分参数容量,是复杂特征学习的主要场所。
  • 掩码机制:解码器中的三角矩阵掩码通过设置负无穷值使 Softmax 输出为零,严格阻断对未生成未来 Token 的访问,确保因果一致性。
  • 计算流程:输入经分词、嵌入与位置编码后进入编码器;解码器从起始符开始,结合编码器输出预测下一词概率分布,直至生成结束符完成翻译任务。

⚙️ 解码逻辑与边界界定

  • 解码器输入机制:序列起始标记(Beginning of Sequence)作为解码器的首个输入 token,其核心功能是作为占位符以预测紧随其后的下一个 token。
  • 输出边界界定:该起始标记仅存在于解码器输入端,不会出现在最终输出中;模型生成过程需监测结束标记(End of Sequence),以此作为停止生成的信号。
  • 技术演进路径:从 2017 年的基础架构确立,到当前驱动各类对话式 AI 应用的技术成熟,中间经历了关键的训练方法优化与应用场景拓展,形成了完整的智能代理生态。

博主头像 👤 同一博主

查看该博主全部 14 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。