斯坦福大学 CME295《Transformer 与大语言模型》课程 | 2026 年秋季学期 |
外来客 • 2026-09-29 11:27:15
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers)
🎓 课程定位与考核机制
- 核心目标:深入解析大语言模型(LLM)的底层架构、训练机制及适用边界,旨在系统性提升学员对人工智能技术的认知素养与技术理解力。
- 受众范围:涵盖科研学者、个人开发者(特别是编码代理使用者)以及需要建立基础 AI 认知的职场人士,强调理论与实践结合。
- 前置要求:学员需具备线性代数基础(尤其是矩阵运算能力)及机器学习基本概念(包括损失函数、神经网络原理及嵌入技术)。
- 考核方式:课程不设常规作业,总成绩由期中与期末两次考试构成,各占 50% 权重;期中考试定于 10 月 23 日进行。
- 教学安排:每周五下午 3:30 至 5:20 授课,共设 9 次讲座;课件提前一天发布以便学员预习与标注。
- 资源支持:推荐教材《The Super Study Guide Transformers and LLMs》及最新更新的 Cheat Sheet(涵盖多语言版本);讲师课后留堂答疑,并支持通过 Canvas 平台或邮件列表进行私下咨询。
📜 技术演进与核心架构
- 范式转变:2017 年论文《Attention is all you need》提出 Transformer 架构,确立了通过增加数据、算力及参数实现性能显著跃升的可扩展性路径,成为当前主流技术基石。
- 应用里程碑:2022 年 ChatGPT 发布标志着 AI 从传统对话机器人向通用交互助手的转变;当前技术已延伸至具备自主行为能力的编码代理(Coding Agents)。
- 架构转折点:Transformer 因具备高可扩展性和优异性能取代了 RNN,其核心在于摒弃隐藏状态传递,通过矩阵运算实现并行化计算,显著提升了模型训练与推理效率。
- 后续展望:本次讲座仅为 Transformer 技术全貌的开端,重点厘清基础解码逻辑与历史定位;后续课程将聚焦于模型训练细节及智能代理(Agents)的实现原理,揭示技术如何从单一翻译任务扩展至多系统交互场景。
🧩 分词机制与 BPE 算法
- 核心逻辑:将文本转化为模型可处理的数值向量,需通过词汇表(Vocabulary)确定不可分割的最小单元(Token),这是连接自然语言与数学计算的关键桥梁。
- 方案对比:
- 词级分词:简单直观但词汇量庞大,且无法有效关联同根词,存在未登录词风险。
- 字符级分词:彻底规避未登录词问题,但序列长度过长导致计算效率低下,语义可解释性差。
- 子词级分词(Subword):当前主流方案,平衡了词汇规模与序列长度,能利用词根知识并降低计算复杂度。
- BPE 原理:字节对编码(Byte Pair Encoding)通过迭代合并训练数据中最高频的字符对来构建词汇表,使高频模式获得独立 Token 表示,优化存储与检索效率。
- 特殊词元规范:BOS/EOS 用于标记生成起止,Padding 用于统一序列长度以适配硬件并行处理;现代模型还包含 User/Assistant 等角色标识以区分对话语境。
📊 关键事实与论据
- 词表规模现状:当前大语言模型的词表大小通常在数十万级别(如 200,000),多语言支持可能增加单语言下的序列长度,但有助于跨语言语义协同。
- Word2Vec 局限:基于代理任务(CBOW/Skip-gram)学习静态向量,存在一词多义混淆、忽略词序及无法处理未登录词等缺陷,难以捕捉动态上下文。
- RNN 瓶颈:虽通过隐藏状态解决词序问题,但受限于长距离依赖遗忘和反向传播中的梯度消失,且串行计算导致训练效率低下,难以扩展至大规模数据。
- 数学实现逻辑:自注意力公式为 $\text{softmax}(QK^T)V$。其中 $QK^T$ 计算相似度权重,Softmax 归一化系数,最终加权求和得到新的词元表示,实现了全局信息交互。
🧠 Transformer架构核心机制
- 自注意力替代循环:摒弃 RNN 的隐藏状态传递,通过 Query、Key、Value 矩阵投影让 Token 直接与序列内所有其他 Token 交互,实现上下文感知表示。
- 位置编码策略:将可学习的 Token 嵌入与位置嵌入相加。位置嵌入可采用学习法或正弦/余弦函数生成;后者利用不同频率组合精确表征相对距离,且能泛化至训练时未见的更长序列。
- 编码器与解码器分工:编码器通过自注意力层和前馈神经网络提取源语言的上下文表示;解码器结合掩码自注意力(仅关注已生成 Token)和交叉注意力(Query 来自解码器,Key/Value 来自编码器),以自回归方式逐词生成目标语言。
- 位置信息缺失修复:纯自注意力机制本身不感知词序,需引入额外机制(如位置编码)来修复该缺陷,确保模型理解序列中的顺序关系。
🛠️ 关键训练技巧与维度
- 残差连接:采用 $x + f(x)$ 结构直接传递特征,缓解深层网络梯度消失问题,优化反向传播路径,提升深网训练稳定性。
- 多头注意力:并行学习多组投影矩阵,使模型能从不同子空间捕捉语言模式,最终通过线性层映射回原始维度($D_{model}$),增强表征能力。
- 正则化手段:使用 Dropout 随机丢弃单元以防过拟合;应用 Label Smoothing 将目标标签概率软化(如 90% 给正确词,10% 分散至其他词),提升模型泛化能力及 BLEU 指标。
- 归一化处理:引入 Layer Normalization 稳定激活值分布,加速收敛;注意力计算中除以 $\sqrt{d_k}$ 以控制方差,防止点积结果过大导致梯度问题。
📌 核心结论与组件权重
- 关键组件:自注意力层是 Transformer 的核心“秘方”,负责上下文交互;前馈神经网络承载模型大部分参数容量,是复杂特征学习的主要场所。
- 掩码机制:解码器中的三角矩阵掩码通过设置负无穷值使 Softmax 输出为零,严格阻断对未生成未来 Token 的访问,确保因果一致性。
- 计算流程:输入经分词、嵌入与位置编码后进入编码器;解码器从起始符开始,结合编码器输出预测下一词概率分布,直至生成结束符完成翻译任务。
⚙️ 解码逻辑与边界界定
- 解码器输入机制:序列起始标记(Beginning of Sequence)作为解码器的首个输入 token,其核心功能是作为占位符以预测紧随其后的下一个 token。
- 输出边界界定:该起始标记仅存在于解码器输入端,不会出现在最终输出中;模型生成过程需监测结束标记(End of Sequence),以此作为停止生成的信号。
- 技术演进路径:从 2017 年的基础架构确立,到当前驱动各类对话式 AI 应用的技术成熟,中间经历了关键的训练方法优化与应用场景拓展,形成了完整的智能代理生态。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
🧭 类似博主
-
为什么AI数据中心消耗如此多的电力?——萨詹·赛尼(Sajan Saini)
-
《三角洲行动》落地重庆:中国游戏如何构建全球影响力
-
高质量发展故事:中国风机挺进深海
-
AI专家称对失控智能体“担忧但不恐惧
-
走進美國AI運算中心 DataBank全美70座【短篇】#TVBS文茜的世界周報 20260919
-
布莱克·肖尔(Blake Scholl):飞机速度为何停滞、超音速商业飞行与发动机革命
-
习特会:是放缓还是加速人工智能竞赛?
-
智谱AI彻底惹毛程序员,ZCode碰了不能碰的数据|今日华尔街
-
有史以来最重要的密码破译机
-
科技养老是福音还是陷阱?清华教授犀利发声:警惕“电子鸦片”与“电子病毒”,别让机器人剥夺了老人的晚年
0 条评论
发表评论
请先 登录 后参与讨论。