博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习

(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 15: Imitation Learning) 🎯 模仿学习核心机制与挑战 分类体系:模仿学习主要涵盖行为克隆(Behavior Cloning)与逆强化学习(Inverse Reinforcement Learning)。前者通过监督学习近似专家策略分布,实施简单且无需显式奖励信号;后者旨在从演示中估计专家优化的奖励函数,核心难点在于解决“奖励歧义性”,即多种奖励函数可能解释同一组数据。 复合误差陷阱:行为克隆面临协变量偏移(Covariate Shift)问题。由于策略影响未来状态,学习者诱导的状态分布 $P_{\pi_\theta}(x)$ 与专家分布 $P_{expert}(x)$ 发生偏移。理论表明,在离散动作空间中,错误概率随轨迹长度 $t$ 呈二次方增长($\epsilon t^2$),导致模型在未见过的状态中失效。 多模态困境:使用均方误差(MSE)拟合多模态控制分布时,模型倾向于预测分布均值。例如在无人机绕树飞行场景中,均值回归会导致策略落入无效区域(如撞向树木),无法捕捉专家行为的多样性。 数据价值悖论:包含错误及恢复过程的广泛轨迹集比狭窄的完美演示集更具学习价值。部署时的策略必然会产生误差,因此模型需具备从错误状态中纠正的能力,而非仅依赖完美路径的复现。 📊 算法优化与数据增强策略 DAgger 算法机制:作为一种迭代式数据聚合方法,DAgger 直接针对学习者分布下的失败模式进行纠正。流程包括让学习者策略与环境交互、在访问状态处查询专家进行重标注、聚合新数据并重新训练。该过程具有数据高效性,有效缓解了复合误差。 变体应用:基于置信度的查询仅在模型不确定时询问专家;Human-Gated DAgger 允许人类在检测到错误时介入接管,从而探索错误后的不同轨迹分支,丰富了状态空间的覆盖范围。 视角切换增强:NVIDIA 早期工作利用三摄像头(左、中、右)视角切换,将侧视图像作为前视输入并调整转向角标签,以低成本生成纠正驾驶错误的训练样本。苏黎世大学团队在四旋翼无人机导航中采用类似头戴多相机方案,通过视角偏移标注离散动作,实现数据增强。 历史观测引入:单帧图像无法捕捉速度等动态信息。引入过去观测序列(如 Transformer 或 RNN)作为上下文,可区分相同视觉状态下的不同行为意图,解决部分可观测问题,提升策略在未见场景下的泛化能力。 💡 动作空间参数化与模型架构 动作分块优势:当前主流方法通过预测长度为 $k$ 的未来动作序列(Action Chunking)而非单一动作,显著提升了推理效率与控制平滑度。预计算 $k$ 步动作允许模型在短期内信任预测,减少重算频率;序列内生成更具连贯性,消除了单次调用引入的随机性。 分布参数化对比:离散输出天然支持多模态但随维度指数级膨胀;高斯混合模型(GMM)通过 $K$ 个分量拟合复杂分布,但 $K$ 为需经验调优的超参数;自回归分解将联合分布拆解为一维条件概率乘积,缓解维度灾难。 生成式建模应用:扩散模型通过学习去噪过程从噪声映射至目标分布;流匹配(Flow Matching)则学习向量场,通过欧拉积分将简单高斯分布样本传输至复杂数据分布,适用于连续控制动作生成。这些方法在保持连续性的同时提供了强大的多模态分布表达能力。 典型应用案例:Diffusion Policy 利用扩散模型从图像观测生成完整机器人手臂轨迹,展示了跨条件泛化能力;Robotics Transformer 将历史图像与语言描述映射为离散动作表示,采用自回归方式逐维度生成动作。 🚀 超越基础克隆的高级策略 过滤与加权机制:引入奖励函数对轨迹进行评分,仅保留或高权重处理表现优于特定阈值的轨迹。此方法适用于任务狭窄或数据质量参差不齐的场景,通过剔除低质量演示提升模型鲁棒性。 条件化策略设计:将策略条件于目标状态(Goal-conditioned)或候选总奖励(Reward-conditioned),使所有演示轨迹均成为有效学习样本。推理时再查询最优目标,从而扩展了策略的适用范围并增强了灵活性。 逆强化学习机制:算法通常交替更新奖励参数 $w$ 和策略参数 $\theta$。主流方法包括学徒学习(Apprenticeship Learning)、最大间隔规划(Maximum Margin Planning)及最大熵 RL(Max Entropy RL),旨在从数据中推导优化目标,适用于需要理解专家意图的场景。 工程实践参考:NVIDIA 2016 年的自动驾驶研究证实,通过持续收集人类驾驶图像与转向角度的配对数据,可显著提升神经网络控制器的稳定性与性能。在端到端学习中,利用经典方法或专家策略生成高质量标签(蒸馏),有助于解决在线实时性与数据可靠性之间的平衡问题。 📌 结论与实践建议 能力上限突破:在机器人控制中,单纯模仿专家行为无法超越其能力上限。需结合环境交互或特定算法(如 DAgger)获取纠正数据,以应对复合误差和行为多模态性挑战。 方法选择依据:行为克隆适合奖励定义困难的任务(如驾驶),但受限于演示数据的覆盖范围;逆强化学习则提供了从数据中推导优化目标的替代路径。针对多模态策略输出,离散化、GMM、自回归 Transformer 及流匹配模型各有优劣,需根据具体任务需求选择。 超参数调优:实际应用中,历史窗口长度、混合分量数 $K$ 等超参数通常需通过消融实验确定,以平衡过拟合与欠拟合风险。高表达力的序列模型与概率分布输出的结合,是提升策略鲁棒性的关键方向。

博主头像

🎬 斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法

(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 17: RL Value-Based Methods) 📌 一句话概述 本内容系统梳理了强化学习中基于价值的方法(Value-Based Methods),深入解析了从时序差分(TD)学习基础到 SARSA、Q-Learning 算法的演进逻辑,并重点阐述了深度 Q 网络(DQN)如何通过经验回放与固定目标网络解决高维状态空间下的训练稳定性难题。 🧠 核心概念与理论基础 价值方法本质:基于价值的强化学习通过近似动作价值函数 $Q(s, a)$ 来实现策略评估与改进,其核心在于平衡探索(Exploration)与利用(Exploitation)。 蒙特卡洛与时序差分对比: 蒙特卡洛(MC):需等待回合终止以计算完整回报,方差较低但无法在线更新;在存在循环策略或无限回合的环境中易失效。 时序差分(TD):通过单步自举(Bootstrapping)利用当前估计值更新下一状态的价值,支持在线学习且无需完整回合数据,显著降低了估计方差对长序列的依赖。 同策略与异策略机制: 同策略(On-policy):行为策略与目标策略一致,如 SARSA 算法,评估的是实际执行策略的性能。 异策略(Off-policy):允许行为策略(用于探索)与目标策略(用于优化)解耦,如 Q-Learning,能够利用历史数据或人类观察进行学习,提高样本效率。 📊 SARSA 算法机制与特性 更新规则:SARSA 基于五元组 $(s_t, a_t, r_{t+1}, s_{t+1}, a_{t+1})$ 进行 TD 备份更新。其目标值依赖于实际选择的下一动作 $a_{t+1}$,而非理论上的最优动作。 策略一致性:作为同策略算法,SARSA 使用 $\epsilon$-greedy 策略既用于环境交互(行为),也用于价值评估(目标)。这意味着它学习的是“在包含随机探索行为的策略下”的最优路径。 风场网格案例表现:在存在向上推力的风场环境中,SARSA 收敛至一个稳健策略(先抵顶再折返),有效规避了因风力导致的不可控漂移风险。相比之下,MC 方法因无法保证回合终止且易受循环限制,在此类动态环境中表现受限。 🚀 Q-Learning 算法机制与对比 核心创新:Q-Learning 引入了策略分离概念,设定目标策略为基于 $Q$ 函数的纯贪婪策略($\arg\max_a Q(s, a)$),而行为策略保持 $\epsilon$-greedy。这使得算法能够学习最优确定性策略,即使实际执行过程中包含随机探索噪声。 TD 目标重构:通过代数变换,Q-Learning 的 TD 目标定义为奖励加上折扣后的最大 $Q$ 值($\max_u Q(s', u)$),取代了 SARSA 中基于实际下一动作的更新方式。 收敛性保证:在满足特定正则性假设(如有限状态/动作空间、充分探索)下,Q-Learning 可证明收敛至最优动作价值函数及策略。 ⚖️ SARSA vs. Q-Learning 实验对比 悬崖环境测试:在无风但含悬崖(奖励 -100)的网格世界实验中,两种算法表现出显著的路径差异。 SARSA(蓝色路径):收敛至最优 $\epsilon$-greedy 策略。由于考虑了探索时的随机性,其路径更靠近天花板以规避风险,训练期间累积奖励较高。 Q-Learning(红色路径):收敛至纯贪婪策略。其最终路径紧贴悬崖边缘以最大化效率,但在训练阶段因频繁落入悬崖导致累积奖励较低。 性能差异解读:SARSA 在记录 $\epsilon$-greedy 执行结果时表现优于 Q-Learning,因为它优化的是“带噪声”的执行过程;而 Q-Learning 追求理论上的最优确定性路径,牺牲了训练过程中的安全性以换取最终策略的最优性。 📈 函数近似与高维扩展 维度灾难解决:针对高维状态空间(如围棋 $10^{170}$ 种配置),摒弃传统的查表法(Lookup Table),采用参数化函数 $\theta$ 近似价值函数。这不仅压缩了内存需求,还实现了跨状态的泛化能力。 回归视角更新:将强化学习过程转化为最小化预测值与真实值误差的回归问题。利用蒙特卡洛回报或 TD 目标作为回归标签,通过梯度下降更新网络参数 $\theta$。 计算优化策略:在离散动作空间中,若 $Q$ 函数能一次性输出所有动作的值,可将贪婪策略的选择从多次查询简化为单次查找(Argmax over outputs),显著提升计算效率。 🧩 深度 Q 网络(DQN)架构与机制 CNN 引入强化学习:DQN 将卷积神经网络(CNN)作为函数近似器,直接从原始环境图像输入中学习控制策略。这解决了 Atari 游戏等复杂视觉环境的优化问题,实现了端到端的感知与控制。 架构特征:采用 CNN 处理图像状态代理,输出当前状态下所有可能动作对应的 $Q$ 值,属于深度价值函数近似方法。 🛡️ DQN 稳定性关键技术 经验回放(Experience Replay): 问题背景:在线交互数据具有高度时间相关性,违反独立同分布(i.i.d.)假设,导致梯度更新不稳定。 解决方案:将转移数据 $(s, a, r, s')$ 存入大型缓冲区(Replay Memory),通过随机采样打破时间相关性,优化回归效果并提高样本利用率。 固定目标网络(Fixed Target Network): 问题背景:参数更新导致回归目标动态变化(Moving Target Problem),使得训练过程难以收敛。 解决方案:维护两套 $Q$ 函数网络参数 $\theta$(在线网络)和 $\phi$(目标网络)。在训练阶段保持 $\phi$ 固定以稳定 TD 目标,随后定期将 $\phi$ 同步为 $\theta$ 的副本或采用 Polyak 平均法进行平滑更新。 📝 结论与后续方向 算法演进逻辑:从 MC 到 TD,再到 SARSA/Q-Learning,最后至 DQN,强化学习价值方法经历了从离线到在线、从查表到函数近似、从离散到低维到高维视觉输入的逐步深化过程。 关键技术贡献:经验回放与固定目标网络是使深度强化学习算法在实际应用中成功的关键技术贡献,解决了深度学习在非平稳数据环境下的训练稳定性难题。 后续课程展望:价值方法讨论至此结束,后续内容将转向无模型策略优化方法及基于模型的强化学习方法,进一步探索直接优化策略或构建环境模型的路径。