斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
外来客 • 2026-08-21 07:49:10
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 19: Model-Based RL)
🎯 强化学习范式演进与核心算法机制
- 强化学习正经历从单步梯度下降向数值优化范式的根本性转变,其核心在于定义代理目标函数以实现策略参数的连续、多步更新,而非仅依赖单次环境交互。
- 策略优化方法如 TRPO 和 PPO 的本质是构建代理目标,确保其梯度等价于策略梯度,从而允许在获取新环境数据前进行多次参数迭代,显著提升了优化效率。
- 模型无关强化学习存在样本效率与稳定性之间的固有权衡:On-policy 算法(如 PPO)样本效率较低但训练稳定;Off-policy 算法样本效率高但稳定性较差,易受分布偏移影响。
- 方法分类上,基于价值的方法(如 Q-learning)通过广义策略迭代交替执行价值评估与策略改进;基于策略的方法(如 Actor-Critic)则直接优化策略参数,结合 Critic 降低方差。
- TRPO 引入信任区域约束,利用 KL 散度衡量新旧策略分布距离,确保更新在可信邻域内,虽可靠但需共轭梯度法求解,实现复杂且在深度网络中表现较弱。
- PPO 作为 TRPO 的简化衍生,通过裁剪概率密度比 $r(\theta)$ 近似约束行为,目标函数取 $\min(r(\theta)A, \text{clip}(r(\theta), 1-\epsilon, 1+\epsilon)A)$,在梯度方向不利时饱和梯度,避免策略偏离过远,解决了 TRPO 在深度神经网络中实现困难的问题。
- 策略梯度天然高方差,通过引入基线(Baselines)和 Critic(Actor-Critic 架构)来降低方差,提升训练稳定性。
- 学习范式对比中,蒙特卡洛方法无偏但高方差且需终止状态;时序差分(TD)学习通过自举降低方差但引入偏差,支持在线学习,更适合连续任务。
📊 基于模型强化学习的核心流程与挑战
- 基于模型的强化学习(Model-Based RL)核心流程为:利用策略与环境交互收集状态-动作-下一状态转移数据,拟合动力学模型,并基于该模型进行规划,从而减少对环境交互的依赖。
- 主要挑战在于复杂非线性动力学下,高容量模型(如神经网络)易过拟合,导致在分布外(Out-of-Distribution)状态上预测失真,进而引发规划错误。
- 优化器可能利用模型预测中的正向误差(Exploit Errors),即模型在过拟合区域给出虚假高奖励,因此必须引入不确定性量化(Uncertainty Quantification)以约束规划行为,确保鲁棒性。
- 分布偏移问题在模型规划中同样存在,当规划策略诱导的状态分布偏离初始探索策略分布时,模型泛化能力下降,简单改进如模型预测控制(MPC)和在线数据更新不足以解决过拟合导致的优化器利用误差问题。
- 不确定性类型需严格区分:Aleatoric Uncertainty(随机不确定性)是过程固有的噪声,可通过输出熵(如高斯分布标准差)建模;Epistemic Uncertainty(认知不确定性)是对模型参数本身的不确定,需通过贝叶斯方法建模参数后验分布 $P(\theta|D)$。
- 贝叶斯预测后验通过对参数分布积分得到预测后验分布,能更准确地表达预测范围,避免优化器利用过拟合带来的虚假高奖励,是解决认知不确定性的关键框架。
- 高斯过程(Gaussian Processes)数据效率高,提供精确的后验分布解析解,适合低数据场景,但计算涉及矩阵求逆,随数据量 $n$ 增加扩展性差,难以应用于大规模复杂系统。
- Bootstrap Ensembles(自举集成)通过独立训练多个模型,利用模型间的一致性反映确定性,不一致性反映不确定性,适用于高容量黑盒模型,通过集成差异捕捉认知不确定性,是工程实践中常用的替代方案。
💡 不确定性量化方法与模型集成策略
- 模型集成(Ensembles)通过独立训练多个神经网络并平均预测,利用随机梯度下降的随机性收敛至不同局部极小值,从而经验性地近似参数后验分布的多模态特性,有效捕捉认知不确定性。
- 在模型强化学习中,不确定性量化并非唯一解,但在动力学近似困难且使用高容量模型时,通过采样后验分布中的参数实例来传播轨迹并计算期望奖励,是一种有效的规划机制,能显著提升鲁棒性。
- PETS 算法采用神经网络集成近似模型后验分布,结合交叉熵方法生成候选计划,并通过集成模型采样评分以选择最佳动作,以模型预测控制(MPC)的滚动时域方式执行,实现了样本效率与稳定性的平衡。
- 与 PPO 或 Soft Actor-Critic 等无模型算法相比,基于模型的方法(如 PETS)在收敛性能相似的情况下,通常能更快达到收敛,显著提升了样本效率,减少了对环境交互的依赖,特别适合样本昂贵的场景。
- 解决复杂动力学建模的关键在于区分并量化认知不确定性,推荐采用贝叶斯框架、高斯过程或集成方法,以确保规划算法在不确定区域保持鲁棒性,避免优化器利用模型误差。
- 理解算法间的权衡(如样本效率、动作空间类型、回合制 vs 无限时域)对于选择合适算法至关重要,这些概念在深入具体算法后变得具体可感,需根据任务特性灵活选择。
- 尽管端到端学习方法正逐渐向决策栈下层渗透,但在涉及硬约束保证和精细控制的底层组件中,传统控制方法仍占据主导地位,学习算法(如感知)已在高层抽象中成为标准,但完整的自主系统仍需结合多种控制理论方法。
🧠 层级化自主决策栈与控制架构
- 最优控制与强化学习算法并非相互竞争,而是通常结合使用,构成层级化的自主决策栈(Autonomy Stack),不同层级对应不同的控制方法,形成完整的决策闭环。
- 高层决策处理随机性,确定高层目标(如车道变更),通常涉及闭环动态规划,负责长期策略制定,需考虑环境不确定性和任务目标。
- 轨迹生成层将目标转化为具体轨迹,编码动力学约束,通常使用开环技术,负责将抽象目标映射为可执行的运动序列,需平衡舒适性与效率。
- 轨迹跟踪层确保物理可实现性,包含更精细的动力学模型和安全约束,通常使用 MPC,负责实时调整控制输入以跟踪参考轨迹,需处理模型失配和外部扰动。
- 底层执行通过 PID 等控制器驱动执行器,确保实时跟踪,负责将控制信号转化为物理动作,需满足严格的实时性和稳定性要求。
- 安全机制通过 Hamilton-Jacobi 可达性分析计算安全状态集,用于约束开环规划和跟踪模块,确保系统在任意时刻都保持在安全区域内,提供硬约束保证。
- 对于连续控制任务,PPO 和 Soft Actor-Critic 目前仍是更成熟的技术选择,而模型强化学习仍是活跃的研究领域,两者在不同层级和场景下各有优势,需根据具体应用需求在层级结构中灵活组合。
- 课程路线图即将完成模型无关强化学习部分,后续将转向模型无关强化学习,重点讨论不确定性量化以应对模型预测的挑战,为构建鲁棒的自主系统奠定基础。
👤 同一博主
🧭 类似博主
-
病毒到底是活的還是死的?科學家吵了100年:揭開的終極答案令人細思極恐!#圆桌派 #许子东 #马家辉
-
中共突然宣布政策大變局,究竟化解危機還是加劇危機?習近平貼身秘書被抓!中共軍委陷入歷史性危機。
-
下一场选举可能在电子游戏中获胜
-
Clavicular 失去女友:关于名声与金钱的残酷真相
-
和公民结婚前有逾期滞留,去婚绿面谈会被抓吗?庇护家属拿到绿卡后离婚,绿卡会被取消吗?庇护绿卡审理期间
-
美国医学院有多难申请?GPA 3.7、MCAT 515+,国际生还有机会吗?
-
黑色之夏:澳大利亚末日级山火中的生存
-
2025-26赛季NBA最佳空中接力扣篮集锦
-
新疆是中国领土不可分割的一部分 穿越千年 探索中国新疆的辉煌篇章!《中国新疆之历史印记》合集(下)【
-
夢境穿越與薩滿通靈!貫穿人類原始靈魂工程的天鵝座印記!【外星圖鑑】
0 条评论
发表评论
请先 登录 后参与讨论。