斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
外来客 • 2026-08-21 19:02:44
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 18: RL Policy Optimization)
🎯 强化学习策略优化核心机制
- 课程进入强化学习策略优化阶段,区别于基于价值的方法,策略优化通过参数化策略 $\pi_\theta$ 显式表示策略,并直接最大化强化学习目标函数。
- 将强化学习问题转化为关于策略参数 $\theta$ 的优化问题,采用梯度上升法求解,策略梯度本质上是最大似然估计梯度的加权版本,权重为轨迹的累积奖励,旨在增加高奖励轨迹出现的概率。
- 轨迹分布 $p(\tau)$ 由初始状态分布、策略分布和转移动态分布因子化构成,其中策略分布依赖于参数 $\theta$,利用恒等式 $\nabla_\theta p(\tau) = p(\tau) \nabla_\theta \log p(\tau)$ 将梯度表达式转化为期望形式,消除对未知动态的直接依赖。
- 对轨迹分布取对数后,仅策略项 $\log \pi(a_t|s_t)$ 包含参数 $\theta$,初始状态和转移动态项在求梯度时消失,最终策略梯度估计器为轨迹奖励总和与策略对数概率乘积的期望,可通过采样 $n$ 条轨迹计算经验均值来近似。
- REINFORCE 算法基于此推导,通过蒙特卡洛方法估计回报并更新策略参数,属于无模型学习策略,策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程。
📉 策略梯度方差问题与成因
- 当前策略梯度估计器存在极高方差,导致学习信号不稳定、训练收敛慢及性能下降,是主要局限性,高方差源于对回报(Return)的样本估计受随机性影响,且未中心化的回报会导致梯度方向偏差。
- 降低方差是策略优化研究的核心目标,旨在提升样本效率与训练稳定性,策略优化天然支持连续与离散动作空间,通过参数化策略(如高斯分布)直接优化,无需像价值方法那样求解复杂的 argmax 优化问题。
- 优化目标直接对强化学习目标(折扣奖励和)进行梯度上升,中间步骤的改进程度清晰可量化,策略类型属于 On-policy 算法,必须使用当前策略生成的经验数据,样本效率相对较低。
🛠️ 方差缩减策略与基线引入
- 因果性技巧仅累加当前时刻 $t$ 及之后的奖励,排除当前动作无法影响的过去奖励,减少求和项数以降低方差,基线(Baseline)引入从回报中减去基线 $B$ 以中心化数据,使优于平均的行为概率增加,劣于平均的行为概率降低。
- 无偏性证明数学推导表明,减去基线项的期望值为零,因此不改变梯度估计的期望值,即在无偏前提下免费降低方差,基线选择常用轨迹平均回报作为基线,能显著加速简单环境下的训练收敛。
- Actor-Critic 方法旨在融合策略优化与基于价值方法的优点,通过同时维护策略网络(Actor)和评价网络(Critic)来降低策略梯度的方差,核心思想是结合策略梯度与价值方法,用参数化函数(Critic)拟合期望回报,替代高方差的样本回报估计。
- 基线优化将基线设为状态价值函数 $V(x_t)$,即策略下 Q 函数的期望值,优势函数(Advantage Function)是核心概念,定义为动作价值与状态平均价值之差,用于衡量特定动作相对于平均水平的优势。
🤖 Actor-Critic 架构与 A2C 实现
- 在连续分布或高维空间中,直接拟合 Q 函数复杂度较高,因此通常采用 A2C(Advantage Actor-Critic)架构,仅拟合状态价值函数 $V(s)$ 来近似优势,A2C 实现技巧为避免同时拟合 Q 函数和 V 函数,利用近似公式 $Q(s,a) \approx r + V(s')$,将优势重写为仅依赖状态价值函数 $V$ 的形式,从而简化网络结构。
- 该框架的理论基础与拟合 Q 学习(Fitted Q-learning)一致,均通过最小化预测误差来拟合参数,但 Actor-Critic 显式地利用价值函数进行策略梯度更新,价值函数的拟合可通过蒙特卡洛(MC)或时序差分(TD)学习实现,具体选择取决于数据效率和偏差-方差权衡。
- Actor-Critic 方法通过解耦策略学习与价值评估,解决了纯策略优化方差大和纯价值方法策略隐式定义的问题,尽管深度强化学习缺乏收敛性证明的理论保证,但 A2C 等算法在复杂任务中的成功证明了其工程有效性。
🏆 AlphaGo 案例验证与工程实践
- 2014 年 AlphaGo 项目成功应用了 Actor-Critic 架构,其中策略网络映射棋盘状态到动作分布,价值网络映射状态到标量价值,AlphaGo 通过自我博弈(Self-play)收集数据,使用策略梯度更新策略网络,其中基线(Baseline)采用状态价值函数 $V(s)$ 以减少方差。
- 行为克隆的影响早期版本通过行为克隆(Behavior Cloning)初始化,但后续研究表明该步骤对最终性能有负面影响,纯自我博弈学习效果更佳,搜索增强 AlphaGo 并非仅从策略分布采样,而是利用策略分布引导蒙特卡洛树搜索(MCTS),这是其超越纯 RL 算法的关键贡献。
- 该框架为理解现代深度强化学习算法提供了基础,后续课程将延伸至基于模型的强化学习方法,策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程。
⚖️ 策略优化特性与理论局限
- 动作空间天然支持连续与离散动作空间,通过参数化策略(如高斯分布)直接优化,无需像价值方法那样求解复杂的 argmax 优化问题,优化目标直接对强化学习目标(折扣奖励和)进行梯度上升,中间步骤的改进程度清晰可量化。
- 策略类型属于 On-policy 算法,必须使用当前策略生成的经验数据,样本效率相对较低,当前策略梯度估计器存在极高方差,导致学习信号不稳定,是主要局限性,后续将讨论降低策略梯度方差的策略,以改善算法稳定性。
- 策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程,Actor-Critic 方法通过解耦策略学习与价值评估,解决了纯策略优化方差大和纯价值方法策略隐式定义的问题。
- 尽管深度强化学习缺乏收敛性证明的理论保证,但 A2C 等算法在 AlphaGo 等复杂任务中的成功证明了其工程有效性,价值函数的拟合可通过蒙特卡洛(MC)或时序差分(TD)学习实现,具体选择取决于数据效率和偏差-方差权衡。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第11讲:模型预测控制(
🧭 类似博主
-
【圆桌派】安逸不是懒,是知道什么时候该停下来!李伯清聊透川渝市井烟火气:只有成都才能治愈现代人的焦虑
-
东日本大地震中残障人士死亡率约为常人两倍:全盲律师大胡田诚谈灾害信息获取困境与信任建立
-
女子旗式橄榄球爆发式增长,将亮相2028年奥运会
-
《金剛經》和《心經》差距有多大?為什麼絕對不能亂念?選錯後果太可怕,一輩子都完蛋了!#耶稣 #基督教
-
海外藝術搞政治!綠營這把竟噁心到大陸退展?!!#光州雙年展 #民進黨 #習近平 #李在明 #賴清德【
-
比尔·古利(Bill Gurley):追寻费曼
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
安东尼·戴维斯(Anthony Davis)本赛季将在华盛顿特区展现统治级表现
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
0 条评论
发表评论
请先 登录 后参与讨论。