斯坦福大学AA203课程:最优与基于学习的控制 | 2026春季学期 | 第9讲:随机动态规划
外来客 • 2026-09-02 08:32:20
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 9: Stochastic Dyn. Program)
🎯 核心概述
本内容系统阐述了离散时间随机动态规划(Stochastic Dynamic Programming)的理论框架与求解方法,重点介绍了马尔可夫决策过程(MDP)在最优控制中的应用。通过引入随机扰动并采用风险中性策略,将随机优化问题转化为基于期望值的确定性优化问题。内容涵盖从有限时域的库存控制案例到无限时域马尔可夫决策过程的扩展,深入解析了贝尔曼方程在随机环境下的推导逻辑、Q函数的定义及其在模型未知场景下的核心优势,为后续值迭代与策略迭代算法的学习奠定了理论基础。
📊 马尔可夫决策过程基础
- 框架定义:最优控制被扩展至离散时间随机动态规划框架,即马尔可夫决策过程(MDP)。该框架处理包含随机扰动的系统动力学,旨在寻找使累积成本最小化或奖励最大化的控制策略。
- 随机扰动特性:引入随机变量 $W_k$ 影响状态转移方程。其概率分布仅依赖于当前状态 $S_k$ 和控制输入 $U_k$,而与历史轨迹无关。这一性质确保了系统的马尔可夫性,即历史信息仅通过当前状态传递,满足动态规划的最优性原理。
- 风险中性策略:采用风险中性假设,通过计算成本关于所有可能扰动的期望值,将随机优化问题转化为确定性优化问题。这种处理方式使得复杂的随机过程可以通过标准的递归算法进行求解,无需考虑决策者的风险偏好。
- 动力学描述等价性:系统动力学可通过状态转移概率分布 $T(x_{k+1} | x_k, u_k)$ 或显式扰动形式描述。两者在数学上等价且可相互映射,为不同领域的建模提供了灵活性。
📉 贝尔曼方程与递归求解
- 随机环境下的扩展:在随机动态规划中,贝尔曼方程的递归计算需对当前阶段扰动 $W_k$ 取期望,而非全序列扰动。这一简化显著降低了从终端向初始时刻逆向求解的计算复杂度。
- 有限时域求解逻辑:对于有限时域问题,终端成本通常设为零或给定值。通过逆向递推,逐步计算每个时间步的最优价值函数。期望算子的线性特性允许将复杂的全局随机成本分解为逐阶段局部优化,从而推导出可计算的闭环最优策略 $\pi^*$。
- 无限时域定义:引入折扣因子 $\gamma \in (0,1)$ 以确保奖励总和收敛并反映近期决策权重。系统假设平稳性,即转移概率不随时间变化。最优价值函数 $V^*(x)$ 满足固定点方程 $V^*(x) = \max_u [r + \gamma \mathbb{E}[V^*(x')]]$。
- 策略价值计算:对于给定策略 $\pi$,其价值函数可通过求解线性方程组获得。这一性质为后续值迭代(Value Iteration)和策略迭代(Policy Iteration)算法提供了数学基础,使得在无限时域中评估和改进策略成为可能。
📦 库存控制案例解析
- 问题设定:以库存管理为例,状态 $S_k$ 表示库存量,控制 $U_k$ 为采购量,扰动 $W_k$ 代表需求。仓库容量限制为2单位,即约束条件 $S_k + U_k \le 2$。
- 概率分布参数:需求分布设定为无需求(10%)、需求1单位(70%)和需求2单位(20%)。成本函数包含线性采购成本及二次惩罚项,用于惩罚库存积压或缺货情况。
- 逆向递推求解:以状态 $x_2=0$ 为例,控制变量 $u_2 \in [0, 2]$。目标是最小化期望成本 $\mathbb{E}[u_2 + (x_2+u_2-w)^2]$。手动计算表明,当初始库存为0时,购买1单位($u^*=1$)可使总成本最低。
- 策略特征:中间状态通常优于极端状态,反映了在不确定性环境下平衡持有成本与缺货成本的权衡。该案例直观展示了随机动态规划在处理离散概率分布时的具体应用步骤。
🧮 Q函数定义与优势
- Q函数定义:Q函数定义为无限时域贝尔曼方程的右端项,表示在状态 $X$ 执行控制 $U$ 后,后续阶段按最优策略 $\pi^*$ 行动所获得的累积奖励。由于下一状态具有随机性,Q函数的计算需对下一状态的不同实现进行概率加权平均。
- 固定点方程重构:将 $V^*(x) = \max_u Q^*(x, u)$ 代入价值函数定义式,可推导出仅针对Q函数的贝尔曼方程形式。这种重构使得直接求解动作价值成为可能,而无需显式计算状态价值。
- 模型未知场景优势:在强化学习等模型未知(缺乏转移核/概率分布)的场景中,直接获取最优Q函数比获取价值函数 $V^*$ 更具操作性。若已知 $V^*$,计算最优动作仍需依赖未知的转移核;而拥有Q函数后,最优动作可通过直接最大化 $Q(x, u)$ 获得,无需显式模型参数。
- 算法推导基础:Q函数的引入使得在部分MDP元素未知时,推导学习算法和估计最优控制律变得更加自然且高效。它为基于样本的学习方法提供了直接的优化目标,是连接经典动态规划与现代强化学习的关键桥梁。
📈 随机LQR与无限时域特性
- 随机LQR特性:在动力学受零均值高斯噪声 $\sigma$ 影响的情况下,通过假设成本函数为二次型加常数,推导得出最优控制策略与确定性线性二次调节器(LQR)相同,即保持线性反馈形式。
- 成本增加项:虽然控制律不变,但总成本会增加一个与噪声方差相关的常数项。这一结论表明,在特定高斯线性假设下,随机性主要影响性能指标而非控制结构,简化了控制器设计。
- 平稳性与收敛性:无限时域MDP假设系统转移概率不随时间变化(平稳性),并通过折扣因子保证价值函数的有界性和收敛性。这种设定适用于长期运行且无明确终止时间的控制系统。
🚀 算法应用与课程展望
- 核心算法预告:下一讲将重点介绍求解无限时域贝尔曼方程的算法,预计涵盖值迭代(Value Iteration)和策略迭代(Policy Iteration)。这些算法利用动态规划的递归结构,通过逐步逼近或交替优化状态价值与控制策略来寻找全局最优解。
- 特定策略评估:计划探讨针对特定策略 $\pi$ 计算 $Q^\pi(x, u)$ 的方法,这是策略改进步骤的基础。通过准确评估当前策略的价值,可以指导向更优策略的迭代更新。
- 后续主题延伸:课程后续将转向连续时间闭环最优控制主题,并在数周后回归无限时域MDP及其在学习型控制中的扩展应用。这种安排旨在构建从离散到连续、从模型已知到模型未知的完整最优控制知识体系。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
🧭 类似博主
-
【圆桌派】安逸不是懒,是知道什么时候该停下来!李伯清聊透川渝市井烟火气:只有成都才能治愈现代人的焦虑
-
东日本大地震中残障人士死亡率约为常人两倍:全盲律师大胡田诚谈灾害信息获取困境与信任建立
-
女子旗式橄榄球爆发式增长,将亮相2028年奥运会
-
《金剛經》和《心經》差距有多大?為什麼絕對不能亂念?選錯後果太可怕,一輩子都完蛋了!#耶稣 #基督教
-
海外藝術搞政治!綠營這把竟噁心到大陸退展?!!#光州雙年展 #民進黨 #習近平 #李在明 #賴清德【
-
比尔·古利(Bill Gurley):追寻费曼
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
安东尼·戴维斯(Anthony Davis)本赛季将在华盛顿特区展现统治级表现
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
0 条评论
发表评论
请先 登录 后参与讨论。