斯坦福大学AA203课程:最优与基于学习的控制(2026春季)第10讲:可达性分析
外来客 • 2026-09-02 08:31:37
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 10: Reachibility Analysis)
📊 无限时域随机动态规划基础
- 核心机制:在已知状态转移概率和奖励函数的前提下,通过求解固定点方程获取最优价值函数 $V^*$ 或 Q 函数,进而推导全局最优策略。该过程将决策问题转化为数学上的不动点搜索,确保在有限步长内逼近理论最优解。
- 价值迭代算法:从初始值(通常设为零向量)开始,反复应用 Bellman 方程进行更新。其收敛性由压缩映射原理保证,终止条件通常设定为相邻两次迭代的差值小于预设阈值,或达到最大迭代次数(如 2000 次)。该方法适用于大规模状态空间,但收敛速度可能较慢。
- 策略迭代算法:直接在策略空间进行优化,包含两个交替步骤。“策略评估”阶段通过求解线性系统计算当前固定策略下的价值函数;“策略改进”阶段利用 Bellman 方程最大化即时奖励与未来折扣价值之和,生成新策略。
- 收敛性保证:在有限状态和控制集合下,策略迭代具有单调严格改善性质。每一步生成的新策略性能均不低于前一步,且由于策略空间有限,算法保证在有限步内收敛至最优策略,通常比价值迭代更快达到精确解。
⏱️ 连续时间最优控制框架
- 模型扩展:将离散时间动态规划扩展为连续时间形式,系统动力学由微分方程 $\dot{x} = f(x, u)$ 描述,代价函数采用积分形式。这一转变使得控制理论能够更自然地处理物理系统中的连续变化过程。
- 对抗性扰动引入:为了增强鲁棒性,模型中引入了代表“自然”或对手的对扰 $d$。玩家一(控制器)旨在最大化奖励 $J$,而玩家二(干扰者)旨在最小化 $J$。两者通过联合动力学耦合,形成微分博弈结构。
- HJB 方程应用:Hamilton-Jacobi-Bellman (HJB) 方程用于求解标准连续时间最优控制问题,如线性二次调节器 (LQR)。它描述了价值函数沿系统轨迹的时间演化规律,是离散 Bellman 方程在连续极限下的对应形式。
- HJI 方程应用:Hamilton-Jacobi-Isaacs (HJI) 方程用于处理包含对抗性干扰的场景,广泛应用于可达性分析。其核心目标是设计碰撞避免策略,例如在自动驾驶汽车或飞机中,确保系统在对手恶意干扰下仍能维持安全状态。
🎯 微分博弈与鲁棒控制理论
- 非预期策略定义:玩家二仅能观测当前时刻及之前的状态与控制轨迹,无法预知未来动作。这种“即时反应”机制赋予干扰者类似棋类后手的优势,同时避免了全知视角导致的过度保守解,使模型更符合现实物理约束。
- Min-Max 结构转换:在连续时间积分层面采用 Min-Max 结构以体现干扰者的外层优化地位;但在瞬时尺度下,为保持玩家二的反应优势,推导中需转换为 Max-Min 结构。即先固定控制 $U$,再求解最优干扰 $D$,确保策略在最坏情况下的有效性。
- HJI 方程推导逻辑:基于 Euler 离散化和 Taylor 展开,将连续时间 Bellman 方程推广至对抗场景。最终形式为包含 Max-Min 优化项的偏微分方程 (PDE),边界条件由终端成本确定。该方程是求解连续时间微分博弈最优值函数的标准数学工具。
- 应用背景实例:适用于 ACAS-X 等下一代碰撞避免系统。通过将其他飞行员建模为随机或对抗性干扰源,系统可确保在对方分心、醉酒或恶意攻击时仍能存活。此外,“杀人司机”博弈案例表明,几何与曲率比单纯距离更关键,行人需确定初始状态集合以确保生存。
⚙️ 连续时间 LQR 求解方法
- 问题设定:动力学由线性时变微分方程描述,代价函数为二次型积分形式。Q 矩阵惩罚状态偏差,R 矩阵惩罚控制努力且需保持正定,以保证解的唯一性和稳定性。
- 二次型假设 (Ansatz):通过假设最优剩余代价(Cost-to-go)为状态的二次型,代入偏微分方程进行求解。若矩阵 V 满足连续时间 Riccati 方程及边界条件 $V(T_f)=Q$,则猜测成立。
- 线性反馈控制:在上述条件下,最优控制表现为状态线性反馈形式。这种解析解不仅计算效率高,而且提供了对系统稳定性的直观理解,是工程实践中最常用的基准控制器。
📌 可达性分析与安全集定义
- 后向可达集定义:指从该集合出发的轨迹保证在终时刻 $T_f$ 到达目标集的状态集合。这一概念将时间反向传播,用于确定当前哪些状态是“安全”或“可行”的。
- 避障场景应用:当目标集为需避免的危险区域(如障碍物)时,计算导致必然碰撞的状态集。规划算法应避开此区域,从而生成无碰撞轨迹。这种方法比传统几何缓冲更精确,因为它考虑了动力学约束和对手行为。
- 目标达成场景应用:当目标集为期望进入的区域时,计算无论对手如何干扰都能保证到达该区域的状态集。规划算法应从内部出发,确保任务完成。这种双向可达性分析为复杂环境下的路径规划提供了严格的安全保障。
💡 理论映射与结论
- 离散到连续的映射:理解从离散 Bellman 方程到连续 HJB/HJI 方程的关键在于将“跨迭代的状态变化”转化为“沿动力学轨迹的时间导数”。这一视角转换揭示了动态规划在不同时间尺度下的统一性。
- 鲁棒性保证机制:该理论框架要求控制策略必须针对最坏可能的干扰响应进行优化。通过在不确定性环境中实现鲁棒的安全保障,微分博弈提供了比传统确定性模型更强的性能边界。
- 计算挑战与价值:尽管 HJI 方程作为含优化项的 PDE 求解难度较高,但其提供了严格的数学保证。后续应用将结合交互式脚本演示其在机器人避障及目标达成中的具体案例,验证理论在实际系统中的可行性。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
🧭 类似博主
-
【圆桌派】安逸不是懒,是知道什么时候该停下来!李伯清聊透川渝市井烟火气:只有成都才能治愈现代人的焦虑
-
东日本大地震中残障人士死亡率约为常人两倍:全盲律师大胡田诚谈灾害信息获取困境与信任建立
-
女子旗式橄榄球爆发式增长,将亮相2028年奥运会
-
《金剛經》和《心經》差距有多大?為什麼絕對不能亂念?選錯後果太可怕,一輩子都完蛋了!#耶稣 #基督教
-
海外藝術搞政治!綠營這把竟噁心到大陸退展?!!#光州雙年展 #民進黨 #習近平 #李在明 #賴清德【
-
比尔·古利(Bill Gurley):追寻费曼
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
安东尼·戴维斯(Anthony Davis)本赛季将在华盛顿特区展现统治级表现
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
0 条评论
发表评论
请先 登录 后参与讨论。