斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
外来客 • 2026-09-01 15:32:54
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 13: Intro to Learning)
🎓 课程定位与学习范式
- 课程阶段:斯坦福 AA203 第13讲,进入基于学习的控制(Learning-Based Control)部分,放宽已知动力学假设,处理未知或不确定系统动态。
- 不确定性应对策略:
- 反馈控制:适用于小幅度未建模效应(如无人机风扰),通过 PID 等补偿误差。
- 鲁棒控制:采用 Min-Max 形式化,针对最坏情况干扰进行保守设计。
- 数据驱动方法:利用收集的状态转移示例学习动力学模型或直接优化控制器,本课程重点。
📊 学习方法分类与场景
- 两大技术路径:直接改进控制器(Direct Adaptive Control)或通过系统辨识获取近似模型再优化(Indirect/System Identification)。
- 三种经验模态:
- 零集数(Zero Episodes):使用离线预收集数据集进行参数估计或模型学习。
- 单集数(One Episode):在线适应,如在控制过程中实时估计未知负载质量。
- 多集数(Multiple Episodes):经典强化学习框架,通过可重置环境(如国际象棋)反复交互更新策略。
📐 系统辨识与线性回归推导
- 核心方法:利用最小二乘法进行线性回归,建立从当前状态/控制到下一状态的映射模型 $x_{t+1} = Ax_t + Bu_t + \epsilon$。
- 数学推导:
- 目标函数为预测误差平方和,通过梯度置零求得解析解 $\hat{\theta} = (Z^TZ)^{-1}Z^Ty$。
- 针对大规模数据,可采用递归形式避免昂贵的矩阵求逆运算。
- 统计性质:
- 在噪声零均值、不相关且方差有限的假设下,该估计量为最佳线性无偏估计量(BLUE)。
- 若噪声服从高斯分布,则同时为最大似然估计量。
- 收敛性证明:通过推导估计量的期望与协方差,证实随着数据量增加,估计值在期望上收敛至真实参数 $\theta$。
📊 系统辨识与参数估计
- 无偏估计条件:假设噪声项 $\epsilon_t$ 不相关且方差为 $\sigma^2$,协方差矩阵仅对角线非零。通过代数推导,参数估计的协方差正比于 $\sigma^2$ 乘以状态与控制组合求和项的逆。
- 持续激励(Persistent Excitation):为使协方差随数据量 $n$ 增加而趋于零,系统必须“非平凡”运行,即持续以有意义的方式探测系统。若满足此条件且 $n \to \infty$,估计值将收敛至真实参数 $\theta$。
- 控制性能与模型精度:统计意义上的最优估计(距离最近)未必对应最佳控制性能。例如在阶跃型控制律中,即使参数估计偏差较大,只要符号正确,控制器表现可能优于更精确但符号错误的估计。系统辨识存在中间目标(模型估计)与控制目标不对齐的瓶颈。
🔄 自适应控制与稳定性分析
- 单回合在线适应:区别于离线数据驱动的系统辨识,自适应控制在单一回合中通过实时在线调整改善控制。分为直接优化控制器(模型参考自适应控制)和先建模再优化(模型识别自适应控制)。
- Lyapunov 全局稳定性判据:针对自治系统 $\dot{x} = f(x)$,若存在函数 $V$ 满足:1) $V(x)>0$ (除平衡点外);2) $\dot{V}(x)<0$ (除平衡点外);3) $\|x\|\to\infty \implies V(x)\to\infty$(径向无界),则系统全局渐近稳定。
- 质量弹簧阻尼器示例:以能量函数 $E = \frac{1}{2}kx^2 + \frac{1}{2}m\dot{x}^2$ 为候选 Lyapunov 函数,通过动力学方程证明 $\dot{E} = -d\dot{x}^2 < 0$,验证了系统向零平衡点的稳定性。
🎯 模型参考自适应控制实例
- 核心组件:包含未知参数的被控对象(Plant)、定义理想输出的参考模型、含可调参数的反馈控制律以及参数更新机制。
- 已知质量情形:对于双积分器 $m\ddot{x}=u$,设计控制律 $u = m\ddot{x}_m - 2\lambda \dot{\tilde{x}} - \lambda^2 \tilde{x}$($\tilde{x}$ 为跟踪误差)。推导闭环动力学得 $\ddot{\tilde{x}} + 2\lambda \dot{\tilde{x}} + \lambda^2 \tilde{x} = 0$,当增益 $\lambda > 0$ 时,跟踪误差指数收敛至零。
- 未知质量自适应律:引入质量估计 $\hat{m}$ 及误差 $\tilde{m} = \hat{m} - m$。定义辅助变量 $S = \dot{\tilde{x}} + \lambda \tilde{x}$ 和 $\nu = \ddot{x}_m - 2\lambda \dot{\tilde{x}} - \lambda^2 \tilde{x}$。
- 稳定性证明:选取候选 Lyapunov 函数 $V = \frac{1}{2}mS^2 + \frac{1}{\gamma}\tilde{m}^2$($\gamma > 0$ 为适应增益)。设定参数更新律 $\dot{\hat{m}} = -\gamma \nu S$,代入计算得 $\dot{V} = mS\dot{S} + \frac{1}{\gamma}\tilde{m}\dot{\tilde{m}}$。利用闭环动力学关系 $m\dot{S} + \lambda S = \tilde{m}\nu$ 及更新律,可进一步推导 $\dot{V}$ 的符号以验证耦合系统的稳定性。
📐 李雅普诺夫稳定性推导
- 基于候选李雅普诺夫函数 $V = \frac{1}{2}m s^2$,验证其导数满足 $\dot{V} = -\lambda m s^2$。
- 由于 $\lambda > 0$,系统状态变量 $s$ 随时间趋于零,即 $s \to 0$。
- 根据定义 $s = \dot{x}_{tilde} + \lambda x_{tilde}$,当 $s \to 0$ 时,$\dot{x}_{tilde}$ 收敛至 $-\lambda x_{tilde}$。
- 在相平面中,系统轨迹收敛于直线 $\dot{x}_{tilde} = -\lambda x_{tilde}$;若 $x_{tilde}$ 为负则导数为正,反之则为负,最终使跟踪误差 $x - x_m$ 趋于零。
🔄 自适应控制架构解析
- 经典自适应控制由系统、控制器及可调参数适应机制组成的耦合系统构成。
- 核心目标是推导并证明该耦合系统的稳定性,而非单纯计算增益 $\gamma$ 或 $\lambda$。
- 在已知质量 $M$ 的基础上引入适应机制以估计未知质量,需通过调谐增益实现参数调整。
📚 课程重点与实施建议
- 实际应用中需针对具体系统推导参考模型、控制律及候选李雅普诺夫函数,过程具有高度案例依赖性。
- 本课程聚焦于在具备所有组件后执行稳定性分析,而非深入探讨各组件的原创推导过程。
- 建议查阅相关文献以了解从系统设计到稳定性证明的完整正向流程。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第11讲:模型预测控制(
🧭 类似博主
-
【圆桌派】安逸不是懒,是知道什么时候该停下来!李伯清聊透川渝市井烟火气:只有成都才能治愈现代人的焦虑
-
东日本大地震中残障人士死亡率约为常人两倍:全盲律师大胡田诚谈灾害信息获取困境与信任建立
-
女子旗式橄榄球爆发式增长,将亮相2028年奥运会
-
《金剛經》和《心經》差距有多大?為什麼絕對不能亂念?選錯後果太可怕,一輩子都完蛋了!#耶稣 #基督教
-
海外藝術搞政治!綠營這把竟噁心到大陸退展?!!#光州雙年展 #民進黨 #習近平 #李在明 #賴清德【
-
比尔·古利(Bill Gurley):追寻费曼
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
安东尼·戴维斯(Anthony Davis)本赛季将在华盛顿特区展现统治级表现
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
0 条评论
发表评论
请先 登录 后参与讨论。