博主头像

斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论

外来客 • 2026-09-01 15:32:54

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 13: Intro to Learning)

🎓 课程定位与学习范式

  • 课程阶段:斯坦福 AA203 第13讲,进入基于学习的控制(Learning-Based Control)部分,放宽已知动力学假设,处理未知或不确定系统动态。
  • 不确定性应对策略
  • 反馈控制:适用于小幅度未建模效应(如无人机风扰),通过 PID 等补偿误差。
  • 鲁棒控制:采用 Min-Max 形式化,针对最坏情况干扰进行保守设计。
  • 数据驱动方法:利用收集的状态转移示例学习动力学模型或直接优化控制器,本课程重点。

📊 学习方法分类与场景

  • 两大技术路径:直接改进控制器(Direct Adaptive Control)或通过系统辨识获取近似模型再优化(Indirect/System Identification)。
  • 三种经验模态
  • 零集数(Zero Episodes):使用离线预收集数据集进行参数估计或模型学习。
  • 单集数(One Episode):在线适应,如在控制过程中实时估计未知负载质量。
  • 多集数(Multiple Episodes):经典强化学习框架,通过可重置环境(如国际象棋)反复交互更新策略。

📐 系统辨识与线性回归推导

  • 核心方法:利用最小二乘法进行线性回归,建立从当前状态/控制到下一状态的映射模型 $x_{t+1} = Ax_t + Bu_t + \epsilon$。
  • 数学推导
  • 目标函数为预测误差平方和,通过梯度置零求得解析解 $\hat{\theta} = (Z^TZ)^{-1}Z^Ty$。
  • 针对大规模数据,可采用递归形式避免昂贵的矩阵求逆运算。
  • 统计性质
  • 在噪声零均值、不相关且方差有限的假设下,该估计量为最佳线性无偏估计量(BLUE)。
  • 若噪声服从高斯分布,则同时为最大似然估计量。
  • 收敛性证明:通过推导估计量的期望与协方差,证实随着数据量增加,估计值在期望上收敛至真实参数 $\theta$。

📊 系统辨识与参数估计

  • 无偏估计条件:假设噪声项 $\epsilon_t$ 不相关且方差为 $\sigma^2$,协方差矩阵仅对角线非零。通过代数推导,参数估计的协方差正比于 $\sigma^2$ 乘以状态与控制组合求和项的逆。
  • 持续激励(Persistent Excitation):为使协方差随数据量 $n$ 增加而趋于零,系统必须“非平凡”运行,即持续以有意义的方式探测系统。若满足此条件且 $n \to \infty$,估计值将收敛至真实参数 $\theta$。
  • 控制性能与模型精度:统计意义上的最优估计(距离最近)未必对应最佳控制性能。例如在阶跃型控制律中,即使参数估计偏差较大,只要符号正确,控制器表现可能优于更精确但符号错误的估计。系统辨识存在中间目标(模型估计)与控制目标不对齐的瓶颈。

🔄 自适应控制与稳定性分析

  • 单回合在线适应:区别于离线数据驱动的系统辨识,自适应控制在单一回合中通过实时在线调整改善控制。分为直接优化控制器(模型参考自适应控制)和先建模再优化(模型识别自适应控制)。
  • Lyapunov 全局稳定性判据:针对自治系统 $\dot{x} = f(x)$,若存在函数 $V$ 满足:1) $V(x)>0$ (除平衡点外);2) $\dot{V}(x)<0$ (除平衡点外);3) $\|x\|\to\infty \implies V(x)\to\infty$(径向无界),则系统全局渐近稳定。
  • 质量弹簧阻尼器示例:以能量函数 $E = \frac{1}{2}kx^2 + \frac{1}{2}m\dot{x}^2$ 为候选 Lyapunov 函数,通过动力学方程证明 $\dot{E} = -d\dot{x}^2 < 0$,验证了系统向零平衡点的稳定性。

🎯 模型参考自适应控制实例

  • 核心组件:包含未知参数的被控对象(Plant)、定义理想输出的参考模型、含可调参数的反馈控制律以及参数更新机制。
  • 已知质量情形:对于双积分器 $m\ddot{x}=u$,设计控制律 $u = m\ddot{x}_m - 2\lambda \dot{\tilde{x}} - \lambda^2 \tilde{x}$($\tilde{x}$ 为跟踪误差)。推导闭环动力学得 $\ddot{\tilde{x}} + 2\lambda \dot{\tilde{x}} + \lambda^2 \tilde{x} = 0$,当增益 $\lambda > 0$ 时,跟踪误差指数收敛至零。
  • 未知质量自适应律:引入质量估计 $\hat{m}$ 及误差 $\tilde{m} = \hat{m} - m$。定义辅助变量 $S = \dot{\tilde{x}} + \lambda \tilde{x}$ 和 $\nu = \ddot{x}_m - 2\lambda \dot{\tilde{x}} - \lambda^2 \tilde{x}$。
  • 稳定性证明:选取候选 Lyapunov 函数 $V = \frac{1}{2}mS^2 + \frac{1}{\gamma}\tilde{m}^2$($\gamma > 0$ 为适应增益)。设定参数更新律 $\dot{\hat{m}} = -\gamma \nu S$,代入计算得 $\dot{V} = mS\dot{S} + \frac{1}{\gamma}\tilde{m}\dot{\tilde{m}}$。利用闭环动力学关系 $m\dot{S} + \lambda S = \tilde{m}\nu$ 及更新律,可进一步推导 $\dot{V}$ 的符号以验证耦合系统的稳定性。

📐 李雅普诺夫稳定性推导

  • 基于候选李雅普诺夫函数 $V = \frac{1}{2}m s^2$,验证其导数满足 $\dot{V} = -\lambda m s^2$。
  • 由于 $\lambda > 0$,系统状态变量 $s$ 随时间趋于零,即 $s \to 0$。
  • 根据定义 $s = \dot{x}_{tilde} + \lambda x_{tilde}$,当 $s \to 0$ 时,$\dot{x}_{tilde}$ 收敛至 $-\lambda x_{tilde}$。
  • 在相平面中,系统轨迹收敛于直线 $\dot{x}_{tilde} = -\lambda x_{tilde}$;若 $x_{tilde}$ 为负则导数为正,反之则为负,最终使跟踪误差 $x - x_m$ 趋于零。

🔄 自适应控制架构解析

  • 经典自适应控制由系统、控制器及可调参数适应机制组成的耦合系统构成。
  • 核心目标是推导并证明该耦合系统的稳定性,而非单纯计算增益 $\gamma$ 或 $\lambda$。
  • 在已知质量 $M$ 的基础上引入适应机制以估计未知质量,需通过调谐增益实现参数调整。

📚 课程重点与实施建议

  • 实际应用中需针对具体系统推导参考模型、控制律及候选李雅普诺夫函数,过程具有高度案例依赖性。
  • 本课程聚焦于在具备所有组件后执行稳定性分析,而非深入探讨各组件的原创推导过程。
  • 建议查阅相关文献以了解从系统设计到稳定性证明的完整正向流程。

博主头像 👤 同一博主

查看该博主全部 13 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。