基于神经网络的强化学习:数学细节
外来客 • 2026-08-25 17:58:33
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Reinforcement Learning with Neural Networks: Mathematical Details)
🧠 强化学习核心机制
- 策略梯度法原理:在无法预知环境反馈(如薯条份量)时,无法使用标准反向传播。需通过“猜测”行动,利用交叉熵量化理想概率与实际输出概率的差异,计算偏置项的导数。
- 奖励修正机制:导数方向基于“猜测正确”的假设。若实际奖励为负(猜测错误),需将导数乘以负奖励值,从而翻转梯度方向,确保参数更新指向正确方向。
- 数学推导链条:利用链式法则,将交叉熵对偏置的导数分解为三部分:交叉熵对网络输出的导数、Sigmoid 函数对输入的导数、输入对偏置的导数。
📐 数学推导细节
- 交叉熵定义:针对特定目标(如去 Squatch),交叉熵为 $-\log(P_{target})$。由于网络输出为 $P_{norm}$,需转换为 $-\log(1 - P_{norm})$。
- Sigmoid 导数推导:
- 初始形式:$\frac{1}{1 + e^{-x}}$ 的导数。
- 推导过程:利用幂法则和链式法则,最终化简为 $P_{norm}(1 - P_{norm})$ 或等价形式。
- 关键结论:Sigmoid 函数的导数等于其输出值乘以(1 减去输出值)。
- 最终导数公式:
- 若目标为 Squatch:导数为 $\frac{1}{1 - P_{norm}} \times P_{norm}(1 - P_{norm}) \times 1 = P_{norm}$。
- 若目标为 Norm:导数为 $-\frac{1}{P_{norm}} \times P_{norm}(1 - P_{norm}) \times 1 = -(1 - P_{norm})$。
- 注意:此处推导中,$x$ 对偏置 $B$ 的导数为 1。
🍟 训练实例演示
- 初始状态:饥饿度输入为 0.0,偏置 $B=0.0$,权重固定。网络输出 $P_{norm}=0.5$,$P_{squatch}=0.5$。
- 第一轮更新(正确猜测):
- 随机数 0.2 指向 Squatch。
- 获得小份薯条(符合低饥饿度),奖励 $R=1.0$。
- 计算导数:$0.5$。
- 更新导数:$0.5 \times 1.0 = 0.5$。
- 梯度下降:学习率 1.0,步长 0.5。新偏置 $B = 0.0 - 0.5 = -0.5$。
- 结果:$P_{squatch}$ 升至 0.6,$P_{norm}$ 降至 0.4。
- 第二轮更新(错误猜测):
- 随机数 0.9 指向 Norm。
- 获得大份薯条(不符合低饥饿度),奖励 $R=-1.0$。
- 计算导数(针对 Norm):$-0.6$。
- 更新导数:$-0.6 \times (-1.0) = 0.6$(方向翻转)。
- 梯度下降:步长 0.6。新偏置 $B = -0.5 - 0.6 = -1.1$。
- 结果:$P_{norm}$ 进一步降至 0.2,$P_{squatch}$ 升至 0.8。
📊 训练收敛与结论
- 收敛趋势:随着多次迭代,当输入饥饿度为 0.0 时,$P_{norm}$ 持续降低,$P_{squatch}$ 持续升高,符合预期行为。
- 最终状态:经过大量不同输入值(0 到 1 之间)的训练,偏置值稳定在 -10 左右,模型训练完成。
- 奖励函数作用:无论奖励函数多么复杂,其核心作用始终是修正基于猜测计算的导数方向,确保参数更新符合实际环境反馈。
- 适用前提:观众需熟悉梯度下降及强化学习基本概念;本教程专注于数学细节推导,而非概念引入。
👤 同一博主
来自父亲的另外三条人生经验
单纯形算法的数学细节
线性规划优化与单纯形算法
StatQuest:随机森林第二部分:缺失值与聚类
假发现率(FDR)详解
线性回归的本质
用超简单的方式解释AI的工作原理
StatQuest:来自科技行业领袖的职业建议
人类反馈强化学习(RLHF)详解
基于神经网络的强化学习:核心概念
🧭 类似博主
-
最佳顺畅稳定机场 1000多Mbps,支持Win 安卓 IOS Mac 全平台,GPT/Gemini
-
人类正式进入埃米时代?!台积电1.6nm进入量产倒计时,深度剖析A16的技术密码
-
无影无踪,核周报9.5
-
取代 OpenAI 模型的方法:我換了這套繁中字幕流程
-
苹果9月9日iPhone发布会:我们期待的一切!
-
Cassie Coppersmith(卡茜·科珀史密斯)的伪考古学谬论
-
一个视频搞懂DeepSeek Harness!
-
约翰·特纳斯(John Ternus)出任CEO、法律纠纷及iPhone Fold登上AppleIn
-
为什么 DDR5 内存的性能表现往往不如预期?
-
明天就要開會,我卻什麼都沒準備!Genspark Super Agent 能救我嗎?
0 条评论
发表评论
请先 登录 后参与讨论。