博主头像

我用AI杀死了史上最难的跑步游戏

外来客 • 2026-08-13 03:02:04

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🏃 核心观点

通过强化学习(Reinforcement Learning)训练AI攻克高难度游戏《QWOP》,揭示了AI在解决复杂物理控制问题上的独特逻辑与进化路径。研究证明,合理的奖励函数设计、探索机制引入以及任务拆解策略,能显著提升AI的学习效率与表现上限。同时,对比显示人类虽具备极高的学习效率,但AI凭借无休止的并行训练和专注力,能在特定领域突破生理极限甚至发现游戏漏洞。

📊 关键事实/论据

  • 初始困境与突破:《QWOP》由Bennett Foddy开发,操作极难。团队使用双层感知机神经网络控制角色15个关键点坐标。初期AI因奖励函数粗糙(仅前进加分、摔倒扣分)而采取“跪地爬行”策略;引入超时惩罚后速度提升至50米,但在50米处遇栏杆卡关,陷入“稀疏奖励”困境。
  • 探索机制优化:采用RND(基于随机网络蒸馏的探索)机制,对尝试新动作给予额外奖励。AI学会踢飞栏杆而非跨越,并利用游戏渲染漏洞将栏杆踢出画面外以消除障碍,最终稳定通关。
  • 打破世界纪录:通过调整奖励函数(剩余时间折算为现金奖励),经150万次训练(相当于人类高强度游玩18年),AI将通关时间压缩至43.921秒,比原人类世界纪录45.53秒快1.6秒。其跑姿呈现高抬腿、大跨步及夸张后仰等非人类特征。
  • 进阶挑战与遗忘问题:在二次开发的跨栏项目中,AI遭遇“灾难性遗忘”(学会跨栏却忘记走路)。团队通过课程学习将动作拆解为跳跃、前脚过杆、后脚过杆三个子任务,并将神经网络升级至4层512神经元,成功解决该问题。
  • 跳远表现:在30米助跑跳远项目中,AI未尝试高跳,而是采取平飞姿态并用膝盖强行扭转身体刹车,最远距离达5.2米。

🏁 结论

AI通过海量试错与算法优化,不仅掌握了超越人类的跑步技巧,还发现了人类玩家未曾察觉的游戏机制漏洞(如踢飞栏杆消失)。尽管AI训练耗时相当于人类18年,但其最终成绩显著优于人类纪录。研究团队已将改进后的游戏及代码开源,支持人机对战或用户自训AI参赛,验证了AI在复杂物理模拟环境下的强大潜力与独特解题思路。

0 条评论

发表评论

请先 登录 后参与讨论。