我用AI杀死了史上最难的跑步游戏
外来客 • 2026-08-13 03:02:04
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🏃 核心观点
通过强化学习(Reinforcement Learning)训练AI攻克高难度游戏《QWOP》,揭示了AI在解决复杂物理控制问题上的独特逻辑与进化路径。研究证明,合理的奖励函数设计、探索机制引入以及任务拆解策略,能显著提升AI的学习效率与表现上限。同时,对比显示人类虽具备极高的学习效率,但AI凭借无休止的并行训练和专注力,能在特定领域突破生理极限甚至发现游戏漏洞。
📊 关键事实/论据
- 初始困境与突破:《QWOP》由Bennett Foddy开发,操作极难。团队使用双层感知机神经网络控制角色15个关键点坐标。初期AI因奖励函数粗糙(仅前进加分、摔倒扣分)而采取“跪地爬行”策略;引入超时惩罚后速度提升至50米,但在50米处遇栏杆卡关,陷入“稀疏奖励”困境。
- 探索机制优化:采用RND(基于随机网络蒸馏的探索)机制,对尝试新动作给予额外奖励。AI学会踢飞栏杆而非跨越,并利用游戏渲染漏洞将栏杆踢出画面外以消除障碍,最终稳定通关。
- 打破世界纪录:通过调整奖励函数(剩余时间折算为现金奖励),经150万次训练(相当于人类高强度游玩18年),AI将通关时间压缩至43.921秒,比原人类世界纪录45.53秒快1.6秒。其跑姿呈现高抬腿、大跨步及夸张后仰等非人类特征。
- 进阶挑战与遗忘问题:在二次开发的跨栏项目中,AI遭遇“灾难性遗忘”(学会跨栏却忘记走路)。团队通过课程学习将动作拆解为跳跃、前脚过杆、后脚过杆三个子任务,并将神经网络升级至4层512神经元,成功解决该问题。
- 跳远表现:在30米助跑跳远项目中,AI未尝试高跳,而是采取平飞姿态并用膝盖强行扭转身体刹车,最远距离达5.2米。
🏁 结论
AI通过海量试错与算法优化,不仅掌握了超越人类的跑步技巧,还发现了人类玩家未曾察觉的游戏机制漏洞(如踢飞栏杆消失)。尽管AI训练耗时相当于人类18年,但其最终成绩显著优于人类纪录。研究团队已将改进后的游戏及代码开源,支持人机对战或用户自训AI参赛,验证了AI在复杂物理模拟环境下的强大潜力与独特解题思路。
👤 同一博主
一个视频搞懂DeepSeek Harness!
我把浏览器插件变成了卡牌游戏
这么好的AI外设你咋不早点告诉我?
大厂集体转向,AI办公能成吗?
你根本不懂Mac!
上火星,马斯克的惊天骗局?
这群程序员,正在教AI取代自己?
AI进阶用法指南,五分钟教会你!
打造AI三省六部!批电子奏折,当赛博皇帝!
盗版游戏又回来了?
🧭 类似博主
-
最佳稳定机场 4K无压力,支持Win 安卓 IOS Mac 全平台,GPT/Gemini/奈飞/等主
-
取代 OpenAI 模型的方法:我換了這套繁中字幕流程
-
苹果9月9日iPhone发布会:我们期待的一切!
-
Cassie Coppersmith(卡茜·科珀史密斯)的伪考古学谬论
-
约翰·特纳斯(John Ternus)出任CEO、法律纠纷及iPhone Fold登上AppleIn
-
为什么 DDR5 内存的性能表现往往不如预期?
-
机器人触觉的爆发前夜:五大技术路线、数据困局与模型之争|机器人系列
-
WeatherNext 3:更精准、及时且本地化的天气预报
-
【半佛】要是没有小米打印机我得疯了
-
都2026年了,为什么还有游戏锁60帧?“解帧”真的是开挂吗?【柴知道】
0 条评论
发表评论
请先 登录 后参与讨论。