我用AI杀死了史上最难的跑步游戏
外来客 • 2026-08-13 03:02:04
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🏃 核心观点
通过强化学习(Reinforcement Learning)训练AI攻克高难度游戏《QWOP》,揭示了AI在解决复杂物理控制问题上的独特逻辑与进化路径。研究证明,合理的奖励函数设计、探索机制引入以及任务拆解策略,能显著提升AI的学习效率与表现上限。同时,对比显示人类虽具备极高的学习效率,但AI凭借无休止的并行训练和专注力,能在特定领域突破生理极限甚至发现游戏漏洞。
📊 关键事实/论据
- 初始困境与突破:《QWOP》由Bennett Foddy开发,操作极难。团队使用双层感知机神经网络控制角色15个关键点坐标。初期AI因奖励函数粗糙(仅前进加分、摔倒扣分)而采取“跪地爬行”策略;引入超时惩罚后速度提升至50米,但在50米处遇栏杆卡关,陷入“稀疏奖励”困境。
- 探索机制优化:采用RND(基于随机网络蒸馏的探索)机制,对尝试新动作给予额外奖励。AI学会踢飞栏杆而非跨越,并利用游戏渲染漏洞将栏杆踢出画面外以消除障碍,最终稳定通关。
- 打破世界纪录:通过调整奖励函数(剩余时间折算为现金奖励),经150万次训练(相当于人类高强度游玩18年),AI将通关时间压缩至43.921秒,比原人类世界纪录45.53秒快1.6秒。其跑姿呈现高抬腿、大跨步及夸张后仰等非人类特征。
- 进阶挑战与遗忘问题:在二次开发的跨栏项目中,AI遭遇“灾难性遗忘”(学会跨栏却忘记走路)。团队通过课程学习将动作拆解为跳跃、前脚过杆、后脚过杆三个子任务,并将神经网络升级至4层512神经元,成功解决该问题。
- 跳远表现:在30米助跑跳远项目中,AI未尝试高跳,而是采取平飞姿态并用膝盖强行扭转身体刹车,最远距离达5.2米。
🏁 结论
AI通过海量试错与算法优化,不仅掌握了超越人类的跑步技巧,还发现了人类玩家未曾察觉的游戏机制漏洞(如踢飞栏杆消失)。尽管AI训练耗时相当于人类18年,但其最终成绩显著优于人类纪录。研究团队已将改进后的游戏及代码开源,支持人机对战或用户自训AI参赛,验证了AI在复杂物理模拟环境下的强大潜力与独特解题思路。
同一博主
大厂集体转向,AI办公能成吗?
你根本不懂Mac!
上火星,马斯克的惊天骗局?
这群程序员,正在教AI取代自己?
AI进阶用法指南,五分钟教会你!
打造AI三省六部!批电子奏折,当赛博皇帝!
盗版游戏又回来了?
月薪0.3元,我有了300个员工
为啥WorkBuddy这么火?
用AI预测世界杯把房子赔掉了!!!!!!
🧭 类似博主
-
DeepSeek Harness预览版发布 | Agent运行时 | 一切皆插件 | 大模型 | A
-
最新研究:一種完全由「力」構成的物質——膠球!| 科學漫談 | Linvo說宇宙
-
iPhone Ultra、OpenAI 的 Alexa Dot 以及 AI 成本——AppleIns
-
底特律地区学区如何利用科技保障学生安全
-
【科技小電報】iPhone 17 將漲價?教育優惠時間延長|Line 更新後主題價值被砍|行動電源頻
-
保卫洋泾浜,请客尼基塔,幽会夏思源|China Joy游记
-
《人民的珍藏》第三季 寸图倾心筑通衢:两年磨一剑!重庆东站高铁站设计画稿惊艳亮相 中铁二院建筑师的匠
-
8月12日日全食
-
腾讯阿里字节集体转向:Chat时代终结,办公Agent大战爆发 - IC实验室出品
-
唐獎得主蘇珊.索羅門,找到地球問題也找到修復地球的可能!
0 条评论
发表评论
请先 登录 后参与讨论。