我让AI同时打768局街霸2,两天后它杀死了所有角色!
外来客 • 2026-10-11 14:09:36
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🎮 AI训练策略与架构演进
- 混合专家(MoE)架构:将神经网络复制12份并配置简单路由器,根据关卡自动分配至对应“专家”。该模型在街霸2中执行3亿次实战操作后实现无伤通关,但硬件要求极高,无法在普通设备上运行。
- 知识蒸馏技术:利用大AI作为教师,通过5000万次操作将判断逻辑刻入小AI。此过程使小AI的学习速度达到从零训练的6倍,成功实现了单命通关12关的目标,但实战稳定性较差,表现波动剧烈。
- 并行训练突破:放弃串行关卡学习,改为同时开启768个游戏窗口(12个对手各64局)。利用M Ultra Max Studio的高带宽统一内存池,在48小时内完成5亿次操作的学习量,相当于人类玩家连续高强度对战385天。
👁️ 视觉感知与课程优化
- 抽帧间隔调整:将画面抽取间隔从每4帧改为每8帧。此举解决了小AI在面对动作缓慢的泰王时因信息冗余而无法分析局势的问题,同时保留了对快速对手的反应能力。
- 运动前景提取:引入预处理器高亮画面中变化幅度大的区域。该方案有效解决了大兵关卡中敌人与观众着装相似导致的识别困难,以及镜像龙关卡中敌我波技无法区分的问题,显著提升了目标锁定精度。
- 课程学习修正:早期“输了退回第一关”的策略导致新经验被旧操作稀释,造成训练停滞。分析发现泰王、大兵和镜像龙的难度实际高于最终Boss警察,原有的线性课程安排不符合AI的认知规律,需通过并行多关卡训练来平衡学习曲线。
📊 实战表现与模型特性
- 稳定性提升:新模型在三轮完整实战中均成功通关12关,不再依赖极致的漏洞利用或投机取巧,而是展现出随机应变的格斗能力。
- 泛化能力验证:小AI在未见过训练数据的奖励关中,能正确执行踢碎汽车、打烂砖墙等操作以获取高分,证明其真正理解了游戏机制而非单纯记忆路径。
- 轻量化部署:最终模型仅包含三层卷积神经网络,结构极致精简。该模型不仅性能强劲,且对硬件要求极低,可在Mac mini、MacBook Air及普通PC设备上流畅运行,实现了“经得起观众检验”的目标。
🧠 核心结论与技术启示
- 并行优势最大化:强化学习在格斗游戏领域的最大优势在于并行处理能力。通过同时应对数百个独立战斗场景,AI能高效积累多样化经验,避免陷入单一关卡的局部最优解。
- 感知先于策略:在视觉驱动的游戏AI中,解决“看清”问题(如敌我识别、动作捕捉)比优化“打法”更关键。针对特定对手特征调整输入数据预处理方式,是突破训练瓶颈的核心手段。
- 开源与迭代:项目最终模型及代码将在GitHub开源。尽管当前算法和数据仍显稚嫩,但通过结合MoE、蒸馏及并行训练等前沿技术,成功解决了长期困扰格斗AI的泛化性与稳定性难题,为后续更复杂对局的研究奠定了基础。
0 条评论
发表评论
请先 登录 后参与讨论。