这个世界模型,着实是有点“反骨”在身上——
上岗前花了大把时间陪机器人训练,等机器人真要开始干活了,它却先从部署链路里退了出去。
要知道,以前的世界模型对机器人来说,就像是一个随身携带的“脑内沙盘”,机器人先借助它预测未来会发生什么,再据此决定下一步怎么动。模型想得越多,推理链路往往也越长。
但这个“反骨”世界模型,却把思路给换了一下。
它只停留在训练场里,专门检查机器人自己提出的动作会造成什么后果,再把这种检查变成策略优化的反馈。等训练完成,受控世界模型便退出部署链路,机器人执行任务时无需继续展开未来、搜索候选动作。
结果呢?
机器人反倒是更能干活了!
这便是由光象科技联合清华大学李升波教授课题组发布的第一代物理原生世界模型Phi-WM 1.0 ActEffect(下文简称ActEffect),整体来看,这项技术试图回答的是具身智能里一个长期存在的问题:
机器人从演示数据里学会了动作长什么样,能否进一步利用动作可能造成的后果,反过来改善自己的策略?
毕竟这个问题最终也会落到真实部署上。工业机器人每多运行一步模型,都对应新的时延、算力和成本。世界模型如果能在训练时发挥作用,并在执行阶段保持轻量,技术价值才有机会继续转化为部署价值。
0
评论 (0)