世界模型进入下半场:自变量 WALL-SS 突破三大瓶颈,让虚拟世界成为机器人的「训练场」
机器人世界模型的下一场竞争,可能不是画质,是架构。 作者|Li Yuan 编辑|郑玄 一只机械臂的夹爪明明没有夹住杯子,杯子却像被磁铁吸住一样,跟着夹爪升了起来。这个看似荒诞的问题,正在困扰机器人世界模型,业内甚至将其称为「磁铁式抓取」。 视频生成模型只要让画面看起来合理,就算完成任务;但世界模型不能只追求「像真的」。机器人训练数据大多来自成功演示,模型容易形成捷径:与其理解动作的细微差别,不如按照画面,直接生成最可能的结果。 可在真实世界里,夹爪位置偏移几毫米,就可能让结果从抓起变成碰倒杯子甚至抓空。世界模型真正需要理解的,是动作与结果之间的因果关系。 8 月 27 日,自变量机器人发布下一尺度自回归世界模型 WALL-SS,试图让世界模型从「能用」走向「好用」。WALL-SS 不是一次性生成整个画面,而是通过由粗到细的方式描绘未来,让不同动作真正对应不同结果;同时结合长时记忆机
原文:极客公园