机械荟萃山庄

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
热搜: 活动 交友 discuz
查看: 128|回复: 0

人形机器人动手之前无法先在脑子里彩排一遍

[复制链接]

2万

主题

3万

帖子

22万

积分

超级版主

Rank: 8Rank: 8

积分
228327
发表于 前天 22:27 | 显示全部楼层 |阅读模式
当机器人执行抓取桌上杯子的任务时,在伸出手臂之前,它是否能够预判动作过程中会不会碰倒旁边的瓶子。
人类处理这类任务时,会在思维中预先推演动作路径,预判手臂运动有可能剐蹭周边物体,进而调整运动轨迹规避风险。机器人想要实现同类 “先推演后执行” 的行为,需要依靠世界模型在内部搭建虚拟沙盘,在实体执行动作之前完成场景推演。
该技术概念已经发展两到三年,但要从生成未来画面走向服务真实机器人决策,还需要攻克三方面核心难题。
本文基于 arXiv 公开论文 WALL‑SS: Scaling Long‑horizon World Models via Next‑Scale Autoregression,对相关技术难点与解决方案展开介绍。

第一个核心难题是模型不一定严格按照动作指令推演后续状态。机器人手指仅偏移 1 毫米,就会产生抓起杯子或是打翻杯子两种截然不同的结果,但两种工况下的瞬时视觉画面高度相似。模型倾向于依靠视觉画面做推断,会生成逻辑合理却不匹配输入动作指令的推演结果。

第二个核心难题是递归推演过程误差会持续累积。模型将自身生成的画面作为输入继续向后推演,微小错误会逐层放大,物体状态,接触关系以及多视角信息很难在长时间推演过程中维持一致性。现有模型大多仅可稳定推演二三十秒,而现实机器人的多数作业任务,都需要至少一分钟的连续执行周期。

第三个核心难题是虚拟仿真实验的数据结果能否有效迁移到真实硬件。仿真环境中表现优异的策略,部署到真实机器人上未必能够复现性能。如果无法准确判断不同策略方案的实际优劣,虚拟训练环境就不能用于方案筛选迭代。

WALL‑SS 模型提出下一度自回归的技术思路,其逻辑类似绘画的创作流程,先勾勒整体大轮廓,再补充细节线条,最后打磨局部精细特征。粗尺度层级确定机器人整体空间位置,精尺度层级处理手指是否合拢这类细节信息。动作信号会按照画面的精细层级,注入每一轮生成流程之中。

在固定初始观测画面,仅变更动作轨迹的条件下,模型可以生成对应的不同推演结果,即便输入失败动作指令,也能够完成对应情景的推演复现。从量化指标来看,该模型动作跟随指标达到 0.29,显著高于 Cosmos3‑Nano 模型的 0.044,轨迹准确度从 InfinityStar 基线模型的 0.251 提升至 0.539。0.29 的指标绝对值并不算高,但该领域整体尚处于起步阶段,取得对应提升已经具备较高技术难度。

时间尺度记忆是该模型的第二大核心模块,这套记忆机制参考人类分层记忆逻辑,新近发生的场景保留完整细节,距离当前较远的场景压缩为摘要信息,初始画面作为记忆锚点留存,同时同步存储画面与对应动作信息,避免只记录结果而丢失动作成因。在固定的记忆预算约束下,历史状态存储开销不会随着推演时长无限膨胀。模型还引入 Dream Forcing 训练方式,使网络适配带有偏差的自生成历史序列,以此降低误差累积效应。

在 60 秒递归推演测试中,WALL‑SS 在轨迹误差,片段边界误差以及状态一致性指标上,均优于仅参考最近片段的对照方案。研究团队还将视觉生成器作为策略模块,在自身推演轨迹上完成对齐训练,奖励函数仅关注动作跟随效果与长时序状态一致性,刻意不纳入任务成功指标,避免模型强行美化失败动作对应的推演结果。

针对仿真结果向真机迁移的难题,研究开展了成本较高的对照实验。实验覆盖 6 项任务,5 个策略检查点,20 组匹配初始工况,合计 600 组虚拟环境与真实机器人闭环结果对照。30 组任务组合的成功率相关系数达到 0.926,策略排序准确率 89%,共有 527 组虚拟推演结局与真机运行结局保持一致。

在 332 次真机失败案例之中,有 45 次被虚拟环境误判为任务成功,偏差主要集中在物体接触以及插入作业阶段。在这套桌面任务测试集之内,WALL‑SS 可以辅助完成策略筛选,但依旧无法完全替代真机验证。

从产业落地视角来看,世界模型的现实价值,是将一部分成本高昂,流程缓慢且存在硬件损坏风险的真机试错工作,放到虚拟沙盘之中完成初筛。该技术发挥作用的前提,是虚拟沙盘的推演结果具备可信度。

该论文并未公布训练成本,GPU 耗时以及投入产出比相关数据,现阶段无法定量核算可以节省的实际成本。但只要仿真与真机的校准精度持续提升,该技术就具备减少无效真机实验,加速策略迭代的潜力。

从开源 VLA 模型 WALL‑OSS,到世界模型 WALL‑WM,再到长时序世界模型 WALL‑SS,该技术路线一直在沿着具身基础模型的方向迭代,持续补齐动作处理,未来预测以及效果评估三类核心能力。WALL‑SS 已经公开项目页面,论文,训练与推理代码,感兴趣的开发者可以查阅开源仓库获取相关资料。期待后续该方向可以产出更多技术进展。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|小黑屋|手机版|Archiver|机械荟萃山庄 ( 辽ICP备16011317号-1 )

GMT+8, 2026-9-4 03:34 , Processed in 0.086964 second(s), 20 queries , Gzip On.

Powered by Discuz! X3.4 Licensed

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表