RynnWorld-4D:面向机器人操作的 4D 具身世界模型
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
追踪操作与抓取的研究、可复用工程方法与真实部署证据。
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
1X 发布面向 NEO 人形平台的 25 自由度腱驱手,其中手指与手掌 22 个自由度全驱动,腕部 3 个自由度,采用约 5:1 至 15:1 低减速比的 1X Tendon Drive 腱驱方案,全部自由度原生力控且可反向驱动。
推荐理由:原文给出 NEO 25 自由度腱驱手的具体规格与量产计划,读者可据此判断人形机器人手部硬件的当前水平。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。
Figure 03 已抵达宝马集团 Spartanburg 工厂的 52 号车间,首次在制造环境中演示物流工作流。上一代 Figure 02 去年在宝马参与了 3 万辆汽车的装配,Figure 此次从钣金取放转向更复杂的排序上料场景。Figure 03 由自研像素到动作 VLA 模型 Helix 02 驱动,协调手、臂、躯干和脚,在抓取薄壁零件的同时移动身体拉动带脚轮的金属料车。
推荐理由:Figure 03 在宝马工厂承担排序上料任务,读者可了解其从取放件到全身移动操作的复杂度升级。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
Qwen 团队发布通用视觉-语言-动作模型 Qwen-VLA,基于 Qwen 多模态骨干模型,将机器人操作与视觉语言导航统一为同一动作或轨迹预测问题,经 T2A、CPT、SFT、RL 四阶段训练产出 Qwen-VLA-Instruct。
推荐理由:Qwen-VLA 把操作与导航统一进一个策略模型,并给出四阶段训练流程与多基准对比数据,可据此判断通用 VLA 与专项模型的差距。
Figure 展示两台搭载 Helix-02 的人形机器人在不到两分钟内协同整理卧室,完成开门、挂衣、收纳耳机、合书、倒垃圾、推椅入桌和共同铺床等任务。两台机器人运行单一学习到的视觉语言动作策略,之间没有共享规划器、消息传递或中央协调器,各自通过摄像头读取场景并从动作推断同伴意图。Figure 称这是首个由单一学习神经网络完成多台人形机器人协同移动操作、直接从像素到动作的演示。
推荐理由:Figure 展示两台 Helix-02 人形机器人用单一 VLA 策略协同整理卧室,可了解多机协作与可变形物体操作的能力边界。
BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。
推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。
Figure 发布 Helix 02 客厅整理演示,该单一神经网络系统直接从像素控制全身,在房间内边行走边连续操作物体、工具和容器。演示包含用喷瓶和毛巾清洁表面、双手端箱捡积木、腋下夹容器腾出双手、抛枕头回沙发、在手内重新调整遥控器并按按钮关电视等行为。Figure 称这些能力仅通过增加新数据获得,未新增算法或专门工程。
推荐理由:Figure 展示 Helix 02 在客厅整理任务中的全身操作表现,可了解单一神经网络如何从数据扩展新技能。
Figure 发布 Helix 02,用单一神经网络从像素直接控制人形机器人全身,在完整厨房中自主完成装卸洗碗机任务,全程约 4 分钟、含 61 个移动操作动作,无人工干预。
推荐理由:Figure 公布 Helix 02 的三层架构与全身自主演示,读者可了解人形机器人从上半身控制扩展到全身连续作业的路径。
Skild AI 提出通过观看人类视频学习新技能的方法,仅需不到 1 小时机器人数据即可微调模型完成新任务。该方法针对遥操作在数据多样性和规模上的局限,尝试用已存在的人类视频数据跨越不同本体形态之间的差异。Skild AI 认为这能改变机器人数据瓶颈,使基础模型的可扩展任务学习成为可能。
推荐理由:Skild AI 提出从人类视频学习技能的方法,读者可了解其如何用少量机器人数据跨越形态差异。
Mercado Libre 与 Agility Robotics 宣布达成商业协议,将把 Digit 人形机器人部署到其位于德克萨斯州圣安东尼奥的设施,初期聚焦支持商业履约的任务,双方还计划探索在拉美仓库的更多用例。
推荐理由:Mercado Libre 与 Agility 的商业协议给出了人形机器人进入拉美物流仓储的具体落地路径与已运行数据。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
Figure 的视觉语言动作模型 Helix 在叠衣服、整理包裹之后,新增了装洗碗机的能力,且未引入新算法或专门工程,仅靠新数据训练。Helix 学会了将叠放的盘子分离并依次装入、单手拿起玻璃杯后换手重新调整方向再放置、根据杂乱的初始状态调整策略,以及在抓取失误或碰撞后恢复。Figure 称洗碗机装载、包裹物流和叠毛巾任务由同一通用架构完成,是迈向可扩展人形智能的一步。
推荐理由:Figure 展示同一 Helix 模型仅靠新数据学会装洗碗机,可观察通用 VLA 架构向多任务扩展的路径。
Figure 的视觉语言动作模型 Helix 展示了完全自主折叠毛巾的能力,这是首个由多指手人形机器人通过端到端神经网络完成叠衣的实例。该模型沿用此前完成物流包裹重定向任务的同一架构,未修改模型或训练超参数,仅新增数据集,即可完成从混合毛巾堆中取毛巾、根据初始状态调整折叠策略、从多次抓取错误中恢复,以及用拇指描边、捏角、解开缠绕毛巾等精细操作。
推荐理由:Figure 展示 Helix 在无架构改动下从物流任务迁移到叠毛巾,可观察端到端 VLA 处理可变形物体的方式。
Figure 发布 Helix 物流场景的升级版本,可处理聚乙烯袋、气泡信封等可变形包裹,平均处理时间从约 5.0 秒降至 4.05 秒,条码朝向成功率从约 70% 提升至约 95%。
推荐理由:Figure 公开 Helix 物流策略的架构改动与消融数据,可看到视觉记忆、状态历史和力反馈各自解决的具体瓶颈。
银河通用机器人发布端到端具身抓取基础大模型 GraspVLA,称其采用全合成大数据预训练。原文未提供正文,模型能力、数据规模与验证结果均未披露。
Apptronik 发布人形机器人 Apollo,身高约 5 英尺 8 英寸、重 160 磅,可举升 55 磅,采用力控架构以保障与人协作时的安全。Apollo 支持双足行走、轮式躯干或固定安装三种模块化形态,配备可更换电池,单块续航四小时,近期面向仓储与制造场景的箱体与周转箱搬运。Apptronik 称其团队近十年间已建造超过 10 款机器人,包括参与 NASA Valkyrie 的开发。
推荐理由:Apollo 的尺寸、负载、模块化形态与可换电池设计,为判断人形机器人进入仓储制造场景的工程取舍提供了具体参照。