RynnWorld-4D:面向机器人操作的 4D 具身世界模型
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
追踪操作与抓取的研究、可复用工程方法与真实部署证据。
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。
推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。