NeDM Study 4 数据集发布:宇树 Go2 在 CRM 颗粒地形上的神经降维动力学复现材料
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
追踪机器人学习的研究、可复用工程方法与真实部署证据。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。
推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。