不依赖 TD 学习的强化学习:Transitive RL 的分治价值学习
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
追踪机器人学习的研究、可复用工程方法与真实部署证据。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
Skild AI 训练了一个 omni-bodied 大脑,在包含 10 万种不同机器人的仿真环境中训练,使其能零样本控制训练中从未见过的机器人。在展示中,同一模型无需针对场景微调,就能应对断腿、锁膝、卡轮、踩高跷等形态突变,通过上下文学习在毫秒到数分钟内调整步态并恢复行走。Skild AI 认为,让模型控制所有身体而非单一或少数身体,是通向可靠物理世界 AGI 的路径。
推荐理由:Skild AI 用 10 万种机器人训练单一策略,展示零样本适应断腿、卡轮等形态突变,可观察跨本体泛化的思路。
Figure 发布用端到端强化学习训练的人形行走控制器,在 GPU 加速物理仿真中并行模拟数千台 Figure 02,数小时生成数年仿真数据。该策略结合域随机化与机器人上 kHz 级力矩反馈闭环控制,无需额外微调即可零样本迁移到真机,并让 10 台 Figure 02 运行同一网络。训练中通过奖励机器人模仿人类行走参考轨迹,保留脚跟着地、脚尖离地和摆臂等步态特征。
推荐理由:Figure 公开了纯仿真强化学习训练的人形行走控制器,并说明零样本迁移到 Figure 02 真机的做法。
Apptronik 宣布与 NVIDIA 合作,将 Apollo 人形机器人接入 NVIDIA 新发布的通用机器人基础模型 Project GR00T,使其能从文本、视频和人类示范中学习协调与灵巧等通用技能并输出动作。
推荐理由:官方披露 Apollo 接入 Project GR00T 的学习路径与算力配置,可了解人形机器人从人类示范中学习任务的实现方式。