跳到正文

机器人学习

追踪机器人学习的研究、可复用工程方法与真实部署证据。

47条精选

最新精选

第 41–47 条 · 共 47 条
7月9日周四
  1. Amazon Science 官方研究博客62

    Amazon Science 开源 Turnstile:在代理层捕获 token ID 以改进强化学习

    Amazon Science 发布 Turnstile,一个用 Rust 编写的代理,位于智能体 harness 与推理后端之间,在生成时刻记录模型采样的精确 token ID、逐 token 对数概率、损失掩码和权重版本边界,并导出与框架无关的训练轨迹。

    推荐理由:Turnstile 把 token 级轨迹采集从 harness 挪到代理层,读者可据此理解智能体 RL 训练数据为何容易失真。

4月29日周三
1月12日周一
  1. Skild AI 官方研究博客62

    Skild AI 提出通过观看人类视频学习机器人技能

    Skild AI 提出通过观看人类视频学习新技能的方法,仅需不到 1 小时机器人数据即可微调模型完成新任务。该方法针对遥操作在数据多样性和规模上的局限,尝试用已存在的人类视频数据跨越不同本体形态之间的差异。Skild AI 认为这能改变机器人数据瓶颈,使基础模型的可扩展任务学习成为可能。

    推荐理由:Skild AI 提出从人类视频学习技能的方法,读者可了解其如何用少量机器人数据跨越形态差异。

11月1日周六
9月24日周三
  1. Skild AI 官方研究博客64

    Skild AI 提出 omni-bodied 机器人大脑,10 万种机器人训练实现零样本适应

    Skild AI 训练了一个 omni-bodied 大脑,在包含 10 万种不同机器人的仿真环境中训练,使其能零样本控制训练中从未见过的机器人。在展示中,同一模型无需针对场景微调,就能应对断腿、锁膝、卡轮、踩高跷等形态突变,通过上下文学习在毫秒到数分钟内调整步态并恢复行走。Skild AI 认为,让模型控制所有身体而非单一或少数身体,是通向可靠物理世界 AGI 的路径。

    推荐理由:Skild AI 用 10 万种机器人训练单一策略,展示零样本适应断腿、卡轮等形态突变,可观察跨本体泛化的思路。

3月25日周二
  1. Figure 官方新闻74

    Figure 用强化学习训练 Figure 02 自然行走控制器

    Figure 发布用端到端强化学习训练的人形行走控制器,在 GPU 加速物理仿真中并行模拟数千台 Figure 02,数小时生成数年仿真数据。该策略结合域随机化与机器人上 kHz 级力矩反馈闭环控制,无需额外微调即可零样本迁移到真机,并让 10 台 Figure 02 运行同一网络。训练中通过奖励机器人模仿人类行走参考轨迹,保留脚跟着地、脚尖离地和摆臂等步态特征。

    推荐理由:Figure 公开了纯仿真强化学习训练的人形行走控制器,并说明零样本迁移到 Figure 02 真机的做法。

3月18日周一
  1. Apptronik 官方发布62

    Apptronik 与 NVIDIA 合作,Apollo 人形机器人接入 Project GR00T

    Apptronik 宣布与 NVIDIA 合作,将 Apollo 人形机器人接入 NVIDIA 新发布的通用机器人基础模型 Project GR00T,使其能从文本、视频和人类示范中学习协调与灵巧等通用技能并输出动作。

    推荐理由:官方披露 Apollo 接入 Project GR00T 的学习路径与算力配置,可了解人形机器人从人类示范中学习任务的实现方式。