跳到正文
10月1日 · 周四

最新精选

9月30日周三
  1. arXiv cs.RO71

    KPI:面向人形机器人物理交互的可提示内核

    论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。

    推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。

  2. arXiv cs.RO62

    SAKI:从人类视频组装技能并做运动学模仿,实现长时程移动操作

    SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。

    推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。

  3. arXiv cs.RO62

    机器人上下文学习综述:方法与应用

    一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。

    推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。

  4. arXiv cs.RO62

    SCOUT:用动作-结果反馈实现测试时策略自适应

    SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。

    推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。

  5. arXiv cs.RO62

    受被动动态行走启发的动力学引导方法提升人形机器人行走能效

    该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。

    推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。

  6. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  7. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

  8. HF blog66

    CrossBFM:跨人形本体蒸馏共享潜行为空间

    CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。

    推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。

9月29日周二
  1. qbitai82

    AMD以82亿美元全股票收购李飞飞World Labs,李飞飞将任首席科学家

    AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。

    推荐理由:梳理AMD收购World Labs的交易结构、技术合作脉络与各轮投资人回报,可看清芯片巨头布局空间智能的路径。

  2. HF blog60

    strands-robots 用 Isaac Lab 训练宇树 Go2 并录制 LeRobot 数据集

    strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。

    推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。

9月22日周二
  1. NVIDIA blog robotics78

    NVIDIA 发布 Isaac ROS 5.0,支持 ROS Lyrical 与 agentic 开发工作流

    NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入面向 AI agent 的 setup、manipulation 等可复用技能与 agent-ready 文档。

    推荐理由:Isaac ROS 5.0 的 agentic 工作流与 ROS Lyrical、Ubuntu 24.04 支持,为开发者提供了从开发到 Jetson 部署的完整路径参考。

9月21日周一
  1. qbitai81

    清华、无问芯穹等开源具身智能体基础设施 RPent

    清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。

    推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。

  2. HF blog62

    Learning Foresight without Explicit Trajectories for 3D Diffusion Policies 论文发布

    论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。

    推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。

9月17日周四
  1. IsaacLab releases78

    NVIDIA 发布 Isaac Lab 3.0 早期访问版

    NVIDIA 发布 Isaac Lab 3.0 早期访问版,基于 Isaac Sim 6.1、Python 3.12、PyTorch 2.11、Warp 1.16 和 Newton 1.5.2,引入跨物理、渲染与可视化后端的统一任务 API,并支持不安装 Isaac Sim 的 kit-less 运行。

    推荐理由:Isaac Lab 3.0 早期访问版给出多后端架构与破坏性变更清单,读者可据此评估迁移成本。

9月14日周一
  1. qbitai78

    生数科技发布世界模型 Motus2,探索机器人自我进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。

    推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。

9月12日周六
  1. qbitai78

    生数发布世界模型 Motus2,探索机器人闭环自进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。

    推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。

9月11日周五
  1. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。

  2. NVIDIA blog robotics71

    Skild AI 发布 S1 机器人基础模型,单段视频即可学习新任务

    Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。

    推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。

9月10日周四
  1. HF blog62

    PlannerForge:用 LLM Agent 统一自动驾驶运动规划器场景测试

    PlannerForge 是一个 LLM-agent 框架,把自动驾驶场景测试的场景生成、检索、修改、ADS 执行与结果分析统一到同一流程,并新增 ADS Enhancement 与 ADS Benchmarking 两个阶段。

    推荐理由:论文把场景生成到评估串成统一 LLM-agent 流程,并给出开源模型与商业 API 的对比数据。