面向水下机器人的机载视觉与 MPC 导航:开源 BlueROV2 多机器人实验与对接平台
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
论文提出一种技能条件表征,让查询到的技能对模态特定的短期观测 token 进行融合,并关注保留最近 K 个已执行技能终末观测的稀疏事件记忆。在三个接触密集任务上以技能进度估计评估,滑移检测延迟较微调 SOTA 进度模型降低 87%,扭转完成延迟较纯视觉消融降低 67.5%,盲搜索任务的进度误差通过稀疏事件记忆降低 92%。作者认为观测构建而非仅策略架构是多模态表征的核心挑战。
CADeT 是一个因果感知的形变传递框架,将结构因果模型与主动感知结合,在线推断潜在传递模式并估计状态相关的黏附雅可比矩阵。在操作过程中控制动作更新模式信念,当歧义持续时选择额外探测动作以提高模式可区分性,模式信念与学到的雅可比矩阵被纳入信念感知模型预测控制器用于间接目标形状控制。
Diffusion-2BC 将扩散去噪目标与辅助确定性行为克隆损失结合在共享视觉编码器上,辅助分支仅用于训练,推理仍基于扩散。在 Claw 任务中,其平均掩码距离误差较扩散行为克隆基线降低约 10%,较标准确定性行为克隆降低 85%;在 CARLA 无路线导航中,于 Town01 和 Town02 均比两个基线行驶更远。
论文提出 L1-MPPI,将 L1 自适应控制与模型预测路径积分(MPPI)级联,用于提升高速无人机轨迹跟踪精度。该方法在 MPPI 的动态模型中纳入底层飞行控制器与电机动力学,并加入迭代混合方案,以应对模型不确定性和外部扰动。
推荐理由:论文把 L1 自适应控制与 MPPI 级联,给出负载扰动下的跟踪误差对比数据,可参考其控制架构与实验设置。
TrafficSignBench 是一个以交通标志为中心的大规模基准,用于系统且可解释地评测自动驾驶规划器的交通规则合规性。该框架结合真实地图仿真与规则定向的程序化场景生成,实现 34 类交通标志对应规则的自动违规检查,产出 29,000 个道路场景和 29 种测试场景类型,并构建 5,800 个测试场景。
针对四轮独立转向独立驱动(4WIS4WID)移动机器人,提出一种带在线标定的视觉-惯性-轮式里程计(VIWO)框架,直接从四个驱动速度和转向角推导二维里程计模型,并构建预积分模型与解析雅可比用于滤波和标定。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
研究提出通用具身引擎(UEE),通过隐式注视与瞳孔信号及任务结果推断操作者的具身感和视本体线索权重,以离散主动推断智能体在显式偏好下选择有界设备设置。在300个异构合成操作者的仿真中,UEE多数在半分钟内找到合适设置,后半程具身感达1.68,接近预言机的0.73(0-2量表)。无模型赌博机表现更差,朴素预测误差最小化器会扣留反馈并降低任务成功率(0.74对0.90)。
研究提出一种基于后向可达管的值函数,为动力系统(DS)运动策略提供安全证书,可度量标称 DS 轨迹的最坏情况安全性。该方法利用学习自示范场景中无控制输入使可达性问题退化为确定性 rollout,并借稳定性条件将无限时域截断为有限时域,从而得到良定义的值函数。
PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。
推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。
作者提出参数化生成工具 Draft,其通用引擎可将任意串行链参数树编译为可直接仿真的 MJCF 模型,无需 CAD。Draft 用对 114 个执行器和 49 份已发表机器人描述的调研拟合趋势来约束设计自由参数,并通过构建四款现成机器人的数字孪生验证,质量几何平均折叠误差为 1.10 倍。作者还用两阶段强化学习课程评估三款四足机器人,展示该工具如何呈现设计权衡。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
GestAdapt 是一个以预设腕部工作空间为条件的共语手势生成框架,从六个共语语料库学习共享运动表示,并支持重定向到不同机器人本体。用户研究中,修改工作空间约束下生成的手势平均质量得分为 3.24/5,高于无工作空间变体(2.43/5),低于参考动作(3.68/5)。在 Reachy2 人形机器人真机评测中,该框架生成的动作在 69.7% 的对比中排名第一。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
研究提出面向灾后物资配送的两级覆盖巡回车辆路径问题(2E-CTVRP):卡车先将物资与无人机从中心仓库运至灾区外围卫星点,无人机再从卫星点并行飞往受灾点簇质心投送,卡车在卫星点等待无人机返回。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
Hugging Face 上线 leapshared 的 Redox_130epi_new_20260928_145214 数据集,由 LeRobot 生成,采用 v3.0 代码库,含 131 条 episode、154675 帧、1 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线数据集 leapshared/SciEdu_3exp_374epi,由 LeRobot 生成,采用 v3.0 格式,含 374 条 episode、440776 帧、16 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线数据集 Jianguo-Huang11/APM-Bench。该数据集页面未提供更多说明,仅附有 Hugging Face 推进开源与开放科学、推动人工智能民主化的使命表述。
Hugging Face 上线 TheBobTheBlob/so101_pickplace_v1 数据集,由 LeRobot 生成,面向 so101_follower 机器人,含 30 条 episode、12029 帧、1 个任务、60 段视频,30 fps,动作与状态均为 6 维关节位置。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
斯坦福团队项目 HomeBody 让 GPT-6 Astra 接入宇树 G1,在陌生厨房中按语言指令收拾物品、丢纸盒并从抽屉取药。系统先让 G1 探索建图,再由 Astra 作为 Real2Sim 智能体在 Isaac Sim 中重建数字厨房,之后由 Astra 调用导航、抓取、放置、开抽屉等可复用技能,底层用预训练 AMO 控制策略协调行走与操作。
Hugging Face 上出现由 LeRobot 生成的 UR5e 螺母装配数据集,含 100 条 episode、24602 帧、1 个任务,机器人类型为 ur5e。数据以 20 fps 采集,动作维度 7、状态维度 9,配两路 84×84 视频,采用绝对动作与 OSC_POS 控制,训练集划分 0:100。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。
推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。
该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。
推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。
一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。
推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。
MagNav 用五通道模拟霍尔效应传感器阵列实现双轮自平衡机器人的磁轨循迹,不受光照干扰。控制系统采用串级 PID:内环用 IMU 加互补滤波保持平衡,外环依据磁传感器读数调整转向,步进电机无需额外旋转编码器即可精确控制力矩。测试中磁引导在超过 10,000 Lux 强光下仍保持准确循迹,而对比的光学模块会失准甚至失效。
SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。
推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。
Hugging Face 上线 nakanakagawa/sponge_task_9_30_v2 数据集,由 LeRobot 生成,机器人类型为 so_follower,共 6 条 episode、2395 帧、1 个任务,帧率 20 fps,采用 codebase_version v3.0。
Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。
Hugging Face 上线数据集 ujheo/pen6_20260930_173022,由 LeRobot 生成,采用 v3.0 数据格式,机器人类型为 so_follower。该数据集含 5 个 episode、3191 帧、1 个任务,以 30 fps 记录 6 自由度动作与状态,并配 front、top 两路 480×640 AV1 视频。
论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。
推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。
Hugging Face 发布 Sys1Cal-v1 基准数据集,用于直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现,Noul 和 Score 的概率接近真实值,而二元 Choice 输出存在系统性非线性失真,可通过引入潜在第三分量 Uncertain 建模。数据集与评估代码已公开,支持在其他结构化决策模型上复现。
Hugging Face 上公开的论文 EpiCon 提出一种共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用彼此经验。它由两个独立训练的 2B 模型组成:记忆控制器与树状自组织器,分别负责跨尝试精炼文本引导与视觉证据、分层整合经验并检索规则。
Sony 公开 FAR 世界模型配套的 AI2-THOR 潜变量数据集,用于训练和评测带动作条件检索记忆的潜扩散世界模型及其基线。
推荐理由:FAR 世界模型配套数据集公开了 AI2-THOR 潜变量语料与下载脚本,可了解其记忆评测如何构造。
EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。
推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。