面向崎岖地形的遮挡感知准静态稳定性轨迹规划
该论文提出一种基于模型的框架,为刚性非铰接四轮车在高度崎岖地形上生成准静态、面向稳定性的参考轨迹。方法将地形遮挡造成的盲区建模为固定特征傅里叶地形表示中的覆盖诱导认知不确定性。
该论文提出一种基于模型的框架,为刚性非铰接四轮车在高度崎岖地形上生成准静态、面向稳定性的参考轨迹。方法将地形遮挡造成的盲区建模为固定特征傅里叶地形表示中的覆盖诱导认知不确定性。
作者提出 LME(Local-Minimum Escaper),一个程序化分层框架,通过显式生成并推理子目标,引导移动机器人脱离局部极小值区域。LME 仅依赖局部观测,用可解释的启发式准则结合障碍几何与候选位置安全性来选取子目标,再由局部规划器生成底层运动指令,无需额外训练且不依赖具体局部规划器。
推荐理由:论文提出用可解释启发式生成子目标来摆脱局部极小值,且不依赖底层规划器、无需额外训练。
研究者提出 EMPlan,一种由奖励引导微调驱动的高效多模态轨迹规划方法,采用稀疏锚点加偏移精修模块的混合架构,稀疏锚点以低时延给出粗轨迹候选,再由偏移模块精修提升精度。方法采用预训练加奖励引导微调的两阶段训练,利用规则奖励信号与非成对偏好监督,在不增加推理成本的前提下提升安全性。在非反应式 NAVSIM 基准上,EMPlan 在实时约束下兼顾了规划精度与效率。
研究提出一种倒置的堆叠方式,先训练通用的指令条件化运动策略作为底层,再在其上叠加 N 个运动引导的踢球技能作为任务门控层,使可达步态空间由运动课程而非参考片段决定。
推荐理由:论文把运动策略作为底层、踢球技能作为任务门控层,并给出多方向射门与地形、推力恢复的评测结果。
PhaseSync-Exo 提出结合双 IMU CNN-Transformer 重建、幅度-步频分解重定向与人体时钟锚定适配器(HCA)的外骨骼步态跟踪方法。重建模块在留出记录上平均绝对误差为 3.24 度,冻结的跟踪策略完成 357 次幅度-频率试验中的 356 次。
针对分散式机器人车队观测与通信范围受限的问题,研究者提出 HALO 混合方法,将车辆路径问题拆分为分配与路由两部分,为动态环境中的机器人提供车载实时解。分配阶段采用异构图神经网络与独特消息传递层,分离空间分布和任务-机器人兼容性的学习。
研究者提出有界通道自适应谱残差门控循环单元(BCS-GRU),以循环时序预测为主表示,将谱信息限制为受控的输出特定修正,用于扑翼气动反演。在统一回合级协议下,BCS-GRU 的反演预测优于循环与自适应谱基线,且预测时域越长收益越大。前向一致微调进一步提升了基于代理模型的气动一致性,同时保持平均运动学精度。
针对滑移转向行星漫游车在松软地形持续牵引不对称下的路径跟踪,研究提出一种无模型、仅靠减速的控制策略,通过限制最大指令速度避免滑陷,并仅对外侧车轮选择性减速使其进入负滑移充当机械锚点。
研究提出一种面向任务的框架,用于认证有界执行器多旋翼在悬停与接触负载后的残余力旋量权限,基于凸几何推导欧氏球与加权椭球等凸储备的带符号裕度,并通过执行器内点界获得可计算的储备证书以支持松弛最大化分配。
Yggdrasil 是一个面向机器人感知的层优先分层3D场景图,用通用节点、边和层表达现有管线已产出的室内外、扁平或分层表示,并原生回答下游任务的位置与语义查询。
推荐理由:论文提出面向实时查询优化的分层3D场景图,并给出查询延迟与三条感知管线的集成数据。
作者提出稠密时序动作重定向(DTMR),在单个优化中联合优化时序与控制,对每个控制步调整时序,并用基于采样的 MPC 在 GPU 上并行求解。在四款人形机器人、两小时人体动作数据上评测,DTMR 优于基线,尤其在跳跃等动态动作上;相同形变预算下比优化时间维度的基线重定向更精确且快约 19 倍。用其参考动作训练的策略已迁移到真实人形机器人。
推荐理由:提出在单个优化中联合调整时序与控制的稠密时序动作重定向方法,读者可了解动态动作迁移的精度与速度权衡。
FAST-Sync 是一种面向任意矩阵李群的快速线性近似群同步方法,可将弦初始化推广到任意矩阵李群,并利用问题数据矩阵的 Kronecker 积结构与同步图拓扑提升速度、可扩展性与精度。实验表明,该方法能为局部优化器提供高质量初始化,在测量噪声较大时仍高效恢复全局最优解并保持高成功率。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
CADeT 是一个因果感知的形变传递框架,将结构因果模型与主动感知结合,在线推断潜在传递模式并估计状态相关的黏附雅可比矩阵。在操作过程中控制动作更新模式信念,当歧义持续时选择额外探测动作以提高模式可区分性,模式信念与学到的雅可比矩阵被纳入信念感知模型预测控制器用于间接目标形状控制。
论文提出 L1-MPPI,将 L1 自适应控制与模型预测路径积分(MPPI)级联,用于提升高速无人机轨迹跟踪精度。该方法在 MPPI 的动态模型中纳入底层飞行控制器与电机动力学,并加入迭代混合方案,以应对模型不确定性和外部扰动。
推荐理由:论文把 L1 自适应控制与 MPPI 级联,给出负载扰动下的跟踪误差对比数据,可参考其控制架构与实验设置。
针对四轮独立转向独立驱动(4WIS4WID)移动机器人,提出一种带在线标定的视觉-惯性-轮式里程计(VIWO)框架,直接从四个驱动速度和转向角推导二维里程计模型,并构建预积分模型与解析雅可比用于滤波和标定。
研究提出通用具身引擎(UEE),通过隐式注视与瞳孔信号及任务结果推断操作者的具身感和视本体线索权重,以离散主动推断智能体在显式偏好下选择有界设备设置。在300个异构合成操作者的仿真中,UEE多数在半分钟内找到合适设置,后半程具身感达1.68,接近预言机的0.73(0-2量表)。无模型赌博机表现更差,朴素预测误差最小化器会扣留反馈并降低任务成功率(0.74对0.90)。
研究提出一种基于后向可达管的值函数,为动力系统(DS)运动策略提供安全证书,可度量标称 DS 轨迹的最坏情况安全性。该方法利用学习自示范场景中无控制输入使可达性问题退化为确定性 rollout,并借稳定性条件将无限时域截断为有限时域,从而得到良定义的值函数。
作者提出参数化生成工具 Draft,其通用引擎可将任意串行链参数树编译为可直接仿真的 MJCF 模型,无需 CAD。Draft 用对 114 个执行器和 49 份已发表机器人描述的调研拟合趋势来约束设计自由参数,并通过构建四款现成机器人的数字孪生验证,质量几何平均折叠误差为 1.10 倍。作者还用两阶段强化学习课程评估三款四足机器人,展示该工具如何呈现设计权衡。
研究提出面向灾后物资配送的两级覆盖巡回车辆路径问题(2E-CTVRP):卡车先将物资与无人机从中心仓库运至灾区外围卫星点,无人机再从卫星点并行飞往受灾点簇质心投送,卡车在卫星点等待无人机返回。
论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。
推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。
MagNav 用五通道模拟霍尔效应传感器阵列实现双轮自平衡机器人的磁轨循迹,不受光照干扰。控制系统采用串级 PID:内环用 IMU 加互补滤波保持平衡,外环依据磁传感器读数调整转向,步进电机无需额外旋转编码器即可精确控制力矩。测试中磁引导在超过 10,000 Lux 强光下仍保持准确循迹,而对比的光学模块会失准甚至失效。
任少卿以通讯作者身份参与论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,第一机构为蔚来,提出一次生成多组配对场景—动作假设、让轨迹与未来场景共同演化的多模式世界—动作联合模型。
IEEE 已公开 2026 年 ICRA 的主旨演讲、全体会议、行业主题演讲、奖项演讲、教程及六场专题讨论的视频录像。本届 ICRA 于 6 月 1 日至 5 日在维也纳举行,全体演讲嘉宾包括 Ken Goldberg、Barbara Mazzolai 和 Roland Siegwart。
PlannerForge 是一个 LLM-agent 框架,把自动驾驶场景测试的场景生成、检索、修改、ADS 执行与结果分析统一到同一流程,并新增 ADS Enhancement 与 ADS Benchmarking 两个阶段。
推荐理由:论文把场景生成到评估串成统一 LLM-agent 流程,并给出开源模型与商业 API 的对比数据。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
EPFL、杜克大学与里斯本高等理工学院联合开发了仿生幼体斑马鱼机器人平台 ZBot,用于对比间歇式滑行游动与连续摆尾游动的能效。ZBot 体长 80 cm、重 2.8 kg,尾部由六个伺服电机驱动,头部集成中央控制器、高精度相机与实时功率计。实验显示间歇游动在所有可达速度下均比连续摆尾省能,但最高速度仅为连续摆尾的约 60%;团队提出执行器效率假说,认为间歇循环让电机更多工作在高效负载区间。
德国卡尔斯鲁厄理工学院(KIT)设计出一套机器人拆解系统,可依据破损产品的 CAD 模型预测故障并拆解,同时保护关键零件不受损伤。系统通过数学建模判断零件自由度异常,并在拆解过程中持续校验、必要时改用铣削等方式,还可指定需完整保留的零件。该研究已在 ICRA 2026 发布,团队设想将其扩展为多机械臂协同的自动化拆解工厂。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。
利兹大学与加州大学圣地亚哥分校合作研发的 1.8 mm 软体生长机器人获 RoboSoft 最佳论文奖,该机器人通过磁控转向、无需内部气压即可生长,并能以最高 500 Hz 实时感知自身形状。其硅胶体内混入磁性颗粒并分区磁化,实现驱动与传感一体化,可同时生长和转向,有望减少微创手术中器械与组织的摩擦。
德州农工大学博士生 Sarah Downs 为 NASA 与美国空军合作项目开发了一种不依赖视觉系统的力反馈插入算法,让太空装配卫星的机械臂完成天线插入的“轴孔装配”任务。该机械臂通过夹爪上的力矩传感器感知力反馈,在零重力下完成插入并保持位置,还需计算反向推力以抵消机械臂运动对卫星的反作用力矩。
西北大学在 RSS 2026 展示的 Phantom Twist 单电机旋转无人机,以 15 至 25 赫兹转速利用人眼视觉暂留,飞行时比同尺寸四旋翼难见约 10 倍。其设计经迭代优化器以 LPIPS 为指标生成,最优构型 LPIPS 为 0.0104,人工设计版本约 0.2。该机由 0.8 毫米碳纤维杆连接电机、电池、控制器与配重,目前依靠光学追踪系统控制。
GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。
推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。
ACID 提出在世界模型决策时规划中加入循环动作一致性代价:用逆动力学模型推断每个预测状态转移背后的动作,其与条件动作的偏差作为逐步规划代价。该方法在四个世界模型和六个任务上改善了规划效果,并显著减少了计算量。
意大利 Gran Sasso Science Institute(GSSI)的研究人员发起一项关于机器人系统适应需求的问卷调查,聚焦使用行为树(Behavior Trees)的机器人系统。问卷旨在回答两个问题:不同适应需求在机器人系统中的相关性,以及各类行为树适应方法应对这些需求的适用性。问卷约需 20 分钟完成,参与者可获取机器人适应需求、行为树当前局限及相关研究的概览。
纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。
MIT 与宾夕法尼亚大学的研究者提出开源轨迹规划系统 MIGHTY,让无人机在毫秒级响应障碍的同时保持平滑航线并缩短飞行时间。该系统用 Hermite 样条把飞行时间与路径放在一步内联合优化,并借助激光雷达地图迭代细化初始轨迹,仅靠机载计算与传感器即可实时飞行。
AAMAS 2026 最佳论文奖授予 Mireia Yurrita 等人的《Developing Guidelines for Human-LLM Agent Teams: A Multi-Stakeholder Lens》。