面向水下机器人的机载视觉与 MPC 导航:开源 BlueROV2 多机器人实验与对接平台
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
论文提出一种技能条件表征,让查询到的技能对模态特定的短期观测 token 进行融合,并关注保留最近 K 个已执行技能终末观测的稀疏事件记忆。在三个接触密集任务上以技能进度估计评估,滑移检测延迟较微调 SOTA 进度模型降低 87%,扭转完成延迟较纯视觉消融降低 67.5%,盲搜索任务的进度误差通过稀疏事件记忆降低 92%。作者认为观测构建而非仅策略架构是多模态表征的核心挑战。
CADeT 是一个因果感知的形变传递框架,将结构因果模型与主动感知结合,在线推断潜在传递模式并估计状态相关的黏附雅可比矩阵。在操作过程中控制动作更新模式信念,当歧义持续时选择额外探测动作以提高模式可区分性,模式信念与学到的雅可比矩阵被纳入信念感知模型预测控制器用于间接目标形状控制。
Diffusion-2BC 将扩散去噪目标与辅助确定性行为克隆损失结合在共享视觉编码器上,辅助分支仅用于训练,推理仍基于扩散。在 Claw 任务中,其平均掩码距离误差较扩散行为克隆基线降低约 10%,较标准确定性行为克隆降低 85%;在 CARLA 无路线导航中,于 Town01 和 Town02 均比两个基线行驶更远。
论文提出 L1-MPPI,将 L1 自适应控制与模型预测路径积分(MPPI)级联,用于提升高速无人机轨迹跟踪精度。该方法在 MPPI 的动态模型中纳入底层飞行控制器与电机动力学,并加入迭代混合方案,以应对模型不确定性和外部扰动。
推荐理由:论文把 L1 自适应控制与 MPPI 级联,给出负载扰动下的跟踪误差对比数据,可参考其控制架构与实验设置。
TrafficSignBench 是一个以交通标志为中心的大规模基准,用于系统且可解释地评测自动驾驶规划器的交通规则合规性。该框架结合真实地图仿真与规则定向的程序化场景生成,实现 34 类交通标志对应规则的自动违规检查,产出 29,000 个道路场景和 29 种测试场景类型,并构建 5,800 个测试场景。
针对四轮独立转向独立驱动(4WIS4WID)移动机器人,提出一种带在线标定的视觉-惯性-轮式里程计(VIWO)框架,直接从四个驱动速度和转向角推导二维里程计模型,并构建预积分模型与解析雅可比用于滤波和标定。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
研究提出通用具身引擎(UEE),通过隐式注视与瞳孔信号及任务结果推断操作者的具身感和视本体线索权重,以离散主动推断智能体在显式偏好下选择有界设备设置。在300个异构合成操作者的仿真中,UEE多数在半分钟内找到合适设置,后半程具身感达1.68,接近预言机的0.73(0-2量表)。无模型赌博机表现更差,朴素预测误差最小化器会扣留反馈并降低任务成功率(0.74对0.90)。
研究提出一种基于后向可达管的值函数,为动力系统(DS)运动策略提供安全证书,可度量标称 DS 轨迹的最坏情况安全性。该方法利用学习自示范场景中无控制输入使可达性问题退化为确定性 rollout,并借稳定性条件将无限时域截断为有限时域,从而得到良定义的值函数。
PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。
推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。
作者提出参数化生成工具 Draft,其通用引擎可将任意串行链参数树编译为可直接仿真的 MJCF 模型,无需 CAD。Draft 用对 114 个执行器和 49 份已发表机器人描述的调研拟合趋势来约束设计自由参数,并通过构建四款现成机器人的数字孪生验证,质量几何平均折叠误差为 1.10 倍。作者还用两阶段强化学习课程评估三款四足机器人,展示该工具如何呈现设计权衡。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
GestAdapt 是一个以预设腕部工作空间为条件的共语手势生成框架,从六个共语语料库学习共享运动表示,并支持重定向到不同机器人本体。用户研究中,修改工作空间约束下生成的手势平均质量得分为 3.24/5,高于无工作空间变体(2.43/5),低于参考动作(3.68/5)。在 Reachy2 人形机器人真机评测中,该框架生成的动作在 69.7% 的对比中排名第一。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
研究提出面向灾后物资配送的两级覆盖巡回车辆路径问题(2E-CTVRP):卡车先将物资与无人机从中心仓库运至灾区外围卫星点,无人机再从卫星点并行飞往受灾点簇质心投送,卡车在卫星点等待无人机返回。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
多伦多大学工程学生将弹簧跳杆、四旋翼与单腿结构结合,做出名为 Pogo-Bot 的单腿跳跃机器人,靠四个螺旋桨提供推力、弹簧腿完成弹跳。早期版本仅用尖刺足端,失败频出;改用带弹性带张紧、可枢转的尖刺足垫后,机器人能在软沙到硬冰等全地形保持直立,不再被冰面滑飞。
StartLux-Decision-4B 在 Hugging Face 发布,可对状态回答选择题、是/否题和评分题,每个选项返回概率,请求响应沿用 TypeSafe /v1/systemone 格式。
Hugging Face 发布 StartLux-Decision 系列决策模型,覆盖 0.8B 至 35B-A3B 六种规模,对状态类问题输出各选项概率,沿用 TypeSafe /v1/systemone 格式。
Hugging Face 上线数据集 leapshared/SciEdu_3exp_374epi,由 LeRobot 生成,采用 v3.0 格式,含 374 条 episode、440776 帧、16 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线数据集 Jianguo-Huang11/APM-Bench。该数据集页面未提供更多说明,仅附有 Hugging Face 推进开源与开放科学、推动人工智能民主化的使命表述。
ROS PMC 于 2026 年 9 月 29 日召开 ROSCon 后首次周会,会上讨论了为 Lyrical 和 Rolling 生成 ARM64 RPM 包的需求,每个发行版约新增 1500 个构建任务。会议还明确 PMC 不维护的包应直接联系包维护者,并计划将 PR 构建钩子恢复为无密钥配置。
NVIDIA 在 CES 上展示 Caterpillar 座舱 AI 助手,基于 Jetson Thor 本地运行 Nemotron 语音模型与 Qwen3 4B,无需云端连接。
NVIDIA 在 CES 展示 Caterpillar 座舱内 Cat AI Assistant 原型,基于 Jetson Thor 本地运行 Nemotron 语音模型与 vLLM 服务的 Qwen3 4B,无需云端连接。
Genesis 发布 v1.4.3,重点提升 GPU 上非批处理至中等批量(约 4000)的仿真速度并全面降低显存占用,Windows 上编译速度最高提升至 3 倍。该版本还修复了 glTF 解析、MJCF 材质纹理保留、Apple Metal 性能模式编译失败、IMU 读数记录与相机外参更新等多项问题,并升级至 Quadrants 1.3.3。
Destro 结束隐身状态并获得 800 万美元种子轮融资,其 AI 智能层让机器人在物流场景中与人类协同作业。该公司在 Yusen Logistics 位于美国西北部的一处设施试点,用三台 Miva Robotics 搬运机器人配合 Vision 操作系统完成跨库装卸,现扩展至 26 台机器人部署,并在南加州启动 17 台机器人的新试点。
rasyosef/Qwen3-1.7B-DSpark 已在 Hugging Face 发布。该页面未提供模型参数、训练数据或评测结果等具体信息,仅附有 Hugging Face 推进开源与开放科学的通用说明。
Hugging Face Hub 上线 toniotgz/act_pick_box,这是一个用 LeRobot 0.6.2 训练的 ACT 模仿学习策略,在 so_follower 机器人上执行“从桌上拿起盒子”任务。
Hugging Face 上线了 maria715 的 CAT_llama3b_likeZephyr_eps0150_42_relativelr_utility_500_NEW_weight000371875 模型页面。该页面未提供模型参数、训练数据或评测结果等具体信息,仅保留 Hugging Face 推进开源与开放科学的平台说明。
Hugging Face 上出现了一个名为 maria715/CAT_adv_eps02_42_relativelr_REFAIT 的模型仓库。该页面未提供模型架构、训练数据、任务类型或性能指标等具体信息,仅包含 Hugging Face 推进开源与开放科学的使命声明。
Hugging Face 上线 TheBobTheBlob/so101_pickplace_v1 数据集,由 LeRobot 生成,面向 so101_follower 机器人,含 30 条 episode、12029 帧、1 个任务、60 段视频,30 fps,动作与状态均为 6 维关节位置。
Hugging Face 用户 TheBobTheBlob 发布 act_so101_pickplace_v1,这是一个用 LeRobot 训练并上传至 Hub 的 ACT(Action Chunking with Transformers)模仿学习策略,从遥操作数据中学习预测短动作块。
bartowski 基于 llama.cpp b11259 为 OmniJev 的 OneJev-9B 模型发布 GGUF 量化版本,覆盖 bf16 到 IQ2_M 共 22 个文件,默认推荐 Q4_K_M(5.84GB)。该模型支持文本与图像输入,仓库同时提供 mmproj 多模态投影文件,可搭配任意量化版本使用。
Hugging Face Hub 上出现了一个由 transformers 推送的模型卡,模型 ID 为 Nat1an/cerulean-lab4-f-e570cde2。该模型卡为自动生成,开发者、模型类型、语言、许可证、微调来源、训练数据与评估结果等信息均标注为待补充。
Hugging Face 上线了名为 Nat1an/cerulean-lab4-h-6a29c74a 的模型页面。该页面目前仅展示 Hugging Face 推进开源与开放科学、推动人工智能民主化的使命表述,未提供模型架构、参数规模、训练数据或评测结果等具体信息。
Hugging Face Hub 上出现了一个由 Nat1an 分享的 transformers 模型,模型 ID 为 cerulean-lab4-e-d8d5d8e9。该模型卡为自动生成,开发方、模型类型、语言、许可证、训练数据与评测结果等信息均标注为待补充。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。