AI 日报 · 2026 年 10 月 7 日 · 星期三
具身雷达
人形机器人拉黄包车:耦合轮式负载下的全身运动控制
今日入选动态聚焦机器人全身运动与策略学习。人形机器人拉黄包车提出全身控制框架,在跟踪车辆指令的同时保持平衡与稳定抓握,应对负载、车辆与地形带来的未知耦合力。此外,Similarity-guided LoRA-PNN 实现人形机器人全身运动持续学习,REDIRECT 仅用 1% 训练预算修复机器人坏习惯。
论文研究
Similarity-guided LoRA-PNN:人形机器人全身运动的持续学习
论文提出 Similarity-guided LoRA-PNN,一种渐进神经网络策略,通过轻量低秩适配复用已有技能,在顺序任务流中不重访旧数据即可学习新技能。在六个顺序学习的技能类别上,该方法取得最佳前向迁移(0.125 对 0.079)和最高平均准确率,最多节省 94.5% 可训练参数与 40.8% 训练时间。
人形机器人拉黄包车:耦合轮式负载下的全身运动控制
论文提出一种人形机器人拉黄包车的全身控制框架,在跟踪车辆运动指令的同时保持平衡与稳定抓握,应对负载、车辆与地形带来的未知耦合力。训练时由特权教师利用车辆状态、交互力与负载属性,将其动作与隐变量蒸馏到历史条件学生策略,再经强化学习微调;对比 No History 与 Only History 基线,该策略车辆跟踪更准,并降低车辆振荡、躯干倾斜与驱动代价。
ForeAct3D:面向 VLA 策略的策略锚定未来世界建模
ForeAct3D 提出一种在 VLA 策略内部进行策略锚定未来世界建模的框架,用可学习几何查询从策略表征中解码深度、语义分割和相机位姿,得到当前与未来语义 3D 场景状态,未来查询以策略生成的动作块为条件。
REDIRECT:用1%训练预算修复机器人坏习惯
REDIRECT 提出一种方法,仅用完整训练样本反向传播预算的 1%,在只有回合级保留/问题标签、无需帧级标注或额外交互的情况下定位问题分支并修复局部动作。在三个随机化 ManiSkill 任务和三个随机种子上,平均成功率从 68.2% 提升到 90.3%,恢复 88.8% 的干净重训练差距,而同等算力微调仅恢复 22.1%。
AgenticTactileVLA:无需重训 VLA 的接触引导执行期监督实现可泛化灵巧操作
AgenticTactileVLA 提出一种执行期监督器,让固定 VLA 负责接近与手部目标,监督器依据手指位置与电机力矩反馈决定是否介入、修正手指弯曲或切换柔顺控制,无需触觉传感器也不重训 VLA。
TTT-RM:将测试时训练作为机器人策略的残差记忆
论文提出 TTT-RM,把测试时训练(TTT)重新用作残差记忆,用快速权重补充有界记忆库,保存无法从策略当前上下文恢复的任务相关历史信息。方法学习一个历史解码器,从当前观测和检索到的记忆中重建历史表示,重建残差作为 TTT 的学习目标,慢权重针对该残差目标优化,快速权重状态再被查询生成残差记忆表示以条件化动作生成。
PatternDex:学习交互模式引导双臂灵巧手操作铰接物体
PatternDex 从人-物示范中学习手部与物体运动的关联,将其表示为交互模式 token 序列,据此估计适配目标机器人的腕部运动与接触点,并训练强化学习策略。在 ARCTIC 数据集的人体示范上,该方法用 Allegro 手平均成功率达 92.8%,对比基线为 52.2%;仅经微调后,另外三种机器人手成功率也超过 70%,并验证策略可迁移到真实开微波炉任务。
TACET:面向四足机器人的情境适配声学社交导航方法
TACET 是一种情境适配的声学社交导航方法,从机器人第一视角推断社交情境,决定行走位置与噪声大小,通过单一紧凑行为 token <gait, speed, social_cost> 将慢速微调视觉语言推理器与快速反应控制器耦合。
快讯
- Reward-DAgger:基于通用进度奖励模型的机器人门控交互式模仿学习arXiv cs.RO
- SUAVE:用掩码扩散统一视频与动作建模arXiv cs.RO
- GiT:面向机器人操作时间定位的多源数据集与基准arXiv cs.RO
- ROOT:从可观测树中发现用户指定具身行为的奖励函数arXiv cs.RO
- TacOT:用触觉引导最优传输从人类示范学习接触丰富灵巧操作arXiv cs.RO
- CrashSim:用真实事故先验生成碰撞场景以评测自动驾驶安全性arXiv cs.RO
- FLTA:面向人到机器人视觉适配的帧级时序对齐框架arXiv cs.RO
- RiskFly:面向动态杂乱环境一阶段敏捷飞行的视锥对齐时空风险场arXiv cs.RO
- RoboIRS:面向通用机器人策略的推理时内部表征引导arXiv cs.RO
- PerturBot:用扰动训练打破 VLA 模型的捷径先验arXiv cs.RO
- Robot Learning with Visual Predicted Force:用视觉力预测实现无力传感器操作arXiv cs.RO
- 流策略作为技能级世界模型的动作:面向长程规划的学习与符号抽象arXiv cs.RO