跳到正文
2026 年 10 月 7 日 · 星期三每天 08:00 出刊

AI 日报 · 2026 年 10 月 7 日 · 星期三

具身雷达

第 13 期072026 年 10 月星期三
8件大事1个来源0件一手发布约 3 分钟读完
头条

人形机器人拉黄包车:耦合轮式负载下的全身运动控制

今日入选动态聚焦机器人全身运动与策略学习。人形机器人拉黄包车提出全身控制框架,在跟踪车辆指令的同时保持平衡与稳定抓握,应对负载、车辆与地形带来的未知耦合力。此外,Similarity-guided LoRA-PNN 实现人形机器人全身运动持续学习,REDIRECT 仅用 1% 训练预算修复机器人坏习惯。

01

论文研究

arXiv cs.RO

Similarity-guided LoRA-PNN:人形机器人全身运动的持续学习

论文提出 Similarity-guided LoRA-PNN,一种渐进神经网络策略,通过轻量低秩适配复用已有技能,在顺序任务流中不重访旧数据即可学习新技能。在六个顺序学习的技能类别上,该方法取得最佳前向迁移(0.125 对 0.079)和最高平均准确率,最多节省 94.5% 可训练参数与 40.8% 训练时间。

arXiv cs.RO

人形机器人拉黄包车:耦合轮式负载下的全身运动控制

论文提出一种人形机器人拉黄包车的全身控制框架,在跟踪车辆运动指令的同时保持平衡与稳定抓握,应对负载、车辆与地形带来的未知耦合力。训练时由特权教师利用车辆状态、交互力与负载属性,将其动作与隐变量蒸馏到历史条件学生策略,再经强化学习微调;对比 No History 与 Only History 基线,该策略车辆跟踪更准,并降低车辆振荡、躯干倾斜与驱动代价。

arXiv cs.RO

ForeAct3D:面向 VLA 策略的策略锚定未来世界建模

ForeAct3D 提出一种在 VLA 策略内部进行策略锚定未来世界建模的框架,用可学习几何查询从策略表征中解码深度、语义分割和相机位姿,得到当前与未来语义 3D 场景状态,未来查询以策略生成的动作块为条件。

arXiv cs.RO

REDIRECT:用1%训练预算修复机器人坏习惯

REDIRECT 提出一种方法,仅用完整训练样本反向传播预算的 1%,在只有回合级保留/问题标签、无需帧级标注或额外交互的情况下定位问题分支并修复局部动作。在三个随机化 ManiSkill 任务和三个随机种子上,平均成功率从 68.2% 提升到 90.3%,恢复 88.8% 的干净重训练差距,而同等算力微调仅恢复 22.1%。

arXiv cs.RO

TTT-RM:将测试时训练作为机器人策略的残差记忆

论文提出 TTT-RM,把测试时训练(TTT)重新用作残差记忆,用快速权重补充有界记忆库,保存无法从策略当前上下文恢复的任务相关历史信息。方法学习一个历史解码器,从当前观测和检索到的记忆中重建历史表示,重建残差作为 TTT 的学习目标,慢权重针对该残差目标优化,快速权重状态再被查询生成残差记忆表示以条件化动作生成。

arXiv cs.RO

PatternDex:学习交互模式引导双臂灵巧手操作铰接物体

PatternDex 从人-物示范中学习手部与物体运动的关联,将其表示为交互模式 token 序列,据此估计适配目标机器人的腕部运动与接触点,并训练强化学习策略。在 ARCTIC 数据集的人体示范上,该方法用 Allegro 手平均成功率达 92.8%,对比基线为 52.2%;仅经微调后,另外三种机器人手成功率也超过 70%,并验证策略可迁移到真实开微波炉任务。

02

快讯

(本期完)

具身雷达 日报由编辑系统根据公开来源自动编辑,每条均附原文 · 日报合订本