Skild AI 用自我对弈训练人形机器人 Messinator 踢足球
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
任少卿以通讯作者身份参与论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,第一机构为蔚来,提出一次生成多组配对场景—动作假设、让轨迹与未来场景共同演化的多模式世界—动作联合模型。
亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。
开发者对机器人行为树执行守卫 QERRA-v2 Classical 开展 20 例对抗基准测试,在 Webots 仿真中用 PAL Robotics TIAGo 验证。
第三方公益机构 Robocurve 发布机器人安全基准 RoboHarm,把 GPT-6 Astra、Fable 5.1 和 MolmoAct2 接入同一套双机械臂,测试刺向类人目标、加热压缩气体、制造有毒烟雾等五类物理风险任务,每任务每模型重复 20 次并由人工打分。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
云南大学张文华团队研制出钙钛矿太阳能电池,在模拟水下10米光谱条件下光电转换效率达34.71%,陆地条件下为17.08%。他们将电池封装后集成到水下迷你机器人上,在南海涠洲岛附近测试,10米深处115平方厘米电池两小时发电324毫瓦时,2米处为1416毫瓦时。研究估算电池在25°C水温下可连续运行约5.5年。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等团队发布技术报告 JEPA-Anything,提出面向不同领域学习预测模型的跨领域框架,各领域保留自己的观测形式与编码器,共享预测核心和统一的 latent world-state interface。
针对 MiniMax-H3 这类全模态生成模型,一项新评测考察其物理世界推理能力,在 517 个评测实例中整体成功率为 41.97%。其中基于视频的决策推理成功率最高,为 56.00%,基于音频的消歧推理最弱,仅 27.40%。评测设计了隐式提示配多帧、音频-图像、前缀视频和音视频四类任务,要求模型跨模态整合互补信息以推断潜在事件状态与未来动态。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
IEEE 已公开 2026 年 ICRA 的主旨演讲、全体会议、行业主题演讲、奖项演讲、教程及六场专题讨论的视频录像。本届 ICRA 于 6 月 1 日至 5 日在维也纳举行,全体演讲嘉宾包括 Ken Goldberg、Barbara Mazzolai 和 Roland Siegwart。
亮源新创过去一个多月连续发布LightParkour、LightNav-0和Light REACT三项技术,分别面向复杂接触技能扩展、通用导航和全身韧性控制。
World in World 是一种免训练的推理时接口,让冻结的自回归视频世界模型支持灵活的相机与时间控制。它把源视频观测、目标视角场景投影、几何渲染和缓存外已生成状态等异构证据转为带相机与时间标签的干净视觉状态,通过原生自注意力读取,并用对应路由器和 EWA 逐通道调节注意力。同一冻结骨干可支持相机控制重渲染、长时程回访和人体动作迁移。
Hugging Face 论文页介绍 Recursive Code World Models(RCWM),一种从单张参考图像以可执行代码递归重建复杂 3D 世界的框架。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R,已被 ECCV 2026 接收。
脸谱心智于 2026 年 6 月发布技术报告《Looped World Models》(arXiv: 2606.18208),提出 LoopWM,称其为首个将循环 Transformer 架构用于世界建模的方法,论文登上 Hugging Face Papers 当日 Top 1。
PlannerForge 是一个 LLM-agent 框架,把自动驾驶场景测试的场景生成、检索、修改、ADS 执行与结果分析统一到同一流程,并新增 ADS Enhancement 与 ADS Benchmarking 两个阶段。
推荐理由:论文把场景生成到评估串成统一 LLM-agent 流程,并给出开源模型与商业 API 的对比数据。
Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。
推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。
Hugging Face 上线论文页面 SAEScientist-Bench,提出用基准测试检验 AI 智能体能否自主完成 SAE 可解释性研究。该页面目前仅开放论文讨论,未披露任务设置、评测指标或实验结果等具体信息。
Hugging Face 上线论文页《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,探讨在策略修正对较弱模型的提升作用。论文指出,在模仿学习失效的场景下,该方法能帮助弱模型追赶。
DianShi-RxnDB 是一个大规模、细粒度的有机反应数据平台,通过全自动流水线构建,面向研究者与 AI Agent。该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 上线论文页《Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents》,提出用于审计 AI 研究智能体的 Discovery Certification Protocol,主张仅凭分数不足以证明发现。
澳大利亚昆士兰大学 Biorobotics Lab 研发出半机械蟑螂“Paraborg”,在约 40 克重的巨型穴居蟑螂(Macropanesthia rhinoceros)触角和尾须植入电极,用游戏手柄无线操控其左右转向、前进或停止,并可搭载无线摄像头或弹簧驱动的注射器。
光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,让受控世界模型只在训练阶段比较三版动作提案的后果并反馈给策略,训练完成后退出部署链路。
NASA 计划在 2026 年底的 IM-3 发射中把三台小型月球车送上月球,执行 CADRE 任务,它们将在约两周内自主组队测绘地形,自行推选领导者、分配任务,并在某台电量不足时重新规划。
德州农工大学团队研发的 1.8 米宽、150 公斤充气机器人 RoboBall III,通过内部摆锤移动重心滚动前进,仅用两个执行器,可翻越障碍并爬上 20 度斜坡。该机器人设想由月球车运至陨石坑边缘后自主下探,并用小型火箭将地质样本射回坑外,相关设计与德州采石场测试结果已发表于 IEEE Transactions on Field Robotics。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
ICRA 一场名为“Surviving the Paper Deluge”的圆桌讨论聚焦机器人论文激增问题,Aude Billard 指出 IEEE RAS 主要会议论文量自 2017 年前后呈指数增长,2025 年含“robotics”一词的论文估计约 7 万篇。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。
推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
一项发表于 Science Robotics 的研究让 50 人与商用人形机器人 Pepper 对话并共同决策,发现机器人出错会损害信任和影响力,无论它是否有表情动作。当富有表现力的 Pepper 打断对话或给出不合逻辑建议时,参与者催产素水平反而升高,且升得越高越不信任机器人、越少采纳其建议。脑成像显示,此时背外侧前额叶与内侧前额叶活动增强并协同更紧密,这一协同预测了催产素上升。