Nav2 1.5.0 发布
Nav2 发布 1.5.0 版本,代号 Lyrical,于 2026 年 8 月 4 日推出。这是该版本的首次发布。
Nav2 发布 1.5.0 版本,代号 Lyrical,于 2026 年 8 月 4 日推出。这是该版本的首次发布。
Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 上线论文《Quo Vadis, World Modeling?》的讨论页面,邀请社区就该论文参与讨论。原文未披露论文的具体方法、模型或实验数据。
Hugging Face 上线论文页面 ExplainBench,用于评估智能体生成的代码解释。该页面目前仅开放讨论,正文未披露基准的具体任务、指标或实验结果。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 论文页介绍 OmniPack,一种面向全模态大语言模型的统一 token 压缩方法,目标是提升这类模型的计算效率。页面未给出具体模型版本、压缩率或实验数据,仅提供论文讨论入口。
GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。
推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
Hugging Face 的 LeRobot 发布 v0.6.1,将 lerobot.types 模块更名为 lerobot.lerobot_types,属破坏性变更。
Open Robotics 为 gz-sim 10.5.0 发布做准备,并给出与 10.4.0 的对比。该版本由 Arjo Chakravarty 提交、Shameek Ganguly 共同参与。
DeepMind 发布 Gemini Robotics ER 2 具身推理模型,作为机器人的高层大脑负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可据此判断高层推理模型与底层 VLA 的分工方式。
Genesis 发布 v1.3.1,修复 Nyx 渲染插件对 FEM 实体的支持并为其添加 CI。新刚性求解器选项 contact_resolution 使接触法向力不再受摩擦系数和滑动速度偏置,提供 convex 与 signorini(新默认值)两种模式。查看器插件同时支持对视觉网格进行射线投射。
Hugging Face 上出现模型 imjustheretotest/MasonAI,其基座模型为 crosbylegal/gpt-5.6-luna,训练数据集为 Crownelius/GPT-5.6-Sol-Luna-Terra-Traces。该模型 README 内容为空,上月下载量未被追踪,且暂无 Inference Provider 部署。
Genesis 发布 v1.3.0,可微刚体仿真不再被视为实验性功能,刚体求解器新增扭转摩擦与滚动摩擦,用于缩小仿真到真实的差距。新版本还在 RigidEntity.attach 中加入显式安装变换、为接触传感器加入连杆过滤,并修复了相机视频录制、SPH 流体浮力、场景重置后相机传感器刷新等问题。
推荐理由:Genesis v1.3.0 把可微刚体仿真移出实验状态,并新增扭转与滚动摩擦,读者可据此判断仿真到真实迁移的建模能力变化。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
NVIDIA 提出以 GPU 原生医学物理仿真开发医疗机器人,应对医疗机器人无法依赖互联网规模数据采集和无限真实世界实验的问题。每项示范都需要专用设备、临床专业知识和患者或实验室环境的使用权限,由此带来数据缺口等三大挑战。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
NVIDIA 展示 Jetson 边缘 AI 与机器人平台,Jetson Orin Nano Super 提供 67 TOPS 算力,可本地运行 Reachy Mini 语音视觉助手等首个机器人项目。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
MuJoCo 3.11.0 为 geom 新增 surfacevel 表面速度场与 adhesion 接触粘附力,可用静态 geom 建模传送带、跑步机和转台,粘附接触支持"远距离粘附"以模拟磁铁。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
Hugging Face 论文页发布 LAMAR,一个开源的语言感知多语言对齐重排序器。页面未提供模型规模、训练数据、评测基准或成功率等具体细节,仅开放论文讨论区供交流。
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
Fast DDS 发布 v2.6.12,修复 18 个 CVE,涉及访问控制解析器和反序列化等模块,相关补丁来自私下审查分支、无公开 PR。
NVIDIA 开源 Medical Physics Simulation 框架,作为 Isaac for Healthcare 内的 GPU 加速能力,用于建模解剖结构与器械交互、生成难以采集的场景并训练或评估机器人策略。
推荐理由:原文给出框架的仿真能力、开源入口与并行训练数据,读者可据此判断医疗机器人仿真工作流的复用方式。
Fast DDS 发布 v3.2.5,修复 18 个 CVE,涉及反序列化、访问控制解析器等问题,均通过私下审查分支的压缩提交完成,无公开 PR。该版本还修复了 RTPSParticipantAttributes 内部数据竞争、on_xxx_matched 线程安全、DataWriterImpl qos 访问数据竞争等问题,并移除过期 TCP 通道。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。
ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。
推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。