跳到正文

全部动态

今日 9 条
7月21日周二
  1. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。

  2. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月20日周一
  1. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。

7月18日周六
  1. genesis releases22

    Genesis v1.2.3 发布:新增椭圆摩擦锥高阻抗静态摩擦模型

    Genesis 发布 v1.2.3,新增带高阻抗选项的椭圆摩擦锥,用于高保真静态摩擦建模,并改进 fp32 精度下约束求解器的收敛性。该版本还支持批量渲染器中的异构实体、射线传感器仅距离模式,并修复 USD、MJCF 解析及质量矩阵等问题,非批量 CPU 仿真提速最高 30%。

7月16日周四
  1. NVIDIA blog robotics78

    NVIDIA 推出 Jetson T3000 与 T2000 模块,扩展边缘 AI 机器人平台

    NVIDIA 推出基于 Thor 架构的 Jetson T3000 与 IGX T3000 模块,提供 865 FP4 teraflops 算力,体积和功耗约为 T5000 的一半,并推出 400 FP4 teraflops、16GB 内存的 Jetson T2000。

    推荐理由:原文给出两款 Thor 模块的算力、内存与上市节奏,读者可据此判断边缘端机器人算力选型与迁移路径。

  2. NVIDIA dev blog robotics34

    NVIDIA 用 AI 智能体加速开发轻量级 USD 运行时

    NVIDIA 提出用 AI 智能体加速开发轻量级 OpenUSD 运行时。OpenUSD 是面向物理 AI 的开放可扩展框架,提供通用场景描述语言,可将 CAD 数据、仿真资产和真实遥测数据整合到统一的物理精确视图中。此前构建 USD 实现通常需要改造大型现有代码库,即便团队只需特定内存占用。

7月12日周日
7月11日周六
  1. genesis releases38

    Genesis v1.2.2 发布:新增高吞吐触觉传感器系列,非凸碰撞检测更稳健

    Genesis 发布 v1.2.2,新增面向强化学习灵巧策略训练的高吞吐真实触觉传感器系列,并支持迟滞、失效触觉单元、探针增益等噪声选项。非凸碰撞检测鲁棒性提升,性能与凸分解相当,修复了虚假深层接触与薄壳穿透问题;启用 noslip 后处理对所有后端的减速降至 20% 以内。

7月10日周五
  1. HF blog60

    AlayaWorld:长时程可交互视频世界生成框架开源

    AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。

    推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。

  2. HF blog71

    RynnWorld-Teleop:面向数字遥操作的动作条件世界模型

    论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。

    推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。

  3. HF blog71

    RynnWorld-4D:面向机器人操作的 4D 具身世界模型

    RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。

    推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。

7月8日周三
  1. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。

  2. HF blog67

    Image2Sim:用生成式神经模拟器扩展具身导航

    Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。

    推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。

  3. HF blog39

    PointDiT:面向单目几何估计的像素空间扩散模型

    PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。

  4. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

  5. NVIDIA dev blog robotics58

    NVIDIA Isaac GR00T 如何端到端开发人形机器人策略

    NVIDIA 发布文章介绍如何用 Isaac GR00T 端到端开发人形机器人策略。文章指出,随着团队从人形机器人整机调试转向特定任务技能开发,对可重复开发工作流的需求正在增长,而当前开发流程仍高度碎片化,开发者需要花大量时间配置机器人基础设施,之后才能专注于构建机器人能力。

7月7日周二
  1. HF blog62

    GaP:面向变异性自动化任务的图即策略多智能体自学习框架

    GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。

    推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。

  2. HF blog62

    SVA:将树搜索蒸馏为动作评估以增强冻结 VLA 模型

    论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。

    推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。

  3. NVIDIA blog robotics80

    NVIDIA 与 Hugging Face 将 Isaac GR00T 1.7 和 Isaac Teleop 引入 LeRobot

    NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。

    推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。

  4. HF blog88

    LeRobot v0.6.0 发布:世界模型策略、新 VLA 与奖励模型 API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。

7月3日周五
  1. genesis releases22

    Genesis v1.1.1 发布:提升刚体碰撞检测鲁棒性

    Genesis 发布 v1.1.1,主要提升凸与非凸几何体刚体碰撞检测的鲁棒性,关闭凸分解以获得更高保真度不再被视为实验性功能。该版本修复了 GPU 仿真非确定性问题、凹几何体非凸碰撞检测,并改进基于扰动的多接触凸-凸碰撞检测。此外还去重 GLB 共享材质纹理、跳过彩色分割图灰度转换,并支持向 RigidSolver.set_base_links_ 传入切片环境掩码。

7月2日周四
7月1日周三
  1. BAIR12

    BAIR 2026 届博士毕业生展示:机器人、LLM 与 AI 安全研究方向

    伯克利人工智能研究实验室(BAIR)展示 2026 届博士毕业生,研究方向覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗。毕业生将赴高校教职、博士后、产业研究实验室及自创初创公司,部分人仍在探索下一步。

6月30日周二
6月29日周一
6月24日周三
6月22日周一
  1. NVIDIA dev blog robotics42

    NVIDIA Halos for Robotics:面向物理 AI 的全栈功能安全系统

    NVIDIA 推出 Halos for Robotics 全栈功能安全系统,面向在工厂、仓库、医院和家庭中与人自主共处的物理 AI 机器人。该系统针对机器人走出围栏、环境愈发非结构化后传统安全方案失效的问题,以 AI 驱动的安全为核心。NVIDIA 称这是物理 AI 到来过程中的一个重要里程碑。

6月19日周五
6月18日周四
6月17日周三
  1. IsaacLab releases62

    Isaac Lab 3.0 Beta 2 发布,强化多后端物理与 Newton 支持

    Isaac Lab 3.0 Beta 2 发布,作为 3.0 beta 的稳定化版本,兼容 Isaac Sim 6.0.0,扩展了 Newton 支持(VBD、求解器耦合、Kamino、崎岖地形、传感器)与多后端物理,并简化训练和安装命令。

    推荐理由:Isaac Lab 3.0 Beta 2 汇总了多后端物理、Newton 与无 Kit 工作流的改动,可据此判断升级与迁移成本。