跳到正文

全部动态

今日 62 条
7月8日周三
  1. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。

  2. HF blog67

    Image2Sim:用生成式神经模拟器扩展具身导航

    Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。

    推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。

  3. HF blog39

    PointDiT:面向单目几何估计的像素空间扩散模型

    PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。

  4. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

7月7日周二
  1. IEEE Spectrum robotics40

    受大脑启发的图像传感器:可感光、可记忆、可渐忘

    俄勒冈州立大学团队研发出一种受大脑启发的光电晶体管图像传感器,能同时感光并存储数据,还可通过电压调节记忆时长,实现从快速遗忘到保留数小时的渐变遗忘。该器件为4×4像素阵列,采用IGZO晶体管与有机光活性层,可在传感器上直接完成变化检测,有望大幅降低机器视觉的能耗。目前仅完成器件级验证,下一步将扩展像素阵列并开发集成成像原型。

  2. HF blog62

    GaP:面向变异性自动化任务的图即策略多智能体自学习框架

    GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。

    推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。

  3. HF blog62

    SVA:将树搜索蒸馏为动作评估以增强冻结 VLA 模型

    论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。

    推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。

7月6日周一
  1. ROS Discourse latest12

    GSSI 研究团队就机器人系统中行为树的适应需求发起问卷调查

    意大利 Gran Sasso Science Institute(GSSI)的研究人员发起一项关于机器人系统适应需求的问卷调查,聚焦使用行为树(Behavior Trees)的机器人系统。问卷旨在回答两个问题:不同适应需求在机器人系统中的相关性,以及各类行为树适应方法应对这些需求的适用性。问卷约需 20 分钟完成,参与者可获取机器人适应需求、行为树当前局限及相关研究的概览。

7月5日周日
  1. qbitai78

    英伟达 GEAR 联合李飞飞团队发布 Real2Sim 系统 SimFoundry

    英伟达 GEAR 联合李飞飞团队、佐治亚理工大学等机构发布 Real2Sim 系统 SimFoundry,只需一段真实世界 RGB 视频即可自动生成可交互、可训练、可评测的机器人仿真环境。

    推荐理由:英伟达 GEAR 与李飞飞团队等提出 Real2Sim 系统,用一段视频自动扩展仿真训练数据,读者可了解其闭环思路与实验结论。

  2. qbitai71

    纽约大学联合LeCun团队提出AdaJEPA,让世界模型学会持续学习

    纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。

7月3日周五
7月1日周三
  1. qbitai58

    群核科技三篇论文入选 ECCV 2026,联合英伟达等提出物理AI仿真平台 SPEAR

    群核科技三篇论文入选 ECCV 2026,涵盖空间感知与推理、强化学习数据生成、高保真物理仿真。其中联合 Adobe、NVIDIA、Apple、Intel 等提出的 SPEAR 仿真平台开放超 14000 个原生 Python 接口,可输出深度图、表面法线、实例分割等物理属性数据,并接入 InteriorAgent、InteriorGS 等结构化三维数据集。

6月17日周三
  1. Robohub66

    MIT 与宾大提出 MIGHTY 轨迹规划系统,让无人机实时避障并保持平滑航线

    MIT 与宾夕法尼亚大学的研究者提出开源轨迹规划系统 MIGHTY,让无人机在毫秒级响应障碍的同时保持平滑航线并缩短飞行时间。该系统用 Hermite 样条把飞行时间与路径放在一步内联合优化,并借助激光雷达地图迭代细化初始轨迹,仅靠机载计算与传感器即可实时飞行。

6月15日周一
6月8日周一
6月3日周三
  1. NVIDIA blog robotics74

    NVIDIA Research 在 CVPR 发布 GraspGen-X、LCDrive 与 NitroGen 三项研究

    NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。

    推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。

5月28日周四
5月27日周三
  1. Robohub60

    康奈尔大学研发软体夹爪,靠触觉判断草莓成熟度并轻柔采摘

    康奈尔大学研究团队用可拉伸光纤传感器制作软体机器人夹爪,通过触觉预测草莓成熟度,并轻柔地将果实从藤蔓上旋拧摘下而不造成损伤。夹爪装有两种光纤传感器,分别测量手指弯曲度和指尖压力,据此估计物体形状并调整抓握力度;腕部还加入行星齿轮机构,使夹爪旋转拧下果实而非拉扯。

5月18日周一
4月20日周一
  1. BAIR62

    GRASP:面向世界模型长时程规划的梯度规划器

    BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。

    推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。

12月13日周六
11月5日周三
11月1日周六
9月26日周五