跳到正文

#论文/研究

今日 59 条
7月20日周一
7月18日周六
  1. IEEE Spectrum robotics22

    德州农工博士生 Sarah Downs 为 NASA 机器人开发卫星装配插入算法

    德州农工大学博士生 Sarah Downs 为 NASA 与美国空军合作项目开发了一种不依赖视觉系统的力反馈插入算法,让太空装配卫星的机械臂完成天线插入的“轴孔装配”任务。该机械臂通过夹爪上的力矩传感器感知力反馈,在零重力下完成插入并保持位置,还需计算反向推力以抵消机械臂运动对卫星的反作用力矩。

  2. IEEE Spectrum robotics40

    你会让人形机器人给你做腹腔镜手术吗?UCSD 系统评估人形机器人手术能力

    UC San Diego 提出基于人形机器人的腹腔镜遥操作框架,使用通用器械,通过台架测试、不同手术经验水平的干实验室用户研究以及活体猪实验,量化其技术可行性、任务表现与临床就绪度。研究称这提供了人形机器人手术应用能力与局限的循证评估,并指出临床部署前仍需解决关键技术挑战。

7月17日周五
  1. IEEE Spectrum robotics39

    西北大学 Phantom Twist 旋转无人机借视觉暂留实现近乎隐形

    西北大学在 RSS 2026 展示的 Phantom Twist 单电机旋转无人机,以 15 至 25 赫兹转速利用人眼视觉暂留,飞行时比同尺寸四旋翼难见约 10 倍。其设计经迭代优化器以 LPIPS 为指标生成,最优构型 LPIPS 为 0.0104,人工设计版本约 0.2。该机由 0.8 毫米碳纤维杆连接电机、电池、控制器与配重,目前依靠光学追踪系统控制。

7月16日周四
7月15日周三
7月14日周二
  1. Hackaday robots32

    Electrofluidic Fiber Muscles:用于人形机器人的电液纤维肌肉执行器

    一种名为 Electrofluidic Fiber Muscles 的新型执行器利用电液压力驱动长管中的压力梯度,使肌肉束收缩,可分别连接执行回路的伸肌与屈肌部分,类似生物机械系统。其驱动压力泵可绕纤维本身布置,形成紧凑结构。该执行器距进入爱好者机器人应用可能还需一段时间。

7月13日周一
  1. Robohub62

    MIT 团队研发超声腕带,可实时追踪手部动作并无线控制机械手

    MIT 工程师设计了一款超声腕带,通过对手腕肌肉、肌腱和韧带成像,配合 AI 算法实时翻译出五指和手掌的位置,从而无线控制机械手。研究团队用 8 名不同手型和腕围的志愿者测试,腕带能追踪包括美国手语 26 个字母在内的手势和抓握动作;演示中佩戴者操控机械手弹琴、投桌面篮球,并在屏幕上缩放和移动虚拟物体。

7月10日周五
  1. HF blog60

    AlayaWorld:长时程可交互视频世界生成框架开源

    AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。

    推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。

  2. HF blog71

    RynnWorld-Teleop:面向数字遥操作的动作条件世界模型

    论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。

    推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。

  3. HF blog71

    RynnWorld-4D:面向机器人操作的 4D 具身世界模型

    RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。

    推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。

7月8日周三
  1. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。

  2. HF blog67

    Image2Sim:用生成式神经模拟器扩展具身导航

    Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。

    推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。

  3. HF blog39

    PointDiT:面向单目几何估计的像素空间扩散模型

    PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。

  4. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

7月7日周二
  1. IEEE Spectrum robotics40

    受大脑启发的图像传感器:可感光、可记忆、可渐忘

    俄勒冈州立大学团队研发出一种受大脑启发的光电晶体管图像传感器,能同时感光并存储数据,还可通过电压调节记忆时长,实现从快速遗忘到保留数小时的渐变遗忘。该器件为4×4像素阵列,采用IGZO晶体管与有机光活性层,可在传感器上直接完成变化检测,有望大幅降低机器视觉的能耗。目前仅完成器件级验证,下一步将扩展像素阵列并开发集成成像原型。

  2. HF blog62

    GaP:面向变异性自动化任务的图即策略多智能体自学习框架

    GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。

    推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。

  3. HF blog62

    SVA:将树搜索蒸馏为动作评估以增强冻结 VLA 模型

    论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。

    推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。

7月6日周一
  1. ROS Discourse latest12

    GSSI 研究团队就机器人系统中行为树的适应需求发起问卷调查

    意大利 Gran Sasso Science Institute(GSSI)的研究人员发起一项关于机器人系统适应需求的问卷调查,聚焦使用行为树(Behavior Trees)的机器人系统。问卷旨在回答两个问题:不同适应需求在机器人系统中的相关性,以及各类行为树适应方法应对这些需求的适用性。问卷约需 20 分钟完成,参与者可获取机器人适应需求、行为树当前局限及相关研究的概览。

7月5日周日
  1. qbitai78

    英伟达 GEAR 联合李飞飞团队发布 Real2Sim 系统 SimFoundry

    英伟达 GEAR 联合李飞飞团队、佐治亚理工大学等机构发布 Real2Sim 系统 SimFoundry,只需一段真实世界 RGB 视频即可自动生成可交互、可训练、可评测的机器人仿真环境。

    推荐理由:英伟达 GEAR 与李飞飞团队等提出 Real2Sim 系统,用一段视频自动扩展仿真训练数据,读者可了解其闭环思路与实验结论。

  2. qbitai71

    纽约大学联合LeCun团队提出AdaJEPA,让世界模型学会持续学习

    纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。

7月3日周五
7月1日周三
  1. qbitai58

    群核科技三篇论文入选 ECCV 2026,联合英伟达等提出物理AI仿真平台 SPEAR

    群核科技三篇论文入选 ECCV 2026,涵盖空间感知与推理、强化学习数据生成、高保真物理仿真。其中联合 Adobe、NVIDIA、Apple、Intel 等提出的 SPEAR 仿真平台开放超 14000 个原生 Python 接口,可输出深度图、表面法线、实例分割等物理属性数据,并接入 InteriorAgent、InteriorGS 等结构化三维数据集。

6月17日周三
  1. Robohub66

    MIT 与宾大提出 MIGHTY 轨迹规划系统,让无人机实时避障并保持平滑航线

    MIT 与宾夕法尼亚大学的研究者提出开源轨迹规划系统 MIGHTY,让无人机在毫秒级响应障碍的同时保持平滑航线并缩短飞行时间。该系统用 Hermite 样条把飞行时间与路径放在一步内联合优化,并借助激光雷达地图迭代细化初始轨迹,仅靠机载计算与传感器即可实时飞行。

6月15日周一
6月8日周一
6月3日周三
  1. NVIDIA blog robotics74

    NVIDIA Research 在 CVPR 发布 GraspGen-X、LCDrive 与 NitroGen 三项研究

    NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。

    推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。

5月28日周四
5月27日周三
  1. Robohub60

    康奈尔大学研发软体夹爪,靠触觉判断草莓成熟度并轻柔采摘

    康奈尔大学研究团队用可拉伸光纤传感器制作软体机器人夹爪,通过触觉预测草莓成熟度,并轻柔地将果实从藤蔓上旋拧摘下而不造成损伤。夹爪装有两种光纤传感器,分别测量手指弯曲度和指尖压力,据此估计物体形状并调整抓握力度;腕部还加入行星齿轮机构,使夹爪旋转拧下果实而非拉扯。

5月18日周一
4月20日周一
  1. BAIR62

    GRASP:面向世界模型长时程规划的梯度规划器

    BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。

    推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。

2月11日周三
  1. NVIDIA dev blog robotics62

    R²D²:用 NVIDIA Isaac Lab 扩展多模态机器人学习

    NVIDIA 开发者博客介绍 R²D²,一种借助 NVIDIA Isaac Lab 扩展多模态机器人学习的方法。文章指出真实世界采集数据昂贵、缓慢且危险,难以安全训练高速碰撞或硬件故障等风险场景,且真实数据通常偏向正常条件。原文正文在此处截断,未给出 R²D² 的具体方法、数据规模或实验结果。

    推荐理由:介绍 R²D² 如何借助 Isaac Lab 在仿真中扩展多模态机器人学习,可了解其应对真实数据采集难题的思路。