跳到正文

#论文/研究

今日 59 条
8月6日周四
  1. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
  1. HF blog71

    MiniWorld:从零训练视频世界模型的可复现框架

    MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。

    推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。

  2. HF blog53

    Push-Wiper:用分段推扫轨迹实现跨污渍与表面的通用机器人清洁

    Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。

  3. HF blog62

    GROVE:从流式视频经验中构建并推理时间分层记忆

    GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。

    推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。

8月4日周二
  1. IEEE Spectrum robotics40

    中国团队研发钙钛矿激光充电接收器,为无人机空中持续供电

    中国民航大学与清华大学团队设计出基于钙钛矿的激光充电接收器,可让无人机在飞行中持续获电。该接收器面积2平方厘米,在5瓦绿光激光照射下实现近39%的光电转换效率,驱动6.7厘米螺旋桨达7820转/分;集成到固定翼模型后,螺旋桨以1200至1450转/分运转约一分钟。研究尚未进行空中飞行测试,团队下一步将开展轻量无人机的飞行验证。

  2. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。

8月3日周一
7月31日周五
  1. Robohub12

    巴塞尔大学团队开发模块化纳米机器人,可靶向癌细胞并重复使用

    瑞士巴塞尔大学 Cornelia Palivan 团队开发出一种模块化纳米机器人,由磁性推进模块与载药胶囊模块经 DNA“魔术贴”自组装连接,可灵活适配不同应用。该纳米机器人携带酶在 HeLa 细胞上原位生成抗癌药物,72 小时内将细胞活力降至 16%;磁性推进模块使其任务完成后可回收并重复使用。

7月29日周三
  1. Robohub41

    一年读完 300 余篇 LfD 论文:人类与 LLM 评估机器人学习示范研究的发现

    一项针对学习示范(LfD)领域为期一年的研究读完 300 余篇论文,发现仅约 20% 可算作高度重要贡献,其余多为对现有方法的渐进改进或新应用领域。研究指出脚本和大语言模型能完成一般性定量评估,却无法判断研究的真正重要性,也识别不出重复已有解决方案的工作或摘要中的夸大表述。作者建议结合人工精读与自动化工具,并让期刊会议评审重新参与论文排序。

  2. BAIR62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。

    推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。

7月28日周二
  1. IEEE Spectrum robotics62

    机器人指尖用彩色机械致变色皮肤实现高分辨率触觉感知

    伦敦玛丽女王大学等欧洲团队研发了一种机器人指尖,其合成皮肤通过布拉格反射器在受力变形时反射不同波长光,由内置摄像头读取颜色变化,生成拓扑、应变和接触压力图。该指尖实现100微米分辨率且无计算延迟,已用于生成人类指尖、硬币和叶片的形貌图。研究者称下一步希望提升对非平面物体的感知能力,并已与潜在应用企业接触。

  2. Robohub32

    UNSW 研发软体机器人心脏模型,可模拟瓣膜反流并测试心脏器械

    悉尼新南威尔士大学(UNSW)研发出全合成软体机器人心脏模型,复现左心内部结构,包含人工瓣膜、乳头肌和腱索,可模拟二尖瓣脱垂与反流等病变。研究发表于 Nature Communications 和 Advanced Science,团队用超声、压力与流量测量验证其行为接近真实心脏,并在该跳动模型内测试了一款软体机器人心脏导管。

  3. HF blog44

    多轮长时程规划的物理学:从预训练到后训练的单教师与多教师在线策略智能体蒸馏

    研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。

  4. HF blog62

    论文提出具身操作数据金字塔,梳理五类数据来源与数据配方

    论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。

    推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。

  5. HF blog43

    机器人学习中的进度奖励建模:一篇综合性综述

    一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。

7月27日周一
7月26日周日
  1. IEEE Spectrum robotics22

    康奈尔 Tech 用光直接翻转 SRAM 存储,为 AI 芯片降低能耗

    康奈尔 Tech 团队提出一种光接收器,用类似二维码的光矩阵产生的光电流直接翻转 SRAM 中的二进制值,省去把光信号转成电信号的高功耗模拟电路。该设计在上月于檀香山举行的 IEEE/JSAP VLSI 技术与电路研讨会上展示,实验室原型目前只能通过金属掩模发出静态 14×14 位矩阵,团队正与光学研究组合作开发每秒可切换数百万次、传输每秒吉比特级的光发射器。

7月24日周五
  1. Robohub36

    巴塞尔大学研发 MIR 微型口腔机器人,简化牙冠预备流程

    巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。

7月23日周四
  1. Robohub46

    利兹大学 1.8 mm 磁控无压生长机器人获 RoboSoft 最佳论文奖

    利兹大学与加州大学圣地亚哥分校合作研发的 1.8 mm 软体生长机器人获 RoboSoft 最佳论文奖,该机器人通过磁控转向、无需内部气压即可生长,并能以最高 500 Hz 实时感知自身形状。其硅胶体内混入磁性颗粒并分区磁化,实现驱动与传感一体化,可同时生长和转向,有望减少微创手术中器械与组织的摩擦。

7月21日周二
  1. HF blog54

    Apple-π 发布以物理定律为锚的视频模型基准

    Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。

  2. HF blog62

    ReflectWorld-MM:面向开放视频流的实体导向多模态记忆系统

    ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。

    推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。

  3. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月20日周一
  1. Robohub82

    交互式世界模拟器:用动作条件视频预测训练与评测机器人策略

    作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。

    推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。

  2. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。