跳到正文

#论文/研究

今日 59 条
8月31日周一
  1. Robohub38

    研究:人形机器人 Pepper 表现力越强,出错时人越不信任它

    一项发表于 Science Robotics 的研究让 50 人与商用人形机器人 Pepper 对话并共同决策,发现机器人出错会损害信任和影响力,无论它是否有表情动作。当富有表现力的 Pepper 打断对话或给出不合逻辑建议时,参与者催产素水平反而升高,且升得越高越不信任机器人、越少采纳其建议。脑成像显示,此时背外侧前额叶与内侧前额叶活动增强并协同更紧密,这一协同预测了催产素上升。

  2. HF blog71

    VLAct:面向视觉语言动作模型的表征中心持续预训练

    论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。

    推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。

  3. HF blog71

    PonderPounce:用预训练 MLLM 作为机器人控制的回合上下文引擎

    PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。

    推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。

  4. HF blog62

    Code-as-World:用可执行代码表示物理世界,为视觉语言模型提供物理推理监督

    论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。

    推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。

8月30日周日
  1. IEEE Spectrum robotics39

    印度团队研发低功耗可穿戴运动追踪系统,准确率超99%

    印度CSIR中央机械工程研究所团队在IEEE Sensors Journal发表研究,用6个可拉伸压阻传感器贴附于衣物髋、膝、踝处,配合微控制器上的机器学习算法,对12名受试者平地行走、上下坡和上下楼梯动作分类准确率达99.83%,未穿戴过该系统的新用户准确率为89%。整套传感层功耗仅0.318毫瓦,传感器可承受超过12000次拉伸至原长三倍的循环,目前仍为仅能分类动作的原型。

8月29日周六
8月28日周五
  1. HF blog38

    论文:评估许可证意味着什么?Inspect Evals 中声明可复现性的提交绑定普查

    一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。

  2. HF blog62

    TacForcing:用执行时触觉反馈的流式动作生成框架

    TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。

    推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。

  3. HF blog24

    Agentic Game Development 作为可验证轨迹数据引擎:为世界模型扩展提供数据

    论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。

  4. HF blog48

    GameWAM:面向视频游戏的世界动作模型

    Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。

  5. HF blog62

    PAWBench:当前视频生成模型距离概率对齐的世界模型还有多远

    论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。

    推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。

  6. HF blog62

    UrbanGround:基于香港全域三维数据的真实尺度城市智能体导航沙盒

    UrbanGround 是一个基于香港全域三维地理数据构建的真实尺度城市副本沙盒,用于测试多模态大语言模型智能体能否在闭环第一人称视角下完成可靠导航与空间推理。

    推荐理由:UrbanGround 用香港全域三维数据搭建可闭环交互的城市沙盒,读者可了解 MLLM 智能体在长程城市导航中的能力边界。

  7. HF blog71

    Zero-WAM:以人类视频上下文建模世界与动作,实现开放任务泛化

    Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。

    推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。

8月26日周三
  1. DeepMind blog27

    DeepMind 发布《视觉通用智能》白皮书:视觉经验能否通向 AGI

    Google DeepMind 发布白皮书《Visual General Intelligence》,探讨以视觉为中心、从图像、视频和几何等模态的学习中能否涌现出通向 AGI 的智能,并将其称为视觉通用智能(VGI)。白皮书由多位不同机构作者共同撰写,目标不是给出视觉智能的唯一定义,而是厘清 AGI 时代计算机视觉应追求的原则、视觉输入模态、基准、学习范式,以及视觉作为核心与语言等其他模态的关系。

8月25日周二
8月24日周一
8月23日周日
8月22日周六
8月21日周五
  1. HF blog71

    τ_0-VLA:世界模型引导测试时计算的分层机器人基础模型

    τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。

    推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。

  2. HF blog62

    GOAG:面向灵巧操作的生成式物体无关抓取规划器

    GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。

    推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。

8月20日周四
8月19日周三
  1. HF blog78

    NeDM Study 4 数据集发布:宇树 Go2 在 CRM 颗粒地形上的神经降维动力学复现材料

    Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。

    推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。

8月18日周二
  1. Hackaday robots28

    用亥姆霍兹共振腔做推进器:微型机器人与微型飞行器演示

    Junsun Hwang 等人在 Science Advances 论文中演示了用亥姆霍兹共振腔做声学推进:外部声源匹配腔体共振频率时,腔颈会喷出气流产生推力。他们做出三个共振腔驱动的船用于推进和转向,以及置于超声相控阵上方悬停的微型飞行器,后者改用倾斜共振腔驱动螺旋桨,推力不足 1 牛顿,结构需做到微克级,靠高分辨率 3D 打印迭代优化。

8月17日周一
  1. Robohub60

    EPFL 等团队用仿生机器鱼 ZBot 研究间歇游动的能效优势

    EPFL、杜克大学与里斯本高等理工学院联合开发了仿生幼体斑马鱼机器人平台 ZBot,用于对比间歇式滑行游动与连续摆尾游动的能效。ZBot 体长 80 cm、重 2.8 kg,尾部由六个伺服电机驱动,头部集成中央控制器、高精度相机与实时功率计。实验显示间歇游动在所有可达速度下均比连续摆尾省能,但最高速度仅为连续摆尾的约 60%;团队提出执行器效率假说,认为间歇循环让电机更多工作在高效负载区间。

8月11日周二
  1. IEEE Spectrum robotics50

    卡尔斯鲁厄理工学院如何用智能拆解机器人推动循环经济

    德国卡尔斯鲁厄理工学院(KIT)设计出一套机器人拆解系统,可依据破损产品的 CAD 模型预测故障并拆解,同时保护关键零件不受损伤。系统通过数学建模判断零件自由度异常,并在拆解过程中持续校验、必要时改用铣削等方式,还可指定需完整保留的零件。该研究已在 ICRA 2026 发布,团队设想将其扩展为多机械臂协同的自动化拆解工厂。

8月10日周一
8月7日周五
8月6日周四
  1. HF blog71

    Ego2Robot:从第一视角人类视频合成可扩展机器人训练数据

    Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。

    推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。

  2. HF blog62

    BridgeVLA++:面向 3D 操作的数据高效、可泛化、记忆增强 VLA 框架

    BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。

    推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。