跳到正文

全部动态

今日 62 条
9月30日周三
  1. HF blog66

    CrossBFM:跨人形本体蒸馏共享潜行为空间

    CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。

    推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。

  2. HF blog38

    LeRF:学习参考坐标系以进行视角采择推理

    Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。

9月29日周二
  1. HF blog58

    ArticuRiddle 数据集发布:100 个外观与关节运动相矛盾的铰接物体

    ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。

9月28日周一
  1. HF blog22

    ngustj/pen_pick_place_clean_150ep_v1:基于 LeRobot 的 150 回合抓笔放置数据集

    Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。

9月27日周日
9月26日周六
9月24日周四
9月23日周三
  1. qbitai74

    刷视频也能教会机器人干活:1200亿tokens人类动作预训练,误差按幂律下降

    亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。

9月22日周二
9月21日周一
  1. HF blog62

    Learning Foresight without Explicit Trajectories for 3D Diffusion Policies 论文发布

    论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。

    推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。

9月20日周日
  1. IEEE Spectrum robotics28

    水下钙钛矿太阳能电池在10米深处实现34.71%光电转换效率

    云南大学张文华团队研制出钙钛矿太阳能电池,在模拟水下10米光谱条件下光电转换效率达34.71%,陆地条件下为17.08%。他们将电池封装后集成到水下迷你机器人上,在南海涠洲岛附近测试,10米深处115平方厘米电池两小时发电324毫瓦时,2米处为1416毫瓦时。研究估算电池在25°C水温下可连续运行约5.5年。

  2. Hackaday robots55

    ETH Zurich 让机器人手用手指行走

    ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。

9月19日周六
9月18日周五
  1. HF blog44

    MiniMax-H3 能否推理物理世界?全模态生成模型评测

    针对 MiniMax-H3 这类全模态生成模型,一项新评测考察其物理世界推理能力,在 517 个评测实例中整体成功率为 41.97%。其中基于视频的决策推理成功率最高,为 56.00%,基于音频的消歧推理最弱,仅 27.40%。评测设计了隐式提示配多帧、音频-图像、前缀视频和音视频四类任务,要求模型跨模态整合互补信息以推断潜在事件状态与未来动态。