CrossBFM:跨人形本体蒸馏共享潜行为空间
CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。
推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。
CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。
推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。
Hugging Face 上的 hotchpotch/s1mb-result 数据集收录 System One Mosaic Benchmark(S1MB)的模型评测结果,整合 Choice、Noul 和 Score 三类专项任务。
Hugging Face 论文 OmniTaskonomy 研究视觉生成监督何时能提升视觉理解,发现采用正确训练配方时,图生图(I2I)训练可提升下游图生文(I2T)性能,且 I2I 训练数据越多增益越大。
Hugging Face 论文页发布 VideoPhysEdit,一种无需训练的物理反事实视频编辑(PCVE)流程,通过刚体物理场景重建显式还原场景物理,将物理编辑作为干预并利用生成轨迹引导反事实视频生成。
Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。
Hugging Face 上线 SO-101 SimStudio Lab01 抓放数据集 v4(alexhegit/so101-simstudio-lab01-pnp-agent-yaw-v4),共 140 个 episode、67235 帧,20 fps、3 路 640×480 相机,状态为 15 维位置+速度+末端 XYZ。
Hugging Face 上线数据集 ssmit203/assignment3_7,由 LeRobot 生成,机器人类型为 so101_follower,代码库版本 v2.1。该数据集含 30 条 episode、2058 帧、1 个任务,30 fps,动作与状态均为 6 维(肩部旋转/抬升、肘部、腕部弯曲/旋转、夹爪),另含 480×640 前置视频。
Hugging Face 上线 nakanakagawa/sponge_task_9_29_v4 数据集,由 LeRobot 生成,机器人类型为 so_follower,共 8 条 episode、3192 帧、1 个任务,帧率 20 fps,采用 codebase_version v3.0。
Hugging Face 上线数据集 jetsonmom/omx_yellow_bear_box_2cam,由 LeRobot 生成,机器人类型为 omx_follower,含 20 条 episode、7043 帧、40 段视频,30 fps,动作与状态均为 6 自由度。
Hugging Face 上线 so-arm101-stack-green 数据集,由 LeRobot 生成,采用 codebase_version v3.0,机器人类型为 so_follower。数据集含 40 条 episode、32712 帧、1 个任务,30 fps,记录 6 自由度关节位置与前置、腕部两路 480×640 视频,全部划为训练集。
Hugging Face 上线 nakanakagawa/sponge_task_9_29 数据集,由 LeRobot 生成,采用 v3.0 代码库版本,机器人类型为 so_follower。数据集含 4 条 episode、1596 帧、1 个任务,20 FPS,动作与状态均为 6 维关节位置,配 cam_0、cam_1 两路 480×640 视频。
Hugging Face 上线数据集 DanielJeongsooLee/seal-5comp-d9-20260923,样本含 sample_id、topology_hash、group_hash 等 64 位字符串字段,以及 duty、gamma、efficiency 等浮点列。
ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。
Hugging Face 上线数据集 Sterzhang/video2skill-bench,页面仅保留“以开源和开放科学推进 AI 民主化”的使命说明,未披露数据规模、任务类型或评测指标等细节。
EPFL 与 NYU 团队在 npj Robotics 发表 ScaFi(Scalable Fish)机器鱼,采用刚性前段加玻纤杆柔性尾部、单电机拉动交叉肌腱产生 S 形摆动,仅需改变尾部杆径即可缩放尺寸。
Hugging Face 上线数据集 jayantrathi/lang_grasp_v1,由 LeRobot 生成,采用 v3.0 数据格式,含 91 条 episode、44598 帧、3 个任务,机器人类型为 so_follower。数据以 30 fps 采集,动作与状态均为 6 维关节位置(含 gripper.pos),并配 480×640 前置视频,训练集划分为 0:91。
Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。
Hugging Face 上线数据集 macmacmacmac/Sev-behavioral-research-v1,以请求起始顺序记录 HTTP 事务,时间用相对毫秒、字节数为 JSON 体积,资源 ID 一致化别名,正文仅保留选择、版本、错误与重试提示,隐去密钥和内容。
Hugging Face 上 hanxunh/VEX-Bench 数据集页面当前显示为占位内容,正文由大量重复的占位标记与气候、金融、健康等主题的 JSON 文件名组成,未提供可用的数据集说明。页面标注为“article invalid or not complied”,无法确认该数据集的真实内容与用途。
Hugging Face 上线数据集 wcxhimself/KIVI-Generated-Videos,页面仅标注其属于 Datasets 类别,未披露视频数量、生成模型、分辨率或授权等具体信息。该数据集以开源开放科学为背景发布。
Hugging Face 上线数据集 Aaaay-0610/so101-task-1,由 LeRobot 生成,采用 codebase_version v3.0,含 75 条 episode、35614 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 izlley/h101_multi_v1,由 LeRobot 生成,含 100 条 episode、49490 帧、3 个任务,机器人类型为 bi_so_follower。数据以 30 fps 记录 12 维双臂关节与夹爪动作及状态,并含左腕、头部、右腕三路 480×640 AV1 视频。
Hugging Face 上线 LeRobot 数据集 zhniu/lerobot_zihao_dataset_a_20260927_202323,含 40 个 episode、12000 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上发布 Taisanson/welding-seam-following 焊缝跟踪数据集,由 LeRobot 构建,采用 v3.0 数据格式,共 40 条 episode、33560 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 Fabyo04/so101_cube_demo_0_20260926_155239,由 LeRobot 生成,机器人类型为 so_follower,共 100 条 episode、44553 帧、1 项任务,采用 v3.0 代码库、30 fps。
Hugging Face 上出现一个用 LeRobot 创建、代号 my_pick_test_color 的机器人抓取数据集,采用 v3.0 代码库版本,共 30 条 episode、6750 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 mim-chess-vlas 数据集,基于 LeRobot v3.0 构建,含 787 段、195184 帧 Panda 机器人仿真演示,覆盖 40 项任务,20 fps,状态为 9 维、动作为 7 维,含 agentview 与两路 eye-in-hand 相机视频。
Hugging Face 上线数据集 mim-chess-vlas/train_800_complex__mask__blackout__sim__all_cameras__live__depth,含 790 条 Franka Panda 仿真演示、共 157,904 帧,任务是把被两条扁平弧形臂夹住的圆球放入盒子。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
任少卿以通讯作者身份参与论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,第一机构为蔚来,提出一次生成多组配对场景—动作假设、让轨迹与未来场景共同演化的多模式世界—动作联合模型。
亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。
开发者对机器人行为树执行守卫 QERRA-v2 Classical 开展 20 例对抗基准测试,在 Webots 仿真中用 PAL Robotics TIAGo 验证。
第三方公益机构 Robocurve 发布机器人安全基准 RoboHarm,把 GPT-6 Astra、Fable 5.1 和 MolmoAct2 接入同一套双机械臂,测试刺向类人目标、加热压缩气体、制造有毒烟雾等五类物理风险任务,每任务每模型重复 20 次并由人工打分。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
云南大学张文华团队研制出钙钛矿太阳能电池,在模拟水下10米光谱条件下光电转换效率达34.71%,陆地条件下为17.08%。他们将电池封装后集成到水下迷你机器人上,在南海涠洲岛附近测试,10米深处115平方厘米电池两小时发电324毫瓦时,2米处为1416毫瓦时。研究估算电池在25°C水温下可连续运行约5.5年。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等团队发布技术报告 JEPA-Anything,提出面向不同领域学习预测模型的跨领域框架,各领域保留自己的观测形式与编码器,共享预测核心和统一的 latent world-state interface。
针对 MiniMax-H3 这类全模态生成模型,一项新评测考察其物理世界推理能力,在 517 个评测实例中整体成功率为 41.97%。其中基于视频的决策推理成功率最高,为 56.00%,基于音频的消歧推理最弱,仅 27.40%。评测设计了隐式提示配多帧、音频-图像、前缀视频和音视频四类任务,要求模型跨模态整合互补信息以推断潜在事件状态与未来动态。