bk912/dp_green_cube_to_box_finetune_20k:基于 LeRobot 的扩散策略模型
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
Hugging Face 上线数据集 jayantrathi/lang_grasp_v1,由 LeRobot 生成,采用 v3.0 数据格式,含 91 条 episode、44598 帧、3 个任务,机器人类型为 so_follower。数据以 30 fps 采集,动作与状态均为 6 维关节位置(含 gripper.pos),并配 480×640 前置视频,训练集划分为 0:91。
Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。
Hugging Face 上线数据集 macmacmacmac/Sev-behavioral-research-v1,以请求起始顺序记录 HTTP 事务,时间用相对毫秒、字节数为 JSON 体积,资源 ID 一致化别名,正文仅保留选择、版本、错误与重试提示,隐去密钥和内容。
Hugging Face 上 hanxunh/VEX-Bench 数据集页面当前显示为占位内容,正文由大量重复的占位标记与气候、金融、健康等主题的 JSON 文件名组成,未提供可用的数据集说明。页面标注为“article invalid or not complied”,无法确认该数据集的真实内容与用途。
Hugging Face 上线数据集 wcxhimself/KIVI-Generated-Videos,页面仅标注其属于 Datasets 类别,未披露视频数量、生成模型、分辨率或授权等具体信息。该数据集以开源开放科学为背景发布。
Hugging Face 上线数据集 Aaaay-0610/so101-task-1,由 LeRobot 生成,采用 codebase_version v3.0,含 75 条 episode、35614 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 izlley/h101_multi_v1,由 LeRobot 生成,含 100 条 episode、49490 帧、3 个任务,机器人类型为 bi_so_follower。数据以 30 fps 记录 12 维双臂关节与夹爪动作及状态,并含左腕、头部、右腕三路 480×640 AV1 视频。
Hugging Face 上线 LeRobot 数据集 zhniu/lerobot_zihao_dataset_a_20260927_202323,含 40 个 episode、12000 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上发布 Taisanson/welding-seam-following 焊缝跟踪数据集,由 LeRobot 构建,采用 v3.0 数据格式,共 40 条 episode、33560 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 Fabyo04/so101_cube_demo_0_20260926_155239,由 LeRobot 生成,机器人类型为 so_follower,共 100 条 episode、44553 帧、1 项任务,采用 v3.0 代码库、30 fps。
FINGR 发布面向真实魔方操作的灵巧手演示数据集,包含 36 条遥操作序列、576 次转面和 25,520 帧 10 Hz 数据,采集自 xArm7 与 Sharpa Wave 手。数据以 LeRobot v3 格式提供关节状态与指令、五指触觉力和视频、魔方几何跟踪及转面标注,论文用其中 435 次转面(18,113 帧)做动作训练、24,943 帧做未来预测。
推荐理由:数据集给出了遥操作序列、触觉力与转面标注的完整字段,可了解灵巧手魔方操作的数据组织方式。
Hugging Face 上线机器人数据集 rbalazs/LeftCupFinal,包含 67 条 LeRobot 格式演示,任务为“拿起左边的杯子并放下”,由 SO-101 本体以 30 fps、双摄像头 640×480 采集,共 23260 帧、约 422 MB。
Hugging Face 上出现一个用 LeRobot 创建、代号 my_pick_test_color 的机器人抓取数据集,采用 v3.0 代码库版本,共 30 条 episode、6750 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 mim-chess-vlas 数据集,基于 LeRobot v3.0 构建,含 787 段、195184 帧 Panda 机器人仿真演示,覆盖 40 项任务,20 fps,状态为 9 维、动作为 7 维,含 agentview 与两路 eye-in-hand 相机视频。
Hugging Face Datasets 页面更新了一批数据集,小米 MiMo-V2.6-RL-oss 以 7.78k 下载量、47.8k 点赞居前,espnet/yodas3 约 2 小时前更新。
Hugging Face 上线数据集 mim-chess-vlas/train_800_complex__mask__blackout__sim__all_cameras__live__depth,含 790 条 Franka Panda 仿真演示、共 157,904 帧,任务是把被两条扁平弧形臂夹住的圆球放入盒子。
Hugging Face 上线数据集 bklassen3434/pick_pen_cotrain_v1,由 LeRobot 创建,采用 v3.0 代码库版本,含 260 个 episode、75763 帧、2 个任务,机器人类型为 so_follower。
Hugging Face 上线 Tenry55/Pick_and_put_screw_driver_Merged_200 数据集,由 LeRobot 生成,含 200 条 episode、119103 帧、1 项任务,机器人类型为 so_follower。
Hugging Face 上线 leoliu49/grasp_p2h1 数据集,基于 LeRobot 构建,采用 v3.0 代码库版本,机器人类型为 so_follower,共 35 条 episode、8400 帧、1 个任务,30 fps,训练集划分为 0:35。
Hugging Face 用户 Tenry55 发布机器人数据集 Pick_and_put_screw_driver_with_variance,任务为把红色螺丝刀放进灰色袋子。
纽伦堡工业大学 AIR Lab 在 Hugging Face 发布 tactic_usbc 数据集,包含 Franka Panda 完成“拾起 USB 并插入桌面中部端口”任务的 103 条示范,30 fps、6 路 224×224 摄像头。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
Hugging Face 上发布 turbovla_so101_bowls 策略,基于 LeRobot 0.6.1 训练,用于 SO-101 的 so_follower 本体,输入前顶与腕部两路 640×480 相机图像和 6 维状态,输出 6 维动作。
理想在 Hugging Face 发布 ME-U0 预训练权重,用于下游机器人策略后训练,采用 Apache 2.0 许可。页面给出 hf download 命令与 ME_U0_PRETRAINED_PTH 环境变量设置,并指向后训练说明;RoboDojo 评测需使用 ME-U0-RoboDojo。
推荐理由:读者可据此了解 ME-U0 预训练权重的下载方式、下游策略后训练用途与 Apache 2.0 许可。
社区独立项目 CPM-jev 发布 v0.1-research-preview,这是基于 openbmb/MiniCPM5-2B-Base 的 LoRA 微调模型,新增决策头为候选动作打分并归一化为概率分布。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
Qyvos 是基于 SupersonicLabs/Julia-1 仅微调决策头得到的决策/分类模型,在 ZefanCai/Open-Jev 数据集上训练,支持 choice、score、noul 三类决策。模型冻结 ModernBERT-small 编码器与动作头,仅训练 3,699,073 个参数(占 2.56%),在 3.9 GB 内存约束下完成 3,750 步训练。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。
推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
PlannerForge 是一个 LLM-agent 框架,把自动驾驶场景测试的场景生成、检索、修改、ADS 执行与结果分析统一到同一流程,并新增 ADS Enhancement 与 ADS Benchmarking 两个阶段。
推荐理由:论文把场景生成到评估串成统一 LLM-agent 流程,并给出开源模型与商业 API 的对比数据。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
Hugging Face 上出现 quangnd58/evo1-so101-multitask,这是基于 OpenGVLab/InternVL3-1B 视觉语言主干、在 hungho77/so101-multitask 数据集上训练的 Evo-1 第二阶段检查点,用于 SO-101 机械臂的 3 项任务。
Hugging Face 上线论文页《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,探讨在策略修正对较弱模型的提升作用。论文指出,在模仿学习失效的场景下,该方法能帮助弱模型追赶。