leapshared 发布 Redox_130epi_new_20260928_145214 机器人数据集
Hugging Face 上线 leapshared 的 Redox_130epi_new_20260928_145214 数据集,由 LeRobot 生成,采用 v3.0 代码库,含 131 条 episode、154675 帧、1 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线 leapshared 的 Redox_130epi_new_20260928_145214 数据集,由 LeRobot 生成,采用 v3.0 代码库,含 131 条 episode、154675 帧、1 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线 TheBobTheBlob/so101_pickplace_v1 数据集,由 LeRobot 生成,面向 so101_follower 机器人,含 30 条 episode、12029 帧、1 个任务、60 段视频,30 fps,动作与状态均为 6 维关节位置。
Hugging Face 上发布 fanqi-robo/molmoact2_insert_gear_in_gripper_base_fft,对 allenai/MolmoAct2 在 50 集双臂 YAM 插齿轮数据集上做全组件微调,global batch 32、20k 步、seed 1000,发布 step 20000 检查点。
Hugging Face 上出现由 LeRobot 生成的 UR5e 螺母装配数据集,含 100 条 episode、24602 帧、1 个任务,机器人类型为 ur5e。数据以 20 fps 采集,动作维度 7、状态维度 9,配两路 84×84 视频,采用绝对动作与 OSC_POS 控制,训练集划分 0:100。
论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。
推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。
Hugging Face 上线 SO-101 SimStudio Lab01 抓放数据集 v4(alexhegit/so101-simstudio-lab01-pnp-agent-yaw-v4),共 140 个 episode、67235 帧,20 fps、3 路 640×480 相机,状态为 15 维位置+速度+末端 XYZ。
Hugging Face Hub 上线 pigProfessional/act_so101_stack_green,这是一个用 LeRobot 0.6.2 训练的 ACT 模仿学习策略,机器人类型为 so_follower,输入 6 维状态与前置、腕部两路 480×640 图像,输出 6 维动作。
ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-repair-no-r3roll-divl 检查点,基于父代冻结扩散 actor 与分布式 DIVL 评论家,训练步数 150001,含 1-5 共 5 个种子。
Hugging Face 上线扩散策略模型 bk912/dp_green_cube_to_box_clean_20k,用 LeRobot 0.6.2 训练,基于 50 条、38140 帧、30 FPS 的 so_follower 机器人数据,训练 20000 步、批量 32。
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
Hugging Face 上线数据集 jayantrathi/lang_grasp_v1,由 LeRobot 生成,采用 v3.0 数据格式,含 91 条 episode、44598 帧、3 个任务,机器人类型为 so_follower。数据以 30 fps 采集,动作与状态均为 6 维关节位置(含 gripper.pos),并配 480×640 前置视频,训练集划分为 0:91。
Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。
Hugging Face 上发布 Taisanson/welding-seam-following 焊缝跟踪数据集,由 LeRobot 构建,采用 v3.0 数据格式,共 40 条 episode、33560 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 mim-chess-vlas 数据集,基于 LeRobot v3.0 构建,含 787 段、195184 帧 Panda 机器人仿真演示,覆盖 40 项任务,20 fps,状态为 9 维、动作为 7 维,含 agentview 与两路 eye-in-hand 相机视频。
Hugging Face 上线数据集 mim-chess-vlas/train_800_complex__mask__blackout__sim__all_cameras__live__depth,含 790 条 Franka Panda 仿真演示、共 157,904 帧,任务是把被两条扁平弧形臂夹住的圆球放入盒子。
Hugging Face 用户 Tenry55 发布机器人数据集 Pick_and_put_screw_driver_with_variance,任务为把红色螺丝刀放进灰色袋子。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。
推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。
TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。
推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。
推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。
GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。
推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。
CoToGrasp 是一个以特定接触拓扑为条件生成多样稳定抓取的生成框架,采用与物体无关、以夹爪为中心的工作空间实现零样本泛化。该方法完全在物体无关的方式下训练,通过特征化规范工作空间将局部物体特征投影到统一的夹爪中心域,解耦语义功能意图与物体几何。
Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。
推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。
BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。
推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。
Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。
推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。