Mulligan 发布 sim-square-narrow-r03-baseline-idql 基线 IDQL 检查点
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-baseline-idql,为基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,含 policy.pt 和 stats.json。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-baseline-idql,为基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,含 policy.pt 和 stats.json。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-baseline-divl 基线智能体,用于 sim-square-narrow 任务,采用父级冻结扩散 actor 与分布式 DIVL critic,训练步数 150001,含 5 个随机种子检查点。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-baseline-divl,这是一个基于状态的智能体,使用父级冻结扩散 actor 与分布式 DIVL critic,任务为 sim-square-narrow,训练步数 150001。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-baseline-idql 基线检查点,为基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,含 policy.pt 和 stats.json。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-repair-no-r3roll-divl 检查点,基于父代冻结扩散 actor 与分布式 DIVL 评论家,训练步数 150001,含 1-5 共 5 个种子。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-repair-no-r3roll-idql 检查点,为基于状态的 IDQL 智能体,采用扩散 actor 加标量 IQL critic,含 policy.pt 与 stats.json 归一化文件。
Hugging Face 上发布了一个名为 krish5831/act_tissues_into_box 的 ACT 模仿学习策略,用 LeRobot 0.6.2 训练,可让 so_follower 机器人完成“把纸巾包放进盒子”的任务。
Hugging Face 上线扩散策略模型 bk912/dp_green_cube_to_box_clean_20k,用 LeRobot 0.6.2 训练,基于 50 条、38140 帧、30 FPS 的 so_follower 机器人数据,训练 20000 步、批量 32。
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
Hugging Face 上线数据集 jayantrathi/lang_grasp_v1,由 LeRobot 生成,采用 v3.0 数据格式,含 91 条 episode、44598 帧、3 个任务,机器人类型为 so_follower。数据以 30 fps 采集,动作与状态均为 6 维关节位置(含 gripper.pos),并配 480×640 前置视频,训练集划分为 0:91。
Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。
Hugging Face 上线数据集 macmacmacmac/Sev-behavioral-research-v1,以请求起始顺序记录 HTTP 事务,时间用相对毫秒、字节数为 JSON 体积,资源 ID 一致化别名,正文仅保留选择、版本、错误与重试提示,隐去密钥和内容。
Hugging Face 上 hanxunh/VEX-Bench 数据集页面当前显示为占位内容,正文由大量重复的占位标记与气候、金融、健康等主题的 JSON 文件名组成,未提供可用的数据集说明。页面标注为“article invalid or not complied”,无法确认该数据集的真实内容与用途。
Hugging Face 上线数据集 wcxhimself/KIVI-Generated-Videos,页面仅标注其属于 Datasets 类别,未披露视频数量、生成模型、分辨率或授权等具体信息。该数据集以开源开放科学为背景发布。
Hugging Face 上线数据集 Aaaay-0610/so101-task-1,由 LeRobot 生成,采用 codebase_version v3.0,含 75 条 episode、35614 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 izlley/h101_multi_v1,由 LeRobot 生成,含 100 条 episode、49490 帧、3 个任务,机器人类型为 bi_so_follower。数据以 30 fps 记录 12 维双臂关节与夹爪动作及状态,并含左腕、头部、右腕三路 480×640 AV1 视频。
Hugging Face 上线 LeRobot 数据集 zhniu/lerobot_zihao_dataset_a_20260927_202323,含 40 个 episode、12000 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上发布 Taisanson/welding-seam-following 焊缝跟踪数据集,由 LeRobot 构建,采用 v3.0 数据格式,共 40 条 episode、33560 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 Fabyo04/so101_cube_demo_0_20260926_155239,由 LeRobot 生成,机器人类型为 so_follower,共 100 条 episode、44553 帧、1 项任务,采用 v3.0 代码库、30 fps。
Hugging Face 上出现一个用 LeRobot 创建、代号 my_pick_test_color 的机器人抓取数据集,采用 v3.0 代码库版本,共 30 条 episode、6750 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 mim-chess-vlas 数据集,基于 LeRobot v3.0 构建,含 787 段、195184 帧 Panda 机器人仿真演示,覆盖 40 项任务,20 fps,状态为 9 维、动作为 7 维,含 agentview 与两路 eye-in-hand 相机视频。
Hugging Face Datasets 页面更新了一批数据集,小米 MiMo-V2.6-RL-oss 以 7.78k 下载量、47.8k 点赞居前,espnet/yodas3 约 2 小时前更新。
armand0e/MiMo-V2.6-Distill-Qwen-9B-RL 已在 Hugging Face 上线,页面归类于 Models。该条目位于 Hugging Face 的模型、数据集、Spaces 等资源导航中,正文未披露模型参数、训练方法或评测结果等更多细节。
Hugging Face 上线数据集 mim-chess-vlas/train_800_complex__mask__blackout__sim__all_cameras__live__depth,含 790 条 Franka Panda 仿真演示、共 157,904 帧,任务是把被两条扁平弧形臂夹住的圆球放入盒子。
Hugging Face 用户 Tenry55 发布机器人数据集 Pick_and_put_screw_driver_with_variance,任务为把红色螺丝刀放进灰色袋子。
Hugging Face 上线 ai-validation-checklists 数据集,用于 AI 验证清单相关用途。该数据集页面未披露样本规模、字段结构或开放许可等具体信息。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
Hugging Face 上发布 turbovla_so101_bowls 策略,基于 LeRobot 0.6.1 训练,用于 SO-101 的 so_follower 本体,输入前顶与腕部两路 640×480 相机图像和 6 维状态,输出 6 维动作。
小米发布MiMo-V2.6-Pro和Flash,Pro为1.02万亿参数、420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一。
推荐理由:原文披露了MiMo-V2.6的RL训练成本、评测成绩与开源清单,读者可据此了解大规模强化学习训练的工程细节。
社区独立项目 CPM-jev 发布 v0.1-research-preview,这是基于 openbmb/MiniCPM5-2B-Base 的 LoRA 微调模型,新增决策头为候选动作打分并归一化为概率分布。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
Qyvos 是基于 SupersonicLabs/Julia-1 仅微调决策头得到的决策/分类模型,在 ZefanCai/Open-Jev 数据集上训练,支持 choice、score、noul 三类决策。模型冻结 ModernBERT-small 编码器与动作头,仅训练 3,699,073 个参数(占 2.56%),在 3.9 GB 内存约束下完成 3,750 步训练。
深度机智于 2026 年 9 月 9 日发布物理基座模型 PhysBrain 1.5,8B 版本在 28 项公开基准上取得 72.5 综合均分,位列参评开源模型首位,与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距在 1 分以内。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
蚂蚁灵波发布LingBot-World 2.0轻量版,参数规模1.3B,面向消费级单卡GPU设计,可在本地实现实时世界生成。该版本延续7月开源的14B主模型路线,先训练Causal World因果预训练底座,再经一致性蒸馏与DMD蒸馏压缩去噪步数,并让Student在自身长时self-rollout轨迹上训练以减少累计漂移。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。
推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。
Hugging Face 上线论文页面 SAEScientist-Bench,提出用基准测试检验 AI 智能体能否自主完成 SAE 可解释性研究。该页面目前仅开放论文讨论,未披露任务设置、评测指标或实验结果等具体信息。
Hugging Face 上线论文页《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,探讨在策略修正对较弱模型的提升作用。论文指出,在模仿学习失效的场景下,该方法能帮助弱模型追赶。