Hugging Face 上 bk912/dp_green_cube_to_box_clean_20k 扩散策略模型发布
Hugging Face 上线扩散策略模型 bk912/dp_green_cube_to_box_clean_20k,用 LeRobot 0.6.2 训练,基于 50 条、38140 帧、30 FPS 的 so_follower 机器人数据,训练 20000 步、批量 32。
Hugging Face 上线扩散策略模型 bk912/dp_green_cube_to_box_clean_20k,用 LeRobot 0.6.2 训练,基于 50 条、38140 帧、30 FPS 的 so_follower 机器人数据,训练 20000 步、批量 32。
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
Hugging Face 上线数据集 jayantrathi/lang_grasp_v1,由 LeRobot 生成,采用 v3.0 数据格式,含 91 条 episode、44598 帧、3 个任务,机器人类型为 so_follower。数据以 30 fps 采集,动作与状态均为 6 维关节位置(含 gripper.pos),并配 480×640 前置视频,训练集划分为 0:91。
Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。
Hugging Face 上发布 Taisanson/welding-seam-following 焊缝跟踪数据集,由 LeRobot 构建,采用 v3.0 数据格式,共 40 条 episode、33560 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 mim-chess-vlas 数据集,基于 LeRobot v3.0 构建,含 787 段、195184 帧 Panda 机器人仿真演示,覆盖 40 项任务,20 fps,状态为 9 维、动作为 7 维,含 agentview 与两路 eye-in-hand 相机视频。
Hugging Face 上线数据集 mim-chess-vlas/train_800_complex__mask__blackout__sim__all_cameras__live__depth,含 790 条 Franka Panda 仿真演示、共 157,904 帧,任务是把被两条扁平弧形臂夹住的圆球放入盒子。
Google 旗下 AI 机器人团队 Intrinsic 宣布将平台部分能力开源,推出 Intrinsic Core,一套兼容 ROS 的机器人应用开发能力集。
Hugging Face 用户 Tenry55 发布机器人数据集 Pick_and_put_screw_driver_with_variance,任务为把红色螺丝刀放进灰色袋子。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
IROS 2026 将于 9 月 27 日至 10 月 1 日在美国匹兹堡举行,议程包括全体会议、主旨演讲、研讨会、教程、论坛、竞赛和一场辩论。主旨演讲于 9 月 28 至 30 日进行,涵盖自主手术、软体机器人、灾害机器人、操作系统的前沿押注以及具身智能的 AlphaGo 与 ChatGPT 时刻等主题。
灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
IEEE 已公开 2026 年 ICRA 的主旨演讲、全体会议、行业主题演讲、奖项演讲、教程及六场专题讨论的视频录像。本届 ICRA 于 6 月 1 日至 5 日在维也纳举行,全体演讲嘉宾包括 Ken Goldberg、Barbara Mazzolai 和 Roland Siegwart。
Agility Robotics 发布人形机器人 Digit 5,可举起 23 公斤至 2.1 米高度,每天可运行超过 20 小时,并能在人员靠近时自主放下负载、停止或坐下,从而无需物理隔离即可与人近距离作业。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
汉朔科技与X-Era Lab(拓元智慧)合作,将具身智能机器人带入真实零售门店,聚焦巡检、盘点、补货三类任务,汉朔巡检机器人已在国内和海外商场开始POC测试。汉朔已在近7万家门店部署电子价签网络,为机器人提供货架语义坐标;X-Era Lab的原生世界动作模型VWA仅用10亿参数,可在32 TOPS算力硬件上端侧部署,推理时延压缩至毫秒级。
澳大利亚昆士兰大学 Biorobotics Lab 研发出半机械蟑螂“Paraborg”,在约 40 克重的巨型穴居蟑螂(Macropanesthia rhinoceros)触角和尾须植入电极,用游戏手柄无线操控其左右转向、前进或停止,并可搭载无线摄像头或弹簧驱动的注射器。
光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,让受控世界模型只在训练阶段比较三版动作提案的后果并反馈给策略,训练完成后退出部署链路。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
自变量发布全新灵巧操作系统 TwinDEX,在后训练阶段真机遥操数据为 0 的情况下,用几百条无本体数据完成化学实验场景中的旋拧瓶盖、注射器推注等精细操作。该系统由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程组成,采用三指九自由度和数采与执行同构设计,官方称单位时间有效轨迹约为传统真机遥操的 5.3 倍。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。
推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。
TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。
推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
8月22日世界人形机器人运动会开幕式上,银河通用机器人参加机器人网球比赛,与网坛运动员同台竞技并由中央广播电视总台全球直播,完成正手、反手、发球、接发、底线调动、网前截击等动作,并在双打中与人类队友实时协作。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
清华在读博士秦深涛创办的 OriginFlow(渊澈太初)提出 NeuroScale 技术体系,以非侵入式神经肌电为信号入口,融合第一视角视觉与 IMU,通过 PULSE 基座模型重建姿态、接触力与驱动力,并整理为可学习的 Human Tokens。
τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。
推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。
GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。
推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。
CoToGrasp 是一个以特定接触拓扑为条件生成多样稳定抓取的生成框架,采用与物体无关、以夹爪为中心的工作空间实现零样本泛化。该方法完全在物体无关的方式下训练,通过特征化规范工作空间将局部物体特征投影到统一的夹爪中心域,解耦语义功能意图与物体几何。
墨奇智能在 WRC 2026 首次公开自研具身模型架构 MoRA 与轮式机器人本体 MORPHI KINO,现场用 15 分钟连续完成清理桌面、检查冰箱库存并补货、洗烘与叠放衣物等家居长程任务,全程无需人工指挥。
星尘智能在 WRC 首次亮相最新一代绳驱人形机器人 T1,起价 8.99 万元,并展示基座模型 Lumo-2、操作系统星尘 AOS 与绳驱本体三层全栈能力。团队一次性公开 22 项家庭任务真机测试,称 Lumo-2 在时序推理、物理理解、高精度、长时序与灵巧操作方面超过 Pi 0.5、FAST-WAM 等模型。
源络科技与国家级科研实验室联合研发的人形机器人Monte2已进入该实验室,可自主完成试剂取放、配置、分液、细胞毒性检测等流程,并协同多台实验设备运行。该机器人此前已在华大制造投入使用,实验室计划到2027年底将机器人数量扩展至约百台规模,并通过AI统一调度机器人集群。源络科技同时发起「原点计划」,寻找首批100位合作伙伴,共同验证具身智能在生物医药、材料科学、化学分析等领域的应用。
IEEE 总统奖学金今年授予三名高中生:Hollie Tang 凭 Tonguage 舌控人机界面获 1 万美元,该系统用普通摄像头追踪舌头与眨眼,可操控电脑和轮椅。