Hugging Face 发布 MolmoAct2 基线微调模型 molmoact2_insert_gear_in_gripper_base_fft
Hugging Face 上发布 fanqi-robo/molmoact2_insert_gear_in_gripper_base_fft,对 allenai/MolmoAct2 在 50 集双臂 YAM 插齿轮数据集上做全组件微调,global batch 32、20k 步、seed 1000,发布 step 20000 检查点。
Hugging Face 上发布 fanqi-robo/molmoact2_insert_gear_in_gripper_base_fft,对 allenai/MolmoAct2 在 50 集双臂 YAM 插齿轮数据集上做全组件微调,global batch 32、20k 步、seed 1000,发布 step 20000 检查点。
fanqi-robo 在 Hugging Face 发布 π0.5 微调检查点 pi05_insert_gear_in_gripper_b0,基于 lerobot/pi05_base 在 50 集双臂 YAM 插齿轮数据集上全量微调,训练 20k 步、全局 batch 32、lr 2.5e-5,采用 QUANTILES 归一化与绝对关节、3 路相机、无图像增强。
Hugging Face 上发布 fanqi-robo/molmoact2_insert_gear_in_gripper_yam_fft,基于 allenai/MolmoAct2-BimanualYAM 检查点在双臂 YAM 数据上做全参数微调。
Hugging Face 上 fanqi-robo 发布 π0.5 微调消融实验 insert_gear_in_gripper 的 expert_only 变体。
基于 lerobot/smolvla_base 微调的 SmolVLA 策略 mongster7/smolvla_dice_50k 在 LeKiwi 移动机械臂上完成"把红色骰子放进篮子"任务。
EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。
推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。
alexhegit 在 Hugging Face 发布 SO-101 Lab01 抓放任务的 ACT 策略检查点,基于 yaw-aware agent v4 数据集训练,仅使用 15 维 observation.state 中的前 6 维关节位置。
Hugging Face Hub 上线 klinzw/pi05_autolife_fridge,这是基于 Physical Intelligence π₀.₅、用 LeRobot 0.6.0 微调并推送的视觉语言动作策略,机器人本体为 autolife_s1,执行“open fridge”和“close fridge”任务。
Hugging Face 上发布 bk912/dp_green_cube_to_box_finetune_20k,这是一个用 LeRobot 0.6.2 训练的扩散策略(Diffusion Policy),在 so_follower 机器人上执行“从蓝色平台拿起绿色方块放入盒子”任务。
9月26日,杭州美梦空间在第五届全球数字贸易博览会上发布Physical-WAM物理-世界动作模型与RoboTwin-Phys物理漂移评测基准。Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,在感知输入与动作输出之间插入物理Token表征,用于估计摩擦、重量、重心、接触状态等物理信息并预判动作后果。
成立三个月的Simate发布首版通用物理快系统Simate-beta,据公司披露以平均Score 33.95、SR 27.96%登顶更新于2026年9月23日的RoboDojo榜单,该成绩属榜单评测,真机表现另行展示。
诺因(Knowin)9月24日发布面向通用具身智能的生成式学习架构 GLOW 技术报告,称人类演示一次后机器人即可跨物体、跨环境、跨任务复用,在开盒收纳、浇水、擦桌、调酒等任务中得到验证。
Hugging Face 上发布 turbovla_so101_bowls 策略,基于 LeRobot 0.6.1 训练,用于 SO-101 的 so_follower 本体,输入前顶与腕部两路 640×480 相机图像和 6 维状态,输出 6 维动作。
灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
Hugging Face 上出现 quangnd58/evo1-so101-multitask,这是基于 OpenGVLab/InternVL3-1B 视觉语言主干、在 hungho77/so101-multitask 数据集上训练的 Evo-1 第二阶段检查点,用于 SO-101 机械臂的 3 项任务。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
Google DeepMind 公布 Gemini 4 Argon,称其为下一代前沿智能。同期发布 Gemini 3.8 Live 与 Live Avatar、Gemini 3.8 Flash 及 3.8 Flash Cyber、Gemini 3.8 文本转语音,以及 AlphaGenome Atlas 和 WeatherNext 3 全球天气 AI 模型。
北美具身初创 Skild AI 发布机器人基础模型 S1,主打上下文学习,无需后训练或微调,只看一段人类示范视频即可完成煎饼、冲泡咖啡、给植物换盆、设备组装等长程任务,上下文学习任务长度最长 10 分钟。
推荐理由:Skild AI 的 S1 把机器人上下文学习拉到 10 分钟长程任务,并给出与语言提示 VLA 的成功率对比数据。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
原力灵机DM0.5在RoboDojo具身评测中以综合得分24.90、平均成功率19.34%登顶,Memory维度得分47.74,Cover Blocks任务三次随机测试成功率均为100%。
推荐理由:原力灵机DM0.5登顶RoboDojo并开源权重与训练框架,读者可了解其数据、架构与推理加速的具体做法。
生数科技创始人朱军在 WRC 2026 分论坛发布团队最新研究成果,提出通用世界模型五级发展路线,从 L1 世界生成、L2 与世界交互、L3 在世界中行动,到 L4 自主世界智能体与 L5 世界组织者。
Generalist AI 发布机器人基础模型 GEN-1.5,主打 One-shot Learning,机器人看完 3-12 秒动作示范后无需梯度更新或微调即可执行新任务,还能把两段演示拼接成连续任务。
推荐理由:GEN-1.5 把动作示范当作上下文提示,读者可据此了解机器人基础模型在少样本学习上的新路径。
墨奇智能在 WRC 2026 首次公开自研具身模型架构 MoRA 与轮式机器人本体 MORPHI KINO,现场用 15 分钟连续完成清理桌面、检查冰箱库存并补货、洗烘与叠放衣物等家居长程任务,全程无需人工指挥。
量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。
墨奇智能(MORPHI)在 WRC 2026 首次国内亮相,发布具身智能模型架构 MoRA 并推出适配家庭长程任务的 MORPHI KINO 轮式机器人。现场机器人全自主完成 15 分钟跨区域家务演示,串联客厅清洁、冰箱补货、衣物洗烘折叠等多步骤任务。
具身智能初创公司共生知行8月17日发布双足人形机器人驾驶卡丁车Demo,机器人在封闭赛道完成双手转向与脚部油门、刹车协调控制。公司将其定位为全身智能压力测试,探索从视觉感知到全身动作输出的端到端基座模型路线,后续将通过技术报告披露模型架构与评测方式。
Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
IEEE Spectrum 的 Video Friday 合集展示了多款机器人视频:Google DeepMind 的 Gemini Robotics 2 作为智能层实现全身控制、灵巧操作与多机器人协作;Hello Robot 推出可在家中安全导航的单臂三轮机器人 Stretch 4.0;南加州大学与 NASA 等合作训练机器狗用于火星、月球等行星探索。
DeepMind 发布 Gemini Robotics ER 2 具身推理模型,作为机器人的高层大脑负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可据此判断高层推理模型与底层 VLA 的分工方式。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。