清华、无问芯穹等开源具身智能体基础设施 RPent
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。
推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。
推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。
社区独立项目 CPM-jev 发布 v0.1-research-preview,这是基于 openbmb/MiniCPM5-2B-Base 的 LoRA 微调模型,新增决策头为候选动作打分并归一化为概率分布。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
DeformSmith 是一个从文本或单张图像自动生成可交互、物理可信可形变资产的框架,通过分层智能体构建与共享物理约束工具,逐步构建、测试并细化几何、物理模型、材质行为和机器人交互,直至资产可用于仿真与操作。
论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。
推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。
Qyvos 是基于 SupersonicLabs/Julia-1 仅微调决策头得到的决策/分类模型,在 ZefanCai/Open-Jev 数据集上训练,支持 choice、score、noul 三类决策。模型冻结 ModernBERT-small 编码器与动作头,仅训练 3,699,073 个参数(占 2.56%),在 3.9 GB 内存约束下完成 3,750 步训练。
PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等团队发布技术报告 JEPA-Anything,提出面向不同领域学习预测模型的跨领域框架,各领域保留自己的观测形式与编码器,共享预测核心和统一的 latent world-state interface。
百度智能云已为超过50家重点具身企业提供全栈AI云技术支撑,其百舸平台将SONIC模型训练配方集成上云后可一键扩展至128卡训练规模,WAM模型推理延迟降至优化前的四分之一。在东莞,由百度智能云承建运营的具身智能训练场规划13个真实产业场景、配置50台套异构本体,已服务35家具身智能企业。IDC报告显示百度智能云以29.55%市场份额位居中国具身智能云市场第一。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。
推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。
英伟达 Inception 全球物理 AI 负责人 Les Karpas 将在 TechCrunch Disrupt 2026 的 Real World AI Stage 发表演讲,主题为机器人为何仍在等待自己的 ChatGPT 时刻、障碍何在。
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
智象未来(HiDream.ai)发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本、图片、视频等多模态输入,可一键直出 5–20 秒 1080p 视频。
首届蚂蚁灵波具身大模型挑战赛在外滩大会启动,由蚂蚁灵波、魔搭社区和阿里云天池共同发起,以 2026 年 7 月开源的 LingBot-VLA 2.0 预训练模型为技术基座,面向全球开发者开放。大赛报名及线上初赛持续至 10 月 26 日,初赛设必做的 RoboTwin 2.0 仿真任务和可选真机创新任务,入围团队将于 11 月 13 日至 15 日在上海参加线下真机黑客马拉松。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
深度机智于 2026 年 9 月 9 日发布物理基座模型 PhysBrain 1.5,8B 版本在 28 项公开基准上取得 72.5 综合均分,位列参评开源模型首位,与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距在 1 分以内。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
Mecka AI 正以约 5 亿美元估值完成红杉资本领投的新一轮融资,交易条款尚未最终确定。这家 2024 年成立的初创公司通过体感传感器和智能手机付费采集人们做咖啡、修车等日常任务的"自我中心"运动数据,用于训练人形机器人等机器人模型。此前三个月,它刚完成由 Framework Ventures 领投的 6000 万美元融资,并预计 2026 年底年化收入达 1 亿美元。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
Mbodi 联合创始人 Xavier Chi 在 TechCrunch 播客 Build Mode 中介绍,其 AI 软件让人用自然语言教工业机器人新技能,并与 ABB Robotics 合作进入工厂和仓库。他透露 Mbodi 在八小时测试中达到 99.6% 成功率,并认为机器人不会出现单一的 ChatGPT 式突破,可靠性才是进入生产的关键。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
Maven Robotics 完成 1 亿美元融资,投资方包括 RoboStrategy、LocalGlobe、Vine Ventures 和 XTX Ventures,并计划生产 250 台第三代机器人、启动第四代平台设计。
9月10日,阿里巴巴集团旗下高德发布3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的一体化全尺寸AI生成,覆盖超过196个国家和地区。模型输入一张卫星图像或一段文字描述,可在消费级GPU上用10分钟生成公里级3DGS城市场景,效率比传统模式提升1000倍。体验官网已上线,相关能力已应用于飞行街景2.0,用户可操控摇杆漫游3D场景。
大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R,已被 ECCV 2026 接收。
蚂蚁灵波发布LingBot-World 2.0轻量版,参数规模1.3B,面向消费级单卡GPU设计,可在本地实现实时世界生成。该版本延续7月开源的14B主模型路线,先训练Causal World因果预训练底座,再经一致性蒸馏与DMD蒸馏压缩去噪步数,并让Student在自身长时self-rollout轨迹上训练以减少累计漂移。
安努智能一周内发布六款模型,包括实时长视频生成模型Helios、软物体仿真平台SimLab、世界模型ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5和端到端部署系统Nexus,覆盖数据生成、认知理解、训练进化、动作执行到端到端部署环节。
脸谱心智于 2026 年 6 月发布技术报告《Looped World Models》(arXiv: 2606.18208),提出 LoopWM,称其为首个将循环 Transformer 架构用于世界建模的方法,论文登上 Hugging Face Papers 当日 Top 1。
PlannerForge 是一个 LLM-agent 框架,把自动驾驶场景测试的场景生成、检索、修改、ADS 执行与结果分析统一到同一流程,并新增 ADS Enhancement 与 ADS Benchmarking 两个阶段。
推荐理由:论文把场景生成到评估串成统一 LLM-agent 流程,并给出开源模型与商业 API 的对比数据。
京东在JDD大会上发布实时可交互世界模型JoyAI-Echo WM,在WBench Navigation评测中以81.6分排名第一。京东云已与摩尔线程等打造国产万卡集群并规划建设十万卡集群,同时推进1000万小时具身数据采集,首批开源数据集EgoLive已对外开放。京东还启动物理AI加速计划,计划5年内采购300万台机器人、100万台无人车及10万架无人机。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
Hugging Face 上出现 quangnd58/evo1-so101-multitask,这是基于 OpenGVLab/InternVL3-1B 视觉语言主干、在 hungho77/so101-multitask 数据集上训练的 Evo-1 第二阶段检查点,用于 SO-101 机械臂的 3 项任务。
Hugging Face 上线论文页《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,探讨在策略修正对较弱模型的提升作用。论文指出,在模仿学习失效的场景下,该方法能帮助弱模型追赶。
DianShi-RxnDB 是一个大规模、细粒度的有机反应数据平台,通过全自动流水线构建,面向研究者与 AI Agent。该论文页面已在 Hugging Face 上线并开放讨论。
Scalabot 发布首个世界模型 HERON-World Model,输入当前画面和待执行动作即可预测后续画面,并支持多智能体动作配合与相互影响的预测。
9月3日,宜宾国际会展中心举办“江源杯”2026具身智能场景技能挑战赛,55支机器人团队围绕产线搬运、零件分拣装配、厂区巡检、配送、衣物整理、饮品制作、应急救援等真实任务展开实机比拼,130余支团队报名。
IEEE Spectrum 记者在加州帕洛阿尔托试乘 Rivian R1S 的 Autonomy+ 系统,该系统属 SAE L2+,需驾驶员全程关注,计划今年年底前后随全新 R2 SUV 首发,并以 OTA 推送给最新 R1S 和 R1T,订阅价每月 49.99 美元或一次性 2500 美元。
智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判能力,打通图像、视频、3D、动作等模态。该模型首次参评具身智能仿真评测平台RoboColiseum,在扰动适应(Robustness)子榜以平均分0.692登顶榜首。
国内创业公司可可矩阵(COCO Matrix)正把In-Context Learning做成具身智能的底层范式,思路是将后训练的ICL前置到预训练阶段。创始人高宇翔称核心团队到齐后不到一个月即拿到验证技术方案可行性的核心证据,其条件表征模型已在八九类视觉任务上验证,动作头压到约60M参数效果依然可用。