紫东太初开源 ZDTaichu5.0-9B 多模态模型,九项空间理解基准中八项第一
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
无问芯穹联合清华大学、上海交通大学开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等平台,首发支持 PI 0.5 与 WALL-OSS 两款具身模型。
首届蚂蚁灵波具身大模型挑战赛在外滩大会启动,由蚂蚁灵波、魔搭社区和阿里云天池共同发起,以 2026 年 7 月开源的 LingBot-VLA 2.0 预训练模型为技术基座,面向全球开发者开放。大赛报名及线上初赛持续至 10 月 26 日,初赛设必做的 RoboTwin 2.0 仿真任务和可选真机创新任务,入围团队将于 11 月 13 日至 15 日在上海参加线下真机黑客马拉松。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
全球 Robotaxi 市场预计到 2035 年达 4000 亿美元,超 600 万辆商用车上路,NVIDIA 以训练、仿真验证、车载三计算机架构支撑商业化车队规模化部署。
安努智能一周内发布六款模型,包括实时长视频生成模型Helios、软物体仿真平台SimLab、世界模型ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5和端到端部署系统Nexus,覆盖数据生成、认知理解、训练进化、动作执行到端到端部署环节。
Hugging Face 上出现 quangnd58/evo1-so101-multitask,这是基于 OpenGVLab/InternVL3-1B 视觉语言主干、在 hungho77/so101-multitask 数据集上训练的 Evo-1 第二阶段检查点,用于 SO-101 机械臂的 3 项任务。
国内创业公司可可矩阵(COCO Matrix)正把In-Context Learning做成具身智能的底层范式,思路是将后训练的ICL前置到预训练阶段。创始人高宇翔称核心团队到齐后不到一个月即拿到验证技术方案可行性的核心证据,其条件表征模型已在八九类视觉任务上验证,动作头压到约60M参数效果依然可用。
光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,让受控世界模型只在训练阶段比较三版动作提案的后果并反馈给策略,训练完成后退出部署链路。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
Google DeepMind 公布 Gemini 4 Argon,称其为下一代前沿智能。同期发布 Gemini 3.8 Live 与 Live Avatar、Gemini 3.8 Flash 及 3.8 Flash Cyber、Gemini 3.8 文本转语音,以及 AlphaGenome Atlas 和 WeatherNext 3 全球天气 AI 模型。
论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。
推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。
PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。
推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。
论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。
推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。
《时代》周刊公布 2026 年度全球百名 AI 人物名单,智元机器人创始人、董事长兼 CEO 邓泰华入选“创新者”类别。时代周刊提到,智元去年出货 5100 台机器人,并于今年 4 月推出视觉-语言-动作模型 GO-2,公司称该模型缩小了“语义-执行差距”。邓泰华表示,目标是让机器人技术在制造业、物流业、零售业和酒店业等领域实现可靠、可重复的应用。
TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。
推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。
Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
北美具身初创 Skild AI 发布机器人基础模型 S1,主打上下文学习,无需后训练或微调,只看一段人类示范视频即可完成煎饼、冲泡咖啡、给植物换盆、设备组装等长程任务,上下文学习任务长度最长 10 分钟。
推荐理由:Skild AI 的 S1 把机器人上下文学习拉到 10 分钟长程任务,并给出与语言提示 VLA 的成功率对比数据。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
原力灵机DM0.5在RoboDojo具身评测中以综合得分24.90、平均成功率19.34%登顶,Memory维度得分47.74,Cover Blocks任务三次随机测试成功率均为100%。
推荐理由:原力灵机DM0.5登顶RoboDojo并开源权重与训练框架,读者可了解其数据、架构与推理加速的具体做法。
生数科技创始人朱军在 WRC 2026 分论坛发布团队最新研究成果,提出通用世界模型五级发展路线,从 L1 世界生成、L2 与世界交互、L3 在世界中行动,到 L4 自主世界智能体与 L5 世界组织者。
共生知行正在研发双足人形机器人的端到端感控一体化「大脑」基座模型,其Demo中机器人全自主驾驶卡丁车连续过弯,实现手眼脚同步协同与多接触点平衡力控。团队由96年出生的丁鹏翔带领,核心成员均为00后博士在读,公司成立刚满两个月,押注纯端到端路线取代分层架构。
魔法原子在8月19日至23日的WRC 2026上展示工业制造、物流分拣、公共安全三大场景解决方案,并首发轻工业四足机器狗MagicDog T1。T1整机重约18kg、持续负载最高15kg、最高速度5m/s,可攀爬18cm高度、应对40°坡道,空载续航最长约3小时,已在追觅智能制造工厂开展实际验证。
优必选在2026年WRC上1:1复刻客户工厂产线,用近十台工业人形机器人Cruzr S2和Cruzr Y1连续演示汽车机加件与钣金件上下料、搬运拆码垛和物流小件分拣,定位精度小于1mm,平均抓取节拍最高接近1100件/小时。
Hugging Face 论文页上线 EXIMO,一种用视觉语言模型(VLM)引导 VLA 策略探索的方法。页面目前仅开放论文讨论,未披露模型版本、任务本体、仿真或真机结果等细节。
明略科技与海康机器人联合参展2026世界机器人大会,聚焦商业服务领域展示具身智能落地进展,现场呈现餐饮清洁、工业物流、智能巡逻三大场景方案。轮式人形机器人与轮式双臂机器人协同完成餐桌清理、餐盘回收、地面洗地等全流程服务,并可自主分辨桌面物体、仅移除垃圾而保留手机钥匙等物品。明略科技同步开源人机协作平台Octo,并称其VLA能力栈覆盖多模态感知、任务推理规划到动作决策执行。