Skild AI 发布 S1 机器人基础模型,单段视频即可学习新任务
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
Maven Robotics 完成 1 亿美元融资,投资方包括 RoboStrategy、LocalGlobe、Vine Ventures 和 XTX Ventures,并计划生产 250 台第三代机器人、启动第四代平台设计。
9月10日,阿里巴巴集团旗下高德发布3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的一体化全尺寸AI生成,覆盖超过196个国家和地区。模型输入一张卫星图像或一段文字描述,可在消费级GPU上用10分钟生成公里级3DGS城市场景,效率比传统模式提升1000倍。体验官网已上线,相关能力已应用于飞行街景2.0,用户可操控摇杆漫游3D场景。
大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R,已被 ECCV 2026 接收。
安努智能一周内发布六款模型,包括实时长视频生成模型Helios、软物体仿真平台SimLab、世界模型ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5和端到端部署系统Nexus,覆盖数据生成、认知理解、训练进化、动作执行到端到端部署环节。
脸谱心智于 2026 年 6 月发布技术报告《Looped World Models》(arXiv: 2606.18208),提出 LoopWM,称其为首个将循环 Transformer 架构用于世界建模的方法,论文登上 Hugging Face Papers 当日 Top 1。
京东在JDD大会上发布实时可交互世界模型JoyAI-Echo WM,在WBench Navigation评测中以81.6分排名第一。京东云已与摩尔线程等打造国产万卡集群并规划建设十万卡集群,同时推进1000万小时具身数据采集,首批开源数据集EgoLive已对外开放。京东还启动物理AI加速计划,计划5年内采购300万台机器人、100万台无人车及10万架无人机。
Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。
推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。
汉朔科技与X-Era Lab(拓元智慧)合作,将具身智能机器人带入真实零售门店,聚焦巡检、盘点、补货三类任务,汉朔巡检机器人已在国内和海外商场开始POC测试。汉朔已在近7万家门店部署电子价签网络,为机器人提供货架语义坐标;X-Era Lab的原生世界动作模型VWA仅用10亿参数,可在32 TOPS算力硬件上端侧部署,推理时延压缩至毫秒级。
Scalabot 发布首个世界模型 HERON-World Model,输入当前画面和待执行动作即可预测后续画面,并支持多智能体动作配合与相互影响的预测。
9月3日,宜宾国际会展中心举办“江源杯”2026具身智能场景技能挑战赛,55支机器人团队围绕产线搬运、零件分拣装配、厂区巡检、配送、衣物整理、饮品制作、应急救援等真实任务展开实机比拼,130余支团队报名。
IEEE Spectrum 记者在加州帕洛阿尔托试乘 Rivian R1S 的 Autonomy+ 系统,该系统属 SAE L2+,需驾驶员全程关注,计划今年年底前后随全新 R2 SUV 首发,并以 OTA 推送给最新 R1S 和 R1T,订阅价每月 49.99 美元或一次性 2500 美元。
GOSIM Shenzhen 2026 将于 10 月 16–17 日在深圳南山伊敦酒店举办,这是该开源技术大会首次来到深圳,汇聚 150+ 国际讲师和 2000+ 全球开发者。
智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判能力,打通图像、视频、3D、动作等模态。该模型首次参评具身智能仿真评测平台RoboColiseum,在扰动适应(Robustness)子榜以平均分0.692登顶榜首。
国内创业公司可可矩阵(COCO Matrix)正把In-Context Learning做成具身智能的底层范式,思路是将后训练的ICL前置到预训练阶段。创始人高宇翔称核心团队到齐后不到一个月即拿到验证技术方案可行性的核心证据,其条件表征模型已在八九类视觉任务上验证,动作头压到约60M参数效果依然可用。
飞渡科技自研空间智能“峥嵘大模型”获HICOOL 2026全球创业者峰会大赛一等奖,该模型为国内首个通过国家备案的工业级空间智能大模型。其洪涝推演链路支持动态边界控制与真实世界1:1验证,大范围流域全域洪涝推演耗时从以天为单位压缩到分钟级,暴雨洪涝仿真系统准备周期从数月压缩到数日、成本降至原有方法的10%。天马科创投合伙人Bill Reichert赛后邀请飞渡明年赴硅谷参加全球投资人峰会路演。
澳大利亚昆士兰大学 Biorobotics Lab 研发出半机械蟑螂“Paraborg”,在约 40 克重的巨型穴居蟑螂(Macropanesthia rhinoceros)触角和尾须植入电极,用游戏手柄无线操控其左右转向、前进或停止,并可搭载无线摄像头或弹簧驱动的注射器。
据知情人士透露,出隐身不足三个月的遥操作数据采集初创公司 XDOF 正进行后期谈判,拟由 8VC 领投 B 轮,估值约 12 亿美元。该公司由 UC Berkeley 研究者 Philipp Wu 和 Fred Shentu 于 2024 年创立,年化营收接近 5000 万美元,此前 6 月刚完成 7000 万美元 A 轮。
NASA 计划在 2026 年底的 IM-3 发射中把三台小型月球车送上月球,执行 CADRE 任务,它们将在约两周内自主组队测绘地形,自行推选领导者、分配任务,并在某台电量不足时重新规划。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
World Labs于9月2日发布多模态世界模型Atlas,可将文字、图像、视频和3D信息放入统一空间上下文,实现三维场景重建与新视角生成。国内团队影溯早在今年3月已开源具备类似能力的InSpatio-World,其升级版本即将发布并继续开源。
影眸 Hyper3D 发布世界生成模型 WorldGen,上传一张场景图后约 2 到 3 分钟可生成完整 3D 场景,场景内每件资产可单独移动、替换,并保留空间与物理关系。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
自变量发布全新灵巧操作系统 TwinDEX,在后训练阶段真机遥操数据为 0 的情况下,用几百条无本体数据完成化学实验场景中的旋拧瓶盖、注射器推注等精细操作。该系统由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程组成,采用三指九自由度和数采与执行同构设计,官方称单位时间有效轨迹约为传统真机遥操的 5.3 倍。
TechCrunch Disrupt 2026 新增 Real World AI Stage,聚焦数字与物理世界交汇,阵容包括 Nvidia 物理 AI 负责人 Les Karpas、Shield AI CTO Nate Michael、Colossal Biosciences CEO Ben Lamm、FieldAI 创始人 Ali Agha 等。
蚂蚁灵波 CEO 朱兴、首席科学家沈宇军、首席数据科学家黄用韬将于 9 月 11 日下午在 2026 Inclusion·外滩大会首次同台,围绕「基座之上:具身智能的场景突围与协同进化」讨论模型、数据与产业落地。多位具身智能青年科学家及百亿级具身企业掌门人也将到场,共同拆解具身智能从“能跑通”走向“真落地”的关键问题。
前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。
智平方(AI² Robotics)的 AlphaBot 2(爱宝)机器人已入驻香港兰桂坊酒吧,提供打鸡尾酒与互动服务,成为香港首个在真实开放场景上岗的服务机器人。该机器人搭载类脑架构具身大模型 NeuroVLA,实验数据显示可将运动抖动降低 75% 以上,碰撞后 20 毫秒内完成反射响应,功耗约 0.4 瓦。智平方称此次落地跑通了从硬件出关、清关合规到取得香港本地饮品售卖资质的出海全链路闭环。
李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。
推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
Google DeepMind 集中列出其模型阵容,包括新一代前沿智能 Gemini、实时音频模型 Gemini Audio、视频生成模型 Veo、图像生成与编辑模型 Nano Banana。
Google DeepMind 公布 Gemini 4 Argon,称其为下一代前沿智能。同期发布 Gemini 3.8 Live 与 Live Avatar、Gemini 3.8 Flash 及 3.8 Flash Cyber、Gemini 3.8 文本转语音,以及 AlphaGenome Atlas 和 WeatherNext 3 全球天气 AI 模型。
成立仅三个月的灵犀智涌在第二届世界人形机器人运动会工业场景装配上料岗赛项中以160分跻身全国三强,成为该赛项除行业头部企业外唯一获奖的机器人公司,参赛机由Demo级本体组装而成。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
TechCrunch 报道称,中国多家车企正追随特斯拉押注人形机器人。小鹏机器人部门本周融资超 9 亿美元,投后估值超 63 亿美元,由 IDG 资本领投,腾讯、阿里等参投,公司称这是中国具身智能行业最大单轮私募融资。奇瑞旗下 AiMOGA 据报已启动 IPO 准备,比亚迪发布人形机器人“小迪”,长安、广汽、理想、上汽、赛力斯等也在研发人形机器人。