光象科技与清华发布物理原生世界模型 Phi-WM 1.0 ActEffect
光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,让受控世界模型只在训练阶段比较三版动作提案的后果并反馈给策略,训练完成后退出部署链路。
光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,让受控世界模型只在训练阶段比较三版动作提案的后果并反馈给策略,训练完成后退出部署链路。
据知情人士透露,出隐身不足三个月的遥操作数据采集初创公司 XDOF 正进行后期谈判,拟由 8VC 领投 B 轮,估值约 12 亿美元。该公司由 UC Berkeley 研究者 Philipp Wu 和 Fred Shentu 于 2024 年创立,年化营收接近 5000 万美元,此前 6 月刚完成 7000 万美元 A 轮。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
World Labs于9月2日发布多模态世界模型Atlas,可将文字、图像、视频和3D信息放入统一空间上下文,实现三维场景重建与新视角生成。国内团队影溯早在今年3月已开源具备类似能力的InSpatio-World,其升级版本即将发布并继续开源。
嬴彻科技宣布其卡车自动驾驶商业运营里程突破10亿公里,称在中国卡车智驾市场份额超90%,高速网络覆盖率达97%。公司同时提出原生于货运场景的货运物理AI技术底座,包含货运原生智能、场景智能与运营智能三部分,其中货运世界模型以真实货运数据重建车辆与交通参与者交互,ROSL场景库已积累几十万个高价值场景。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
自变量发布全新灵巧操作系统 TwinDEX,在后训练阶段真机遥操数据为 0 的情况下,用几百条无本体数据完成化学实验场景中的旋拧瓶盖、注射器推注等精细操作。该系统由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程组成,采用三指九自由度和数采与执行同构设计,官方称单位时间有效轨迹约为传统真机遥操的 5.3 倍。
Hugging Face 上线数据集 trinity-graphics/truncgradgs,页面仅附 Hugging Face 推进开源与开放科学的使命宣言,未披露数据规模、模态、许可或使用方式等细节。
旧金山 Periodic Labs 与剑桥 Quantum Formatics 正用 AI 和机器人寻找转变温度高于 10 K 的超导材料。Periodic Labs 已开发 AI 驱动的机械臂系统,每天可测试 1000 个候选超导体,目前每天进行 100 次实验,并计划开设第二实验室将通量提升至每天 1000 次。
蚂蚁灵波 CEO 朱兴、首席科学家沈宇军、首席数据科学家黄用韬将于 9 月 11 日下午在 2026 Inclusion·外滩大会首次同台,围绕「基座之上:具身智能的场景突围与协同进化」讨论模型、数据与产业落地。多位具身智能青年科学家及百亿级具身企业掌门人也将到场,共同拆解具身智能从“能跑通”走向“真落地”的关键问题。
ICRA 一场名为“Surviving the Paper Deluge”的圆桌讨论聚焦机器人论文激增问题,Aude Billard 指出 IEEE RAS 主要会议论文量自 2017 年前后呈指数增长,2025 年含“robotics”一词的论文估计约 7 万篇。
前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。
李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。
推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。
推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
成立仅三个月的灵犀智涌在第二届世界人形机器人运动会工业场景装配上料岗赛项中以160分跻身全国三强,成为该赛项除行业头部企业外唯一获奖的机器人公司,参赛机由Demo级本体组装而成。
论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。
推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。
PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。
推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。
论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。
推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。
印度CSIR中央机械工程研究所团队在IEEE Sensors Journal发表研究,用6个可拉伸压阻传感器贴附于衣物髋、膝、踝处,配合微控制器上的机器学习算法,对12名受试者平地行走、上下坡和上下楼梯动作分类准确率达99.83%,未穿戴过该系统的新用户准确率为89%。整套传感层功耗仅0.318毫瓦,传感器可承受超过12000次拉伸至原长三倍的循环,目前仍为仅能分类动作的原型。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
Hugging Face 论文页介绍 Self-OPD,一种面向流匹配模型的在线策略蒸馏方法,其特点是不依赖教师模型。该页面目前仅开放论文讨论,未给出模型版本、任务、成功率或实验数据等细节。
Microduck 是一款 25 厘米、780 克的机器人,内置 15 个自由度、前视摄像头、8x8 激光雷达、两个 IMU、麦克风、扬声器、NFC、Wi-Fi 和蓝牙,出厂即可行走、坐下、蹲下、滑旱冰、用关节喙拾取物体并自行从跌倒中恢复。它支持手柄操控、外接配件与 NFC 标签物体,可运行自主行为,也能多台组队竞速和踢足球,软件完全开源。目前已开启预售,售价 399 美元,圣诞节前发货。
Anthropic 发布模型硬件标准 MHS,把不同厂商硬件的控制方式转译成 Agent 可发现、可读取、可调用的一致接口,被称作物理世界的 MCP。接入后 Claude 可直接控制 Hugging Face LeRobot 生态中的低成本 SO-ARM101 机械臂,自行测量工作区、完成校准,再通过 MHS 调用底层控制器执行动作,无需提前训练策略或遥操作。
一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。
量子位刊载的触觉传感技术路线分析首篇认为,视触觉传感器(VBTS)底层仍依赖小体积CMOS摄像头模组成像,算法多复用ResNet/CNN、U-Net、光流法等视觉工具,硬件门槛低、同质化严重,难以形成技术护城河。
8月28日,阿里巴巴集团旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧局部画面即可实时重建上万帧3D场景,在KITTI、Oxford Spires、VBR等评测中取得最低误差的SOTA。
TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。
推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。
推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。
UrbanGround 是一个基于香港全域三维地理数据构建的真实尺度城市副本沙盒,用于测试多模态大语言模型智能体能否在闭环第一人称视角下完成可靠导航与空间推理。
推荐理由:UrbanGround 用香港全域三维数据搭建可闭环交互的城市沙盒,读者可了解 MLLM 智能体在长程城市导航中的能力边界。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
Hugging Face 论文页收录《What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents》,从 ACE 视角审视 LLM 智能体的数据生成问题。该页面目前仅开放论文讨论,未给出具体方法、数据规模或实验结果。
Hugging Face 上线数据集 jeffreylin1222/SDGBiasBench,页面仅附 Hugging Face 推进开源开放科学的使命说明,未给出该数据集的规模、任务或评测指标等信息。