TechCrunch Disrupt 2026 新增 Real World AI Stage:Nvidia、机器人与灭绝动物同台
TechCrunch Disrupt 2026 新增 Real World AI Stage,聚焦数字与物理世界交汇,阵容包括 Nvidia 物理 AI 负责人 Les Karpas、Shield AI CTO Nate Michael、Colossal Biosciences CEO Ben Lamm、FieldAI 创始人 Ali Agha 等。
TechCrunch Disrupt 2026 新增 Real World AI Stage,聚焦数字与物理世界交汇,阵容包括 Nvidia 物理 AI 负责人 Les Karpas、Shield AI CTO Nate Michael、Colossal Biosciences CEO Ben Lamm、FieldAI 创始人 Ali Agha 等。
IEEE 将 Canadarm 航天机械臂认定为第 300 个里程碑,6 月 19 日在 MDA Space 总部举行授牌仪式,由 IEEE 多伦多分会提名。该机械臂由 Spar Aerospace 与加拿大国家研究委员会为 NASA 航天飞机研制,1981 年 11 月随哥伦比亚号第二次飞行首次部署,在五架航天飞机和国际空间站上使用了 30 年。
Hugging Face 上线数据集 trinity-graphics/truncgradgs,页面仅附 Hugging Face 推进开源与开放科学的使命宣言,未披露数据规模、模态、许可或使用方式等细节。
旧金山 Periodic Labs 与剑桥 Quantum Formatics 正用 AI 和机器人寻找转变温度高于 10 K 的超导材料。Periodic Labs 已开发 AI 驱动的机械臂系统,每天可测试 1000 个候选超导体,目前每天进行 100 次实验,并计划开设第二实验室将通量提升至每天 1000 次。
蚂蚁灵波 CEO 朱兴、首席科学家沈宇军、首席数据科学家黄用韬将于 9 月 11 日下午在 2026 Inclusion·外滩大会首次同台,围绕「基座之上:具身智能的场景突围与协同进化」讨论模型、数据与产业落地。多位具身智能青年科学家及百亿级具身企业掌门人也将到场,共同拆解具身智能从“能跑通”走向“真落地”的关键问题。
ICRA 一场名为“Surviving the Paper Deluge”的圆桌讨论聚焦机器人论文激增问题,Aude Billard 指出 IEEE RAS 主要会议论文量自 2017 年前后呈指数增长,2025 年含“robotics”一词的论文估计约 7 万篇。
前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。
智平方(AI² Robotics)的 AlphaBot 2(爱宝)机器人已入驻香港兰桂坊酒吧,提供打鸡尾酒与互动服务,成为香港首个在真实开放场景上岗的服务机器人。该机器人搭载类脑架构具身大模型 NeuroVLA,实验数据显示可将运动抖动降低 75% 以上,碰撞后 20 毫秒内完成反射响应,功耗约 0.4 瓦。智平方称此次落地跑通了从硬件出关、清关合规到取得香港本地饮品售卖资质的出海全链路闭环。
李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。
推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。
推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
MoveIt 2 发布 2.5.10 版本,由 rhaschke 于 9 月 1 日打上标签。该版本未在发布说明中列出具体更新内容,仅提供 2 个资源文件供下载。
Waymo 已在丹佛、圣迭戈和坦帕向公众开放 Robotaxi 服务,将商业运营扩展至美国 14 个城市,并采取滚动邀请、逐步放量的方式。其自动驾驶车队规模已超过 4000 辆,包括捷豹 I-Pace 和名为 Ojai 的新款厢式车;在丹佛和圣迭戈,乘客只能乘坐搭载第六代自动驾驶系统的 Ojai,目前该车型约 300 辆。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
Danu Robotics 是一家英国公司,用 AI 驱动机器人改造垃圾分拣与资源回收,业务覆盖 AI/机器学习、机器人、可持续发展和工业自动化领域。公司由 Xiaoyan Ma 创立,目前处于开放运营并正在融资阶段,将参加 TechCrunch Disrupt 2026。
Vitrobot 是一家聚焦工业自动化领域的机器人项目,业务方向涉及机器人与安全合规。公司目前处于开放运营状态并正在融资,创始人为 Enguerand Chretien、Jean-Philippe Winckler 和 Theophile Jouanno。
Google DeepMind 集中列出其模型阵容,包括新一代前沿智能 Gemini、实时音频模型 Gemini Audio、视频生成模型 Veo、图像生成与编辑模型 Nano Banana。
Google DeepMind 公布 Gemini 4 Argon,称其为下一代前沿智能。同期发布 Gemini 3.8 Live 与 Live Avatar、Gemini 3.8 Flash 及 3.8 Flash Cyber、Gemini 3.8 文本转语音,以及 AlphaGenome Atlas 和 WeatherNext 3 全球天气 AI 模型。
一项发表于 Science Robotics 的研究让 50 人与商用人形机器人 Pepper 对话并共同决策,发现机器人出错会损害信任和影响力,无论它是否有表情动作。当富有表现力的 Pepper 打断对话或给出不合逻辑建议时,参与者催产素水平反而升高,且升得越高越不信任机器人、越少采纳其建议。脑成像显示,此时背外侧前额叶与内侧前额叶活动增强并协同更紧密,这一协同预测了催产素上升。
滴滴自动驾驶新一代 Robotaxi R2 正式开启无人载客测试服务,用户可在北京、广州部分示范区域内呼单体验。R2 由滴滴自动驾驶与广汽埃安联合打造,采用滴滴自动驾驶 L4 全栈软硬件方案,搭载 33 个传感器和三域融合计算平台,车身平台满足中欧双五星标准。
Travis Mitchell 将小型工业机械臂 Denso VS050 改造成羽毛球发球机器人,用气动夹爪从料斗抓球并送入高速旋转轮发射。控制部分因与机械臂通信的输入输出需求,最终采用 ATmega AVR 而非 Raspberry Pi Pico。测试中确定用 3D 打印塑料盘加硅胶条作为夹球面,在球场上完成发球验证。
成立仅三个月的灵犀智涌在第二届世界人形机器人运动会工业场景装配上料岗赛项中以160分跻身全国三强,成为该赛项除行业头部企业外唯一获奖的机器人公司,参赛机由Demo级本体组装而成。
TechCrunch 报道,美国在7月和8月收紧对外国先进机器人系统的限制,并对进口无人机及部件加征关税,无人机关税9月生效,部件关税2027年跟进。Counterpoint 数据显示,2026年上半年全球人形机器人出货2.2万台,AgiBot、宇树、Galbot、优必选、乐聚五家中国厂商合计占86%。
论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。
推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。
PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。
推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。
论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。
推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。
TechCrunch 调查美国职业安全与健康管理局(OSHA)数据发现,Waymo 和 Zoox 的测试司机在 2024 至 2025 年间因自动驾驶车辆急刹或突然移动受伤超过二十起,部分人因挥鞭伤等停工数月。其他自动驾驶公司的测试司机可能同样受伤,但其雇主或可豁免 OSHA 报告要求。
Berkeley Humanoid Lite 是一个开源、易定制的人形机器人参考设计,核心是 3D 打印执行器,由电机、打印摆线减速箱和嵌入式磁编码器组成,模块化设计可单独复用。整机硬件成本低于 5000 美元,GitHub 仓库提供所需全部资料,演示视频中包含 VR 遥操作。该设计并非成品,而是可自由修改的参考方案。
印度CSIR中央机械工程研究所团队在IEEE Sensors Journal发表研究,用6个可拉伸压阻传感器贴附于衣物髋、膝、踝处,配合微控制器上的机器学习算法,对12名受试者平地行走、上下坡和上下楼梯动作分类准确率达99.83%,未穿戴过该系统的新用户准确率为89%。整套传感层功耗仅0.318毫瓦,传感器可承受超过12000次拉伸至原长三倍的循环,目前仍为仅能分类动作的原型。
MoveIt 2 发布 2.15.1 版本,由 nbbrooks 于 8 月 29 日打上标签。该版本页面未列出具体更新内容,仅提供 2 个资源文件下载。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
爱好者 svofski 用现有 microSD 卡搭建了一套 SD 卡库,核心是一台微型机械臂,可在 12 个 microSD 卡槽间抓取并插拔卡片。夹爪最初采用双钳旋转方案,因过于复杂改为齿条齿轮式平移夹持,整机置于类似 coreXY 运动学的 T-bot 结构中。该装置并非为特定用途而造,更多出于对磁带机式自动换卡机器人的兴趣,但可用于批量复制 SD 卡等可移动介质。
TechCrunch 报道称,中国多家车企正追随特斯拉押注人形机器人。小鹏机器人部门本周融资超 9 亿美元,投后估值超 63 亿美元,由 IDG 资本领投,腾讯、阿里等参投,公司称这是中国具身智能行业最大单轮私募融资。奇瑞旗下 AiMOGA 据报已启动 IPO 准备,比亚迪发布人形机器人“小迪”,长安、广汽、理想、上汽、赛力斯等也在研发人形机器人。
南加州大学教授 Jernej Barbič 因设计开发 Ziva VFX 获得 2025 年奥斯卡技术成就奖,该软件可模拟 3D 数字人与生物的肌肉、脂肪和皮肤。Ziva VFX 由他参与创办的 Ziva Dynamics 于 2016 年推出,2021 年被 Unity Technologies 收购,已用于《海王与失落的王国》《哥斯拉大战金刚:新帝国》《毒液2》等 60 多部电影。
Hugging Face 论文页介绍 Self-OPD,一种面向流匹配模型的在线策略蒸馏方法,其特点是不依赖教师模型。该页面目前仅开放论文讨论,未给出模型版本、任务、成功率或实验数据等细节。
Hugging Face 论文页上线 Magpie,一个面向交互式游戏的实时世界渲染器。该页面目前仅开放论文讨论,未披露模型规模、渲染帧率或真机部署等细节。