EPFL 与 MIT 研发扑翼机器人实现水空两栖运动
EPFL 与 MIT 工程师受潜水鸟类启发,设计出重量不足 300 克的扑翼式水空两栖飞行器 FAAV,可在水下游泳并拍翅跃出水面继续飞行,相关成果发表于 Science。
EPFL 与 MIT 工程师受潜水鸟类启发,设计出重量不足 300 克的扑翼式水空两栖飞行器 FAAV,可在水下游泳并拍翅跃出水面继续飞行,相关成果发表于 Science。
小米技术官方微博发布小米机器人进厂实习进展,本季度新解锁中控台侧盖板排序和料箱折叠回收两个工站,成功率均达90%以上并实现连续长时作业,此前自攻螺母工站成功率做到98%。
通用人形机器人公司逐际动力宣布完成2亿美元Pre-IPO轮融资,投后估值150亿元,海外资本占本轮融资额70%,过去半年累计融资4亿美元。资金将用于大小脑融合技术产品化、数千台全自主人形机器人批量落地交付及全球市场渠道建设。创始人张巍表示过往融资均未设置营收、交付规模业绩对赌,并首次拆解系统0、系统1、系统2三层大脑架构,主张对世界模型去魅。
中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。
搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
量子位不完全统计97家国内具身数据玩家,其中70家做数据采集、27家做数据infra,并总结出十条行业现状。过去一年(2025年7月1日至2026年7月1日),15家不做本体、不做模型、只做数据的独立具身数据服务商共完成34起融资,合计约44.7亿元,其中光轮智能一家融资31亿元、最新估值超20亿美元。
NVIDIA 发文讨论通用机器人策略在真实世界部署前的评估难题,指出当前最强系统已能按自然语言指令完成抓取、放置、分拣和操作多种物体,但严格评估仍是该领域最难解决的未解问题之一。文章介绍了其中的关键问题及 NVIDIA 的应对方法。
Drew Smith 发布纯 Python 项目 Kindalive,用多巴胺、皮质醇等八种神经化学物质的模拟衰减与相互作用实时推导情绪状态,而非用大语言模型给文本打离散标签。它通过调整 FACS 面部动作编码系统中的十二种面部动作,驱动点阵机器人脸表达短期与长期情绪,也可用于真实 LED 矩阵或动画脸舵机。
两支全尺寸人形机器人队伍首次在硬件上完成 11 对 11 足球比赛,RoboCup 称这是机器人领域长期愿景的一次落地。1X 发布为 NEO 平台打造的 25 自由度机器人手,采用腱驱动、触觉传感与内置柔顺,可实现灵巧操作与精细工具使用。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
OpenRAL 发布开源机器人智能层(RAL),定位为物理 AI 的运行时框架,在 ROS 2、tf2、MoveIt 2、Nav2、ros2_control 之上用 Pydantic v2 schema 建立各层之间的类型化契约。
AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。
推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。
原力灵机在开发者大会上发布新一代具身基础模型DM0.5,参数规模4B较上一代DM0翻倍,数据量增加400%,由5万小时真机操作数据、10万小时第一视角数据和100万平方米场景重建数据构成。
蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。
7月9日,蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0(又称LingBot-World-Infinity),支持小时级实时生成、720p/60fps高清实时输出,并首次将Agent机制引入世界模型。
7月9日,蚂蚁灵波开源LingBot-Video,称其为全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型采用DiT+MoE设计,30B总参数生成时仅激活约3B参数,相比同等规模Dense架构约有3倍推理效率,并引入VLA、VLN、Ego等共7万小时具身数据。
量化派近期在餐饮后厨完成四轮具身智能技术验证,覆盖三明治柔性制作、购物袋自主分拣、牛排跨抽屉找盐调味和奶茶跨设备协同,均落地真实动态工况。其定位为跨场景、跨本体的开放生活场景世界模型提供商,不绑定硬件,主张让机器人从「动作自动化」迈向「任务级自主作业」,并以RaaS按效用付费模式切入。
General Intuition 上月以 23 亿美元估值融资 3.2 亿美元,其 CEO Pim de Witte 认为具身 AI 会像大语言模型一样走向通用基础模型,而非为每个本体和环境单独采集海量真实数据。
魔芯科技联合浙江大学潘云鹤院士、华为等发布实时交互世界模型 MoWorld,全栈基于国产 NPU,14B 参数 MoE 模型实现最高 50FPS 推理,推理成本为同规模 GPU 方案的 30%。
曾推出 RoboTwin 系列的团队发布 RoboDojo,一个统一的仿真加真实世界机器人操作评测基准,包含 42 个仿真任务和 18 个真机任务,覆盖泛化、记忆、精细操作、长程执行和开放语义五类能力。
2026世界机器人大会将于8月19日至23日在北京经济技术开发区举行,主题为“人机共生,产需共融”。博览会参展企业300余家、较去年增加36%,预计展品超2000件、首发新品150余件,同期活动60余场。大会将发起“全球机器人应用探索计划”,国务院国资委将现场宣布成立中央企业机器人创新联合体。
智源研究院悟界·RoboBrain Orca Team发布技术报告Orca: The World is in Your Mind,提出Next-State Prediction路线,先学习统一的世界状态表征,再从中读出理解、预测与行动能力。
高德7月8日发布Phys AI Data数据系统,称其为业内首个面向物理AI训练与应用的一站式空间数据基座,由面向仿真训练的Phys AI Foundry和面向实际应用的Phys AI Map组成。
2026世界人工智能大会暨人工智能全球治理高级别会议将于7月17日至20日在上海世博、张江、西岸"三地四馆"举行,主题为"智能伙伴 共创未来",并首发主题片。大会策划140余场论坛,展览总面积首次突破10万平方米,1100余家企业参展,超300款产品将全球首发。上海2025年规上人工智能企业394家,产业规模超6370亿元,同比增长39.5%。
蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。
推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。
至简动力宣布首款全场景机器人i7 Pro完成首批百台交付,用时不到一年,并同步亮相与绿的谐波子公司开璇智能合作的全球首个CNC智能化具身机器人产线。i7 Pro在产线上加工谐波减速器内部零件,顶配版本售价22.98万元,公司称购买后可1.5年回本。创始团队王凯、贾鹏、王佳佳均来自理想汽车智能驾驶团队,公司称已搭建LaST₀基座模型及完整数据闭环,下月还将发布两款新品。
Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。
推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。
福田敏男获 2026 年 IEEE Richard M. Emberson 奖,表彰其在机器人领域的杰出服务。他发表超 2000 篇论文,1985 年提出模块化细胞机器人系统 CEBOT,并创办 IEEE/RSJ IROS 会议,2020 年成为首位亚裔 IEEE 主席。
GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。
推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。
美国自动驾驶车辆公司 Forterra 披露,其 100 余台基于 Polaris ATV 改装、搭载自研传感器与计算栈的 Lancer 自主地面车已在乌克兰冲突区部署九个月。
6月30日,联想控股微空间、联想之星和融科资讯中心发起的“科技有「联想」”沙龙首场活动“硅基进化论”在京举行,8位具身智能嘉宾围绕数据基础设施、模型范式与量产商业化展开讨论。智在无界称其4月发布的Being—H0.7将数据扩展至20万小时人类视频,并采用隐式世界模型路线;优宝特正从百台级迈向千台级交付。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
openJiuwen 社区发布多模态 Skill 范式 Skill-Omni,并在 JiuwenSwarm 中默认提供 skill-omni-creation,可将网页链接或 B 站视频链接自动提取关键截图、界面状态与操作脉络,生成 Agent 可直接读取复用的多模态 Skill。
蚂蚁灵波开源空间原生视觉基模 LingBot-Vision,并发布基于它的空间感知模型 LingBot-Depth 2.0。
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
AI for Industry Challenge 已选出顶尖团队并进入第二阶段,晋级队伍正使用 Intrinsic Flowstate 和 Intrinsic Vision Model 开发完整的机器人线缆处理方案。该论坛现已关闭,相关问题可联系 Intrinsic 团队 challenge@intrinsic.ai。