讯飞爻方智能发布 iFLYTEK-Embodied-Omni 技术报告:世界模型需补上本体认知
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
优艾智合研发的FabriVLA在Evo-SOTA榜单的Meta-World MT50基准中以90.0%的tier-average成功率登顶第一,超过包括π0在内的国际模型,参数规模为1B级。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
Travis Kalanick 的机器人公司 Atoms 完成 17 亿美元融资,由 Andreessen Horowitz 领投,Ben Horowitz 将加入董事会,Bain Capital、Fifth Wall 和 Uber 参投。
量子位在 WAIC 2026 现场总结出十大趋势:Agent 成为约 70% 展商的默认话题,能否完成有效交付取代参数规模成为衡量大模型能力的标准。具身智能从动作演示转向真干活,灵初智能联合长飞切入光模块生产,方案搭载自研大模型 Psi-R2,初步测算可降低生产损耗率约 10%。未来不远机器人以 3000 元/月租赁价落地 500 多个家庭,开展首日 8 台被抢空。
日冕开物与广东远图未来科技启动超级工站战略合作,计划2027年完成百台级部署,未来实现万台级具身智能产品部署。WAIC 2026现场,其超级工站基于自研LaMPA世界模型,在通电后仅训练半小时即完成服务器制造场景的新环境适配。该方案由LaMPA物理世界模型、模块化机器人硬件和Workflow Agent组成,目标形成规划、测试、执行、反馈、进化的闭环。
联影智能在2026年世界人工智能大会上首次发布「元医院」战略,不新建虚拟医院、不替代医生,而是把零散AI工具整合为全院协同的智能体系。该体系需数据、模型、智能体调度、临床验证四项能力,并已开源uAI Nexus MedVLM(元智医疗视频理解大模型)。WAIC现场演示了「超级医生」:医生戴VR头显语音调取患者全周期病历,并完成肝脏实质剥离等术前规划操作。
酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。
Gritt 结束隐身状态,宣布完成由 Obvious Ventures 领投的 2600 万美元 A 轮融资,累计融资 3200 万美元。该公司由两位卡内基梅隆背景的机器人专家创立,不自建机器人本体,而是用 Kawasaki 机械臂等现成硬件搭配自家 AI 模型,首个任务是卸载并定位大型玻璃太阳能板,精度达亚毫米级。
ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。
推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
中国河北工业大学的研究团队开发出一款完全无电机的下肢软体外骨骼,由高功率人工肌肉驱动,相关研究7月10日发表于《Science Advances》。在4公里/小时步行测试中,该装置将受试者步行能耗平均降低13.9%,优于多数既往髋部助力外骨骼。
国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。
光鉴科技发布具身智能视觉感知方案,以AI双目视觉为核心,并推出Libra系列AI双目视觉模组:Libra 1000采用2cm基线面向腕部精细操作,Libra 3000采用7cm基线面向中远距离空间感知。方案采用全域泛化感知设计,以统一硬件平台支撑深度感知、SLAM定位、目标检测等任务并支持OTA升级,同时通过优化计算架构降低算力占用,为VLA推理等释放算力。
苏度科技在 WAIC 首次国内大型展会亮相,展示精密装配、柔性打包、移动操作和与宁德时代合作的电池模组产线四组 Demo,四台同型号机器人分守不同工位协同完成上料、电芯装配、扫码、下料全流程。
RSS 2026 公布论文奖项,共收到 708 篇投稿、录用 210 篇,接收率 29.7%,8 篇进入 Final List 后评出三项最佳论文。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
上海不筹量子在WAIC 2026发布国内首款原子量子人工智能基座“量筹一号”,量子比特规模突破1500,单量子比特保真度99.9%,里德堡门保真度超99%。该产品采用中性原子QPU、GPU集群与经典CPU的“三算力融合”架构,配套六层全栈软件并开放Q-Cub SDK。其与演逻科技合作将QAOA用于7自由度机械臂逆运动学求解,末端位姿误差小于1毫米、求解时间小于50毫秒、成功率99%。
PyTorch 基金会执行董事柯理怀在 WAIC 论坛上宣布,蚂蚁集团、阿里云、Shopify 正式成为基金会新成员。蚂蚁灵波科技同期发布全栈 2.0 及核心模型 LingBot-VA 2.0,称其为行业首个"具身原生"世界动作模型,面向机器人真实任务从头预训练,可边行动边预测。基于该通用大脑打造的"机器人智慧药房"已入选 WAIC2026"十大镇馆之宝"。
京东在WAIC首次集体亮相JoyAI全系列大模型、具身数据采集与训练链路,以及以JoyInside为底座的京东AI Home。其开源行业最大人类第一视角数据集EgoLive,含2000小时视频、65866个Episode、覆盖346项真实世界任务,并已发动60万人参与数据采集。接入JoyInside的智能硬件对话轮次平均提升超120%,合作覆盖近200个品牌。
Om AI联汇在WAIC分论坛发起《端侧多模态基座与AI硬件协同发展倡议》,并上线VLX开发者社区,开放VLX端侧流式多模态基座能力。倡议提出共建端侧原生技术标准、共研软硬一体联合方案、共拓物理AI产业场景三个方向。其自研VLX端侧流式多模态模型系列此前已开放线上体验,本届WAIC为首次线下公开亮相。
西门子中国董事长肖松提出,工业AI落地须以具体场景为牵引,破解模型训练与数据供给衔接不足的结构性难题。西门子Smart Detection智能检测平台已在南京、仪征多家工厂部署,硬件成本降低90%,项目交付周期从周级缩短至小时级;其与十五冶合作打造炼铜行业首个下沉到边缘的智能体,使冰铜品位稳定性提升15%。西门子近期还发布Eigen工程智能体,可自主完成PLC编程、HMI可视化、设备配置等任务。
摩尔线程在WAIC 2026论坛上首次公开基于夸娥(KUAE)智算集群的三大“AI工厂”实践成果,涵盖模型训练、词元生产与智能体生产。其夸娥集群训练规模增大时可保持95%线性扩展效率,有效训练时长占比超90%,并完成MoE-236B基础模型从零训练及北京大学5D世界模型EvoPhys-World全栈原生训练。
魔法原子在 2026 世界人工智能大会(WAIC)期间展示自研通用具身大模型 Magic-VLA K02,现场完成叠盒封胶、柔性衣物整理和行李箱收纳等长程任务,其中叠盒封胶组合式长程任务成功率超过 90%。
普渡机器人在WAIC首次亮相PUDU D7,并披露自研具身智能大模型PuduFM与具身智能操作系统PuduAgent,共同支撑其「一脑多形」战略。PuduFM由PIM物理预言家、VLA多模态对齐和World Model仿真引擎三部分组成,官方称仅需50条专家示范数据即可完成新任务适配。目前普渡已在全球85个国家和地区部署超13万台机器人,覆盖16个行业。
梅卡曼德在WAIC 2026展示由3D视觉系统、Mech-GPT多模态大模型和Mech-Hand灵巧手组成的眼脑手组件,覆盖人形机器人上下料、线束装配、五角螺母抓取及透明物体分拣等场景。其中五角螺母抓取单件用时不到2.4秒,线束插接精度达亚毫米级。公司称其产品已在工业场景大规模落地,全球累计部署27000余台,服务100余家《财富》500强客户。
优理奇机器人(UniX AI)联合浙江大学、MIT、牛津、耶鲁、上海交大发布 UniTac,提出统一的跨传感器触觉理解与生成架构,并接入 VLA,该工作已被 ECCV 2026 接收。
中国电信人工智能研究院(TeleAI)在 WAIC 2026 发布智传网(AI Flow),提出用生成式智能传输把视频编码成 Token 序列,经卫星链路回传后在接收端用生成式模型重建画面。
后摩智能在 WAIC 2026 展出多款 M50 Inside 终端,M50 芯片依托存算一体架构,在 10W 功耗下实现 160 TOPS 单芯片算力,可运行 30B 至 120B 参数大模型。
WAIC 首日,Kimi K3 在模型侧搅动风云,印奇提出 AI 产业下一轮爆发来自智能体模型与下一代终端产品的结合,物理场景通用智能体是第三波核心主线。Richard Sutton 认为静态数据标注已达天花板,经验驱动是下一代 AI 核心路线;苏昊提出解决大模型幻觉的关键是物理智能,需进入真实世界完成端到端交互。
上海推动“AI+制造”,央国企率先在研发端重用大模型,羚数智能“百工”大模型已服务港机、造船巨头并切入超高压变电设备图纸审核。识渊科技AI原生质检方案将电路板换线调机时间缩短至最少55秒,一人可管3条产线。华院计算以“非线性期望的小样本学习算法框架”实现智能配煤,焦炭质量指标预测误差控制在2%以内。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
开发者展示了一台基于 AgenticROS 的新机器人,通过 OpenClaw、Claude、Gemini、Codex 和 Hermes 等 AI Agent 连接 ROS2,实现对 RealSense、轮子、腿和手臂等自身本体的控制。
Nav2 集成 Meta 的 SAM3 基础模型实现通用语义导航,在 AMD Strix Halo(Ryzen AI Max+ 395)上端侧运行,以 5-10 Hz 输出逐像素掩码。
银河通用发布面向具身智能大模型的测试时后训练框架 WAM-TTT,将 Test-Time Training 迁移至机器人控制,无需重新预训练或人类动作标注,仅用未标注人类 RGB 视频即可在部署阶段适配新场景。
友机技术连续完成B轮、C轮融资,金浦投资、九派资本入场,中国移动链长基金战略投资成为其重要产业投资方。该公司聚焦设备端工业AI,将机床状态转化为AI可理解的数据语言,并推动AI进入实时反馈与控制优化闭环,已在航空航天、军工、汽车制造、3C电子等行业形成应用积累。其UJ-Ucut优切仿真系统于2026年获国产数控机床领域“春燕奖”。
无问芯穹联合清华大学等研发的具身智能强化学习基础设施 RLinf 升级至 v0.3,首次完整打通数据采集、数据管理、SFT、RL、模型评测与真机部署环节,形成从仿真训练到真机在线学习的统一开发闭环。
文远知行内部孵化的景烁科技独立运营,由文远001号员工霍达任CEO,不做整机也不做大脑,专注物理AI的数据与世界模型基础设施。其三层架构为WorldEngine数据闭环、GENESIS-Robotics世界模型和SkillForge技能包,后者已含500K+小时真实交互数据、200+标准化技能包。景烁还自研EGOK采集设备,双目4K@60fps、延迟8ms、整机280g。
逐际动力发布一段3分钟一镜到底的视频,展示全尺寸人形机器人Oli全自主完成收纳整理、搬箱、深弯腰拾物等长程家务任务,无后台人工远程介入。支撑其行动的是刚更新的人形大脑系统LimX COSA 0.5,首次完整展示S2认知层、S1技能层、S0运控层三层架构,其中S0底层为自研LimX WBT全身运动基础模型,约千万参数Transformer策略,控制频率1000Hz。
NVIDIA 推出基于 Thor 架构的 Jetson T3000 与 IGX T3000 模块,提供 865 FP4 teraflops 算力,体积和功耗约为 T5000 的一半,并推出 400 FP4 teraflops、16GB 内存的 Jetson T2000。
推荐理由:原文给出两款 Thor 模块的算力、内存与上市节奏,读者可据此判断边缘端机器人算力选型与迁移路径。