Noiz AI 发布实时可交互音视频世界模型 HelixWorld 1.0,24FPS 画面配 48kHz 立体声
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
理想智能驾驶前核心负责人郎咸朋与来自华为的任庚联手创办具身智能公司昆仑行,成立三个月内拿下数十亿人民币融资、跻身独角兽。郎咸朋称具身智能要解决的是“理解”而非模仿,昆仑行选择物理因果世界模型和“数据编译”路线,商业路径先从toB做起、家庭是终点。
Imperial Robotics Summer School 的一个小组项目尝试让机器人同时与多人互动,而非多数社交机器人惯常的一对一模式。团队实现了实时检测活跃说话人、在交互中追踪每个人的身份,并生成自然的注视与转头行为,使机器人对整组人表现出关注。作者借此梳理了从语言到动作的完整流程:LLM 将自然意图转为结构化命令,再映射到高层机器人功能,经逆运动学生成关节轨迹,最终通过控制栈驱动执行器。
逐际动力联合创始人兼CTO谌骅透露,过去两年公司研发团队算力需求增长5到10倍,其与阿里云无影灵构合作,将GPU、仿真环境等搬上云端工作站,用于模型训练、仿真评测和云上研发环境。
德塔智能与舞肌科技签署战略合作协议,将围绕全身协同灵巧操作的数据采集与模型训练展开协同,打通“数据采集—模型训练—灵巧操作”全链路。双方计划于年内推出联合定义的“全身协同灵巧操作数据标准”与“模型训练基线”,并以舞肌科技轻量化数据手套为核心采集终端、直驱灵巧手适配德塔智能基础模型,完成从采集、训练到端侧部署的链路验证。
AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。
推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。
新加坡 AI 计算公司 Acrab 完成 1.3 亿美元 B 轮融资,累计融资超 4.8 亿美元,资金用于扩大产能和研发下一代 AI 计算平台。其首代端侧 AI 芯片 GΞLIX 1 峰值算力 700TOPS,已于 2025 年 11 月流片,今年 7 月与个人 AI 中心 Agent Box 一同发布,目前开始客户导入并推进规模化生产。
具身智能数据基础设施公司元点科技(SCALEFORCE)近日完成数千万元人民币融资,投资方含国内顶级具身智能产业方、恒旭资本和凯联资本,资金将用于MatrixOS迭代、数据生产网络建设及团队扩展。其MatrixOS包含ADA数据泛化引擎、GDP数据质量引擎,真机多场景评测成功率从65%升至92%,数据可用转化率达80%,平台支持全球数十万级数采节点统一纳管,全流程自动化程度超95%。
RoboParts 正在构建一个开放的结构化数据集与在线选型引擎,面向仿生机器人部件。该引擎旨在解决硬件选型难题,目前项目处于早期建设阶段,具体功能与数据规模尚未披露。
自变量机器人进行「夹爪方案挑战1248件/小时物流分拣」公开直播实测,双机械臂加标准夹爪连续作业1小时,分拣效率达1816件/小时,准确率98%,全程无人工接管。
ROS Discourse 上有人分享用 LLM 与 SQL 分析 rosbag 以及可查询 Nav2 行为树的方案,并提到此前 @jopequ 发布的 mcp-rosbags 与 mcp-lab,后者是带 UI、可对比不同 LLM 提供商的 MCP 服务器。该 MCP 服务器内置面向 rosbag 分析的专用工具。
擎羽科技发布 FEAGINE A01、A02、A03 三款绳驱柔性机器人,以及第一代跨本体基础模型 Fi0。三款产品按节段、自由度和负载递进,A01 为 2 自由度、整机 750 克、末端负载 200 克,A03 为 6+1 自由度、整臂 50 厘米、末端负载 600 克,均支持 ROS 1、ROS 2、Python 与 C++。
戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。
宇树科技IPO路演中,董事长兼CEO王兴兴回应了200多道提问,涉及219倍扣非市盈率争议、破发风险、DeepSeek战略配售与具身大模型进展。他称按2025年扣非净利润计算发行价对应市盈率为92.92倍,DeepSeek获配约1.41亿元、锁定期36个月,双方将在通用人工智能、高性能通用机器人、AI大模型三方面合作。
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的 TriWorldBench Challenge 公布首周榜单,这是首个面向机器人三视角世界模型的评测榜单。
元戎启行成立国内首个面向物理世界基础能力研究的 AI Lab——Superfluid Lab,由前 DeepSeek 核心成员、首席科学家阮翀带队,以基座模型为核心,重点探索 VLA 模型,同时推进世界模型和多模态理解。实验室今年 5 月已在内部成立,目前完成基础设施重构等早期工作,并同步启动大模型算法、仿真算法和 AI Infra 三个方向的招聘。
理想汽车前智驾一号位郎咸朋今年3月创立具身智能公司昆仑行,90天内连融三轮、规模达数十亿元,成为独角兽。他判断训一个具身大模型需几十亿甚至上百亿元,只靠融资撑不到具身实现那天,量产交付自我造血才是分水岭,行业最终会跑出自己的“蔚小理”。昆仑行选择先toB再toC,从工厂上下料、物流切入,家庭放到最后落地。
量子位统计,今年上半年灵巧手相关企业融资额超200亿,其中10家以灵巧手为主业的公司新增融资近80亿元、投后估值合计超750亿元,灵心巧手6月传出估值60亿美元。
Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。
有开发者为 ROS 2 的 rosidl::Buffer 实现了基于 memfd 的 CPU 共享内存后端,并用 sensor_msgs/Image 在 64 B 至 16 MiB 负载下对比了进程间与进程内的时延。
MIT CSAIL 与丰田研究院提出 SceneSmith,用设计师、评论者、编排者三个基于 GPT-5.2 的 VLM 智能体协作生成可直接载入物理仿真软件的 3D 室内场景,单场景物体数量最多为先前方法的六倍。
黎曼动力联合光轮智能和诺亦腾机器人共建具身智能数据底座,把采集、仿真、训练和评测接成一条线,并计划到2026年底完成100万小时机器人训练数据采集。黎曼动力此前用23.2万小时数据训练出Riemann-1.0,其前身为昆仑万维内部Matrix世界模型团队。三方还将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。
rosbag-resurrector v0.8 本周发布,为 ROS 2(MCAP)bag 提供类 pandas 访问、跨多个 bag 的 DuckDB 索引、健康/QC 校验、语义帧搜索、跨 bag 叠加,以及一键导出到 LeRobot、RLDS、Parquet。
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
ROBOTIS 团队开源模块化框架 CYCLO,将 Physical AI 工作流中的数据、训练、仿真与硬件控制整合到单一流程。
Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。
推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。
BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。
推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
Hugging Face 论文页面发布 PAST-Bench,用于评测个人智能体递归自我改进的基础能力。该基准聚焦个人智能体场景下的自我改进研究,目前页面仅开放论文讨论,未披露具体任务、指标或实验结果。
MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。
推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。
Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 论文页介绍 OmniPack,一种面向全模态大语言模型的统一 token 压缩方法,目标是提升这类模型的计算效率。页面未给出具体模型版本、压缩率或实验数据,仅提供论文讨论入口。
GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。
推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
protoros2 发布,这是一个面向 ROS 2 的中间件封装与编排引擎,提供零侵入的 Protobuf 支持。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Toyota Research Institute 分拆公司 Walden Robotics 于 7 月 15 日结束隐身状态,获得 3 亿美元融资,估值 11 亿美元。