Rank-Then-Act:用帧序进度实现无奖励强化学习控制
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。
推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。
至简动力宣布首款全场景机器人i7 Pro完成首批百台交付,用时不到一年,并同步亮相与绿的谐波子公司开璇智能合作的全球首个CNC智能化具身机器人产线。i7 Pro在产线上加工谐波减速器内部零件,顶配版本售价22.98万元,公司称购买后可1.5年回本。创始团队王凯、贾鹏、王佳佳均来自理想汽车智能驾驶团队,公司称已搭建LaST₀基座模型及完整数据闭环,下月还将发布两款新品。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。
SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。
NVIDIA 发布文章介绍如何用 Isaac GR00T 端到端开发人形机器人策略。文章指出,随着团队从人形机器人整机调试转向特定任务技能开发,对可重复开发工作流的需求正在增长,而当前开发流程仍高度碎片化,开发者需要花大量时间配置机器人基础设施,之后才能专注于构建机器人能力。
ACID 提出在世界模型决策时规划中加入循环动作一致性代价:用逆动力学模型推断每个预测状态转移背后的动作,其与条件动作的偏差作为逐步规划代价。该方法在四个世界模型和六个任务上改善了规划效果,并显著减少了计算量。
6月30日,联想控股微空间、联想之星和融科资讯中心发起的“科技有「联想」”沙龙首场活动“硅基进化论”在京举行,8位具身智能嘉宾围绕数据基础设施、模型范式与量产商业化展开讨论。智在无界称其4月发布的Being—H0.7将数据扩展至20万小时人类视频,并采用隐式世界模型路线;优宝特正从百台级迈向千台级交付。
论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。
推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。
openJiuwen 社区发布多模态 Skill 范式 Skill-Omni,并在 JiuwenSwarm 中默认提供 skill-omni-creation,可将网页链接或 B 站视频链接自动提取关键截图、界面状态与操作脉络,生成 Agent 可直接读取复用的多模态 Skill。
蚂蚁灵波开源空间原生视觉基模 LingBot-Vision,并发布基于它的空间感知模型 LingBot-Depth 2.0。
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
浏览器端 ROS bag 查看/编辑工具 BAGEL 更新至 v1.6,自 v1.0 起新增按时间裁剪、删除话题并导出索引 MCAP 的编辑功能,支持 .mcap、ROS2 .db3 和 ROS1 .bag 转为 MCAP。
针对 CAD、URDF 导出器和切片软件把 3D 打印件当作实心塑料块计算惯量、导致 MuJoCo/PyBullet/Gazebo 仿真动力学失真、拉大仿真到真实迁移差距的问题,开发者用 LeRobot SO101 机械臂测试后开源了 printphys 工具。
英伟达 GEAR 联合李飞飞团队、佐治亚理工大学等机构发布 Real2Sim 系统 SimFoundry,只需一段真实世界 RGB 视频即可自动生成可交互、可训练、可评测的机器人仿真环境。
推荐理由:英伟达 GEAR 与李飞飞团队等提出 Real2Sim 系统,用一段视频自动扩展仿真训练数据,读者可了解其闭环思路与实验结论。
作者发布 Altara,一套 MIT 许可的 React 实时遥测组件,提供一行 rosbridge 适配器,可将 sensor_msgs 话题直接接入图表、仪表或姿态指示器。
光象科技宣布累计完成数亿元天使轮融资,资金将投入物理原生基座模型研发迭代并推进具身智能机器人商业化交付。公司同期发布工业级自进化具身智能机器人 Phi-Bot X1,在汽车产线焊接上料真实工位完成验证,2026 ATC 展会连续三天运行 21.5 小时零失误,双孔对准动态操作精度达毫米级、角度控制在 0.3° 以内,连续工作成功率 100%。
华大智造子公司涌生智能与上海人工智能实验室联合发布ProtoPilot多智能体系统和BioLab Bench评测体系,前者由Orchestrator、Protocol Expert、Coding三个Agent协同,将自然语言实验意图转化为设备可执行代码并依据湿实验反馈修正。
地瓜机器人发布世界模型 Uranus,定位为机器人开发基础设施,用于评测 VLA 与世界模型并支持操作训练仿真。它采用帧级闭环逐帧生成,训练时只见过 2 秒短片段,推理时可稳定运行 60 秒,支持 G1 人形机器人和 Franka 协作臂,目前仅支持 manipulation 训练,尚不支持 locomotion。
PlotJuggler 4 发布早期预览版(beta),作者称经过数月开发,功能尚不完整但已大幅优化。新版支持 2D 图像、压缩图像、深度、压缩视频(H264、AV1)、图像矫正、WebRTC 实时流与 markers,3D 支持网格、occupancygrid、TF2、3D markers、点云(含 Draco 和 Cloudini 压缩)以及类似 RViz 的多相机控制。
上海西井科技已在深交所创业板获IPO申请受理,计划募资约37亿元。公司2025年营收4.93亿元,同比增长152.34%,赛力斯重庆超级工厂项目贡献1.64亿元、占总收入33.23%,成为第一大客户;但三年归母净亏损累计13.6亿元,毛利率约10%。募资将投向自动驾驶算法世界模型、整车及具身智能产品研发试制、全球化业务拓展和补充流动资金。
FaceMind脸谱心智提出 Ego-NeuroLoop 数据范式,同步采集 world camera、gaze、EEG、sEMG 四类信号,记录人类操作时"看哪里、准备做什么、肌肉怎么发力、反馈如何修正"的完整闭环。
Aether AI 宣布完成 2000 万美元种子轮融资,由经纬创投领投,走不做视频生成、3D 重建和 JEPA 的因果世界模型路线。其内部数据显示,在机器人操作任务上,因果世界模型相比传统世界模型成功率提升 25%-50%,样本效率提升 5 到 10 倍,部分案例仅用 50 条高质量数据即可让频繁失败的任务达到可靠成功率。
教程演示用 CAN 总线把两条 AgileX NERO 7 自由度机械臂配置成主从结构,从臂实时复现主臂运动,可用于遥操作与模仿学习实验。接线需保证 CAN H 与 CAN L 正确对应,启用前须将两臂对齐至相近位姿,否则从臂会快速校正引发碰撞风险。NERO 软件 1.1 版本下主从模式启用后 API 仅接受主臂指令,无法单独查询从臂状态。
英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。
推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。
群核科技三篇论文入选 ECCV 2026,涵盖空间感知与推理、强化学习数据生成、高保真物理仿真。其中联合 Adobe、NVIDIA、Apple、Intel 等提出的 SPEAR 仿真平台开放超 14000 个原生 Python 接口,可输出深度图、表面法线、实例分割等物理属性数据,并接入 InteriorAgent、InteriorGS 等结构化三维数据集。
脸谱心智(FaceMind Research Asia)的 Looped World Models(LoopWM)论文登上 Hugging Face Papers 当日 Top1,该工作让共享参数的 Transformer 模块对潜空间状态反复迭代细化,而非一次前向传播完成预测。
自变量连续完成B+、B++和C轮融资,投后估值突破200亿元并完成资本交割,成为大湾区首家估值超200亿元的具身大脑公司。已确认投资机构超30家,小米战投连续参与B、B+、B++三轮,美团、阿里、字节此前分别领投A、A+、A++轮。
NVIDIA 介绍基于 OpenUSD 和 Omniverse 的三种视觉 AI 智能体工作流:用 Defect Image Generation 技能生成合成缺陷数据、用 Video Data Augmentation 扩展场景覆盖、用 TAO 技能微调模型。
Google DeepMind 推出为期三个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导、产品辅导及 Gemini 机器人模型等 AI 资源支持。入选企业覆盖物流、制造、医疗、气候与导航等领域,包括开发机器人焊接平台的 3D-Components、做自主水下机器人的 Bubble Robotics、研发神经外科微机器人的 ROBEAUTE 等。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA 在 CVPR 发布面向物理 AI 研究的 agent skills,帮助研究者自动化自动驾驶、机器人和视觉 AI 的开发流程。
推荐理由:NVIDIA 在 CVPR 发布面向物理 AI 的 agent skills,读者可了解其覆盖自动驾驶、视觉 AI 与机器人学习的工具链与开放入口。
Robot Talk 第157期对话洛桑联邦理工学院(EPFL)助理教授 Josie Hughes,讨论如何用 AI 为机器人机械臂开发新设计。Hughes 于 2021 年在 EPFL 创立 CREATE Lab,研究聚焦利用机器人自身物理特性与环境交互的新型结构设计范式,涵盖机械手、软体机械臂及面向可持续性与科学的自动化系统。
DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。
推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。
IsaacLab 为 Linux 多 GPU 训练文档补充 NCCL 排障说明,针对 ProcessGroupNCCL 报出 CUDA "an illegal memory access was encountered" 导致分布式训练失败的情况,给出 NCCL_SHM_DISABLE=1、NCCL_IB_DISABLE=1、NCCL_ALGO=Ring 三个环境变量变通方案。
IsaacLab 合并 #5195,在多 GPU 训练文档中新增 NCCL 故障排查说明,针对 Linux 上分布式训练报 ProcessGroupNCCL 的 CUDA illegal memory access 错误。
Hugging Face 的 LeRobot 发布 v0.5.1,为 pi0、pi0.5 和 pi0_fast 策略新增相对动作支持,并加入 HIL/Dagger/HG-Dagger/RaC 风格数据采集功能。
Isaac Lab 3.0 Beta 发布,基于 Isaac Sim 6.0 做架构重构,引入多后端物理、可插拔渲染器与 Warp 原生数据管线。新增 isaaclab_newton 扩展支持 MuJoCo-Warp 求解器与无 Kit 模式,并给出四元数 XYZW 顺序、.data.* 返回 wp.array 等破坏性变更及迁移工具。
推荐理由:Isaac Lab 3.0 Beta 的架构改动与迁移工具清单,可帮助现有用户评估升级成本与后端切换路径。