ECHO-G 发布:从语音和文本生成宇树 G1 全身动作
ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。
推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。
ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。
推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
亮源新创过去一个多月连续发布LightParkour、LightNav-0和Light REACT三项技术,分别面向复杂接触技能扩展、通用导航和全身韧性控制。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
8月22日世界人形机器人运动会开幕式上,银河通用机器人参加机器人网球比赛,与网坛运动员同台竞技并由中央广播电视总台全球直播,完成正手、反手、发球、接发、底线调动、网前截击等动作,并在双打中与人类队友实时协作。
具身智能初创公司共生知行8月17日发布双足人形机器人驾驶卡丁车Demo,机器人在封闭赛道完成双手转向与脚部油门、刹车协调控制。公司将其定位为全身智能压力测试,探索从视觉感知到全身动作输出的端到端基座模型路线,后续将通过技术报告披露模型架构与评测方式。
IEEE Spectrum 的 Video Friday 合集展示了多款机器人视频:Google DeepMind 的 Gemini Robotics 2 作为智能层实现全身控制、灵巧操作与多机器人协作;Hello Robot 推出可在家中安全导航的单臂三轮机器人 Stretch 4.0;南加州大学与 NASA 等合作训练机器狗用于火星、月球等行星探索。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
NVIDIA 发布 Isaac GR00T N1.6,用于构建人形机器人的通用能力,覆盖感知、规划与全身控制。该工作流将仿真、控制与学习统一起来,让机器人在进入真实世界前先习得复杂技能。
推荐理由:NVIDIA 官方给出 GR00T N1.6 的仿真到真实工作流,读者可了解人形机器人通用能力训练如何统一仿真、控制与学习。