ECHO-G 发布:从语音和文本生成宇树 G1 全身动作
ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。
推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。
ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。
推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。
EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。
推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。