跳到正文

#数据/训练

今日 35 条
9月30日周三
  1. TechCrunch robotics12

    Nimble Robotics 自主履约核心软件背后的工程师 Shivansh Inamdar

    Shivansh Inamdar 在 Nimble Robotics 负责机器人操作软件层,主导抓取、移动与放置决策,并参与所有主要零售商部署。Nimble 称其技术已处理数百万件服装、鞋类、美妆、电子和快消品。2024 年公司与 FedEx 达成战略合作,10 月宣布由 FedEx 领投的 1.06 亿美元 C 轮融资,估值 10 亿美元。

  2. qbitai62

    36家机器人上市公司财报盘点:人形机器人收入占比与盈利分化明显

    量子位ROBO梳理A股和港股至少36家已上市机器人相关公司,按整机应用与系统部件各18家分类,对比其机器人业务收入与盈利表现。优必选2025年收入约20.01亿元,全尺寸具身智能人形机器人产品及解决方案收入约8.21亿元、占比约41.0%,2026年上半年升至46.5%;宇树2025年营收约16.99亿元,人形机器人约8.68亿元、占比约51.1%。

  3. arXiv cs.RO62

    SAKI:从人类视频组装技能并做运动学模仿,实现长时程移动操作

    SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。

    推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。

  4. arXiv cs.RO62

    SCOUT:用动作-结果反馈实现测试时策略自适应

    SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。

    推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。

  5. HF blog72

    ECHO-G 发布:从语音和文本生成宇树 G1 全身动作

    ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。

    推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。

  6. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  7. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

  8. HF blog66

    CrossBFM:跨人形本体蒸馏共享潜行为空间

    CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。

    推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。

  9. HF blog38

    LeRF:学习参考坐标系以进行视角采择推理

    Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。

  10. HF blog80

    EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

    EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

    推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

9月29日周二
  1. qbitai47

    诺因智能完成数亿元天使+++轮融资,GLOW 大模型与 KNOWIN-X1 推进量产准备

    消费级具身智能公司诺因智能完成数亿元人民币天使+++轮融资,由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投,成立以来累计融资超10亿元。资金将用于扩充GLOW生成式具身大模型训练数据、推进KNOWIN-X1本体工程验证与量产准备。GLOW在RoboDojo的18项仿真任务中平均成功率62.2%,在LIBERO-Pro以86.7%位列所列单策略模型第一。