跳到正文

#数据/训练

今日 35 条
8月17日周一
8月15日周六
  1. qbitai38

    对话郎咸朋:昆仑行用机器人创业重做“百万智驾量产”

    理想智能驾驶前核心负责人郎咸朋与来自华为的任庚联手创办具身智能公司昆仑行,成立三个月内拿下数十亿人民币融资、跻身独角兽。郎咸朋称具身智能要解决的是“理解”而非模仿,昆仑行选择物理因果世界模型和“数据编译”路线,商业路径先从toB做起、家庭是终点。

8月14日周五
  1. Robohub12

    机器人如何与一屋子人对话,而不只是一个人?Imperial Robotics Summer School 的多方人机交互项目

    Imperial Robotics Summer School 的一个小组项目尝试让机器人同时与多人互动,而非多数社交机器人惯常的一对一模式。团队实现了实时检测活跃说话人、在交互中追踪每个人的身份,并生成自然的注视与转头行为,使机器人对整组人表现出关注。作者借此梳理了从语言到动作的完整流程:LLM 将自然意图转为结构化命令,再映射到高层机器人功能,经逆运动学生成关节轨迹,最终通过控制栈驱动执行器。

  2. qbitai22

    德塔智能与舞肌科技达成战略合作,联合规范全身协同灵巧操作数据采集

    德塔智能与舞肌科技签署战略合作协议,将围绕全身协同灵巧操作的数据采集与模型训练展开协同,打通“数据采集—模型训练—灵巧操作”全链路。双方计划于年内推出联合定义的“全身协同灵巧操作数据标准”与“模型训练基线”,并以舞肌科技轻量化数据手套为核心采集终端、直驱灵巧手适配德塔智能基础模型,完成从采集、训练到端侧部署的链路验证。

  3. HF blog70

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制、训练与部署闭环

    AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。

    推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。

8月13日周四
  1. qbitai42

    Acrab 完成 1.3 亿美元 B 轮融资,端侧 AI 芯片 GΞLIX 1 进入量产准备

    新加坡 AI 计算公司 Acrab 完成 1.3 亿美元 B 轮融资,累计融资超 4.8 亿美元,资金用于扩大产能和研发下一代 AI 计算平台。其首代端侧 AI 芯片 GΞLIX 1 峰值算力 700TOPS,已于 2025 年 11 月流片,今年 7 月与个人 AI 中心 Agent Box 一同发布,目前开始客户导入并推进规模化生产。

  2. qbitai33

    元点科技完成数千万元融资,押注物理AI数据基础设施MatrixOS

    具身智能数据基础设施公司元点科技(SCALEFORCE)近日完成数千万元人民币融资,投资方含国内顶级具身智能产业方、恒旭资本和凯联资本,资金将用于MatrixOS迭代、数据生产网络建设及团队扩展。其MatrixOS包含ADA数据泛化引擎、GDP数据质量引擎,真机多场景评测成功率从65%升至92%,数据可用转化率达80%,平台支持全球数十万级数采节点统一纳管,全流程自动化程度超95%。

8月12日周三
8月11日周二
  1. qbitai71

    戴盟发布全球首个物理交互脑 Daimon-TWM,获蚂蚁领投数亿元战略轮融资

    戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。

  2. qbitai62

    宇树IPO路演王兴兴回应200余问:谈估值、破发与具身大模型进展

    宇树科技IPO路演中,董事长兼CEO王兴兴回应了200多道提问,涉及219倍扣非市盈率争议、破发风险、DeepSeek战略配售与具身大模型进展。他称按2025年扣非净利润计算发行价对应市盈率为92.92倍,DeepSeek获配约1.41亿元、锁定期36个月,双方将在通用人工智能、高性能通用机器人、AI大模型三方面合作。

8月10日周一
  1. qbitai22

    元戎启行成立 Superfluid Lab,探索物理 AI 基座模型与研发闭环

    元戎启行成立国内首个面向物理世界基础能力研究的 AI Lab——Superfluid Lab,由前 DeepSeek 核心成员、首席科学家阮翀带队,以基座模型为核心,重点探索 VLA 模型,同时推进世界模型和多模态理解。实验室今年 5 月已在内部成立,目前完成基础设施重构等早期工作,并同步启动大模型算法、仿真算法和 AI Infra 三个方向的招聘。

  2. qbitai38

    对话郎咸朋:昆仑行要做具身智能的“蔚小理”,靠融资实现不了物理AGI

    理想汽车前智驾一号位郎咸朋今年3月创立具身智能公司昆仑行,90天内连融三轮、规模达数十亿元,成为独角兽。他判断训一个具身大模型需几十亿甚至上百亿元,只靠融资撑不到具身实现那天,量产交付自我造血才是分水岭,行业最终会跑出自己的“蔚小理”。昆仑行选择先toB再toC,从工厂上下料、物流切入,家庭放到最后落地。

  3. qbitai62

    Om AI联汇开源端侧原生模型VLX-Seek 1.5,3B版本多项评测对标英伟达LocateAnything

    Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。

8月8日周六
8月7日周五
  1. qbitai62

    黎曼动力联合光轮智能、诺亦腾机器人共建具身数据底座,目标2026年底采集100万小时

    黎曼动力联合光轮智能和诺亦腾机器人共建具身智能数据底座,把采集、仿真、训练和评测接成一条线,并计划到2026年底完成100万小时机器人训练数据采集。黎曼动力此前用23.2万小时数据训练出Riemann-1.0,其前身为昆仑万维内部Matrix世界模型团队。三方还将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。

8月6日周四
  1. HF blog71

    Ego2Robot:从第一视角人类视频合成可扩展机器人训练数据

    Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。

    推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。

  2. HF blog62

    BridgeVLA++:面向 3D 操作的数据高效、可泛化、记忆增强 VLA 框架

    BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。

    推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。

  3. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
  1. HF blog71

    MiniWorld:从零训练视频世界模型的可复现框架

    MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。

    推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。

  2. HF blog53

    Push-Wiper:用分段推扫轨迹实现跨污渍与表面的通用机器人清洁

    Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。

  3. HF blog62

    GROVE:从流式视频经验中构建并推理时间分层记忆

    GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。

    推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。

8月4日周二
  1. NVIDIA dev blog robotics58

    NVIDIA 发布 Alpamayo 2 Super 开源推理视觉模型

    NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。

  2. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。