跳到正文

#数据/训练

今日 35 条
7月22日周三
  1. ROS Discourse latest38

    ROS 2 学习路径架构 v0.1:14 个课程基准测试,零能力模型

    对 14 个机器人课程的基准测试显示,没有一个定义能力模型、提供分支进阶或开放式学习者标准参照评估。该 v0.1 讨论稿提出四阶段能力模型(按可观察工作而非课程完成度划分)、以 tf2+URDF 为骨干的技能树,以及五处学习者流失缺口的映射。11 份招聘样本中 10 份要求生产级 ROS 2,8 份要求 C++ 与 Python。

7月21日周二
  1. TechCrunch robotics56

    Gritt 结束隐身获 3200 万美元,用机器人安装太阳能板

    Gritt 结束隐身状态,宣布完成由 Obvious Ventures 领投的 2600 万美元 A 轮融资,累计融资 3200 万美元。该公司由两位卡内基梅隆背景的机器人专家创立,不自建机器人本体,而是用 Kawasaki 机械臂等现成硬件搭配自家 AI 模型,首个任务是卸载并定位大型玻璃太阳能板,精度达亚毫米级。

  2. HF blog78

    Pollen Robotics 开源 Grabette:用手持夹爪录制机器人操作数据

    Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。

    推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。

  3. HF blog54

    Apple-π 发布以物理定律为锚的视频模型基准

    Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。

  4. HF blog62

    ReflectWorld-MM:面向开放视频流的实体导向多模态记忆系统

    ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。

    推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。

  5. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。

  6. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月20日周一
  1. Robohub82

    交互式世界模拟器:用动作条件视频预测训练与评测机器人策略

    作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。

    推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。

  2. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。

  3. qbitai22

    不筹量子发布“量筹一号”原子量子人工智能基座,1500量子比特、保真度99.9%

    上海不筹量子在WAIC 2026发布国内首款原子量子人工智能基座“量筹一号”,量子比特规模突破1500,单量子比特保真度99.9%,里德堡门保真度超99%。该产品采用中性原子QPU、GPU集群与经典CPU的“三算力融合”架构,配套六层全栈软件并开放Q-Cub SDK。其与演逻科技合作将QAOA用于7自由度机械臂逆运动学求解,末端位姿误差小于1毫米、求解时间小于50毫秒、成功率99%。

  4. qbitai26

    蚂蚁集团、阿里云、Shopify 加入 PyTorch 基金会,蚂蚁灵波发布 LingBot-VA 2.0

    PyTorch 基金会执行董事柯理怀在 WAIC 论坛上宣布,蚂蚁集团、阿里云、Shopify 正式成为基金会新成员。蚂蚁灵波科技同期发布全栈 2.0 及核心模型 LingBot-VA 2.0,称其为行业首个"具身原生"世界动作模型,面向机器人真实任务从头预训练,可边行动边预测。基于该通用大脑打造的"机器人智慧药房"已入选 WAIC2026"十大镇馆之宝"。

7月19日周日
  1. qbitai38

    京东WAIC亮相JoyAI全系列大模型与具身数据采集链路

    京东在WAIC首次集体亮相JoyAI全系列大模型、具身数据采集与训练链路,以及以JoyInside为底座的京东AI Home。其开源行业最大人类第一视角数据集EgoLive,含2000小时视频、65866个Episode、覆盖346项真实世界任务,并已发动60万人参与数据采集。接入JoyInside的智能硬件对话轮次平均提升超120%,合作覆盖近200个品牌。

  2. qbitai22

    西门子肖松:以场景为牵引,推动工业AI从单点实效迈向生产力跃迁

    西门子中国董事长肖松提出,工业AI落地须以具体场景为牵引,破解模型训练与数据供给衔接不足的结构性难题。西门子Smart Detection智能检测平台已在南京、仪征多家工厂部署,硬件成本降低90%,项目交付周期从周级缩短至小时级;其与十五冶合作打造炼铜行业首个下沉到边缘的智能体,使冰铜品位稳定性提升15%。西门子近期还发布Eigen工程智能体,可自主完成PLC编程、HMI可视化、设备配置等任务。

  3. qbitai47

    全球市占第一后,普渡在WAIC发布PuduFM与PuduAgent,推进「一脑多形」

    普渡机器人在WAIC首次亮相PUDU D7,并披露自研具身智能大模型PuduFM与具身智能操作系统PuduAgent,共同支撑其「一脑多形」战略。PuduFM由PIM物理预言家、VLA多模态对齐和World Model仿真引擎三部分组成,官方称仅需50条专家示范数据即可完成新任务适配。目前普渡已在全球85个国家和地区部署超13万台机器人,覆盖16个行业。

7月18日周六
  1. qbitai22

    WAIC 2026 首日:Kimi K3、印奇、Sutton、Bengio 等大佬都在说什么

    WAIC 首日,Kimi K3 在模型侧搅动风云,印奇提出 AI 产业下一轮爆发来自智能体模型与下一代终端产品的结合,物理场景通用智能体是第三波核心主线。Richard Sutton 认为静态数据标注已达天花板,经验驱动是下一代 AI 核心路线;苏昊提出解决大模型幻觉的关键是物理智能,需进入真实世界完成端到端交互。

7月17日周五
  1. qbitai38

    上海“AI+制造”:央国企率先重用大模型,识渊科技、羚数智能等落地工业场景

    上海推动“AI+制造”,央国企率先在研发端重用大模型,羚数智能“百工”大模型已服务港机、造船巨头并切入超高压变电设备图纸审核。识渊科技AI原生质检方案将电路板换线调机时间缩短至最少55秒,一人可管3条产线。华院计算以“非线性期望的小样本学习算法框架”实现智能配煤,焦炭质量指标预测误差控制在2%以内。

7月16日周四
  1. qbitai48

    文远知行孵化的景烁科技独立运营,押注具身智能数据基础设施

    文远知行内部孵化的景烁科技独立运营,由文远001号员工霍达任CEO,不做整机也不做大脑,专注物理AI的数据与世界模型基础设施。其三层架构为WorldEngine数据闭环、GENESIS-Robotics世界模型和SkillForge技能包,后者已含500K+小时真实交互数据、200+标准化技能包。景烁还自研EGOK采集设备,双目4K@60fps、延迟8ms、整机280g。

  2. qbitai78

    原力灵机发布具身世界模型 DW0.5,接入 DFOL2.0 后训练框架

    原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。

    推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。

7月14日周二
  1. qbitai62

    逐际动力再融2亿美元筹备港股IPO,张巍称营收对赌不符合具身商业逻辑

    通用人形机器人公司逐际动力宣布完成2亿美元Pre-IPO轮融资,投后估值150亿元,海外资本占本轮融资额70%,过去半年累计融资4亿美元。资金将用于大小脑融合技术产品化、数千台全自主人形机器人批量落地交付及全球市场渠道建设。创始人张巍表示过往融资均未设置营收、交付规模业绩对赌,并首次拆解系统0、系统1、系统2三层大脑架构,主张对世界模型去魅。

  2. TechCrunch robotics22

    Uber 产品负责人谈酒店、Robotaxi 与 AV Labs 数据业务

    Uber 首席产品官 Sachin Kansal 披露,公司正把旅行做成继出行、外卖之后的第三大支柱,酒店预订由 Expedia 提供支持,欧洲的船只租赁则跳转至合作方完成预订。Uber One 会员已达 5100 万,贡献约一半预订量;Uber Eats 近几个季度已独立盈利。此外,成立六个月的 AV Labs 正组建独立于普通司机网络的传感器车队,以采集驾驶数据。

7月13日周一
  1. IEEE Spectrum robotics62

    X Square Robot 自述其家用机器人具身 AI 全栈方案

    中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。

  2. Robohub62

    MIT 团队研发超声腕带,可实时追踪手部动作并无线控制机械手

    MIT 工程师设计了一款超声腕带,通过对手腕肌肉、肌腱和韧带成像,配合 AI 算法实时翻译出五指和手掌的位置,从而无线控制机械手。研究团队用 8 名不同手型和腕围的志愿者测试,腕带能追踪包括美国手语 26 个字母在内的手势和抓握动作;演示中佩戴者操控机械手弹琴、投桌面篮球,并在屏幕上缩放和移动虚拟物体。

7月12日周日
  1. qbitai62

    量子位梳理97家具身数据玩家:一年融资44.7亿,谁真能靠卖数据赚钱

    量子位不完全统计97家国内具身数据玩家,其中70家做数据采集、27家做数据infra,并总结出十条行业现状。过去一年(2025年7月1日至2026年7月1日),15家不做本体、不做模型、只做数据的独立具身数据服务商共完成34起融资,合计约44.7亿元,其中光轮智能一家融资31亿元、最新估值超20亿美元。

7月11日周六
  1. ROS Discourse latest17

    ROS 周报:ROSCon 早鸟票、Gazebo 仿真工具链与 PlotJuggler 4.0

    ROS 官方发布 7 月 6 日当周周报,提醒 7 月 12 日是 ROSCon Global 早鸟票最后购买日。本周推荐了可用免费卫星影像和 DEM 数据生成仿真世界的 Gazebo 工具链、支持发送指令且可 pip 安装的机器人数据可视化界面 RUBI,以及支持时序、2D/3D/4D 数据并可通过 AppImage 安装的 PlotJuggler v4.0。

7月10日周五
  1. qbitai78

    蚂蚁灵波发布 LingBot-VA 2.0 具身原生预训练 VA 基座模型

    蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。

    推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。