跳到正文

全部动态

今日 71 条
7月9日周四
  1. qbitai74

    蚂蚁灵波开源 LingBot-Video 具身视频模型

    蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。

  2. qbitai22

    量化派物理AI:从餐饮后厨验证到物理世界基础模型,走卖能力的路

    量化派近期在餐饮后厨完成四轮具身智能技术验证,覆盖三明治柔性制作、购物袋自主分拣、牛排跨抽屉找盐调味和奶茶跨设备协同,均落地真实动态工况。其定位为跨场景、跨本体的开放生活场景世界模型提供商,不绑定硬件,主张让机器人从「动作自动化」迈向「任务级自主作业」,并以RaaS按效用付费模式切入。

7月8日周三
  1. qbitai22

    2026世界机器人大会8月19日北京亦庄举行:主题“人机共生,产需共融”

    2026世界机器人大会将于8月19日至23日在北京经济技术开发区举行,主题为“人机共生,产需共融”。博览会参展企业300余家、较去年增加36%,预计展品超2000件、首发新品150余件,同期活动60余场。大会将发起“全球机器人应用探索计划”,国务院国资委将现场宣布成立中央企业机器人创新联合体。

  2. qbitai20

    WAIC 2026 将于7月17日至20日在上海举行并首发主题片

    2026世界人工智能大会暨人工智能全球治理高级别会议将于7月17日至20日在上海世博、张江、西岸"三地四馆"举行,主题为"智能伙伴 共创未来",并首发主题片。大会策划140余场论坛,展览总面积首次突破10万平方米,1100余家企业参展,超300款产品将全球首发。上海2025年规上人工智能企业394家,产业规模超6370亿元,同比增长39.5%。

  3. qbitai80

    蚂蚁灵波开源 LingBot-VLA 2.0,6 万小时数据支持 20 多种机器人

    蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。

    推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。

  4. qbitai78

    蚂蚁灵波开源LingBot-VLA 2.0,支持17家厂商20种机器人构型

    蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。

    推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。

  5. qbitai68

    至简动力i7 Pro完成首批百台交付,落地全球首个CNC具身机器人产线

    至简动力宣布首款全场景机器人i7 Pro完成首批百台交付,用时不到一年,并同步亮相与绿的谐波子公司开璇智能合作的全球首个CNC智能化具身机器人产线。i7 Pro在产线上加工谐波减速器内部零件,顶配版本售价22.98万元,公司称购买后可1.5年回本。创始团队王凯、贾鹏、王佳佳均来自理想汽车智能驾驶团队,公司称已搭建LaST₀基座模型及完整数据闭环,下月还将发布两款新品。

  6. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。

  7. HF blog67

    Image2Sim:用生成式神经模拟器扩展具身导航

    Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。

    推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。

  8. HF blog39

    PointDiT:面向单目几何估计的像素空间扩散模型

    PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。

  9. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

  10. NVIDIA dev blog robotics58

    NVIDIA Isaac GR00T 如何端到端开发人形机器人策略

    NVIDIA 发布文章介绍如何用 Isaac GR00T 端到端开发人形机器人策略。文章指出,随着团队从人形机器人整机调试转向特定任务技能开发,对可重复开发工作流的需求正在增长,而当前开发流程仍高度碎片化,开发者需要花大量时间配置机器人基础设施,之后才能专注于构建机器人能力。

7月7日周二
  1. IEEE Spectrum robotics40

    受大脑启发的图像传感器:可感光、可记忆、可渐忘

    俄勒冈州立大学团队研发出一种受大脑启发的光电晶体管图像传感器,能同时感光并存储数据,还可通过电压调节记忆时长,实现从快速遗忘到保留数小时的渐变遗忘。该器件为4×4像素阵列,采用IGZO晶体管与有机光活性层,可在传感器上直接完成变化检测,有望大幅降低机器视觉的能耗。目前仅完成器件级验证,下一步将扩展像素阵列并开发集成成像原型。

  2. HF blog62

    GaP:面向变异性自动化任务的图即策略多智能体自学习框架

    GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。

    推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。

  3. qbitai22

    从共识到非共识:科技有「联想」沙龙首场活动直击具身智能产业化“三大困惑”

    6月30日,联想控股微空间、联想之星和融科资讯中心发起的“科技有「联想」”沙龙首场活动“硅基进化论”在京举行,8位具身智能嘉宾围绕数据基础设施、模型范式与量产商业化展开讨论。智在无界称其4月发布的Being—H0.7将数据扩展至20万小时人类视频,并采用隐式世界模型路线;优宝特正从百台级迈向千台级交付。

  4. HF blog62

    SVA:将树搜索蒸馏为动作评估以增强冻结 VLA 模型

    论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。

    推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。

  5. NVIDIA blog robotics80

    NVIDIA 与 Hugging Face 将 Isaac GR00T 1.7 和 Isaac Teleop 引入 LeRobot

    NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。

    推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。

  6. HF blog88

    LeRobot v0.6.0 发布:世界模型策略、新 VLA 与奖励模型 API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。

  7. ROS Discourse latest2

    TEKsystems 招聘高级机器人架构师(ROS 2,美国远程,约 15% 出差)

    TEKsystems 为一个大型制造业机器人团队招聘高级机器人架构师,负责基于 ROS 2 和 EtherCAT 的机器人控制平台架构与技术方向,主导平台维护、优化与扩展,并设计交付新功能。该岗位为美国境内 100% 远程,约 15% 出差用于现场协作与硬件集成,需具备 ROS 2 生产级经验及感知系统/物理 AI 背景。

  8. ROS Discourse latest18

    Gazebo PMC 会议纪要 2026-07-06:设立维护小时、讨论 SDFormat 占位符语法与 AI 贡献署名政策

    Gazebo PMC 在 2026-07-06 的会议上同意设立每月约两次、跨时区轮换的维护小时,供维护者通过分组会议协作审查 PR。会议讨论了 SDFormat 新的命名空间占位符语法(__name__、$name、{name} 等),最终选择推迟,并倾向不回溯到 Fortress 而面向 Harmonic。