跳到正文

#VLA

今日 17 条
8月21日周五
  1. HF blog71

    τ_0-VLA:世界模型引导测试时计算的分层机器人基础模型

    τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。

    推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。

  2. qbitai78

    Generalist AI 发布机器人基础模型 GEN-1.5,看 3-12 秒示范即可学会新任务

    Generalist AI 发布机器人基础模型 GEN-1.5,主打 One-shot Learning,机器人看完 3-12 秒动作示范后无需梯度更新或微调即可执行新任务,还能把两段演示拼接成连续任务。

    推荐理由:GEN-1.5 把动作示范当作上下文提示,读者可据此了解机器人基础模型在少样本学习上的新路径。

  3. qbitai62

    千寻智能WRC重映整理客厅Demo:成功率与导航耗时30天内的变化

    千寻智能在2026世界机器人大会上重映了WAIC上做过的“整理客厅”长程任务Demo,并给出30天内的量化变化:可乐放入冰箱的自主推理成功率由约80%提升至99%以上,碗放入洗碗机由约90%提升至99%以上,导航目标确认耗时降低近50%,捡垃圾任务在颜色、种类、位置等泛化条件下执行成功率85%。

  4. qbitai36

    优必选WRC 2026展示工业、商用、家庭消费三大人形机器人新品

    优必选在WRC 2026集中亮相工业人形机器人Cruzr Y1、商用服务人形机器人Walker C1和超仿生人形机器人U1,覆盖工业、商用、家庭消费三大场景。Cruzr Y1与Cruzr S2现场实景演示汽车钣金件上下料、料箱拆码垛等无人自主作业;U1搭载自研Resonance-LM情感大模型,具备33轴面部肌腱网络与19个主动自由度面肌。

8月20日周四
  1. qbitai60

    星海图 WRC 最大展台展示 G0.5 模型与生产力觉醒

    量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。

  2. qbitai60

    招商局狮子山人工智能实验室在WRC 2026演示LiOS端云协同叠衣方案

    招商局先进技术研究院下属狮子山人工智能实验室在2026世界机器人大会首次公开亮相,依托自研LiOS端云协同基础设施演示柔性衣物自主折叠方案。LiOS分云侧、端侧、端云协同三层,云侧支撑模型参数向百亿规模扩展,端侧接入异构本体与末端执行器,端云协同图传实现约30ms(网络部分24ms)本地相机到云端显存的单向端到端延迟。

8月17日周一
  1. qbitai40

    共生知行发布双足人形机器人驾驶卡丁车Demo,测试全身智能

    具身智能初创公司共生知行8月17日发布双足人形机器人驾驶卡丁车Demo,机器人在封闭赛道完成双手转向与脚部油门、刹车协调控制。公司将其定位为全身智能压力测试,探索从视觉感知到全身动作输出的端到端基座模型路线,后续将通过技术报告披露模型架构与评测方式。

8月13日周四
8月12日周三
8月10日周一
  1. qbitai22

    元戎启行成立 Superfluid Lab,探索物理 AI 基座模型与研发闭环

    元戎启行成立国内首个面向物理世界基础能力研究的 AI Lab——Superfluid Lab,由前 DeepSeek 核心成员、首席科学家阮翀带队,以基座模型为核心,重点探索 VLA 模型,同时推进世界模型和多模态理解。实验室今年 5 月已在内部成立,目前完成基础设施重构等早期工作,并同步启动大模型算法、仿真算法和 AI Infra 三个方向的招聘。

  2. qbitai62

    Om AI联汇开源端侧原生模型VLX-Seek 1.5,3B版本多项评测对标英伟达LocateAnything

    Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。

8月7日周五
8月6日周四
  1. HF blog71

    Ego2Robot:从第一视角人类视频合成可扩展机器人训练数据

    Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。

    推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。

  2. HF blog62

    BridgeVLA++:面向 3D 操作的数据高效、可泛化、记忆增强 VLA 框架

    BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。

    推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。

8月5日周三
8月4日周二
  1. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。

8月3日周一
8月1日周六
7月30日周四
7月29日周三
  1. HF blog74

    PruhaNLP 发布 TurboVLA-base:面向 SO-100 机械臂的可微调 VLA 检查点

    PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。

    推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。

7月28日周二
  1. HF blog62

    论文提出具身操作数据金字塔,梳理五类数据来源与数据配方

    论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。

    推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。

7月26日周日
7月25日周六
  1. qbitai34

    PI 称北美具身智能公司离成熟尚远,中国公司何必自称"中国版XX"|RSS 2026

    RSS 2026 上,Physical Intelligence 相关研究者称包括 PI 在内的北美头部具身智能公司离成熟都还有不短距离,整个领域尚未出现奠基性工作,并质疑中国公司自称"中国版XX"。多位研究者认为 VLA 与世界模型并不冲突,π0.7 已含世界模型组件;数据筛选与配比(curation)比单纯堆量更关键,Simar Kareer 建议参照 π0 的 1 万小时训练规模。

7月24日周五
  1. IEEE Spectrum robotics22

    人形机器人笼斗与牛仔表演之后,下一步是什么?

    IEEE Spectrum 的 Video Friday 汇总了本周机器人视频:Generative Bionics 用六个月把 GENE.01 做成可行走、可感知和交互的人形平台,其全身多模态皮肤可感知触觉、接近、力与温度。Generalist 的具身基础模型 GEN-1 支持从五指手到专用工具的多种末端执行器,通过跨数千种接口的预训练获得可迁移的物理常识。

7月23日周四
7月21日周二
  1. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。

  2. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月20日周一
  1. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。

7月19日周日
7月18日周六
7月16日周四