跳到正文

#VLA

今日 0 条
9月30日周三
  1. HF blog80

    EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

    EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

    推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

9月29日周二
9月28日周一
9月26日周六
  1. qbitai66

    美梦空间联合索辰科技发布Physical-WAM世界动作模型与RoboTwin-Phys物理漂移评测基准

    9月26日,杭州美梦空间在第五届全球数字贸易博览会上发布Physical-WAM物理-世界动作模型与RoboTwin-Phys物理漂移评测基准。Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,在感知输入与动作输出之间插入物理Token表征,用于估计摩擦、重量、重心、接触状态等物理信息并预判动作后果。

9月24日周四
  1. qbitai62

    灵初智能发布 Psi-R2.5,用强配对数据改进人机动作对齐

    灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。

9月21日周一
9月16日周三
9月14日周一
  1. qbitai78

    生数科技发布世界模型 Motus2,探索机器人自我进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。

    推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。

9月12日周六
  1. qbitai78

    生数发布世界模型 Motus2,探索机器人闭环自进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。

    推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。

9月11日周五
  1. NVIDIA blog robotics71

    Skild AI 发布 S1 机器人基础模型,单段视频即可学习新任务

    Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。

    推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。

9月10日周四
9月3日周四
  1. qbitai22

    神秘具身团队 MVP 模型连发 Demo:自进化路线曝光,机器人将上街开放环境测试

    神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。

9月1日周二
8月26日周三
  1. qbitai80

    Skild AI 发布机器人基础模型 S1,上下文学习支持 10 分钟长程任务

    北美具身初创 Skild AI 发布机器人基础模型 S1,主打上下文学习,无需后训练或微调,只看一段人类示范视频即可完成煎饼、冲泡咖啡、给植物换盆、设备组装等长程任务,上下文学习任务长度最长 10 分钟。

    推荐理由:Skild AI 的 S1 把机器人上下文学习拉到 10 分钟长程任务,并给出与语言提示 VLA 的成功率对比数据。

  2. qbitai36

    宇树智元共用一个大脑:神秘具身模型10分钟一镜到底Demo曝光

    一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。

8月25日周二
8月21日周五
  1. qbitai78

    Generalist AI 发布机器人基础模型 GEN-1.5,看 3-12 秒示范即可学会新任务

    Generalist AI 发布机器人基础模型 GEN-1.5,主打 One-shot Learning,机器人看完 3-12 秒动作示范后无需梯度更新或微调即可执行新任务,还能把两段演示拼接成连续任务。

    推荐理由:GEN-1.5 把动作示范当作上下文提示,读者可据此了解机器人基础模型在少样本学习上的新路径。

8月20日周四
  1. qbitai60

    星海图 WRC 最大展台展示 G0.5 模型与生产力觉醒

    量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。

8月17日周一
  1. qbitai40

    共生知行发布双足人形机器人驾驶卡丁车Demo,测试全身智能

    具身智能初创公司共生知行8月17日发布双足人形机器人驾驶卡丁车Demo,机器人在封闭赛道完成双手转向与脚部油门、刹车协调控制。公司将其定位为全身智能压力测试,探索从视觉感知到全身动作输出的端到端基座模型路线,后续将通过技术报告披露模型架构与评测方式。

8月10日周一
  1. qbitai62

    Om AI联汇开源端侧原生模型VLX-Seek 1.5,3B版本多项评测对标英伟达LocateAnything

    Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。

8月7日周五
8月5日周三
8月1日周六
7月30日周四
7月29日周三
  1. HF blog74

    PruhaNLP 发布 TurboVLA-base:面向 SO-100 机械臂的可微调 VLA 检查点

    PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。

    推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。

7月28日周二