跳到正文

#模型发布

今日 3 条
9月12日周六
  1. qbitai78

    生数发布世界模型 Motus2,探索机器人闭环自进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。

    推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。

9月11日周五
  1. NVIDIA blog robotics71

    Skild AI 发布 S1 机器人基础模型,单段视频即可学习新任务

    Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。

    推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。

9月10日周四
  1. qbitai62

    高德发布3D原生城市世界模型ABot-Earth 0.7

    9月10日,阿里巴巴集团旗下高德发布3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的一体化全尺寸AI生成,覆盖超过196个国家和地区。模型输入一张卫星图像或一段文字描述,可在消费级GPU上用10分钟生成公里级3DGS城市场景,效率比传统模式提升1000倍。体验官网已上线,相关能力已应用于飞行街景2.0,用户可操控摇杆漫游3D场景。

  2. qbitai71

    蚂蚁灵波开源1.3B轻量版LingBot-World 2.0,单卡可实时生成世界

    蚂蚁灵波发布LingBot-World 2.0轻量版,参数规模1.3B,面向消费级单卡GPU设计,可在本地实现实时世界生成。该版本延续7月开源的14B主模型路线,先训练Causal World因果预训练底座,再经一致性蒸馏与DMD蒸馏压缩去噪步数,并让Student在自身长时self-rollout轨迹上训练以减少累计漂移。

  3. qbitai57

    京东发布JoyAI-Echo WM世界模型,规划十万卡国产算力集群

    京东在JDD大会上发布实时可交互世界模型JoyAI-Echo WM,在WBench Navigation评测中以81.6分排名第一。京东云已与摩尔线程等打造国产万卡集群并规划建设十万卡集群,同时推进1000万小时具身数据采集,首批开源数据集EgoLive已对外开放。京东还启动物理AI加速计划,计划5年内采购300万台机器人、100万台无人车及10万架无人机。

9月9日周三
9月7日周一
9月4日周五
9月3日周四
  1. qbitai22

    神秘具身团队 MVP 模型连发 Demo:自进化路线曝光,机器人将上街开放环境测试

    神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。

9月2日周三
  1. qbitai78

    李飞飞 World Labs 发布多模态世界模型 Atlas

    李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。

    推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。

9月1日周二
8月28日周五
8月26日周三
  1. qbitai80

    Skild AI 发布机器人基础模型 S1,上下文学习支持 10 分钟长程任务

    北美具身初创 Skild AI 发布机器人基础模型 S1,主打上下文学习,无需后训练或微调,只看一段人类示范视频即可完成煎饼、冲泡咖啡、给植物换盆、设备组装等长程任务,上下文学习任务长度最长 10 分钟。

    推荐理由:Skild AI 的 S1 把机器人上下文学习拉到 10 分钟长程任务,并给出与语言提示 VLA 的成功率对比数据。

  2. qbitai36

    宇树智元共用一个大脑:神秘具身模型10分钟一镜到底Demo曝光

    一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。

8月25日周二
8月24日周一
8月22日周六
8月21日周五
  1. qbitai78

    Generalist AI 发布机器人基础模型 GEN-1.5,看 3-12 秒示范即可学会新任务

    Generalist AI 发布机器人基础模型 GEN-1.5,主打 One-shot Learning,机器人看完 3-12 秒动作示范后无需梯度更新或微调即可执行新任务,还能把两段演示拼接成连续任务。

    推荐理由:GEN-1.5 把动作示范当作上下文提示,读者可据此了解机器人基础模型在少样本学习上的新路径。

8月20日周四
  1. NVIDIA dev blog robotics60

    NVIDIA 发布 Cosmos 3 Edge,面向端侧机器人控制的后训练世界模型

    NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。

    推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。

8月18日周二
8月17日周一
  1. qbitai40

    共生知行发布双足人形机器人驾驶卡丁车Demo,测试全身智能

    具身智能初创公司共生知行8月17日发布双足人形机器人驾驶卡丁车Demo,机器人在封闭赛道完成双手转向与脚部油门、刹车协调控制。公司将其定位为全身智能压力测试,探索从视觉感知到全身动作输出的端到端基座模型路线,后续将通过技术报告披露模型架构与评测方式。

8月11日周二
  1. qbitai71

    戴盟发布全球首个物理交互脑 Daimon-TWM,获蚂蚁领投数亿元战略轮融资

    戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。

8月10日周一
  1. qbitai62

    Om AI联汇开源端侧原生模型VLX-Seek 1.5,3B版本多项评测对标英伟达LocateAnything

    Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。

8月7日周五
8月6日周四
8月5日周三
8月4日周二
  1. NVIDIA dev blog robotics58

    NVIDIA 发布 Alpamayo 2 Super 开源推理视觉模型

    NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。

8月1日周六
7月30日周四
  1. qbitai78

    World Labs 发布 R2S2R 机器人策略训练与评估引擎

    World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。

    推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。

7月29日周三
  1. HF blog74

    PruhaNLP 发布 TurboVLA-base:面向 SO-100 机械臂的可微调 VLA 检查点

    PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。

    推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。