跳到正文

全部动态

今日 71 条
9月3日周四
  1. IEEE Spectrum robotics12

    IEEE 第 300 个里程碑授予加拿大 Canadarm 机械臂

    IEEE 将 Canadarm 航天机械臂认定为第 300 个里程碑,6 月 19 日在 MDA Space 总部举行授牌仪式,由 IEEE 多伦多分会提名。该机械臂由 Spar Aerospace 与加拿大国家研究委员会为 NASA 航天飞机研制,1981 年 11 月随哥伦比亚号第二次飞行首次部署,在五架航天飞机和国际空间站上使用了 30 年。

9月2日周三
  1. qbitai10

    蚂蚁灵波 CEO 朱兴等将首次同台,外滩大会聊具身智能落地

    蚂蚁灵波 CEO 朱兴、首席科学家沈宇军、首席数据科学家黄用韬将于 9 月 11 日下午在 2026 Inclusion·外滩大会首次同台,围绕「基座之上:具身智能的场景突围与协同进化」讨论模型、数据与产业落地。多位具身智能青年科学家及百亿级具身企业掌门人也将到场,共同拆解具身智能从“能跑通”走向“真落地”的关键问题。

  2. qbitai22

    前字节强化学习专家孙鹏博士加盟星尘智能,负责机器人强化学习研发

    前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。

  3. qbitai42

    智平方 AlphaBot 2 入驻香港兰桂坊,成香港首个真实开放场景服务机器人

    智平方(AI² Robotics)的 AlphaBot 2(爱宝)机器人已入驻香港兰桂坊酒吧,提供打鸡尾酒与互动服务,成为香港首个在真实开放场景上岗的服务机器人。该机器人搭载类脑架构具身大模型 NeuroVLA,实验数据显示可将运动抖动降低 75% 以上,碰撞后 20 毫秒内完成反射响应,功耗约 0.4 瓦。智平方称此次落地跑通了从硬件出关、清关合规到取得香港本地饮品售卖资质的出海全链路闭环。

  4. qbitai78

    李飞飞 World Labs 发布多模态世界模型 Atlas

    李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。

    推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。

  5. HF blog62

    Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

    Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。

    推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。

  6. HF blog74

    ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型

    ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。

    推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。

  7. HF blog62

    H3-World:把语言理解变成世界控制,将 33B MiniMax-H3 视频生成器改造为交互式世界模型

    H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。

    推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。

  8. HF blog60

    DroneCATS 评测多模态 LLM 作为无人机视觉语言动作智能体

    论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。

    推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。

9月1日周二
  1. TechCrunch robotics62

    Waymo 在丹佛、圣迭戈和坦帕推出 Robotaxi 服务,覆盖美国 14 城

    Waymo 已在丹佛、圣迭戈和坦帕向公众开放 Robotaxi 服务,将商业运营扩展至美国 14 个城市,并采取滚动邀请、逐步放量的方式。其自动驾驶车队规模已超过 4000 辆,包括捷豹 I-Pace 和名为 Ojai 的新款厢式车;在丹佛和圣迭戈,乘客只能乘坐搭载第六代自动驾驶系统的 Ojai,目前该车型约 300 辆。

  2. HF blog71

    LightNav-0:用 VLM 空间智能实现通用具身导航

    LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。

    推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。

  3. HF blog45

    MineAmongUs:VLM 智能体在具身社交互动中的言语与非言语欺骗

    Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。

  4. TechCrunch robotics18

    Danu Robotics:AI 机器人分拣垃圾与资源回收

    Danu Robotics 是一家英国公司,用 AI 驱动机器人改造垃圾分拣与资源回收,业务覆盖 AI/机器学习、机器人、可持续发展和工业自动化领域。公司由 Xiaoyan Ma 创立,目前处于开放运营并正在融资阶段,将参加 TechCrunch Disrupt 2026。

8月31日周一
  1. Robohub38

    研究:人形机器人 Pepper 表现力越强,出错时人越不信任它

    一项发表于 Science Robotics 的研究让 50 人与商用人形机器人 Pepper 对话并共同决策,发现机器人出错会损害信任和影响力,无论它是否有表情动作。当富有表现力的 Pepper 打断对话或给出不合逻辑建议时,参与者催产素水平反而升高,且升得越高越不信任机器人、越少采纳其建议。脑成像显示,此时背外侧前额叶与内侧前额叶活动增强并协同更紧密,这一协同预测了催产素上升。

  2. TechCrunch robotics52

    美国收紧机器人与无人机限制,中国靠规模优势转向其他市场

    TechCrunch 报道,美国在7月和8月收紧对外国先进机器人系统的限制,并对进口无人机及部件加征关税,无人机关税9月生效,部件关税2027年跟进。Counterpoint 数据显示,2026年上半年全球人形机器人出货2.2万台,AgiBot、宇树、Galbot、优必选、乐聚五家中国厂商合计占86%。

  3. HF blog71

    VLAct:面向视觉语言动作模型的表征中心持续预训练

    论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。

    推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。

  4. HF blog71

    PonderPounce:用预训练 MLLM 作为机器人控制的回合上下文引擎

    PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。

    推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。

  5. HF blog62

    Code-as-World:用可执行代码表示物理世界,为视觉语言模型提供物理推理监督

    论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。

    推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。

8月30日周日
  1. Hackaday robots62

    Berkeley Humanoid Lite 开源人形机器人采用 3D 打印执行器

    Berkeley Humanoid Lite 是一个开源、易定制的人形机器人参考设计,核心是 3D 打印执行器,由电机、打印摆线减速箱和嵌入式磁编码器组成,模块化设计可单独复用。整机硬件成本低于 5000 美元,GitHub 仓库提供所需全部资料,演示视频中包含 VR 遥操作。该设计并非成品,而是可自由修改的参考方案。

  2. IEEE Spectrum robotics39

    印度团队研发低功耗可穿戴运动追踪系统,准确率超99%

    印度CSIR中央机械工程研究所团队在IEEE Sensors Journal发表研究,用6个可拉伸压阻传感器贴附于衣物髋、膝、踝处,配合微控制器上的机器学习算法,对12名受试者平地行走、上下坡和上下楼梯动作分类准确率达99.83%,未穿戴过该系统的新用户准确率为89%。整套传感层功耗仅0.318毫瓦,传感器可承受超过12000次拉伸至原长三倍的循环,目前仍为仅能分类动作的原型。

8月29日周六
  1. qbitai22

    去年归国的徐梦迪,成了清华姚班班主任

    2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。

  2. Hackaday robots16

    用微型机械臂搭建 microSD 卡库:T-bot 结构实现 12 槽位取放

    爱好者 svofski 用现有 microSD 卡搭建了一套 SD 卡库,核心是一台微型机械臂,可在 12 个 microSD 卡槽间抓取并插拔卡片。夹爪最初采用双钳旋转方案,因过于复杂改为齿条齿轮式平移夹持,整机置于类似 coreXY 运动学的 T-bot 结构中。该装置并非为特定用途而造,更多出于对磁带机式自动换卡机器人的兴趣,但可用于批量复制 SD 卡等可移动介质。

  3. TechCrunch robotics58

    中国车企追随特斯拉押注人形机器人

    TechCrunch 报道称,中国多家车企正追随特斯拉押注人形机器人。小鹏机器人部门本周融资超 9 亿美元,投后估值超 63 亿美元,由 IDG 资本领投,腾讯、阿里等参投,公司称这是中国具身智能行业最大单轮私募融资。奇瑞旗下 AiMOGA 据报已启动 IPO 准备,比亚迪发布人形机器人“小迪”,长安、广汽、理想、上汽、赛力斯等也在研发人形机器人。

  4. IEEE Spectrum robotics22

    让金刚肌肉如此真实的物理引擎:Ziva VFX 与 2025 奥斯卡技术成就奖

    南加州大学教授 Jernej Barbič 因设计开发 Ziva VFX 获得 2025 年奥斯卡技术成就奖,该软件可模拟 3D 数字人与生物的肌肉、脂肪和皮肤。Ziva VFX 由他参与创办的 Ziva Dynamics 于 2016 年推出,2021 年被 Unity Technologies 收购,已用于《海王与失落的王国》《哥斯拉大战金刚:新帝国》《毒液2》等 60 多部电影。