清华、无问芯穹等开源具身智能体基础设施 RPent
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。
推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。
推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。
社区独立项目 CPM-jev 发布 v0.1-research-preview,这是基于 openbmb/MiniCPM5-2B-Base 的 LoRA 微调模型,新增决策头为候选动作打分并归一化为概率分布。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
Qyvos 是基于 SupersonicLabs/Julia-1 仅微调决策头得到的决策/分类模型,在 ZefanCai/Open-Jev 数据集上训练,支持 choice、score、noul 三类决策。模型冻结 ModernBERT-small 编码器与动作头,仅训练 3,699,073 个参数(占 2.56%),在 3.9 GB 内存约束下完成 3,750 步训练。
PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等团队发布技术报告 JEPA-Anything,提出面向不同领域学习预测模型的跨领域框架,各领域保留自己的观测形式与编码器,共享预测核心和统一的 latent world-state interface。
Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。
MoveIt 2 发布 2.15.2 版本,由 nbbrooks 于 9 月 16 日打标签。该版本在 GitHub 上提供 2 个资源文件下载,仓库现有 2k 星标、810 次 fork。
无问芯穹联合清华大学、上海交通大学开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等平台,首发支持 PI 0.5 与 WALL-OSS 两款具身模型。
Genesis 发布 v1.4.1,重点提升大规模场景下 CPU 与 GPU 的性能,速度随岛屿数量呈亚线性下降,不平衡场景的 Jacobi 均衡开销大幅降低,接触密集场景在 CPU 上明显加速。新版本支持不含 joint2 的 MJCF 关节等式,并修复 glTF 归一化整数访问器解码、法线与纹理坐标保留、MJCF 关节执行器力范围等问题。
Hugging Face 论文页介绍 Recursive Code World Models(RCWM),一种从单张参考图像以可执行代码递归重建复杂 3D 世界的框架。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
蚂蚁灵波发布LingBot-World 2.0轻量版,参数规模1.3B,面向消费级单卡GPU设计,可在本地实现实时世界生成。该版本延续7月开源的14B主模型路线,先训练Causal World因果预训练底座,再经一致性蒸馏与DMD蒸馏压缩去噪步数,并让Student在自身长时self-rollout轨迹上训练以减少累计漂移。
Zenoh 发布 1.10.1,为 TransportUnicast API 新增 close_link 方法。该版本修复了回环定位器的 gossip 探测、REST 插件从编码中提取 content-type HTTP 头,以及空 scout 定位器下待处理连接未清除的问题。
Genesis 发布 v1.4.0,支持将场景连同完整轨迹导出为独立归档,可在任意机器上通过 gs replay 实现位精确回放,目前仅支持刚体求解器。该版本还新增在内存中保存与恢复已构建场景、在连杆任意局部点施加外部力旋量,并修复了大量与资产解析相关的缺陷。
Hugging Face 上线数据集 trinity-graphics/truncgradgs,页面仅附 Hugging Face 推进开源与开放科学的使命宣言,未披露数据规模、模态、许可或使用方式等细节。
MoveIt 2 发布 2.5.10 版本,由 rhaschke 于 9 月 1 日打上标签。该版本未在发布说明中列出具体更新内容,仅提供 2 个资源文件供下载。
Berkeley Humanoid Lite 是一个开源、易定制的人形机器人参考设计,核心是 3D 打印执行器,由电机、打印摆线减速箱和嵌入式磁编码器组成,模块化设计可单独复用。整机硬件成本低于 5000 美元,GitHub 仓库提供所需全部资料,演示视频中包含 VR 遥操作。该设计并非成品,而是可自由修改的参考方案。
MoveIt 2 发布 2.15.1 版本,由 nbbrooks 于 8 月 29 日打上标签。该版本页面未列出具体更新内容,仅提供 2 个资源文件下载。
Hugging Face 论文页介绍 Self-OPD,一种面向流匹配模型的在线策略蒸馏方法,其特点是不依赖教师模型。该页面目前仅开放论文讨论,未给出模型版本、任务、成功率或实验数据等细节。
Microduck 是一款 25 厘米、780 克的机器人,内置 15 个自由度、前视摄像头、8x8 激光雷达、两个 IMU、麦克风、扬声器、NFC、Wi-Fi 和蓝牙,出厂即可行走、坐下、蹲下、滑旱冰、用关节喙拾取物体并自行从跌倒中恢复。它支持手柄操控、外接配件与 NFC 标签物体,可运行自主行为,也能多台组队竞速和踢足球,软件完全开源。目前已开启预售,售价 399 美元,圣诞节前发货。
8月28日,阿里巴巴集团旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧局部画面即可实时重建上万帧3D场景,在KITTI、Oxford Spires、VBR等评测中取得最低误差的SOTA。
Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。
Hugging Face 上线数据集 jeffreylin1222/SDGBiasBench,页面仅附 Hugging Face 推进开源开放科学的使命说明,未给出该数据集的规模、任务或评测指标等信息。
原力灵机DM0.5在RoboDojo具身评测中以综合得分24.90、平均成功率19.34%登顶,Memory维度得分47.74,Cover Blocks任务三次随机测试成功率均为100%。
推荐理由:原力灵机DM0.5登顶RoboDojo并开源权重与训练框架,读者可了解其数据、架构与推理加速的具体做法。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
Zenoh 1.10.0 发布,新增 io_uring 支持、可等待的 SHM 传输提供者,并在 shared_memory/transport_optimization 中新增配置以选择要优化的消息类型。
Genesis 发布 v1.3.3,修复刚体求解器收敛回归,并新增类 torch 的 use_deterministic_algorithms 选项,可在给定机器上实现位精确可复现仿真。
RoboParts 正在构建一个开放的结构化数据集与在线选型引擎,面向仿生机器人部件。该引擎旨在解决硬件选型难题,目前项目处于早期建设阶段,具体功能与数据规模尚未披露。
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的 TriWorldBench Challenge 公布首周榜单,这是首个面向机器人三视角世界模型的评测榜单。
一位开发者分享了其首个完整自主移动机器人项目:用 ROS 2 Jazzy、Gazebo Harmonic 和 Nav2 搭建的自主仓库 AMR 仿真。该机器人是差速驱动 AMR。
一位博士生发布 Ros2_test_compose,可从 YAML 文件生成 pytest/launch_test 集成测试套件,用户只需描述测试、无需编写 Python 代码。该工具面向跨 git 仓库、Docker 容器和机器的 ROS2 代码库,用于避免回归,作者称其比 ros2-easy-test 更易编写和修改测试。
EdgeAI Forge 正在原型化一套本地优先的工程架构,用于生成、测试、基准测试和文档化 ROS 2 与机器视觉流水线,首个目标工作流是 ROS 2 视觉流水线生成器。
作者发布 mppi_controller_cuda,一个基于 MPPI-Generic 框架、参考 nav2_mppi_controller 的 CUDA 加速 MPPI 局部规划器。
Aachal Sharma 与 Rahul Gupta 为 Gazebo Harmonic / Gazebo Sim 8 发布开源火灾仿真插件,可配置模拟火焰、烟雾粒子、热传播与基于距离和方向的火源暴露。
开发者发布了 ROS2 Dev Container Feature,并将 VSCode ROS2 Workspace Template 从预构建 ROS Docker 镜像切换为使用该 Feature。
GZ Weather System 开源了基于 Gazebo Sim(Harmonic)内置 ParticleEmitter 的雨雪仿真世界,无需自定义渲染插件即可集成到机器人仿真中。项目提供 Rain World、Snow World 和基于 Gazebo Transport 的运行时粒子发射控制,并计划加入风效与动态天气过渡。
frontier_exploration_ros2 是一个基于 ROS 2 和 Nav2 的开源 C++ 自主探索项目,探索逻辑封装为 C++ 库,可集成到不同栈中,而不必依赖其提供的 ROS 2 节点。
一个在 TurtleBot3 Burger 上搭配 Intel RealSense D435i 构建增量式 3D 占据栅格地图(OctoMap)的小项目:机器人经 WiFi 回传深度、彩色与轮式里程计,笔记本端将深度转为点云并由 octomap_server 生成体素地图,在 RViz 中实时更新。