论文研究 VLM 智能体空间记忆过期问题
一篇论文在动态 FrozenLake 测试台上研究记忆增强 VLM 智能体的空间记忆过期问题,覆盖三个闭源模型和三个开放权重 VLM,在文本与图像输入下完成 1,800 次过期检测运行,并在共享 50 种子规模下完成 12,000 个文本模式导航回合。
一篇论文在动态 FrozenLake 测试台上研究记忆增强 VLM 智能体的空间记忆过期问题,覆盖三个闭源模型和三个开放权重 VLM,在文本与图像输入下完成 1,800 次过期检测运行,并在共享 50 种子规模下完成 12,000 个文本模式导航回合。
中国民航大学与清华大学团队设计出基于钙钛矿的激光充电接收器,可让无人机在飞行中持续获电。该接收器面积2平方厘米,在5瓦绿光激光照射下实现近39%的光电转换效率,驱动6.7厘米螺旋桨达7820转/分;集成到固定翼模型后,螺旋桨以1200至1450转/分运转约一分钟。研究尚未进行空中飞行测试,团队下一步将开展轻量无人机的飞行验证。
爱好者 JD 为 Stewart 平台改造的六足机器人 Stewy 加装力感知:在腿部舵机串联电阻,通过测量电压降推算电流,再依据欧姆定律换算出扭矩,无需应变片。数据质量出乎意料地好,但需略微降低舵机速度。
Framatome 位于美国弗吉尼亚州 Lynchburg 的 Installed Base NDE 服务团队正在招聘机器人感知/自主软件工程师,该岗位为现场办公,用于支持面向美国、加拿大和欧洲商用核电站的无损检测(NDE)自动化流程开发。
伦敦玛丽女王大学等欧洲团队研发了一种机器人指尖,其合成皮肤通过布拉格反射器在受力变形时反射不同波长光,由内置摄像头读取颜色变化,生成拓扑、应变和接触压力图。该指尖实现100微米分辨率且无计算延迟,已用于生成人类指尖、硬币和叶片的形貌图。研究者称下一步希望提升对非平面物体的感知能力,并已与潜在应用企业接触。
针对 ROS/ROS2 感知管线现场调试难题,原型 YERP(YOLO Edge Runtime Profiler)提出在 rosbag2 snapshot 之上加一层事件触发的运行时证据层,由 YERP 判断何时触发快照并记录触发原因与结构化感知运行时证据。
Polka v0.5.0 发布,这是一个在 ROS 2 中统一处理 2D/3D 激光雷达数据的节点,支持点云合并、传感器同步/丢帧标记、滤波、完整 QoS 控制以及单雷达加 IMU、多源加 IMU、运动关节上传感器的去畸变。
高中生作者在 ROS 2 Jazzy 发行版中发布 scan_detection_fusion,将 2D LiDAR 扫描与相机目标检测融合,输出带语义标签的距离化障碍物和类别感知地面轮廓供导航使用。
Pavlov Mini Wheel 系列第 2 部分解析了这台 ROS 2 自主机器人从单帧相机图像到导航目标的完整感知流水线,系统由多个独立 ROS 2 节点组成。
利兹大学与加州大学圣地亚哥分校合作研发的 1.8 mm 软体生长机器人获 RoboSoft 最佳论文奖,该机器人通过磁控转向、无需内部气压即可生长,并能以最高 500 Hz 实时感知自身形状。其硅胶体内混入磁性颗粒并分区磁化,实现驱动与传感一体化,可同时生长和转向,有望减少微创手术中器械与组织的摩擦。
Pavlov Mini Wheel 是一个基于 ROS2 的开源自主四足机器人平台,可借助计算机视觉检测目标物体并据此自主移动。系统采用 ROS2 Humble 负责通信与控制、Gazebo 用于仿真测试、树莓派 4B 做高层处理、Arduino Mega 做底层硬件控制,开发涵盖 URDF/Xacro 建模、仿真、硬件集成与 AI 感知。
都灵理工大学五人团队在ROS 2 Humble/Gazebo中复现并扩展了Yousuf & Kadri 2020年的ANN+FLS定位论文,用双EKF、在线训练ANN和模糊逻辑系统实现TurtleBot3 Burger的室内外无缝切换。
OOMWOO 是一款完全开源的扫地机器人,从硬件到软件均不依赖任何云服务,依靠树莓派运行 ROS 2,并使用低成本 2D 激光雷达实现房间感知与建图。该项目大部分零件需 3D 打印,可便捷接入 Home Assistant 等现有开源工具,目前软件开发基本完成,物料清单仍在整理中,由志愿者在 GitHub 上协作推进。
作者开源了 ros2-fast-stereo,一个基于 ROS 2 Jazzy 的实时立体深度估计工作区,用 TensorRT 加速移植 NVIDIA 的 Fast-FoundationStereo 模型。
OnSLAM 是一款开源 Windows 应用,可直接对 ROS1 bag 文件运行 LiDAR-惯性里程计与建图,自动识别兼容的 LiDAR 与 IMU 话题,在本地运行建图流程,并在浏览器中可视化轨迹与点云地图,导出 PLY 和 PCD 文件。
有开发者在 ROS Discourse 发起调查,计划制作面向初学者的机器人数学与经典论文学习资源,侧重直觉理解、公式推导和实际实现,而非只给最终方程,主题涵盖状态估计、SLAM、优化、控制、运动规划与计算机视觉。团队在投入制作前先通过问卷征集社区反馈,并邀请学生、研究人员、教育者和机器人工程师参与填写与转发。
光鉴科技发布具身智能视觉感知方案,以AI双目视觉为核心,并推出Libra系列AI双目视觉模组:Libra 1000采用2cm基线面向腕部精细操作,Libra 3000采用7cm基线面向中远距离空间感知。方案采用全域泛化感知设计,以统一硬件平台支撑深度感知、SLAM定位、目标检测等任务并支持OTA升级,同时通过优化计算架构降低算力占用,为VLA推理等释放算力。
Nav2 集成 Meta 的 SAM3 基础模型实现通用语义导航,在 AMD Strix Halo(Ryzen AI Max+ 395)上端侧运行,以 5-10 Hz 输出逐像素掩码。
西北大学在 RSS 2026 展示的 Phantom Twist 单电机旋转无人机,以 15 至 25 赫兹转速利用人眼视觉暂留,飞行时比同尺寸四旋翼难见约 10 倍。其设计经迭代优化器以 LPIPS 为指标生成,最优构型 LPIPS 为 0.0104,人工设计版本约 0.2。该机由 0.8 毫米碳纤维杆连接电机、电池、控制器与配重,目前依靠光学追踪系统控制。
上海 Robooter 与新加坡 Strutt 今年将智能轮椅带入美国消费市场:Robooter 的 E80 和 E60 Pro-A 售价 3,499 和 3,299 美元,仅支持 App 遥控转向与自动折叠,不具备自主导航;Strutt 的 EV1 售价 7,499 美元,用激光雷达和摄像头实现自主导航,但明确声明不作为医疗器械使用。
PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。
俄勒冈州立大学团队研发出一种受大脑启发的光电晶体管图像传感器,能同时感光并存储数据,还可通过电压调节记忆时长,实现从快速遗忘到保留数小时的渐变遗忘。该器件为4×4像素阵列,采用IGZO晶体管与有机光活性层,可在传感器上直接完成变化检测,有望大幅降低机器视觉的能耗。目前仅完成器件级验证,下一步将扩展像素阵列并开发集成成像原型。
蚂蚁灵波开源空间原生视觉基模 LingBot-Vision,并发布基于它的空间感知模型 LingBot-Depth 2.0。
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
AffectGuard-HRI 是运行在 ROS 2 Jazzy 上的社交/家庭机器人框架,将视频(FER+ ONNX)与音频(MFCC + ONNX)情感节点融合为 fused_emotion_state,再由规则引擎提出动作、经不可覆盖的安全包络钳制后才执行。
开发者 Vladimir Privalov 为索尼 PlayStation 5 HD 相机实现了一个 ROS 2 节点,让这款 60 美元、支持 1080p 60 FPS 的双目相机更易接入 ROS 2。
7月2日,2026科大讯飞智能交互生态发布会在深圳举行,AIUI从语音交互向多模态AI交互平台演进,融合图像理解与生成能力。多语种交互平台覆盖40余种语言,一站式赋能智能硬件出海;机器人超脑平台完成新一轮升级,强化多模态感知、复杂任务理解与场景执行能力,加速机器人从实验室走向真实产业。
Robot Talk 第161期对话斯坦福大学 Allison Okamura,讨论面向触觉交互的先进机器人系统开发。Okamura 是斯坦福大学 Richard W. Weiland 工程学教授,研究兴趣涵盖触觉、遥操作、虚拟现实、医疗机器人、软体机器人、康复与教育,并担任斯坦福机器人中心创始教员及执行委员会成员。
Robot Talk 第159期对话赫瑞瓦特大学助理教授 Maria Koskinopoulou,主题为机器人感知与操作。她与 Ignacio Carlucho 共同领导该校及国家机器人馆的 ARM²Lab(自主机器人操作与多智能体系统实验室),研究涵盖机器人操作、感知、机器人视觉、医疗机器人、人机交互与机器学习。
MIT 工程师与 Meta Reality Labs 等合作者在 Nature Communications 发表研究,开发出一种柔性凝胶,光照后可将其导电性提升 400 倍,所用光离子发生器(PIG)材料本身导电性可提升约 1000 倍。
康奈尔大学研究团队用可拉伸光纤传感器制作软体机器人夹爪,通过触觉预测草莓成熟度,并轻柔地将果实从藤蔓上旋拧摘下而不造成损伤。夹爪装有两种光纤传感器,分别测量手指弯曲度和指尖压力,据此估计物体形状并调整抓握力度;腕部还加入行星齿轮机构,使夹爪旋转拧下果实而非拉扯。
Sony AI 开发的自主乒乓球机器人 Ace 在测试中五场赢下三场,对手是训练十年以上、每周约 20 小时的精英选手,但对阵日本职业联赛选手两场均告负,仅赢下一局,相关系统细节发表在 Nature 论文中。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
NVIDIA 机器人研发文摘 R²D² 本期聚焦长时程操作中的感知引导任务与运动规划,指出传统 TAMP 系统依赖静态模型、在新环境中常失效。方案将感知与操作结合,使机器人能在执行过程中更新规划并适应动态场景。