DiFF:用多普勒信息流匹配估计人体运动流
DiFF 是一个结合多普勒运动先验与基于 Kolmogorov-Arnold Network(KAN)条件流匹配的生成框架,用于从 4D 毫米波雷达点云中估计人体非刚性运动流。
DiFF 是一个结合多普勒运动先验与基于 Kolmogorov-Arnold Network(KAN)条件流匹配的生成框架,用于从 4D 毫米波雷达点云中估计人体非刚性运动流。
澳大利亚研究团队提出珊瑚培育机器人评估系统 CGRAS,结合机器人成像与计算机视觉,自动完成珊瑚多物种检测计数与健康评估,并提取生长、存活和空间分布指标。该系统在大型水产养殖设施的标准珊瑚附着基上验证,相比人工监测将时间和人力成本降低 9.6 倍,对 Acropora kenti 珊瑚的计数与专家结果一致率达 96.4%。
AIfred 是一款桌面机械臂,末端执行器搭载投影仪,可将 AI 生成指导直接投射在手写作业旁,支持数学作业、图像生成和绘画任务。
研究提出一种面向任务的框架,用于认证有界执行器多旋翼在悬停与接触负载后的残余力旋量权限,基于凸几何推导欧氏球与加权椭球等凸储备的带符号裕度,并通过执行器内点界获得可计算的储备证书以支持松弛最大化分配。
Yggdrasil 是一个面向机器人感知的层优先分层3D场景图,用通用节点、边和层表达现有管线已产出的室内外、扁平或分层表示,并原生回答下游任务的位置与语义查询。
推荐理由:论文提出面向实时查询优化的分层3D场景图,并给出查询延迟与三条感知管线的集成数据。
FAST-Sync 是一种面向任意矩阵李群的快速线性近似群同步方法,可将弦初始化推广到任意矩阵李群,并利用问题数据矩阵的 Kronecker 积结构与同步图拓扑提升速度、可扩展性与精度。实验表明,该方法能为局部优化器提供高质量初始化,在测量噪声较大时仍高效恢复全局最优解并保持高成功率。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
针对四轮独立转向独立驱动(4WIS4WID)移动机器人,提出一种带在线标定的视觉-惯性-轮式里程计(VIWO)框架,直接从四个驱动速度和转向角推导二维里程计模型,并构建预积分模型与解析雅可比用于滤波和标定。
研究提出通用具身引擎(UEE),通过隐式注视与瞳孔信号及任务结果推断操作者的具身感和视本体线索权重,以离散主动推断智能体在显式偏好下选择有界设备设置。在300个异构合成操作者的仿真中,UEE多数在半分钟内找到合适设置,后半程具身感达1.68,接近预言机的0.73(0-2量表)。无模型赌博机表现更差,朴素预测误差最小化器会扣留反馈并降低任务成功率(0.74对0.90)。
MagNav 用五通道模拟霍尔效应传感器阵列实现双轮自平衡机器人的磁轨循迹,不受光照干扰。控制系统采用串级 PID:内环用 IMU 加互补滤波保持平衡,外环依据磁传感器读数调整转向,步进电机无需额外旋转编码器即可精确控制力矩。测试中磁引导在超过 10,000 Lux 强光下仍保持准确循迹,而对比的光学模块会失准甚至失效。
Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。
Hugging Face 论文 OmniTaskonomy 研究视觉生成监督何时能提升视觉理解,发现采用正确训练配方时,图生图(I2I)训练可提升下游图生文(I2T)性能,且 I2I 训练数据越多增益越大。
Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。
Remora Robotics 正在招聘一名机器人及计算机视觉工程师,为下一代自主水下机器人构建感知系统,工作涵盖 SLAM、视觉里程计、目标检测与场景理解,需从想法落地到机器人上运行的代码。该岗位加入 12 人研发团队,要求扎实的机器人与计算机视觉基础、熟练的 C++ 和 Python,SLAM 或视觉里程计经验优先。工作地点为挪威斯塔万格全职,或远程/现场的兼职与全职合同。
一个基于 Vulkan 的 SLAM 系统正在开发中,可在 Android 和 Linux 上运行。项目目前更像概念验证,证明能在相机帧上以零拷贝方式运行任意计算着色器,而非实际的 SLAM/VIO,作者计划未来实现后者。
开发者 haihoang1219931 开源了 SenseRobot AI 国际象棋训练器的 DIY 克隆方案,用 Arduino Mega 2560 + RAMP 1.5 和 NEMA 步进电机复现其物理移子机构、AI 视觉追踪与机械臂精度,无需 ROS。
一名电子与计算机工程本科生在 ROS Discourse 征集机器人感知与高层 AI 任务的推理放置经验:本地、边缘服务器还是云端,是否按截止时间、网络状况和本地算力负载动态调整。提问者想了解延迟或本地算力争抢是否真正造成过问题、如何解决,以及是否有人尝试卸载推理后又回退,并强调不涉及急停、电机控制等安全关键任务。
旧金山初创公司 PitPro Automation 周三宣布,其首套自动换胎系统已在加拿大阿尔伯塔省卡尔加里的一家 Kal Tire 门店投入使用,可在 15 分钟内更换全套四条轮胎。该系统由两个烤箱大小的箱式机器人组成,通过传感器与机械臂定位并松开轮毂螺母,完成拆装轮胎。PitPro 目前主要面向商用车队,同时看好轮胎连锁店因劳动力短缺带来的需求。
云南大学张文华团队研制出钙钛矿太阳能电池,在模拟水下10米光谱条件下光电转换效率达34.71%,陆地条件下为17.08%。他们将电池封装后集成到水下迷你机器人上,在南海涠洲岛附近测试,10米深处115平方厘米电池两小时发电324毫瓦时,2米处为1416毫瓦时。研究估算电池在25°C水温下可连续运行约5.5年。
新西兰怀卡托大学团队公布一款用光学和红外传感单元替代电极的假肢臂环,光电探测器贴近皮肤覆盖不同肌肉群,并采用新型收紧机构以减少运动伪影。团队称皮肤色调会影响传感器读数,正迭代设计并计划开发电学与光学传感混合的假肢。
8 月 25 至 27 日,UK RAS STEPS 成员在约克大学安全自主研究所参加为期三天的 Micromaze 机器人黑客松,组队设计、搭建并编程可穿越递增复杂度迷宫的自主机器人。
IEEE Spectrum 记者在加州帕洛阿尔托试乘 Rivian R1S 的 Autonomy+ 系统,该系统属 SAE L2+,需驾驶员全程关注,计划今年年底前后随全新 R2 SUV 首发,并以 OTA 推送给最新 R1S 和 R1T,订阅价每月 49.99 美元或一次性 2500 美元。
荷兰医疗机器人公司 Vitestro 的自主采血设备 Aletta 于 8 月 19 日获美国 FDA 授权,可在非住院场景用于成人采血,此前已获欧洲监管机构批准。荷兰 1600 多人的临床试验显示,Aletta 首针采血成功率为 94.5%,一名采血员可同时监督最多三台机器。专家关注近红外成像对深色皮肤的偏差风险,Vitestro 称超声传感器不受肤色影响,但相关数据尚未发表。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
一项发表于 Science Robotics 的研究让 50 人与商用人形机器人 Pepper 对话并共同决策,发现机器人出错会损害信任和影响力,无论它是否有表情动作。当富有表现力的 Pepper 打断对话或给出不合逻辑建议时,参与者催产素水平反而升高,且升得越高越不信任机器人、越少采纳其建议。脑成像显示,此时背外侧前额叶与内侧前额叶活动增强并协同更紧密,这一协同预测了催产素上升。
印度CSIR中央机械工程研究所团队在IEEE Sensors Journal发表研究,用6个可拉伸压阻传感器贴附于衣物髋、膝、踝处,配合微控制器上的机器学习算法,对12名受试者平地行走、上下坡和上下楼梯动作分类准确率达99.83%,未穿戴过该系统的新用户准确率为89%。整套传感层功耗仅0.318毫瓦,传感器可承受超过12000次拉伸至原长三倍的循环,目前仍为仅能分类动作的原型。
量子位刊载的触觉传感技术路线分析首篇认为,视触觉传感器(VBTS)底层仍依赖小体积CMOS摄像头模组成像,算法多复用ResNet/CNN、U-Net、光流法等视觉工具,硬件门槛低、同质化严重,难以形成技术护城河。
8月28日,阿里巴巴集团旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧局部画面即可实时重建上万帧3D场景,在KITTI、Oxford Spires、VBR等评测中取得最低误差的SOTA。
Ollobot 推出 AI 家庭陪伴机器人 OlloNi SS1,主打主动交互、跌倒检测与持续在场,面向独居老人、父母远行的儿童和城市独居职场人三类场景。它搭载多芯片 AI 4K 视觉模块,支持人脸识别与运动追踪,可在木地板、瓷砖和低矮地毯上移动,爬坡能力达 3.5 度,并配有物理摄像头隐私盖。机器人通过 OTA 更新持续升级,可主动靠近家人参与互动、提醒孩子学习休息。
Haofeng Chen 等人发表研究,用 3D 打印的柔性 TPU 层与导电织物贴片构成人工皮肤,通过电阻抗层析成像(EIT)重建触摸位置与力度。原型仅用 16 个电极就生成了较准确的压力分布图,硬件结构相对简单,主要难点在于 TPU 孔隙率表征与论文给出的 EIT 算法。
硅羽科技创始人张富(李泽湘学生、前大疆8年产业顾问、香港大学副教授)正把港大MaRS Lab的自主导航技术转化为产品,让飞行器不靠GPS和飞手遥控,自主感知、决策并完成任务。公司半年内连续完成四轮融资,累计数亿元,投资方包括耀途资本、锦秋基金、阿里巴巴。今年年底将量产第一阶段产品,面向地下管廊、隧道、仓储厂房、桥下与森林等场景,产品重量不到一千克、续航20-30分钟。
Imperial Robotics Summer School 的一个小组项目尝试让机器人同时与多人互动,而非多数社交机器人惯常的一对一模式。团队实现了实时检测活跃说话人、在交互中追踪每个人的身份,并生成自然的注视与转头行为,使机器人对整组人表现出关注。作者借此梳理了从语言到动作的完整流程:LLM 将自然意图转为结构化命令,再映射到高层机器人功能,经逆运动学生成关节轨迹,最终通过控制栈驱动执行器。
在宇树 G1、EngineAI T800 等人形机器人上部署 VLA 时,RealSense 相机组的配置成为主要障碍。以 unitreerobotics/unifolm-vla 为例,该 VLA 需要 2 个腕部相机,而现有 RealSense 相机组的安装与配置尚待解决。
有开发者在 ROS Discourse 提问,是否已有人实现传感器数据和控制指令的延迟(乃至抖动)仿真,并认为在 ROS 中直观做法是类似 topic_tools/delay 的节点。目前该问题尚未给出具体实现方案或结果。
该项目用 AgileX PiPER 六自由度机械臂、Orbbec RGB-D 相机和 ROS 2 Humble 搭建人脸跟踪显示屏控制系统,通过 YOLOv5-Face 与深度数据估计人脸三维位置,发布 face TF 后计算目标显示器位姿并下发 /pos_cmd 控制机械臂。
UCL 机器人硕士生发帖询问,团队如何在感知或传感器融合栈于生产环境中静默退化、尚未引发可见故障前就发现它,并列举人工抽查、日志告警、定期标定等可能做法。有回复者称其做法是对每个检测结果运行位姿估计以快速过滤单帧误检,在已知目标时还依据估计距离核验物体尺寸,并可查看检测器 softmax 值,若所选类别领先幅度不大则降低对该检测的信任。
硬件维修爱好者 Aad 用 ESP32-WROOM 控制舵机与步进电机,把一台 Ultimaker 3D 打印机热端换成可升降夹爪,做出自动分拣螺丝和螺栓的系统。混合零件经传送带落入照明平台,由 ESP32-CAM 机器视觉识别尺寸、形状与朝向,夹爪逐个抓取并按类投入料盒,还能称重并可选送 USB 显微镜细看。该系统目前只是概念验证,但理论上可分拣任意小物件。
一个最小 C++ 复现示例提出顺序敏感一致性残差:输入三个连续位姿样本,输出一个标量,用于量化状态复合嵌套顺序改变时结果偏移多少。合成测试中,平滑线性运动残差为 4.9848e-08,位姿/朝向突变时为 0.000881456。作者称其尚非经验证的异常检测器,归一化、坐标系约定与真实阈值仍需完善,复现无需 ROS、Eigen 或外部依赖。
DARPA Lift Challenge 本周末举行,多款外形奇特的重型起重无人机设计亮相,DARPA 已录制全程直播。NASA SkyFall 火星直升机将用地面穿透雷达搜寻冰冻水,为此搭载可向下伸展的柔性织物天线,避免干扰着陆或在触地时损坏。Generalist 称 GEN-1 在适应新执行器与新机器人方面改进,内部基准提升 10-20 倍,在 NIST 板拆解等高精度任务上表现显著提升。
一个在 TurtleBot3 Burger 上搭配 Intel RealSense D435i 构建增量式 3D 占据栅格地图(OctoMap)的小项目:机器人经 WiFi 回传深度、彩色与轮式里程计,笔记本端将深度转为点云并由 octomap_server 生成体素地图,在 RViz 中实时更新。