PCSD:Agentic 强化学习自蒸馏的持续一致性方法
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 论文页介绍 OmniPack,一种面向全模态大语言模型的统一 token 压缩方法,目标是提升这类模型的计算效率。页面未给出具体模型版本、压缩率或实验数据,仅提供论文讨论入口。
GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。
推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。
中国民航大学与清华大学团队设计出基于钙钛矿的激光充电接收器,可让无人机在飞行中持续获电。该接收器面积2平方厘米,在5瓦绿光激光照射下实现近39%的光电转换效率,驱动6.7厘米螺旋桨达7820转/分;集成到固定翼模型后,螺旋桨以1200至1450转/分运转约一分钟。研究尚未进行空中飞行测试,团队下一步将开展轻量无人机的飞行验证。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
EPFL、杜克大学和里斯本高等技术学院团队在 Science Robotics 发表研究,用物理仿真 simZFish 和 80 厘米、2.7 公斤的机器鱼 ZBot 复现斑马鱼视觉运动反应(OMR)神经回路。
瑞士巴塞尔大学 Cornelia Palivan 团队开发出一种模块化纳米机器人,由磁性推进模块与载药胶囊模块经 DNA“魔术贴”自组装连接,可灵活适配不同应用。该纳米机器人携带酶在 HeLa 细胞上原位生成抗癌药物,72 小时内将细胞活力降至 16%;磁性推进模块使其任务完成后可回收并重复使用。
一项针对学习示范(LfD)领域为期一年的研究读完 300 余篇论文,发现仅约 20% 可算作高度重要贡献,其余多为对现有方法的渐进改进或新应用领域。研究指出脚本和大语言模型能完成一般性定量评估,却无法判断研究的真正重要性,也识别不出重复已有解决方案的工作或摘要中的夸大表述。作者建议结合人工精读与自动化工具,并让期刊会议评审重新参与论文排序。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
伦敦玛丽女王大学等欧洲团队研发了一种机器人指尖,其合成皮肤通过布拉格反射器在受力变形时反射不同波长光,由内置摄像头读取颜色变化,生成拓扑、应变和接触压力图。该指尖实现100微米分辨率且无计算延迟,已用于生成人类指尖、硬币和叶片的形貌图。研究者称下一步希望提升对非平面物体的感知能力,并已与潜在应用企业接触。
悉尼新南威尔士大学(UNSW)研发出全合成软体机器人心脏模型,复现左心内部结构,包含人工瓣膜、乳头肌和腱索,可模拟二尖瓣脱垂与反流等病变。研究发表于 Nature Communications 和 Advanced Science,团队用超声、压力与流量测量验证其行为接近真实心脏,并在该跳动模型内测试了一款软体机器人心脏导管。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
Hugging Face 论文页发布 LAMAR,一个开源的语言感知多语言对齐重排序器。页面未提供模型规模、训练数据、评测基准或成功率等具体细节,仅开放论文讨论区供交流。
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
上海新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,数据与模型均开源。
推荐理由:三份报告分别给出触觉数据底座、VLA 触觉预判和世界模型触觉预测,可对照看触觉如何接入现有技术路线。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。
利兹大学与加州大学圣地亚哥分校合作研发的 1.8 mm 软体生长机器人获 RoboSoft 最佳论文奖,该机器人通过磁控转向、无需内部气压即可生长,并能以最高 500 Hz 实时感知自身形状。其硅胶体内混入磁性颗粒并分区磁化,实现驱动与传感一体化,可同时生长和转向,有望减少微创手术中器械与组织的摩擦。
Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。
ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。
推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。
JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。
DiffGI 用连续 2D TSDF 和可微 Marching Squares 模块替换几何图像中的二值占用图,使整条流水线端到端可微,可在消费级 GPU 上约一秒完成高保真薄壳 3D 生成,甚至能在笔记本 CPU 上运行,无需服务器。项目主页已上线,交互式 demo 即将推出。
中国河北工业大学的研究团队开发出一款完全无电机的下肢软体外骨骼,由高功率人工肌肉驱动,相关研究7月10日发表于《Science Advances》。在4公里/小时步行测试中,该装置将受试者步行能耗平均降低13.9%,优于多数既往髋部助力外骨骼。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。
推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。
RSS 2026 公布论文奖项,共收到 708 篇投稿、录用 210 篇,接收率 29.7%,8 篇进入 Final List 后评出三项最佳论文。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
Hugging Face 上线论文页面 xHC: Expanded Hyper-Connections,围绕“扩展超连接”这一主题开放讨论。页面目前仅提供论文入口与讨论区,未披露模型规模、训练数据或实验结果等具体信息。
优理奇机器人(UniX AI)联合浙江大学、MIT、牛津、耶鲁、上海交大发布 UniTac,提出统一的跨传感器触觉理解与生成架构,并接入 VLA,该工作已被 ECCV 2026 接收。
德州农工大学博士生 Sarah Downs 为 NASA 与美国空军合作项目开发了一种不依赖视觉系统的力反馈插入算法,让太空装配卫星的机械臂完成天线插入的“轴孔装配”任务。该机械臂通过夹爪上的力矩传感器感知力反馈,在零重力下完成插入并保持位置,还需计算反向推力以抵消机械臂运动对卫星的反作用力矩。
UC San Diego 提出基于人形机器人的腹腔镜遥操作框架,使用通用器械,通过台架测试、不同手术经验水平的干实验室用户研究以及活体猪实验,量化其技术可行性、任务表现与临床就绪度。研究称这提供了人形机器人手术应用能力与局限的循证评估,并指出临床部署前仍需解决关键技术挑战。
西北大学在 RSS 2026 展示的 Phantom Twist 单电机旋转无人机,以 15 至 25 赫兹转速利用人眼视觉暂留,飞行时比同尺寸四旋翼难见约 10 倍。其设计经迭代优化器以 LPIPS 为指标生成,最优构型 LPIPS 为 0.0104,人工设计版本约 0.2。该机由 0.8 毫米碳纤维杆连接电机、电池、控制器与配重,目前依靠光学追踪系统控制。
EPFL 与 MIT 工程师受潜水鸟类启发,设计出重量不足 300 克的扑翼式水空两栖飞行器 FAAV,可在水下游泳并拍翅跃出水面继续飞行,相关成果发表于 Science。
一种名为 Electrofluidic Fiber Muscles 的新型执行器利用电液压力驱动长管中的压力梯度,使肌肉束收缩,可分别连接执行回路的伸肌与屈肌部分,类似生物机械系统。其驱动压力泵可绕纤维本身布置,形成紧凑结构。该执行器距进入爱好者机器人应用可能还需一段时间。
MIT 工程师设计了一款超声腕带,通过对手腕肌肉、肌腱和韧带成像,配合 AI 算法实时翻译出五指和手掌的位置,从而无线控制机械手。研究团队用 8 名不同手型和腕围的志愿者测试,腕带能追踪包括美国手语 26 个字母在内的手势和抓握动作;演示中佩戴者操控机械手弹琴、投桌面篮球,并在屏幕上缩放和移动虚拟物体。