跳到正文

#操作/抓取

今日 24 条
9月28日周一
  1. HF blog22

    ngustj/pen_pick_place_clean_150ep_v1:基于 LeRobot 的 150 回合抓笔放置数据集

    Hugging Face 上线数据集 ngustj/pen_pick_place_clean_150ep_v1,用 LeRobot 采集,共 150 个回合、71019 帧,30 fps,机器人类型为 so_follower。该数据集含 1 项任务,动作与状态均为 6 维关节位置,另配 top 和 wrist 两路 480×640 视频,采用 v3.0 代码库格式,训练集覆盖全部 150 个回合。

9月27日周日
9月26日周六
9月25日周五
9月24日周四
  1. Robohub12

    IROS 2026 有哪些看点?

    IROS 2026 将于 9 月 27 日至 10 月 1 日在美国匹兹堡举行,议程包括全体会议、主旨演讲、研讨会、教程、论坛、竞赛和一场辩论。主旨演讲于 9 月 28 至 30 日进行,涵盖自主手术、软体机器人、灾害机器人、操作系统的前沿押注以及具身智能的 AlphaGo 与 ChatGPT 时刻等主题。

  2. qbitai62

    灵初智能发布 Psi-R2.5,用强配对数据改进人机动作对齐

    灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。

9月21日周一
  1. HF blog62

    Learning Foresight without Explicit Trajectories for 3D Diffusion Policies 论文发布

    论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。

    推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。

9月18日周五
  1. HF blog45

    FAMOS:从稀疏观测进行前馈 3D 关节建模

    Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。

9月16日周三
9月15日周二
9月11日周五
9月9日周三
  1. qbitai40

    汉朔科技与X-Era Lab合作:具身机器人能否搞定超市盘点?

    汉朔科技与X-Era Lab(拓元智慧)合作,将具身智能机器人带入真实零售门店,聚焦巡检、盘点、补货三类任务,汉朔巡检机器人已在国内和海外商场开始POC测试。汉朔已在近7万家门店部署电子价签网络,为机器人提供货架语义坐标;X-Era Lab的原生世界动作模型VWA仅用10亿参数,可在32 TOPS算力硬件上端侧部署,推理时延压缩至毫秒级。

9月5日周六
9月3日周四
  1. qbitai71

    自变量发布三指灵巧操作系统 TwinDEX,后训练真机遥操数据为 0

    自变量发布全新灵巧操作系统 TwinDEX,在后训练阶段真机遥操数据为 0 的情况下,用几百条无本体数据完成化学实验场景中的旋拧瓶盖、注射器推注等精细操作。该系统由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程组成,采用三指九自由度和数采与执行同构设计,官方称单位时间有效轨迹约为传统真机遥操的 5.3 倍。

9月2日周三
  1. HF blog74

    ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型

    ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。

    推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。

9月1日周二
8月31日周一
  1. HF blog71

    PonderPounce:用预训练 MLLM 作为机器人控制的回合上下文引擎

    PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。

    推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。

8月28日周五
  1. HF blog62

    TacForcing:用执行时触觉反馈的流式动作生成框架

    TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。

    推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。

  2. HF blog71

    Zero-WAM:以人类视频上下文建模世界与动作,实现开放任务泛化

    Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。

    推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。

8月26日周三
  1. qbitai36

    宇树智元共用一个大脑:神秘具身模型10分钟一镜到底Demo曝光

    一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。

8月23日周日
8月22日周六
8月21日周五
  1. HF blog71

    τ_0-VLA:世界模型引导测试时计算的分层机器人基础模型

    τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。

    推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。

  2. HF blog62

    GOAG:面向灵巧操作的生成式物体无关抓取规划器

    GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。

    推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。

8月20日周四
8月19日周三
  1. qbitai58

    源络科技Monte2人形机器人落地国家级科研实验室

    源络科技与国家级科研实验室联合研发的人形机器人Monte2已进入该实验室,可自主完成试剂取放、配置、分液、细胞毒性检测等流程,并协同多台实验设备运行。该机器人此前已在华大制造投入使用,实验室计划到2027年底将机器人数量扩展至约百台规模,并通过AI统一调度机器人集群。源络科技同时发起「原点计划」,寻找首批100位合作伙伴,共同验证具身智能在生物医药、材料科学、化学分析等领域的应用。

8月18日周二