跳到正文

评测与基准

机器人与具身智能领域的评测与基准,保留来源、阶段和证据边界。

5条精选

最新精选

第 1–5 条 · 共 5 条
今天10月1日周四
  1. arXiv cs.RO66

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉

    研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。

    推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。

9月2日周三
  1. HF blog60

    DroneCATS 评测多模态 LLM 作为无人机视觉语言动作智能体

    论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。

    推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。

8月28日周五
  1. HF blog62

    PAWBench:当前视频生成模型距离概率对齐的世界模型还有多远

    论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。

    推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。

8月6日周四
  1. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

1月6日周二
  1. NVIDIA dev blog robotics62

    NVIDIA 推出 Isaac Lab-Arena,简化仿真中的通用机器人策略评测

    NVIDIA 发布 Isaac Lab-Arena,用于在仿真中简化通用机器人策略的评测。通用机器人策略需跨多种任务、本体和环境运行,需要可扩展、可重复的仿真评测,而大规模评测搭建繁琐且依赖人工,开发者往往要自建高开销的定制基础设施,任务库在复杂度和多样性上也有限。

    推荐理由:Isaac Lab-Arena 面向通用机器人策略的仿真评测,读者可了解其如何降低大规模评测的搭建成本。