跳到正文

#安全/对齐

今日 1 条
今天10月1日周四
  1. arXiv cs.RO62

    TALK-Dem:面向痴呆症沟通模式的具身任务规划基准

    作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。

    推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。

9月30日周三
9月28日周一
9月22日周二
9月21日周一
9月17日周四
9月8日周二
9月7日周一
  1. IEEE Spectrum robotics46

    Vitestro 自主采血机器人 Aletta 获 FDA 授权,首针成功率 94.5%

    荷兰医疗机器人公司 Vitestro 的自主采血设备 Aletta 于 8 月 19 日获美国 FDA 授权,可在非住院场景用于成人采血,此前已获欧洲监管机构批准。荷兰 1600 多人的临床试验显示,Aletta 首针采血成功率为 94.5%,一名采血员可同时监督最多三台机器。专家关注近红外成像对深色皮肤的偏差风险,Vitestro 称超声传感器不受肤色影响,但相关数据尚未发表。

9月1日周二
  1. HF blog45

    MineAmongUs:VLM 智能体在具身社交互动中的言语与非言语欺骗

    Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。

8月21日周五
  1. qbitai38

    优必选行者具身智能大模型完成生成式人工智能服务备案

    优必选自研的“行者具身智能模型”于2026年8月18日通过中央网信办测评审核,正式完成生成式人工智能服务备案,成为具身智能机器人行业首批通过模型备案的企业之一。该模型面向情感交互专项微调,与2026年2月开源的视觉—语言基础多模态模型Thinker共享具身底座,Thinker在权威基准评测中取得9项全球第一。截至目前,优必选已有5项算法通过国家互联网信息服务算法备案。

8月16日周日
8月6日周四
8月2日周日
  1. ROS Discourse latest38

    QERRA-v2 Classical:面向 ROS 2 与行为树的两层道德与物理安全中间件

    QERRA-v2 Classical 是一款开源、完全可解释的安全中间件,用于在自主机器人动作执行前进行评估。其架构分两层:零机器学习的纯 Python 物理安全层 QERRA-HSR 评估物理危险接近度与人类痛苦信号并触发故障关闭式安全停机,SEMEV-12 道德审议引擎则依据 12 个人本伦理维度评估自然语言任务并输出完整推理日志。

7月29日周三
7月25日周六
  1. ROS Discourse latest15

    仓库 AMR 车队在生产环境中是否做运行时安全监控?

    一名安全工程师在 ROS Discourse 询问,已投产的仓库/3PL AMR 车队是否在运行时持续做安全监控,还是仍以 SROS 2、DDS security 等设计期加固为主、上线后不再干预。他还追问机器人被入侵的担忧被归为网络安全问题还是安全/可用性问题,以及内部由谁负责。OSRA 回应称即将启动改善 ROS 安全性的工作,并邀请其提供经验与问题。

7月18日周六
  1. qbitai22

    WAIC 2026 首日:Kimi K3、印奇、Sutton、Bengio 等大佬都在说什么

    WAIC 首日,Kimi K3 在模型侧搅动风云,印奇提出 AI 产业下一轮爆发来自智能体模型与下一代终端产品的结合,物理场景通用智能体是第三波核心主线。Richard Sutton 认为静态数据标注已达天花板,经验驱动是下一代 AI 核心路线;苏昊提出解决大模型幻觉的关键是物理智能,需进入真实世界完成端到端交互。