TALK-Dem:面向痴呆症沟通模式的具身任务规划基准
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
同一台两轴云台机械臂、同一句"满行程转一遍"的模糊指令下,GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol 都让机器人转了起来,但对"完成"的理解完全不同。
Hugging Face 上线数据集 macmacmacmac/Sev-behavioral-research-v1,以请求起始顺序记录 HTTP 事务,时间用相对毫秒、字节数为 JSON 体积,资源 ID 一致化别名,正文仅保留选择、版本、错误与重试提示,隐去密钥和内容。
NVIDIA 推出 Halos,称其为首个也是唯一一个面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
第三方公益机构 Robocurve 发布机器人安全基准 RoboHarm,把 GPT-6 Astra、Fable 5.1 和 MolmoAct2 接入同一套双机械臂,测试刺向类人目标、加热压缩气体、制造有毒烟雾等五类物理风险任务,每任务每模型重复 20 次并由人工打分。
研究显示,针对视觉语言动作(VLA)模型的后门攻击 BadVLA 可在触发器出现时让机器人动作轨迹产生条件性偏移,无触发器时任务表现基本正常;GoBA 用咖啡杯等普通物体作触发器,报告 97% 攻击成功率且不降低干净输入上的表现。
Fast DDS 发布 v2.14.7,修复 18 项 CVE,涉及访问控制解析器、反序列化及 PartitionQosPolicy CDR 反序列化整数溢出(GHSA-8g7x-c9fg-g6mh),相关补丁来自私下审查分支。
荷兰医疗机器人公司 Vitestro 的自主采血设备 Aletta 于 8 月 19 日获美国 FDA 授权,可在非住院场景用于成人采血,此前已获欧洲监管机构批准。荷兰 1600 多人的临床试验显示,Aletta 首针采血成功率为 94.5%,一名采血员可同时监督最多三台机器。专家关注近红外成像对深色皮肤的偏差风险,Vitestro 称超声传感器不受肤色影响,但相关数据尚未发表。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
优必选自研的“行者具身智能模型”于2026年8月18日通过中央网信办测评审核,正式完成生成式人工智能服务备案,成为具身智能机器人行业首批通过模型备案的企业之一。该模型面向情感交互专项微调,与2026年2月开源的视觉—语言基础多模态模型Thinker共享具身底座,Thinker在权威基准评测中取得9项全球第一。截至目前,优必选已有5项算法通过国家互联网信息服务算法备案。
李飞飞在Huberman Lab访谈中表示,AI在医疗、影视、教育等领域都不是人类的替代者,而是个人能力的放大镜。她以父亲接受达芬奇手术机器人操刀的肝脏手术为例,指出复杂外科手术中人机协作效果远好于机器人自主执刀,并强调不能让少数科技企业替整个社会做决定。
一篇论文在动态 FrozenLake 测试台上研究记忆增强 VLM 智能体的空间记忆过期问题,覆盖三个闭源模型和三个开放权重 VLM,在文本与图像输入下完成 1,800 次过期检测运行,并在共享 50 种子规模下完成 12,000 个文本模式导航回合。
QERRA-v2 Classical 是一款开源、完全可解释的安全中间件,用于在自主机器人动作执行前进行评估。其架构分两层:零机器学习的纯 Python 物理安全层 QERRA-HSR 评估物理危险接近度与人类痛苦信号并触发故障关闭式安全停机,SEMEV-12 道德审议引擎则依据 12 个人本伦理维度评估自然语言任务并输出完整推理日志。
Open Robotics 本周继续 IRS 要求的年度审计,并启动两个 OSRA 技术治理委员会(TGC)新委员会:一个为 OSRF 和 OSRA 及其项目制定安全政策,另一个制定 2027 年 Open Robotics 技术战略。
一名安全工程师在 ROS Discourse 询问,已投产的仓库/3PL AMR 车队是否在运行时持续做安全监控,还是仍以 SROS 2、DDS security 等设计期加固为主、上线后不再干预。他还追问机器人被入侵的担忧被归为网络安全问题还是安全/可用性问题,以及内部由谁负责。OSRA 回应称即将启动改善 ROS 安全性的工作,并邀请其提供经验与问题。
WAIC 首日,Kimi K3 在模型侧搅动风云,印奇提出 AI 产业下一轮爆发来自智能体模型与下一代终端产品的结合,物理场景通用智能体是第三波核心主线。Richard Sutton 认为静态数据标注已达天花板,经验驱动是下一代 AI 核心路线;苏昊提出解决大模型幻觉的关键是物理智能,需进入真实世界完成端到端交互。