跳到正文
原文
arXiv cs.RO· Zirun Zhou, Jingfeng Zhang, HaoChuan Xu, Xizhe Zhang, Elliott Wen, Jing Sun, Hong Jia·· 3 小时前AI 评分53

TMT:面向未见任务上 VLA 策略的运行时后门检测

TMT: Runtime Backdoor Detection for Vision-Language-Action Policies on Unseen Tasks

AI 导读

研究提出 TMT,一种基于 Token 流形与隐层转移建模的运行时后门检测器,仅用良性 rollout 训练,两个分支分别评估输入 token 结构与相邻层隐动态的预测误差。作者还探索用自蒸馏进行策略净化,由冻结的后门策略在成对的良性与被触发观测上监督学生模型,无需单独的干净参考策略。在与十种基线的后验对比中,TMT 在三种 VLA 后门攻击的未见任务上取得最优检测表现。

来源:arXiv cs.RO · arxiv.org