arXiv cs.RO· Sathwik Karnik, Joseph JR. Lee, Aryaman Gupta, Somil Bansal·· 2 小时前AI 评分56
TRUST:在 VLA 策略中监测与引导思维链推理
When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies
AI 导读
论文提出 TRUST,一种离线训练的价值模型,可从部分前缀预测推理最终正确性,并在冻结的 VLA 策略中监测与选择性引导思维链生成。在 Alpamayo 1.5 驾驶 VLA 上,TRUST 监测正确性准确率 88.9%,推理正确率从 75.9% 提升到 90.0%;在 AlpaSim 的困难子集上碰撞率降低 30.4%、最大轨迹误差降低 11.5%。
来源:arXiv cs.RO · arxiv.org