HF blog·· 28 天前AI 评分39
LLAMIA-Bench:语言模型与非语言智能体协作的基准测试
Paper page - Exploring Collaboration between a language and a non-language agent
AI 导读
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
来源:HF blog · huggingface.co