SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究?
Hugging Face 上线论文页面 SAEScientist-Bench,提出用基准测试检验 AI 智能体能否自主完成 SAE 可解释性研究。该页面目前仅开放论文讨论,未披露任务设置、评测指标或实验结果等具体信息。
Hugging Face 上线论文页面 SAEScientist-Bench,提出用基准测试检验 AI 智能体能否自主完成 SAE 可解释性研究。该页面目前仅开放论文讨论,未披露任务设置、评测指标或实验结果等具体信息。
DianShi-RxnDB 是一个大规模、细粒度的有机反应数据平台,通过全自动流水线构建,面向研究者与 AI Agent。该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 论文页上线 FACET,一种在终端任务合成中保留源意图与可执行状态的方法。该页面目前仅开放论文讨论,正文未披露模型版本、任务成功率或真机验证等具体结果。
Hugging Face 上线论文页面 ExplainBench,用于评估智能体生成的代码解释。该页面目前仅开放讨论,正文未披露基准的具体任务、指标或实验结果。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
Hugging Face 上线论文页面 xHC: Expanded Hyper-Connections,围绕“扩展超连接”这一主题开放讨论。页面目前仅提供论文入口与讨论区,未披露模型规模、训练数据或实验结果等具体信息。