DianShi-RxnDB:面向研究者与 AI Agent 的全自动流水线大规模细粒度有机反应数据平台
DianShi-RxnDB 是一个大规模、细粒度的有机反应数据平台,通过全自动流水线构建,面向研究者与 AI Agent。该论文页面已在 Hugging Face 上线并开放讨论。
DianShi-RxnDB 是一个大规模、细粒度的有机反应数据平台,通过全自动流水线构建,面向研究者与 AI Agent。该论文页面已在 Hugging Face 上线并开放讨论。
GOSIM Shenzhen 2026 将于 10 月 16–17 日在深圳南山伊敦酒店举办,这是该开源技术大会首次来到深圳,汇聚 150+ 国际讲师和 2000+ 全球开发者。
Hugging Face 上线数据集 trinity-graphics/truncgradgs,页面仅附 Hugging Face 推进开源与开放科学的使命宣言,未披露数据规模、模态、许可或使用方式等细节。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
Hugging Face 论文页介绍 Self-OPD,一种面向流匹配模型的在线策略蒸馏方法,其特点是不依赖教师模型。该页面目前仅开放论文讨论,未给出模型版本、任务、成功率或实验数据等细节。
Hugging Face 论文页上线 Magpie,一个面向交互式游戏的实时世界渲染器。该页面目前仅开放论文讨论,未披露模型规模、渲染帧率或真机部署等细节。
Anthropic 发布模型硬件标准 MHS,把不同厂商硬件的控制方式转译成 Agent 可发现、可读取、可调用的一致接口,被称作物理世界的 MCP。接入后 Claude 可直接控制 Hugging Face LeRobot 生态中的低成本 SO-ARM101 机械臂,自行测量工作区、完成校准,再通过 MHS 调用底层控制器执行动作,无需提前训练策略或遥操作。
一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
Hugging Face 论文页收录《What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents》,从 ACE 视角审视 LLM 智能体的数据生成问题。该页面目前仅开放论文讨论,未给出具体方法、数据规模或实验结果。
Hugging Face 上线数据集 jeffreylin1222/SDGBiasBench,页面仅附 Hugging Face 推进开源开放科学的使命说明,未给出该数据集的规模、任务或评测指标等信息。
Hugging Face 发布开源鸭子机器人 Microduck,售价 399 美元,圣诞节前发货。这款高 25 厘米的机器人能摇摆行走、用喙叼取物品、跌倒后自行站起、蹲下甚至滑旱冰,通过摄像头、激光雷达和两个 IMU 感知环境。Pollen Robotics 表示其行为可在仿真中训练并直接部署到机器人上,SDK、仿真和完整强化学习训练栈已在 GitHub 开放。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
Hugging Face 论文页上线 EXIMO,一种用视觉语言模型(VLM)引导 VLA 策略探索的方法。页面目前仅开放论文讨论,未披露模型版本、任务本体、仿真或真机结果等细节。
Hugging Face 博客介绍 TinyCast,一个 146,505 参数的零样本时间序列基础模型,是 GIFT-Eval 榜单上最小的公开逐配置结果且无测试数据泄漏的模型,也是 140 万参数以下唯一输出预测分布而非点预测的零样本模型。
Hugging Face 论文页发布 EnvHarness,提出为智能体学习"唤醒静态世界"的方法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或真机部署等具体细节。
Hugging Face 论文页发布 ForgeWM,一种面向少步动作条件视频世界模型的渐进式因果训练方法。该页面目前仅开放论文讨论,未披露模型规模、任务本体、成功率或推理时延等具体结果。
Hugging Face 论文页上线 FACET,一种在终端任务合成中保留源意图与可执行状态的方法。该页面目前仅开放论文讨论,正文未披露模型版本、任务成功率或真机验证等具体结果。
AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。
推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
Hugging Face 论文页面发布 PAST-Bench,用于评测个人智能体递归自我改进的基础能力。该基准聚焦个人智能体场景下的自我改进研究,目前页面仅开放论文讨论,未披露具体任务、指标或实验结果。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 上线论文《Quo Vadis, World Modeling?》的讨论页面,邀请社区就该论文参与讨论。原文未披露论文的具体方法、模型或实验数据。
Hugging Face 上线论文页面 ExplainBench,用于评估智能体生成的代码解释。该页面目前仅开放讨论,正文未披露基准的具体任务、指标或实验结果。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 论文页介绍 OmniPack,一种面向全模态大语言模型的统一 token 压缩方法,目标是提升这类模型的计算效率。页面未给出具体模型版本、压缩率或实验数据,仅提供论文讨论入口。
GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。
推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
Hugging Face 的 LeRobot 发布 v0.6.1,将 lerobot.types 模块更名为 lerobot.lerobot_types,属破坏性变更。
Hugging Face 上出现模型 imjustheretotest/MasonAI,其基座模型为 crosbylegal/gpt-5.6-luna,训练数据集为 Crownelius/GPT-5.6-Sol-Luna-Terra-Traces。该模型 README 内容为空,上月下载量未被追踪,且暂无 Inference Provider 部署。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
DiffGI 用连续 2D TSDF 和可微 Marching Squares 模块替换几何图像中的二值占用图,使整条流水线端到端可微,可在消费级 GPU 上约一秒完成高保真薄壳 3D 生成,甚至能在笔记本 CPU 上运行,无需服务器。项目主页已上线,交互式 demo 即将推出。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。