Hugging Face 上发布 maria715/CAT_adv_eps02_42_relativelr_REFAIT 模型
Hugging Face 上出现了一个名为 maria715/CAT_adv_eps02_42_relativelr_REFAIT 的模型仓库。该页面未提供模型架构、训练数据、任务类型或性能指标等具体信息,仅包含 Hugging Face 推进开源与开放科学的使命声明。
Hugging Face 上出现了一个名为 maria715/CAT_adv_eps02_42_relativelr_REFAIT 的模型仓库。该页面未提供模型架构、训练数据、任务类型或性能指标等具体信息,仅包含 Hugging Face 推进开源与开放科学的使命声明。
Hugging Face 上出现名为 emmanuel-v/policy_2026-09-30_shake_it_up_on_cart_100kHz_nfft4096 的模型条目,名称包含 100kHz 与 nfft4096 等参数标识。该条目页面未提供更多模型细节,仅附有 Hugging Face 推进人工智能开源与开放科学的使命说明。
EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。
推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。
ayousanz 发布 JapaneseTinyAgentLM-Action-3M,一个 3,148,608 参数的 decoder-only Transformer,把日语短指令转成 look、set_expression、nod 三类动作的 JSON 数组,非指令或无法执行的请求返回空数组。
推荐理由:3.1M 参数模型在 ESP32-S3 上本地把日语指令转成动作 JSON,附完整评测与误差区间,可看端侧具身控制的可行边界。
Hugging Face 上线了 arrg-unam/molmoact2_omx_hidroferol 模型页面。该页面目前仅展示 Hugging Face 推进开源与开放科学的使命表述,未提供模型架构、参数规模、训练数据或评测结果等具体信息。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-mining-no-cf-idql,这是一个基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,包含 policy.pt 和 stats.json 归一化器。
成立三个月的Simate发布首版通用物理快系统Simate-beta,据公司披露以平均Score 33.95、SR 27.96%登顶更新于2026年9月23日的RoboDojo榜单,该成绩属榜单评测,真机表现另行展示。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
诺因(Knowin)9月24日发布面向通用具身智能的生成式学习架构 GLOW 技术报告,称人类演示一次后机器人即可跨物体、跨环境、跨任务复用,在开盒收纳、浇水、擦桌、调酒等任务中得到验证。
灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。
小米发布MiMo-V2.6-Pro和Flash,Pro为1.02万亿参数、420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一。
推荐理由:原文披露了MiMo-V2.6的RL训练成本、评测成绩与开源清单,读者可据此了解大规模强化学习训练的工程细节。
社区独立项目 CPM-jev 发布 v0.1-research-preview,这是基于 openbmb/MiniCPM5-2B-Base 的 LoRA 微调模型,新增决策头为候选动作打分并归一化为概率分布。
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
智象未来(HiDream.ai)发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本、图片、视频等多模态输入,可一键直出 5–20 秒 1080p 视频。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
深度机智于 2026 年 9 月 9 日发布物理基座模型 PhysBrain 1.5,8B 版本在 28 项公开基准上取得 72.5 综合均分,位列参评开源模型首位,与 GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距在 1 分以内。
亮源新创过去一个多月连续发布LightParkour、LightNav-0和Light REACT三项技术,分别面向复杂接触技能扩展、通用导航和全身韧性控制。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
9月10日,阿里巴巴集团旗下高德发布3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的一体化全尺寸AI生成,覆盖超过196个国家和地区。模型输入一张卫星图像或一段文字描述,可在消费级GPU上用10分钟生成公里级3DGS城市场景,效率比传统模式提升1000倍。体验官网已上线,相关能力已应用于飞行街景2.0,用户可操控摇杆漫游3D场景。
脸谱心智于 2026 年 6 月发布技术报告《Looped World Models》(arXiv: 2606.18208),提出 LoopWM,称其为首个将循环 Transformer 架构用于世界建模的方法,论文登上 Hugging Face Papers 当日 Top 1。
Scalabot 发布首个世界模型 HERON-World Model,输入当前画面和待执行动作即可预测后续画面,并支持多智能体动作配合与相互影响的预测。
智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判能力,打通图像、视频、3D、动作等模态。该模型首次参评具身智能仿真评测平台RoboColiseum,在扰动适应(Robustness)子榜以平均分0.692登顶榜首。
World Labs于9月2日发布多模态世界模型Atlas,可将文字、图像、视频和3D信息放入统一空间上下文,实现三维场景重建与新视角生成。国内团队影溯早在今年3月已开源具备类似能力的InSpatio-World,其升级版本即将发布并继续开源。
它石智航通用具身大模型 AWE3.7(AI World Engine)在十天内连续发布一系列任务,用同一套基座模型覆盖工业产线、物流作业、生活服务与移动操作等场景。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。
推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。
清华AIR与域变换发布具身WAM模型Zeva,在权重冻结、零梯度更新的情况下从交互经验中持续学习,RoboCasa365-Atomic5上平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%。
Google DeepMind 集中列出其模型阵容,包括新一代前沿智能 Gemini、实时音频模型 Gemini Audio、视频生成模型 Veo、图像生成与编辑模型 Nano Banana。
Google DeepMind 公布 Gemini 4 Argon,称其为下一代前沿智能。同期发布 Gemini 3.8 Live 与 Live Avatar、Gemini 3.8 Flash 及 3.8 Flash Cyber、Gemini 3.8 文本转语音,以及 AlphaGenome Atlas 和 WeatherNext 3 全球天气 AI 模型。
8月28日,阿里巴巴集团旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧局部画面即可实时重建上万帧3D场景,在KITTI、Oxford Spires、VBR等评测中取得最低误差的SOTA。
由两位前 Meta FAIR 研究科学家创办的 Perceptron 本周发布视觉模型 Isaac 0.5,面向仓库、工厂等工业场景,帮助视觉引导机器人感知、推理与行动,并从机器人拍摄的视频中提取视觉信息。
北美具身初创 Skild AI 发布机器人基础模型 S1,主打上下文学习,无需后训练或微调,只看一段人类示范视频即可完成煎饼、冲泡咖啡、给植物换盆、设备组装等长程任务,上下文学习任务长度最长 10 分钟。
推荐理由:Skild AI 的 S1 把机器人上下文学习拉到 10 分钟长程任务,并给出与语言提示 VLA 的成功率对比数据。
一段10分钟一镜到底、无剪辑无遥操作的Demo显示,宇树G1与智元远征A3两款不同品牌机器人共用同一套模型,在15m²出租屋内协作完成擦玻璃、收纳、跨本体递围巾等长时序家务。模型支持任务随时打断后断点续做,宇树G1够不到第三层柜子时自主搬箱、用脚踢箱垫高,据称仅用几十小时视频数据训练。
原力灵机DM0.5在RoboDojo具身评测中以综合得分24.90、平均成功率19.34%登顶,Memory维度得分47.74,Cover Blocks任务三次随机测试成功率均为100%。
推荐理由:原力灵机DM0.5登顶RoboDojo并开源权重与训练框架,读者可了解其数据、架构与推理加速的具体做法。
生数科技创始人朱军在 WRC 2026 分论坛发布团队最新研究成果,提出通用世界模型五级发展路线,从 L1 世界生成、L2 与世界交互、L3 在世界中行动,到 L4 自主世界智能体与 L5 世界组织者。
智象未来在 WRC 2026 发布原生全模态交互式世界模型 HiDream-O1-World,基于自研 UiT 架构,首次参评即登顶 WBench 的 Navi 分榜。该模型支持文本、图像及交互式操控输入,具备漫游、编辑、交互三项能力,核心突破是长时程时空一致性与物理一致性。
8月22日世界人形机器人运动会开幕式上,银河通用机器人参加机器人网球比赛,与网坛运动员同台竞技并由中央广播电视总台全球直播,完成正手、反手、发球、接发、底线调动、网前截击等动作,并在双打中与人类队友实时协作。
知跃空间智能发布全脑仿真基础平台 DeepSoma(知跃灵物),从树突、膜电位、离子通道等生物物理层面建模精细神经元,而非 Eon Systems 采用的 LIF 简化模型。
Generalist AI 发布机器人基础模型 GEN-1.5,主打 One-shot Learning,机器人看完 3-12 秒动作示范后无需梯度更新或微调即可执行新任务,还能把两段演示拼接成连续任务。
推荐理由:GEN-1.5 把动作示范当作上下文提示,读者可据此了解机器人基础模型在少样本学习上的新路径。
墨奇智能在 WRC 2026 首次公开自研具身模型架构 MoRA 与轮式机器人本体 MORPHI KINO,现场用 15 分钟连续完成清理桌面、检查冰箱库存并补货、洗烘与叠放衣物等家居长程任务,全程无需人工指挥。