Hugging Face 发布 riidolaya difficulty 实验性 MPS 试点 v0.2
Hugging Face 上线 riidolaya difficulty 实验性 MPS 试点 v0.2,在完全冻结的 Laya 编码器上训练了一个 5,123 参数的 LayerNorm/Linear 固定档位分类器,输出 fast、standard、strong 三档,仅以任务文本为输入。
Hugging Face 上线 riidolaya difficulty 实验性 MPS 试点 v0.2,在完全冻结的 Laya 编码器上训练了一个 5,123 参数的 LayerNorm/Linear 固定档位分类器,输出 fast、standard、strong 三档,仅以任务文本为输入。
StartLux-Decision-4B 在 Hugging Face 发布,可对状态回答选择题、是/否题和评分题,每个选项返回概率,请求响应沿用 TypeSafe /v1/systemone 格式。
Hugging Face 发布 StartLux-Decision 系列决策模型,覆盖 0.8B 至 35B-A3B 六种规模,对状态类问题输出各选项概率,沿用 TypeSafe /v1/systemone 格式。
bartowski 基于 llama.cpp b11259 为 OmniJev 的 OneJev-9B 模型发布 GGUF 量化版本,覆盖 bf16 到 IQ2_M 共 22 个文件,默认推荐 Q4_K_M(5.84GB)。该模型支持文本与图像输入,仓库同时提供 mmproj 多模态投影文件,可搭配任意量化版本使用。
Hugging Face 上线 jevhome-E-int8,一个约 48M 参数的双编码器 int8 类型化决策模型,接收状态后对是/否、单选或评分问题在一次前向传播中返回校准概率,可在普通 CPU 上运行。
Hugging Face 上线 jevhome-L-int8,这是 jevhome-L 的动态 int8 量化版本,约 396M 参数,可在普通 CPU 上单次前向返回校准概率,速度更快且体积约为原来的 1/4。
Hugging Face 上线 jevhome-ettin-1b-int8,这是 jevhome-ettin-1b 的动态 int8 量化版本,采用 ONNX Runtime quantize_dynamic 与 int8 token 嵌入表,体积约为原版四分之一,可在普通 CPU 上单次前向返回校准概率。
Hugging Face 上线 jevhome-B-int8,这是 jevhome-B 的动态 int8 量化版本,采用 ONNX Runtime quantize_dynamic 与 int8 token 嵌入表,体积约为原版四分之一,可在普通 CPU 上单次前向返回校准概率。
Hugging Face 上线 jevhome-E,一个约 48M 参数的双编码器类型化决策模型,输入状态与是/否、单选或评分问题,一次前向传播即可在普通 CPU 上返回校准概率,接口与 Jev、PostHog Jeeves 一致(POST /v1/systemone)。
Hugging Face 发布 jevhome-B,一个约 150M 参数、fp32 的类型化决策交叉编码器,接收状态与是/否、单选或评分问题,在普通 CPU 上单次前向返回校准概率。
Hugging Face 上线 jevhome-L,一个约 396M 参数的交叉编码器类型化决策模型,接收状态与是/否、单选或评分问题,一次前向传播即返回校准概率,可在普通 CPU 上运行。
Hugging Face 上线 jevhome-ettin-1b,一个约 1.0B 参数、fp32 的类型化决策模型,可对状态给出是/否、单选或分级问题,并在一次前向传播中返回校准概率,纯 CPU 即可运行。
mradermacher 为 SEAD-SAGE-4B 发布了 GGUF 静态量化版本,暂未提供 weighted/imatrix 量化。已提供从 Q2_K(1.9 GB)到 f16(8.9 GB)的多档量化,其中 Q4_K_S 与 Q4_K_M 标注为快速、推荐,Q6_K 为质量很好,Q8_0 为快速且最佳质量。
ayousanz 发布 JapaneseTinyAgentLM-Action-3M,一个 3,148,608 参数的 decoder-only Transformer,把日语短指令转成 look、set_expression、nod 三类动作的 JSON 数组,非指令或无法执行的请求返回空数组。
推荐理由:3.1M 参数模型在 ESP32-S3 上本地把日语指令转成动作 JSON,附完整评测与误差区间,可看端侧具身控制的可行边界。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。
搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。
魔芯科技联合浙江大学潘云鹤院士、华为等发布实时交互世界模型 MoWorld,全栈基于国产 NPU,14B 参数 MoE 模型实现最高 50FPS 推理,推理成本为同规模 GPU 方案的 30%。
Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。
NVIDIA 发布 Alpamayo,面向自动驾驶的推理式视觉语言动作(VLA)模型,可将决策过程展开为逐步推理轨迹。该模型被视为在语义空间中运行的隐式世界模型,用于处理复杂驾驶问题。