Hugging Face 发布 riidolaya difficulty 实验性 MPS 试点 v0.2
Hugging Face 上线 riidolaya difficulty 实验性 MPS 试点 v0.2,在完全冻结的 Laya 编码器上训练了一个 5,123 参数的 LayerNorm/Linear 固定档位分类器,输出 fast、standard、strong 三档,仅以任务文本为输入。
Hugging Face 上线 riidolaya difficulty 实验性 MPS 试点 v0.2,在完全冻结的 Laya 编码器上训练了一个 5,123 参数的 LayerNorm/Linear 固定档位分类器,输出 fast、standard、strong 三档,仅以任务文本为输入。
StartLux-Decision-4B 在 Hugging Face 发布,可对状态回答选择题、是/否题和评分题,每个选项返回概率,请求响应沿用 TypeSafe /v1/systemone 格式。
Hugging Face 发布 StartLux-Decision 系列决策模型,覆盖 0.8B 至 35B-A3B 六种规模,对状态类问题输出各选项概率,沿用 TypeSafe /v1/systemone 格式。
NVIDIA 在 CES 上展示 Caterpillar 座舱 AI 助手,基于 Jetson Thor 本地运行 Nemotron 语音模型与 Qwen3 4B,无需云端连接。
NVIDIA 在 CES 展示 Caterpillar 座舱内 Cat AI Assistant 原型,基于 Jetson Thor 本地运行 Nemotron 语音模型与 vLLM 服务的 Qwen3 4B,无需云端连接。
bartowski 基于 llama.cpp b11259 为 OmniJev 的 OneJev-9B 模型发布 GGUF 量化版本,覆盖 bf16 到 IQ2_M 共 22 个文件,默认推荐 Q4_K_M(5.84GB)。该模型支持文本与图像输入,仓库同时提供 mmproj 多模态投影文件,可搭配任意量化版本使用。
Hugging Face 上线 jevhome-L-int8,这是 jevhome-L 的动态 int8 量化版本,约 396M 参数,可在普通 CPU 上单次前向返回校准概率,速度更快且体积约为原来的 1/4。
Hugging Face 上线 jevhome-ettin-1b-int8,这是 jevhome-ettin-1b 的动态 int8 量化版本,采用 ONNX Runtime quantize_dynamic 与 int8 token 嵌入表,体积约为原版四分之一,可在普通 CPU 上单次前向返回校准概率。
Hugging Face 上线 jevhome-L,一个约 396M 参数的交叉编码器类型化决策模型,接收状态与是/否、单选或评分问题,一次前向传播即返回校准概率,可在普通 CPU 上运行。
Hugging Face 上线 jevhome-ettin-1b,一个约 1.0B 参数、fp32 的类型化决策模型,可对状态给出是/否、单选或分级问题,并在一次前向传播中返回校准概率,纯 CPU 即可运行。
mradermacher 为 SEAD-SAGE-4B 发布了 GGUF 静态量化版本,暂未提供 weighted/imatrix 量化。已提供从 Q2_K(1.9 GB)到 f16(8.9 GB)的多档量化,其中 Q4_K_S 与 Q4_K_M 标注为快速、推荐,Q6_K 为质量很好,Q8_0 为快速且最佳质量。
ayousanz 发布 JapaneseTinyAgentLM-Action-3M,一个 3,148,608 参数的 decoder-only Transformer,把日语短指令转成 look、set_expression、nod 三类动作的 JSON 数组,非指令或无法执行的请求返回空数组。
推荐理由:3.1M 参数模型在 ESP32-S3 上本地把日语指令转成动作 JSON,附完整评测与误差区间,可看端侧具身控制的可行边界。
一个基于 Vulkan 的 SLAM 系统正在开发中,可在 Android 和 Linux 上运行。项目目前更像概念验证,证明能在相机帧上以零拷贝方式运行任意计算着色器,而非实际的 SLAM/VIO,作者计划未来实现后者。
物理 AI 芯片开发商 SiMa.ai 完成 1.5 亿美元 C 轮融资,估值达 14.5 亿美元,由 Fidelity Management & Research Company 和 Amplify 联合领投,Alter Venture Partners、Dell Technologies Capital 和 StepStone Group 参投。
Open Robotics 将于 9 月 28 日 15:00 UTC 举行 meta-ros 社区会议 #64,议题包括 Layer Audit、ROS World 构建与 skip groups、Superflore 传递依赖、SDK 文档、OEROS 容器镜像、边缘 AI 支持、bitbake-setup 和 OE Config Fragments。
一名电子与计算机工程本科生在 ROS Discourse 征集机器人感知与高层 AI 任务的推理放置经验:本地、边缘服务器还是云端,是否按截止时间、网络状况和本地算力负载动态调整。提问者想了解延迟或本地算力争抢是否真正造成过问题、如何解决,以及是否有人尝试卸载推理后又回退,并强调不涉及急停、电机控制等安全关键任务。
任少卿以通讯作者身份参与论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,第一机构为蔚来,提出一次生成多组配对场景—动作假设、让轨迹与未来场景共同演化的多模式世界—动作联合模型。
NVIDIA 介绍如何借助上游抽象层与 CUDA buffer 后端,让 AI Agent 加速 ROS 2 节点,避免消息在节点间经 CPU 内存序列化或拷贝而抵消 GPU 加速收益。仅靠快速 CUDA kernel 并不能保证 ROS 2 图变快,感知与 AI 负载留在 GPU 上的优势可能被传输开销侵蚀。
新西兰怀卡托大学团队公布一款用光学和红外传感单元替代电极的假肢臂环,光电探测器贴近皮肤覆盖不同肌肉群,并采用新型收紧机构以减少运动伪影。团队称皮肤色调会影响传感器读数,正迭代设计并计划开发电学与光学传感混合的假肢。
意大利初创公司 Exein 以 17 亿美元估值完成 2.7 亿美元融资,由 Headline 领投,主打为物理 AI 提供网络安全层。其最新产品 Photon 是内核级运行时安全方案,公司称已覆盖超 20 亿台联网设备,并正训练面向物理 AI 安全的基础模型,计划 2027 年第一季度就绪。
无问芯穹联合清华大学、上海交通大学开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等平台,首发支持 PI 0.5 与 WALL-OSS 两款具身模型。
全球 Robotaxi 市场预计到 2035 年达 4000 亿美元,超 600 万辆商用车上路,NVIDIA 以训练、仿真验证、车载三计算机架构支撑商业化车队规模化部署。
Microduck 是一款 25 厘米、780 克的机器人,内置 15 个自由度、前视摄像头、8x8 激光雷达、两个 IMU、麦克风、扬声器、NFC、Wi-Fi 和蓝牙,出厂即可行走、坐下、蹲下、滑旱冰、用关节喙拾取物体并自行从跌倒中恢复。它支持手柄操控、外接配件与 NFC 标签物体,可运行自主行为,也能多台组队竞速和踢足球,软件完全开源。目前已开启预售,售价 399 美元,圣诞节前发货。
Ollobot 推出 AI 家庭陪伴机器人 OlloNi SS1,主打主动交互、跌倒检测与持续在场,面向独居老人、父母远行的儿童和城市独居职场人三类场景。它搭载多芯片 AI 4K 视觉模块,支持人脸识别与运动追踪,可在木地板、瓷砖和低矮地毯上移动,爬坡能力达 3.5 度,并配有物理摄像头隐私盖。机器人通过 OTA 更新持续升级,可主动靠近家人参与互动、提醒孩子学习休息。
共生知行正在研发双足人形机器人的端到端感控一体化「大脑」基座模型,其Demo中机器人全自主驾驶卡丁车连续过弯,实现手眼脚同步协同与多接触点平衡力控。团队由96年出生的丁鹏翔带领,核心成员均为00后博士在读,公司成立刚满两个月,押注纯端到端路线取代分层架构。
优必选在 WRC 上1:1复刻客户真实产线,用近十台工业人形机器人 Cruzr S2 和 Cruzr Y1 连续演示汽车机加件与钣金件上下料、拆码垛和物流小件分拣,定位精度小于1mm,物流分拣平均抓取节拍接近1100件/小时。
Hugging Face 博客介绍 TinyCast,一个 146,505 参数的零样本时间序列基础模型,是 GIFT-Eval 榜单上最小的公开逐配置结果且无测试数据泄漏的模型,也是 140 万参数以下唯一输出预测分布而非点预测的零样本模型。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
Ceyhun Karataş 用 Futaba S3003 舵机、Arduino Nano 和 3D 打印件把 BabyBjorn 弹跳摇椅改成自动摇椅,舵机通过绳子拉动座椅、再由摇椅自带弹簧回弹。两个电位器可分别调节摇动速度和幅度,作者强调使用时不能让孩子无人看管。
新加坡 AI 计算公司 Acrab 完成 1.3 亿美元 B 轮融资,累计融资超 4.8 亿美元,资金用于扩大产能和研发下一代 AI 计算平台。其首代端侧 AI 芯片 GΞLIX 1 峰值算力 700TOPS,已于 2025 年 11 月流片,今年 7 月与个人 AI 中心 Agent Box 一同发布,目前开始客户导入并推进规模化生产。
荣耀在广州发布全球首款机器人手机 Robot Phone,首创四自由度钛合金灵巧云台,电机仅重 2.6g,三轴最大控制转速 360°/s,并搭载首个系统级 Agent 架构的 Agentic OS 与 YOYO Pro 模式。
NVIDIA 发布 JetPack 7.2.1,为 Jetson 平台新增智能体视频技能与 T3000 仿真能力。该版本面向机器人、智能视频分析、工业自动化等场景,覆盖多路摄像头采集、网络流解码、AI 推理与传统视觉处理、结果绘制及视频编码存储或传输等完整视频数据链路。
Om AI联汇于8月6日宣布开源端侧原生多模态模型VLX-Seek 1.5,含3B与10B两个版本,同日该公司完成数亿元融资,前海母基金领投。公开评测中,VLX-Seek 1.5-3B在LVIS Mean达57.5,高于LocateAnything-3B的50.7;RefDrone测试F1为73.2,对比后者52.3,目标幻觉指标FP/GT为18,后者为71.3。
EdgeAI Forge 正在原型化一套本地优先的工程架构,用于生成、测试、基准测试和文档化 ROS 2 与机器视觉流水线,首个目标工作流是 ROS 2 视觉流水线生成器。
优诺智行(UnoMove)在苏州招聘四类机器人岗位:控制与导航算法、边缘侧大模型与3D场景理解、机器人应用全栈、电气与传感器工程师。其核心产品 UnoBox 为边缘计算盒子,提供感知-决策-控制全栈能力,代码跑在 Jetson 上,算法在 Isaac Sim 中训练,最终交付物流堆场、巡检机器人和农机等真实场景。
中国民航大学与清华大学团队设计出基于钙钛矿的激光充电接收器,可让无人机在飞行中持续获电。该接收器面积2平方厘米,在5瓦绿光激光照射下实现近39%的光电转换效率,驱动6.7厘米螺旋桨达7820转/分;集成到固定翼模型后,螺旋桨以1200至1450转/分运转约一分钟。研究尚未进行空中飞行测试,团队下一步将开展轻量无人机的飞行验证。
杭州联汇科技(Om AI联汇)宣布完成新一轮数亿元融资,由前海母基金加码领投,杭州政府产业基金与多方资本协同参投。公司同时开源VLX-Seek 1.5端侧原生细粒度感知多模态模型,其3B参数版本多项核心指标超越英伟达LocateAnything-3B,无人机具身场景准确率提升62.9%,目标误报率降低74.8%。募集资金将用于VLX模型系列技术迭代及加速物理AI场景商业化落地。
一位运行 ROS 2 Humble + Jetson Orin + STM32 的 AMR 车队运营者发帖求助:高层 OTA 可回滚,但每次更新 MCU 固件仍需现场插线,三台尚可、三十台要耗一整天。
NVIDIA 展示 Jetson 边缘 AI 与机器人平台,Jetson Orin Nano Super 提供 67 TOPS 算力,可本地运行 Reachy Mini 语音视觉助手等首个机器人项目。