Hugging Face 发布 Holo3.1 系列计算机使用智能体模型
Hugging Face 发布 Holo3.1 系列计算机使用智能体模型,基于 Qwen 家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF、NVFP4 量化权重以支持本地推理。
推荐理由:给出了各尺寸在移动与桌面基准上的具体提升和量化后的吞吐数据,可据此评估本地部署的可行性。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 发布 Holo3.1 系列计算机使用智能体模型,基于 Qwen 家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF、NVFP4 量化权重以支持本地推理。
推荐理由:给出了各尺寸在移动与桌面基准上的具体提升和量化后的吞吐数据,可据此评估本地部署的可行性。
Hugging Face 在 TRL 落地 Delta Weight Sync PR(huggingface/trl#5417,分支 delta-weight-sync)。
推荐理由:原文把稀疏增量同步的原理、协议和实测暂停时长一并给出,读者可据此评估它对自身训练部署的迁移成本。
Hugging Face 博客讲解如何通过分离 CPU 与 GPU 工作负载来提升 LLM 推理性能。同步批处理下 CPU 与 GPU 交替等待,8K tokens、batch size 32、8B 模型的测试中 GPU 空闲占 24.0%,总耗时 300.6 秒。
推荐理由:原文用可复现的 profile 数据展示了同步批处理的空闲浪费,并给出基于 CUDA streams 与 events 的具体改造路径。
Mistral AI 宣布 Workflows 进入公开预览,作为企业 AI 的编排层,提供持久执行、可观测性和容错能力,帮助组织把 AI 流程从概念验证推进到生产。
推荐理由:原文拆解了企业 AI 落地的典型失败模式并给出对应机制,可迁移判断生产化编排层该具备什么。
Hugging Face 在 Hub 上推出 Storage Buckets,一种可浏览、可用 Python 脚本或 hf CLI 管理的可变 S3 式对象存储,用于存放 checkpoint、优化器状态、处理后的数据分片和日志等中间产物。
推荐理由:原文说明了它与 Git 存储的分工边界以及 Xet 去重带来的成本收益,读者可据此判断是否迁移现有工作流。
Hugging Face Blog 发布长文,为 TRL 的异步训练器设计做调研,按七个维度(编排原语、rollout buffer 设计、权重同步协议、staleness 管理、partial rollout 处理、LoRA 支持、分布式训练后端)对比了16个从零围绕异步训练构建的开源库。
推荐理由:文章用七个维度拆解了16个开源RL库的异步训练设计,读者可据此对比选型并理解各自权衡。
OpenAI 与 Amazon 宣布达成战略合作,将 OpenAI 的 Frontier 平台引入 AWS,扩展 AI 基础设施、定制模型和企业级 AI 智能体。
Hugging Face 官方博客介绍 Mixture of Experts (MoE) 的原理及其在 transformers 库中的工程支持。文章以 gpt-oss-20b 为例说明总参数与激活参数的区别(21B 总参数、每 token 激活约 3.6B),并给出 M3 Ultra 上约 115 tok/s 的实测速度。
推荐理由:文章把 MoE 原理与 transformers 库的加载、后端、并行改造串起来,读者可据此理解工程落地路径。
Hugging Face 宣布 GGML(llama.cpp 的创建者)及其团队加入 HF,以在 Local AI 快速发展期间为项目提供长期可持续资源。合并后 Georgi Gerganov 和团队仍 100% 投入维护 llama.cpp,在技术方向和社区上保持完全自治,项目继续 100% 开源并由社区驱动。
推荐理由:说明了合并后 llama.cpp 保持自治与开源的原因,以及 transformers 与本地推理栈打通的技术方向。
Hugging Face 发布了一个教编码智能体编写生产级 CUDA kernel 的 agent skill,随 kernels 库提供,可用 kernels skills add cuda-kernels --claude 等命令装入 Claude、Codex、OpenCode 等智能体。
推荐理由:给出了可直接安装的 skill 命令和两组真实基准数据,读者可据此评估它能否用于自己的 kernel 工作流。
Hugging Face 宣布 Transformers.js v4 已发布到 NPM(npm i @huggingface/transformers),核心变化是采用用 C++ 重写的全新 WebGPU Runtime,与 ONNX Runtime 团队合作在约 200 个已支持模型架构上完成测试,同一份代码可运行于浏览器、Node、Bun 和 Deno。
推荐理由:原文给出了构建耗时、包体积和推理速度的具体数字,读者可据此评估升级到 v4 的实际收益。
Mistral AI 在 Engineering Deep Dive 系列首篇文章中复盘了排查 vLLM 内存泄漏的过程:在 Mistral Medium 3.1 配合 Prefill/Decode 分离式部署且启用 graph compilation 时,系统内存以 400 MB/分钟线性增长。
推荐理由:逐层递进的排查路径和每种工具的失效原因,对定位同类底层内存问题有直接可迁移的方法价值。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,用 10,000 小时游戏画面训练,支持零延迟自由控制相机与按键输入。
推荐理由:原文对比了与现有世界模型在控制延迟上的差异,并给出推理库的具体吞吐与帧率数据,便于评估其实用性。
Hugging Face 发布 Transformers v5.0.0rc-0,日安装量超 300 万次、累计超 12 亿次,模型架构从 v4 的 40 个增至 400 多个。
推荐理由:官方系统梳理了 v5 在简化、训练、推理和量化上的取舍,读者可据此判断迁移成本与生态兼容变化。
Hugging Face 官方宣布 huggingface_hub 发布 v1.0,这是该库五年 35+ 个版本后的首个大版本,支撑 GitHub 上 200,000+ 仓库和 PyPI 上 3,000 个包,月下载量达 113.5 million。
推荐理由:官方系统梳理了 v1.0 的破坏性变更与迁移路径,读者可据此评估升级影响与兼容范围。
Hugging Face 官方博客宣布 datasets 库的 streaming=True 流式加载获得大幅优化:数据文件解析时间快 10 倍、启动请求最多减少 100 倍、流式速度最高提升 2 倍,在 256 并发 worker 下零崩溃。
推荐理由:原文拆解了启动与流式两个阶段的具体优化手段,读者可迁移其缓存与预取思路到自己的数据管线。
OpenAI 与 Broadcom 宣布达成多年期合作,部署 10 gigawatts 的 OpenAI 自研 AI 加速器,并共同开发下一代系统与 Ethernet 方案,以在 2029 年前支撑可扩展、高能效的 AI 基础设施。
推荐理由:原文给出了合作规模与时间表,读者可据此理解 OpenAI 在自研加速器与算力基础设施上的布局方向。
AMD 与 OpenAI 宣布达成多年期战略合作,将部署 6 gigawatts 的 AMD Instinct GPU,为 OpenAI 下一代 AI 基础设施提供算力。首批 1 gigawatt 将于 2026 年开始部署。
推荐理由:原文给出了合作规模和分阶段部署节奏,可据此判断双方在算力供给上的长期绑定程度。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,第一阶段将于 2026 年启动。
Hugging Face 官方博客详解为支持 OpenAI gpt-oss 系列而对 transformers 库做的多项升级,包括可从 Hub 下载的零构建 kernels、MXFP4 量化、Tensor Parallelism、Expert Parallelism、动态滑动窗口层与缓存、连续批处理与 Paged Attention 以及更快加载大模型。
推荐理由:逐项拆解了可直接复用的配置参数与代码片段,读者可按需移植到自己的模型上。