跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–40 条 · 共 53 条
6月2日周二
  1. Hugging Face Blog74

    Hugging Face 发布 Holo3.1 系列计算机使用智能体模型

    Hugging Face 发布 Holo3.1 系列计算机使用智能体模型,基于 Qwen 家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF、NVFP4 量化权重以支持本地推理。

    推荐理由:给出了各尺寸在移动与桌面基准上的具体提升和量化后的吞吐数据,可据此评估本地部署的可行性。

5月27日周三
5月14日周四
  1. Hugging Face Blog63

    Hugging Face 解锁 continuous batching 的异步化:GPU 活跃率提升至 99.4%

    Hugging Face 博客讲解如何通过分离 CPU 与 GPU 工作负载来提升 LLM 推理性能。同步批处理下 CPU 与 GPU 交替等待,8K tokens、batch size 32、8B 模型的测试中 GPU 空闲占 24.0%,总耗时 300.6 秒。

    推荐理由:原文用可复现的 profile 数据展示了同步批处理的空闲浪费,并给出基于 CUDA streams 与 events 的具体改造路径。

4月27日周一
3月10日周二
  1. Hugging Face Blog62

    Hugging Face Hub 推出 Storage Buckets 对象存储功能

    Hugging Face 在 Hub 上推出 Storage Buckets,一种可浏览、可用 Python 脚本或 hf CLI 管理的可变 S3 式对象存储,用于存放 checkpoint、优化器状态、处理后的数据分片和日志等中间产物。

    推荐理由:原文说明了它与 Git 存储的分工边界以及 Xet 去重带来的成本收益,读者可据此判断是否迁移现有工作流。

  2. Hugging Face Blog62

    Hugging Face 用七个维度对比16个开源异步RL训练库

    Hugging Face Blog 发布长文,为 TRL 的异步训练器设计做调研,按七个维度(编排原语、rollout buffer 设计、权重同步协议、staleness 管理、partial rollout 处理、LoRA 支持、分布式训练后端)对比了16个从零围绕异步训练构建的开源库。

    推荐理由:文章用七个维度拆解了16个开源RL库的异步训练设计,读者可据此对比选型并理解各自权衡。

2月27日周五
2月26日周四
  1. Hugging Face Blog70

    Hugging Face 博客解读 MoE 在 transformers 中的工程实现

    Hugging Face 官方博客介绍 Mixture of Experts (MoE) 的原理及其在 transformers 库中的工程支持。文章以 gpt-oss-20b 为例说明总参数与激活参数的区别(21B 总参数、每 token 激活约 3.6B),并给出 M3 Ultra 上约 115 tok/s 的实测速度。

    推荐理由:文章把 MoE 原理与 transformers 库的加载、后端、并行改造串起来,读者可据此理解工程落地路径。

2月20日周五
  1. Hugging Face Blog78

    GGML 与 llama.cpp 加入 Hugging Face

    Hugging Face 宣布 GGML(llama.cpp 的创建者)及其团队加入 HF,以在 Local AI 快速发展期间为项目提供长期可持续资源。合并后 Georgi Gerganov 和团队仍 100% 投入维护 llama.cpp,在技术方向和社区上保持完全自治,项目继续 100% 开源并由社区驱动。

    推荐理由:说明了合并后 llama.cpp 保持自治与开源的原因,以及 transformers 与本地推理栈打通的技术方向。

2月13日周五
  1. Hugging Face Blog70

    Hugging Face 发布 CUDA kernel agent skill,让 Claude 和 Codex 端到端生成可用 kernel

    Hugging Face 发布了一个教编码智能体编写生产级 CUDA kernel 的 agent skill,随 kernels 库提供,可用 kernels skills add cuda-kernels --claude 等命令装入 Claude、Codex、OpenCode 等智能体。

    推荐理由:给出了可直接安装的 skill 命令和两组真实基准数据,读者可据此评估它能否用于自己的 kernel 工作流。

2月9日周一
  1. Hugging Face Blog72

    Hugging Face 发布 Transformers.js v4,WebGPU 加速覆盖 Node、Bun 与 Deno

    Hugging Face 宣布 Transformers.js v4 已发布到 NPM(npm i @huggingface/transformers),核心变化是采用用 C++ 重写的全新 WebGPU Runtime,与 ONNX Runtime 团队合作在约 200 个已支持模型架构上完成测试,同一份代码可运行于浏览器、Node、Bun 和 Deno。

    推荐理由:原文给出了构建耗时、包体积和推理速度的具体数字,读者可据此评估升级到 v4 的实际收益。

1月22日周四
  1. Mistral AI61

    Mistral AI 排查 vLLM 分离式部署内存泄漏:UCX mmap hook 是元凶

    Mistral AI 在 Engineering Deep Dive 系列首篇文章中复盘了排查 vLLM 内存泄漏的过程:在 Mistral Medium 3.1 配合 Prefill/Decode 分离式部署且启用 graph compilation 时,系统内存以 400 MB/分钟线性增长。

    推荐理由:逐层递进的排查路径和每种工具的失效原因,对定位同类底层内存问题有直接可迁移的方法价值。

1月20日周二
  1. Hugging Face Blog61

    Overworld 发布实时交互视频扩散模型 Waypoint-1 与推理库 WorldEngine

    Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,用 10,000 小时游戏画面训练,支持零延迟自由控制相机与按键输入。

    推荐理由:原文对比了与现有世界模型在控制延迟上的差异,并给出推理库的具体吞吐与帧率数据,便于评估其实用性。

12月1日周一
10月27日周一
  1. Hugging Face Blog62

    Hugging Face datasets 流式加载提速,启动请求最多减少 100 倍

    Hugging Face 官方博客宣布 datasets 库的 streaming=True 流式加载获得大幅优化:数据文件解析时间快 10 倍、启动请求最多减少 100 倍、流式速度最高提升 2 倍,在 256 并发 worker 下零崩溃。

    推荐理由:原文拆解了启动与流式两个阶段的具体优化手段,读者可迁移其缓存与预取思路到自己的数据管线。

10月13日周一
  1. OpenAI News70

    OpenAI 与 Broadcom 达成多年期合作,2029 年前部署 10 吉瓦自研 AI 加速器

    OpenAI 与 Broadcom 宣布达成多年期合作,部署 10 gigawatts 的 OpenAI 自研 AI 加速器,并共同开发下一代系统与 Ethernet 方案,以在 2029 年前支撑可扩展、高能效的 AI 基础设施。

    推荐理由:原文给出了合作规模与时间表,读者可据此理解 OpenAI 在自研加速器与算力基础设施上的布局方向。

10月6日周一
9月22日周一
9月11日周四
  1. Hugging Face Blog74

    Hugging Face 解析 transformers 为 OpenAI gpt-oss 升级的八项优化技巧

    Hugging Face 官方博客详解为支持 OpenAI gpt-oss 系列而对 transformers 库做的多项升级,包括可从 Hub 下载的零构建 kernels、MXFP4 量化、Tensor Parallelism、Expert Parallelism、动态滑动窗口层与缓存、连续批处理与 Paged Attention 以及更快加载大模型。

    推荐理由:逐项拆解了可直接复用的配置参数与代码片段,读者可按需移植到自己的模型上。