跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 41–53 条 · 共 53 条
9月2日周二
8月5日周二
  1. Hugging Face Blog92

    Hugging Face 欢迎 OpenAI 开源 gpt-oss 模型家族并给出部署指南

    Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。

    推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。

7月15日周二
5月15日周四
  1. Hugging Face Blog60

    Hugging Face Transformers 将标准化模型定义,降低跨框架贡献门槛

    Hugging Face 宣布 Transformers 将成为跨框架的模型定义枢纽:只要模型架构被 transformers 支持,就预期在生态其他部分同样被支持。

    推荐理由:原文说明了 Transformers 作为模型定义标准如何打通训练、推理与本地部署链路,读者可据此理解生态碎片化的应对方式。

4月5日周六
  1. Hugging Face Blog88

    Hugging Face 迎来 Meta Llama 4 Maverick 与 Scout 模型

    Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。

    推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。

1月27日周一
10月9日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Gradio 5 稳定版,主打生产可用的机器学习 Web 应用

    Hugging Face 宣布 Gradio 5 稳定版发布,用几行 Python 即可构建高性能、可扩展、符合 Web 安全最佳实践的机器学习应用,升级命令为 pip install --upgrade gradio。

    推荐理由:原文逐条对应开发者痛点给出改进方案,读者可据此评估升级到 Gradio 5 的收益与迁移成本。

7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

2月21日周三
9月15日周五
8月23日周三
  1. Hugging Face Blog64

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。

    推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。

6月5日周一
7月28日周三
  1. OpenAI News66

    OpenAI 开源 GPU 编程语言 Triton 1.0

    OpenAI 发布 Triton 1.0,一款类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能可与专家手写代码相当。

    推荐理由:原文点明了 Triton 1.0 面向无 CUDA 经验研究者且性能接近专家水平,读者可据此判断它对 GPU 编程门槛的影响。