Hugging Face 教你在 ZeroGPU Spaces 中接入 PyTorch AoT 编译提速
Hugging Face 官方博客介绍如何在 ZeroGPU Spaces 中接入 PyTorch ahead-of-time (AoT) 编译,利用 spaces 包提供的 aoti_capture。
推荐理由:文章给出可直接复用的 AoT 编译接入步骤和多种进阶技巧,读者可据此改造自己的 ZeroGPU 应用。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 官方博客介绍如何在 ZeroGPU Spaces 中接入 PyTorch ahead-of-time (AoT) 编译,利用 spaces 包提供的 aoti_capture。
推荐理由:文章给出可直接复用的 AoT 编译接入步骤和多种进阶技巧,读者可据此改造自己的 ZeroGPU 应用。
Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。
推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。
Hugging Face 宣布将 Hub 存储从 Git LFS 迁移至 Xet,6 个月内已有 500,000 个仓库、20 PB 数据完成迁移,超过 100 万人在使用 Xet,5 月起成为新用户和组织的默认选项。
推荐理由:原文拆解了无感迁移的桥接与后台同步机制,可迁移借鉴其平滑迁移方案。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义枢纽:只要模型架构被 transformers 支持,就预期在生态其他部分同样被支持。
推荐理由:原文说明了 Transformers 作为模型定义标准如何打通训练、推理与本地部署链路,读者可据此理解生态碎片化的应对方式。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
Hugging Face Diffusers 团队发文盘点当前开源视频生成模型现状,并给出在 Diffusers 中运行和优化这些模型的方案。
推荐理由:给出了显存实测数据和可组合的优化手段,读者可据此判断在自己硬件上跑开源视频模型的可行性。
Hugging Face 宣布 Gradio 5 稳定版发布,用几行 Python 即可构建高性能、可扩展、符合 Web 安全最佳实践的机器学习应用,升级命令为 pip install --upgrade gradio。
推荐理由:原文逐条对应开发者痛点给出改进方案,读者可据此评估升级到 Gradio 5 的收益与迁移成本。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
Google 发布开源大模型系列 Gemma,包含 7B 和 2B 两种参数规模、各有 base 与 instruction-tuned 版本,共 4 个开放模型上线 Hugging Face Hub。
推荐理由:文章给出各尺寸模型的跑分对照和单卡微调命令,读者可据此判断在自有硬件上落地的可行性。
Hugging Face 官方博客给出生产环境优化 LLM 的三类技术并附实测:低精度量化、Flash Attention 与面向长文本的架构改进。
推荐理由:原文用同一模型的实测显存与耗时数据,把量化、Flash Attention 和 KV cache 优化的取舍讲得可直接迁移。
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。
推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。
Hugging Face 官方博客介绍 Falcon 系列模型(Falcon-40B 与 Falcon-7B,由阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布)接入其生态的完整用法。
推荐理由:文章系统梳理了 Falcon 在 Hugging Face 生态中的推理、量化与微调路径,可直接迁移为落地参考。
OpenAI 发布 Triton 1.0,一款类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能可与专家手写代码相当。
推荐理由:原文点明了 Triton 1.0 面向无 CUDA 经验研究者且性能接近专家水平,读者可据此判断它对 GPU 编程门槛的影响。