Hugging Face 教你在 ZeroGPU Spaces 中接入 PyTorch AoT 编译提速
Hugging Face 官方博客介绍如何在 ZeroGPU Spaces 中接入 PyTorch ahead-of-time (AoT) 编译,利用 spaces 包提供的 aoti_capture。
推荐理由:文章给出可直接复用的 AoT 编译接入步骤和多种进阶技巧,读者可据此改造自己的 ZeroGPU 应用。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 官方博客介绍如何在 ZeroGPU Spaces 中接入 PyTorch ahead-of-time (AoT) 编译,利用 spaces 包提供的 aoti_capture。
推荐理由:文章给出可直接复用的 AoT 编译接入步骤和多种进阶技巧,读者可据此改造自己的 ZeroGPU 应用。
Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。
推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。
Hugging Face 发布开源无代码工具 AI Sheets,用于用 AI 模型构建、转换和丰富数据集,可本地部署或部署到 Hub,通过 Inference Providers 或本地模型调用 Hub 上的数千个开放模型,包括 OpenAI 的 gpt-oss。
推荐理由:原文给出了免安装入口、导入与生成两种起步方式以及 few-shot 反馈机制,读者可据此判断它如何嵌入现有数据工作流。
Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。
推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。
Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。
推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。
Hugging Face 宣布将 Hub 存储从 Git LFS 迁移至 Xet,6 个月内已有 500,000 个仓库、20 PB 数据完成迁移,超过 100 万人在使用 Xet,5 月起成为新用户和组织的默认选项。
推荐理由:原文拆解了无感迁移的桥接与后台同步机制,可迁移借鉴其平滑迁移方案。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。
推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。
推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。
Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。
推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。
Hugging Face 在 TRL 中通过 PR #3394 引入 vLLM colocate 模式,让训练与推理共享同一组 GPU、在同一进程组内轮流执行,取代此前需要独立 GPU 和 HTTP 通信的 server 模式。
推荐理由:原文给出 colocate 模式的实测加速数据和踩坑清单,可帮助判断何时该从 server 模式迁移。
Hugging Face 发布教程,介绍如何用 Python 构建约 70 行代码的 MCP 驱动 Tiny Agent,并宣布 tiny-agents 已支持 AGENTS.md 标准。
推荐理由:文章拆解了 MCPClient 与 Agent 的关键代码,读者可据此理解一个 MCP 智能体如何用极少代码搭起来。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义枢纽:只要模型架构被 transformers 支持,就预期在生态其他部分同样被支持。
推荐理由:原文说明了 Transformers 作为模型定义标准如何打通训练、推理与本地部署链路,读者可据此理解生态碎片化的应对方式。
Meta 发布 Llama Guard 4,一个 12B 稠密多模态安全模型,以及两款新的 Llama Prompt Guard 2 分类器(86M 和 22M 参数)。
推荐理由:原文给出了从 Llama 4 Scout 剪枝为稠密模型的架构细节和与上一代的对比数据,便于判断其部署成本与效果取舍。
Hugging Face 发布 Tiny Agent,用约 50 行 TypeScript 代码实现一个由 MCP 驱动的 Agent,核心思路是 MCP 客户端之上套一个 while 循环。
推荐理由:文章把 MCP 客户端与 Agent 的实现拆解到 50 行代码级别,读者可直接照搬这套 while 循环结构到自己的项目。
Hugging Face 宣布收购成立 9 年的开源机器人公司 Pollen Robotics,这是继 Gradio、XetHub 之后其第五次收购,并将开售首款开源人形机器人 Reachy 2,售价 $70,000,已在 Cornell、Carnegie Mellon 等实验室使用。
推荐理由:梳理了 Hugging Face 从 LeRobot 到收购 Pollen Robotics 的完整布局,便于理解其开源机器人路线。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
DeepSeek-V3 0324 上周悄然登陆 Hugging Face Hub,它是 R1 推理模型底层基座 DeepSeek-V3 的更新版本,架构与原版相同并改用 MIT 许可证。
推荐理由:文章梳理了新模型的基准提升与部署方式,并给出开源模型下载和使用的安全注意事项。
Hugging Face 官方博客给出用 Sentence Transformers 微调 reranker(Cross Encoder)模型的完整教程,覆盖数据集、硬负例挖掘、损失函数、训练参数、评估器与 CrossEncoderTrainer 各组件,并附完整训练脚本。
推荐理由:教程给出可复用的训练配方和评测对照,读者可据此判断在自有数据上微调 reranker 能带来多大提升。
Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。
推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个微调代码模型,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型,OlympicCoder-32B 在 50 次提交限制下还超过 o1-mini 和 DeepSeek-R1。
推荐理由:文中给出的五条训练经验可直接迁移到用推理轨迹微调代码模型的实践中。