用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment 教程
Hugging Face 博客用 GRPO 和 Countdown Game 在 4x NVIDIA H100 上复现 DeepSeek R1 的 aha moment,训练 Qwen2.5-3B-Instruct 学会自我验证与搜索。
推荐理由:教程给出可复现的 GRPO 训练配置与超参调整过程,读者可据此在自有硬件上复现类似实验。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 博客用 GRPO 和 Countdown Game 在 4x NVIDIA H100 上复现 DeepSeek R1 的 aha moment,训练 Qwen2.5-3B-Instruct 学会自我验证与搜索。
推荐理由:教程给出可复现的 GRPO 训练配置与超参调整过程,读者可据此在自有硬件上复现类似实验。
Hugging Face 在 Hub 模型页上线 fal、Replicate、Sambanova、Together AI 四家 serverless 推理提供商的集成,并同步接入 JS 和 Python 客户端 SDK。
推荐理由:原文给出了统一接入方式、计费规则和可直接复用的调用示例,读者可据此判断如何在自己项目中切换推理提供商。
Hugging Face 发布 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据与训练管线、验证其技术报告中的主张,并推动开源推理模型的发展。
推荐理由:原文拆解了 DeepSeek-R1 训练配方中尚未公开的部分,并给出 Open-R1 的三步复现路线,便于读者理解开源社区如何补齐这些环节。
Hugging Face Diffusers 团队发文盘点当前开源视频生成模型现状,并给出在 Diffusers 中运行和优化这些模型的方案。
推荐理由:给出了显存实测数据和可组合的优化手段,读者可据此判断在自己硬件上跑开源视频模型的可行性。
Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,含 base 与指令微调共四个 checkpoint,可直接通过 transformers、MLX 和 ONNX 加载。
推荐理由:原文对比了视觉编码器与分词优化的取舍,读者可借鉴其在极小模型上做效率权衡的思路。
Hugging Face 发布 smolagents,一个让语言模型获得智能体能力的简洁库,核心特点是让智能体以代码形式编写动作而非 JSON 片段。库的逻辑约数千行代码,支持 E2B 沙箱执行、通过 Hub 分享加载工具,并经 LiteLLM 集成支持 OpenAI、Anthropic 等 100+ 云端模型,是 transformers.agents 的继任者。
推荐理由:原文对比了代码动作与 JSON 工具调用的取舍依据,读者可据此判断何时该用智能体。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中推出 SynthID Text,可通过 logits processor 为 AI 生成文本添加水印并用分类器检测。
推荐理由:原文给出了配置参数、检测器训练流程和局限,读者可据此评估如何在自己的模型上落地水印方案。
Stable Diffusion 3.5 已上线 Hugging Face Hub 并可用 Diffusers 调用,提供 8B 参数版和 timestep-distilled 少步推理版两个 checkpoint。
推荐理由:文章给出了量化推理和 LoRA 训练的具体配置,读者可直接迁移到自己的消费级显卡上跑 SD3.5 Large。
Hugging Face 官方发布 Transformers.js v3,加入 WebGPU 支持,性能最高可达 WASM 的 100 倍,可通过设置 device: 'webgpu' 启用。
推荐理由:原文列出了 WebGPU 加速与 dtype 量化参数的具体用法,读者可据此判断浏览器端模型部署的性能与体积取舍。
Hugging Face 宣布 Gradio 5 稳定版发布,用几行 Python 即可构建高性能、可扩展、符合 Web 安全最佳实践的机器学习应用,升级命令为 pip install --upgrade gradio。
推荐理由:原文逐条对应开发者痛点给出改进方案,读者可据此评估升级到 Gradio 5 的收益与迁移成本。
Meta 与 Hugging Face 合作发布 Llama 3.2 系列,共 10 个开放权重模型上线 Hub,包括 5 个多模态模型和 5 个纯文本模型。
推荐理由:原文给出各尺寸模型的显存需求与本地运行方式,读者可据此判断能否在自己的设备上跑起来。
Hugging Face 在 Transformers 中推出跨模型统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch、Llama 等模型间移植,几乎无需模型特定改动,并配套辅助功能与完整文档示例。
推荐理由:文章给出统一工具调用 API 的设计取舍与完整可运行示例,读者可直接迁移方法到自己的项目中。
Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。
推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
Hugging Face 官方博客讲解如何借助 WWDC 24 新发布的 Core ML 特性,在 Mac 上以不到 4GB 内存运行 Mistral 7B。
推荐理由:逐步骤给出转换与运行命令,读者可照做在 Mac 上跑起 7B 模型并了解各项新特性的作用。
Hugging Face 发布 SmolLM 小语言模型系列,包含 135M、360M、1.7B 三种参数规模,并同步开源 SmolLM-Corpus 训练语料。
推荐理由:原文公开了数据配比与消融实验细节,读者可迁移其小模型数据筛选方法。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:详细拆解了从数据构造到解码算法的完整配方,可迁移方法多。
Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。
推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 上线并支持 🧨 Diffusers,同时提供 SD3 Dreambooth 和 LoRA 训练脚本。
推荐理由:原文给出显存与速度的实测对照表,读者可据此选择适合自己硬件的运行方案。