跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 61–80 条 · 共 139 条
9月2日周二
8月14日周四
  1. Hugging Face Blog60

    Hugging Face 开源 Kimina-Prover-RL 训练管线并发布 1.7B 与 0.6B 模型

    Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。

    推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。

8月8日周五
  1. Hugging Face Blog65

    Hugging Face 推出开源无代码数据工具 AI Sheets

    Hugging Face 发布开源无代码工具 AI Sheets,用于用 AI 模型构建、转换和丰富数据集,可本地部署或部署到 Hub,通过 Inference Providers 或本地模型调用 Hub 上的数千个开放模型,包括 OpenAI 的 gpt-oss。

    推荐理由:原文给出了免安装入口、导入与生成两种起步方式以及 few-shot 反馈机制,读者可据此判断它如何嵌入现有数据工作流。

8月5日周二
  1. Hugging Face Blog92

    Hugging Face 欢迎 OpenAI 开源 gpt-oss 模型家族并给出部署指南

    Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。

    推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。

7月16日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Ettin 系列配对编码器与解码器模型

    Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。

    推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。

7月15日周二
7月8日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 3B 模型 SmolLM3:多语言、128k 长上下文与双模式推理

    Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。

    推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。

6月26日周四
  1. Hugging Face Blog81

    Gemma 3n 在开源生态全面开放可用

    Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。

    推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。

6月3日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 450M 视觉语言动作模型 SmolVLA

    Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。

    推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。

5月23日周五
5月15日周四
  1. Hugging Face Blog60

    Hugging Face Transformers 将标准化模型定义,降低跨框架贡献门槛

    Hugging Face 宣布 Transformers 将成为跨框架的模型定义枢纽:只要模型架构被 transformers 支持,就预期在生态其他部分同样被支持。

    推荐理由:原文说明了 Transformers 作为模型定义标准如何打通训练、推理与本地部署链路,读者可据此理解生态碎片化的应对方式。

4月29日周二
4月25日周五
4月14日周一
  1. Hugging Face Blog60

    Hugging Face 收购 Pollen Robotics,将开售开源人形机器人 Reachy 2

    Hugging Face 宣布收购成立 9 年的开源机器人公司 Pollen Robotics,这是继 Gradio、XetHub 之后其第五次收购,并将开售首款开源人形机器人 Reachy 2,售价 $70,000,已在 Cornell、Carnegie Mellon 等实验室使用。

    推荐理由:梳理了 Hugging Face 从 LeRobot 到收购 Pollen Robotics 的完整布局,便于理解其开源机器人路线。

4月5日周六
  1. Hugging Face Blog88

    Hugging Face 迎来 Meta Llama 4 Maverick 与 Scout 模型

    Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。

    推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。

3月27日周四
3月26日周三
  1. Hugging Face Blog61

    Hugging Face 教程:用 Sentence Transformers 训练与微调 Reranker 模型

    Hugging Face 官方博客给出用 Sentence Transformers 微调 reranker(Cross Encoder)模型的完整教程,覆盖数据集、硬负例挖掘、损失函数、训练参数、评估器与 CrossEncoderTrainer 各组件,并附完整训练脚本。

    推荐理由:教程给出可复用的训练配方和评测对照,读者可据此判断在自有数据上微调 reranker 能带来多大提升。

3月12日周三
  1. Hugging Face Blog84

    Google 发布 Gemma 3:多模态、多语言、128k 上下文的开源 LLM

    Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。

    推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。