跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

180条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 81–100 条 · 共 180 条
10月21日周二
10月7日周二
  1. Hugging Face Blog64

    Hugging Face BigCodeArena 发布:通过代码执行评测代码生成模型

    Hugging Face BigCode 团队宣布推出 BigCodeArena,一个通过实际执行代码来评测代码生成模型的人机协同平台,用户可提交任务、让两个模型生成方案、执行并投票,结果汇总为排行榜。

    推荐理由:原文给出平台机制、社区投票数据和分层排名,读者可据此理解执行反馈如何改变代码模型评测方式。

9月22日周一
9月11日周四
  1. Hugging Face Blog74

    Hugging Face 解析 transformers 为 OpenAI gpt-oss 升级的八项优化技巧

    Hugging Face 官方博客详解为支持 OpenAI gpt-oss 系列而对 transformers 库做的多项升级,包括可从 Hub 下载的零构建 kernels、MXFP4 量化、Tensor Parallelism、Expert Parallelism、动态滑动窗口层与缓存、连续批处理与 Paged Attention 以及更快加载大模型。

    推荐理由:逐项拆解了可直接复用的配置参数与代码片段,读者可按需移植到自己的模型上。

9月10日周三
9月9日周二
  1. Hugging Face Blog61

    Hugging Face 发布 mmBERT 多语言编码器模型

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 构建的大规模多语言编码器模型,使用 3T+ tokens、覆盖 1800 多种语言训练,是首个在性能与速度上超越 XLM-R 的同类模型。

    推荐理由:原文给出三阶段训练与低资源语言在衰减阶段快速学习的细节,可迁移其渐进式多语言训练思路。

9月2日周二
8月14日周四
  1. Hugging Face Blog60

    Hugging Face 开源 Kimina-Prover-RL 训练管线并发布 1.7B 与 0.6B 模型

    Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。

    推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。

8月8日周五
  1. Hugging Face Blog65

    Hugging Face 推出开源无代码数据工具 AI Sheets

    Hugging Face 发布开源无代码工具 AI Sheets,用于用 AI 模型构建、转换和丰富数据集,可本地部署或部署到 Hub,通过 Inference Providers 或本地模型调用 Hub 上的数千个开放模型,包括 OpenAI 的 gpt-oss。

    推荐理由:原文给出了免安装入口、导入与生成两种起步方式以及 few-shot 反馈机制,读者可据此判断它如何嵌入现有数据工作流。

8月5日周二
  1. Hugging Face Blog92

    Hugging Face 欢迎 OpenAI 开源 gpt-oss 模型家族并给出部署指南

    Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。

    推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。

  2. OpenAI News81

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证,主打低成本下的强真实世界性能。原文称二者在推理任务上超越同规模开放模型,具备较强的工具使用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:原文说明了模型规模、许可证与部署目标,读者可据此判断其在消费级硬件上的可用性。

7月16日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Ettin 系列配对编码器与解码器模型

    Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。

    推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。

7月15日周二
  1. Mistral AI75

    Mistral AI 开源 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。

    推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。

7月8日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 3B 模型 SmolLM3:多语言、128k 长上下文与双模式推理

    Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。

    推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。

6月26日周四
  1. Hugging Face Blog81

    Gemma 3n 在开源生态全面开放可用

    Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。

    推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。

6月19日周四
  1. Hugging Face Blog65

    Hugging Face 教你在消费级显卡上用 QLoRA 微调 FLUX.1-dev

    Hugging Face 官方博客给出用 diffusers 库以 QLoRA 微调 FLUX.1-dev 的完整教程,在 RTX 4090 上峰值显存约 9GB,700 步训练约 41 分钟,而同配置 BF16 LoRA 需 26GB、无优化全量微调估计约 120GB。

    推荐理由:给出了完整的显存数据和可复现命令,读者可据此评估自己硬件能否跑通并直接照做。

6月10日周二
6月3日周二