Hugging Face 发布开源 OCR 模型选型与部署指南
Hugging Face 发布指南介绍如何挑选和使用开源 OCR 模型,覆盖模型能力、输出格式(DocTag、HTML、Markdown、JSON)、评测基准与成本对比。
推荐理由:文章给出模型能力、输出格式与成本的对照维度,读者可据此为自己的文档场景挑选 OCR 模型。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 发布指南介绍如何挑选和使用开源 OCR 模型,覆盖模型能力、输出格式(DocTag、HTML、Markdown、JSON)、评测基准与成本对比。
推荐理由:文章给出模型能力、输出格式与成本的对照维度,读者可据此为自己的文档场景挑选 OCR 模型。
Hugging Face BigCode 团队宣布推出 BigCodeArena,一个通过实际执行代码来评测代码生成模型的人机协同平台,用户可提交任务、让两个模型生成方案、执行并投票,结果汇总为排行榜。
推荐理由:原文给出平台机制、社区投票数据和分层排名,读者可据此理解执行反馈如何改变代码模型评测方式。
Hugging Face 发布智能体评测基准 Gaia2 及配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集以 CC by 4.0 许可发布,ARE 以 MIT 许可发布。
推荐理由:原文给出了评测维度与各模型的强弱分布,读者可据此判断当前智能体能力的真实短板所在。
Hugging Face 官方博客详解为支持 OpenAI gpt-oss 系列而对 transformers 库做的多项升级,包括可从 Hub 下载的零构建 kernels、MXFP4 量化、Tensor Parallelism、Expert Parallelism、动态滑动窗口层与缓存、连续批处理与 Paged Attention 以及更快加载大模型。
推荐理由:逐项拆解了可直接复用的配置参数与代码片段,读者可按需移植到自己的模型上。
Hugging Face 发布 Jupyter Agent 项目后续工作,通过生成高质量训练数据并微调 Qwen3-4B,使其在 DABStep 数据科学基准上成为 SOTA 小模型智能体。
推荐理由:完整拆解了从数据清洗到微调评测的全流程,可迁移的方法细节和踩坑经验较多。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 构建的大规模多语言编码器模型,使用 3T+ tokens、覆盖 1800 多种语言训练,是首个在性能与速度上超越 XLM-R 的同类模型。
推荐理由:原文给出三阶段训练与低资源语言在衰减阶段快速学习的细节,可迁移其渐进式多语言训练思路。
Hugging Face 官方博客介绍如何在 ZeroGPU Spaces 中接入 PyTorch ahead-of-time (AoT) 编译,利用 spaces 包提供的 aoti_capture。
推荐理由:文章给出可直接复用的 AoT 编译接入步骤和多种进阶技巧,读者可据此改造自己的 ZeroGPU 应用。
Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。
推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。
Hugging Face 发布开源无代码工具 AI Sheets,用于用 AI 模型构建、转换和丰富数据集,可本地部署或部署到 Hub,通过 Inference Providers 或本地模型调用 Hub 上的数千个开放模型,包括 OpenAI 的 gpt-oss。
推荐理由:原文给出了免安装入口、导入与生成两种起步方式以及 few-shot 反馈机制,读者可据此判断它如何嵌入现有数据工作流。
Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。
推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可证并遵循 gpt-oss 使用政策提供下载。
推荐理由:官方模型卡说明了开放权重与许可方式,读者可据此评估其可商用性和部署门槛。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证,主打低成本下的强真实世界性能。原文称二者在推理任务上超越同规模开放模型,具备较强的工具使用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:原文说明了模型规模、许可证与部署目标,读者可据此判断其在消费级硬件上的可用性。
Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。
推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。
推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。
Hugging Face 宣布将 Hub 存储从 Git LFS 迁移至 Xet,6 个月内已有 500,000 个仓库、20 PB 数据完成迁移,超过 100 万人在使用 Xet,5 月起成为新用户和组织的默认选项。
推荐理由:原文拆解了无感迁移的桥接与后台同步机制,可迁移借鉴其平滑迁移方案。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。
推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。
推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。
Hugging Face 官方博客给出用 diffusers 库以 QLoRA 微调 FLUX.1-dev 的完整教程,在 RTX 4090 上峰值显存约 9GB,700 步训练约 41 分钟,而同配置 BF16 LoRA 需 26GB、无优化全量微调估计约 120GB。
推荐理由:给出了完整的显存数据和可复现命令,读者可据此评估自己硬件能否跑通并直接照做。
Mistral AI 发布首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数,Apache 2.0 许可)和企业版 Magistral Medium。
推荐理由:原文给出两个变体的参数规模、AIME2024 分数与开放许可,便于读者评估其与现有推理模型的差距。
H Company 在 Hugging Face 开源了 Holo1 系列 Action VLM(含 Holo1-3B 和 Holo1-7B)以及包含 1,639 个人类式 UI 任务的多模态定位基准 WebClick。
推荐理由:给出了模型规格、基准成绩与单任务成本,读者可据此评估开源 GUI 自动化方案的性价比。