跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

180条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–140 条 · 共 180 条
1月31日周五
1月28日周二
  1. Hugging Face Blog72

    Hugging Face 发起 Open-R1 项目,系统复现 DeepSeek-R1 的数据与训练流程

    Hugging Face 发布 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据与训练管线、验证其技术报告中的主张,并推动开源推理模型的发展。

    推荐理由:原文拆解了 DeepSeek-R1 训练配方中尚未公开的部分,并给出 Open-R1 的三步复现路线,便于读者理解开源社区如何补齐这些环节。

1月27日周一
1月23日周四
12月31日周二
  1. Hugging Face Blog61

    Hugging Face 发布 smolagents 库,让语言模型以代码形式编写动作

    Hugging Face 发布 smolagents,一个让语言模型获得智能体能力的简洁库,核心特点是让智能体以代码形式编写动作而非 JSON 片段。库的逻辑约数千行代码,支持 E2B 沙箱执行、通过 Hub 分享加载工具,并经 LiteLLM 集成支持 OpenAI、Anthropic 等 100+ 云端模型,是 transformers.agents 的继任者。

    推荐理由:原文对比了代码动作与 JSON 工具调用的取舍依据,读者可据此判断何时该用智能体。

10月23日周三
10月22日周二
10月9日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Gradio 5 稳定版,主打生产可用的机器学习 Web 应用

    Hugging Face 宣布 Gradio 5 稳定版发布,用几行 Python 即可构建高性能、可扩展、符合 Web 安全最佳实践的机器学习应用,升级命令为 pip install --upgrade gradio。

    推荐理由:原文逐条对应开发者痛点给出改进方案,读者可据此评估升级到 Gradio 5 的收益与迁移成本。

9月25日周三
8月12日周一
  1. Hugging Face Blog62

    Hugging Face Transformers 推出跨模型统一工具调用 API

    Hugging Face 在 Transformers 中推出跨模型统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch、Llama 等模型间移植,几乎无需模型特定改动,并配套辅助功能与完整文档示例。

    推荐理由:文章给出统一工具调用 API 的设计取舍与完整可运行示例,读者可直接迁移方法到自己的项目中。

  2. Hugging Face Blog66

    Hugging Face 发布 Falcon Mamba 7B:首个强性能无注意力 7B 模型

    Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。

    推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。

7月31日周三
7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

7月22日周一
7月16日周二
7月11日周四
6月27日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 新开放模型 Gemma 2 的技术细节与生态集成

    Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。

    推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。

6月12日周三