跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 101–120 条 · 共 139 条
7月31日周三
7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

7月22日周一
7月11日周四
6月27日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 新开放模型 Gemma 2 的技术细节与生态集成

    Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。

    推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。

5月14日周二
  1. Hugging Face Blog65

    Hugging Face 介绍 Google PaliGemma 开源视觉语言模型系列

    Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。

    推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。

5月13日周一
4月18日周四
4月15日周一
  1. Hugging Face Blog63

    Hugging Face 发布 8B 多模态模型 Idefics2

    Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。

    推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。

3月20日周三
  1. Hugging Face Blog62

    Hugging Face 开源 Cosmopedia 合成数据集与 cosmo-1b 模型

    Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

    推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。

2月28日周三
2月21日周三
2月16日周五
2月1日周四
12月18日周一
  1. Hugging Face Blog60

    Hugging Face 2023 年开源 LLM 年度回顾

    Hugging Face 发布 2023 年开源 LLM 年度回顾,梳理了从 BLOOM、OPT、GLM-130B 到 LLaMA、Llama 2、Mistral、Qwen、Yi 等模型的发布脉络,以及 Chinchilla 范式转变带来的小模型加更多数据趋势。

    推荐理由:系统梳理了开源 LLM 的技术要素与全年脉络,可作为理解开源模型生态的入门地图。

12月11日周一
  1. Hugging Face Blog78

    Hugging Face 完整集成 Mixtral 8x7B 模型

    Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。

    推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。

11月9日周四
9月15日周五
9月6日周三
  1. Hugging Face Blog76

    Hugging Face 迎来 TII 的 Falcon 180B 开源模型

    Hugging Face 官方博客宣布 TII 的 Falcon 180B 加入 HuggingFace 生态,这是当时最大的公开可用语言模型,拥有 180B 参数、在 RefinedWeb 数据集上训练 3.5 trillion tokens,是开源模型中最长的单轮预训练。

    推荐理由:文章给出了硬件需求和量化实测,读者可据此评估自己能否跑起这个 180B 模型。

8月25日周五
  1. Hugging Face Blog78

    Hugging Face 集成 Code Llama 模型家族

    Hugging Face 宣布在自身生态中集成 Meta 的 Code Llama 模型家族,包含 7B、13B、34B 三种参数规模,以及 Python 专精版和指令微调版,采用与 Llama 2 相同的宽松社区许可并可商用。

    推荐理由:原文给出模型规格、上下文窗口扩展方法和多语言榜单成绩,便于评估其在代码任务上的定位。