跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 121–139 条 · 共 139 条
8月23日周三
  1. Hugging Face Blog64

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。

    推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。

8月22日周二
7月27日周四
  1. Hugging Face Blog61

    Hugging Face 与 Apple 推出 Stable Diffusion XL 的 Core ML 版本与混合位调色板压缩

    Hugging Face 与 Apple 合作将 Stable Diffusion XL 移植到 Core ML,发布了 apple/coreml-stable-diffusion-xl-base 完整流水线和 apple/coreml-stable-diffusion-mixed-bit-palettization 版本。

    推荐理由:原文给出混合位调色板压缩的逐层比特分配方法与实测体积数据,读者可迁移到自己的 Core ML 模型压缩上。

7月18日周二
  1. Hugging Face Blog88

    Hugging Face 全面支持 Meta Llama 2 发布并提供推理与微调指南

    Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。

    推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。

6月23日周五
6月5日周一
5月24日周三
  1. Hugging Face Blog88

    Hugging Face 推出基于 bitsandbytes 的 4-bit 量化与 QLoRA 集成

    Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。

    推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。

5月16日周二
  1. Hugging Face Blog60

    BigCode 背后的大规模近似去重实践

    Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。

    推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。

5月15日周一
  1. Hugging Face Blog60

    RWKV 架构集成进 Hugging Face transformers 库

    Hugging Face 官方博客宣布 RWKV 架构已通过 Pull Request 集成进 transformers 库,可通过源码安装或 main 分支使用,支持 pipeline 文本生成与 alpaca 风格的 RWKV-4 Raven 聊天模型调用,并提供 convert_rwkv_checkpoint_to_hf.py 脚本转换原始权重。

    推荐理由:原文对比了 RWKV 与 Transformer、RNN 的取舍并给出可直接运行的代码,便于读者判断其适用场景。

5月11日周四
  1. Hugging Face Blog64

    Hugging Face Transformers 推出 assisted generation 低延迟解码方法

    Hugging Face 在 🤗 Transformers 的 .generate() 中推出新解码方法 assisted generation,用小模型生成候选 token、再由目标模型一次前向验证,在普通硬件上最高可将延迟降低 10x。

    推荐理由:原文拆解了延迟瓶颈并给出可复现的加速数字,读者可据此判断该方法是否适配自己的部署场景。

5月9日周二
5月4日周四
4月5日周三
  1. Hugging Face Blog71

    Hugging Face 发布 StackLLaMA:用 RLHF 训练 LLaMA 回答 Stack Exchange 问题的实战指南

    Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。

    推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。

3月3日周五
  1. Hugging Face Blog71

    Hugging Face Diffusers 集成 ControlNet 并发布 StableDiffusionControlNetPipeline

    Hugging Face 在 Diffusers 中集成 ControlNet,发布 StableDiffusionControlNetPipeline,支持用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成,论文提出的 8 种条件模型全部支持。

    推荐理由:原文给出完整可复现的代码与性能数字,读者可直接照搬这套省显存的 ControlNet 推理配置。

2月10日周五
1月26日周四
  1. Hugging Face Blog65

    Hugging Face 介绍如何用 LoRA 高效微调 Stable Diffusion

    Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。

    推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。

8月17日周三
7月12日周二
  1. Hugging Face Blog78

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,这是首个完全透明训练的多语言大语言模型,拥有 176B 参数,可生成 46 种自然语言和 13 种编程语言的文本。该项目由 70+ 国家、250+ 机构的 1000 多名研究人员协作完成,在法国巴黎南部的 Jean Zay 超算上训练 117 天(3 月 11 日至 7 月 6 日),算力资助价值约 €3M。

    推荐理由:原文交代了训练协作规模与开放许可细节,读者可据此理解大模型研究门槛如何被降低。