Falcon 系列模型接入 Hugging Face 生态并提供完整推理与微调指南
Hugging Face 官方博客介绍 Falcon 系列模型(Falcon-40B 与 Falcon-7B,由阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布)接入其生态的完整用法。
推荐理由:文章系统梳理了 Falcon 在 Hugging Face 生态中的推理、量化与微调路径,可直接迁移为落地参考。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 官方博客介绍 Falcon 系列模型(Falcon-40B 与 Falcon-7B,由阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布)接入其生态的完整用法。
推荐理由:文章系统梳理了 Falcon 在 Hugging Face 生态中的推理、量化与微调路径,可直接迁移为落地参考。
Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。
推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。
Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。
推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。
Hugging Face 官方博客宣布 RWKV 架构已通过 Pull Request 集成进 transformers 库,可通过源码安装或 main 分支使用,支持 pipeline 文本生成与 alpaca 风格的 RWKV-4 Raven 聊天模型调用,并提供 convert_rwkv_checkpoint_to_hf.py 脚本转换原始权重。
推荐理由:原文对比了 RWKV 与 Transformer、RNN 的取舍并给出可直接运行的代码,便于读者判断其适用场景。
Hugging Face 在 🤗 Transformers 的 .generate() 中推出新解码方法 assisted generation,用小模型生成候选 token、再由目标模型一次前向验证,在普通硬件上最高可将延迟降低 10x。
推荐理由:原文拆解了延迟瓶颈并给出可复现的加速数字,读者可据此判断该方法是否适配自己的部署场景。
Hugging Face 官方博客讲解如何把 BigCode 的 16B 参数开源代码模型 StarCoder 微调成对话式编码助手 StarChat。
推荐理由:完整给出从数据准备、ChatML 格式化到 DeepSpeed 训练与评测的可复现流程,适合想动手微调代码模型的读者。
Hugging Face 与 ServiceNow 联合的 BigCode 项目发布代码大模型 StarCoder 和 StarCoderBase,基于 80+ 编程语言等许可数据训练,约 15B 参数、1 trillion tokens。
推荐理由:原文给出评测数据和提示词技巧,读者可了解开源代码模型的水平及提升分数的具体做法。
Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。
推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。
Hugging Face 官方正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调在消费级硬件上更易实现。文中给出三步流程:用 8-bit 精度加载活跃模型、通过 peft 添加可训练的低秩适配器、利用 disable_adapters 复用同一模型同时得到参考与活跃 logits,从而省去两份模型副本。
推荐理由:原文拆解了 8-bit 加载、LoRA 适配器与复用同一模型的三步流程,读者可直接迁移到自己的显存受限训练场景。
Hugging Face 官方博客复盘了 2023 年 2 月土耳其地震后志愿者团队如何用机器学习构建救援应用 afetharita 的实践。
推荐理由:复盘了灾后救援中从数据标注到模型部署的完整 MLOps 流程,可迁移方法具体。
Hugging Face 在 Diffusers 中集成 ControlNet,发布 StableDiffusionControlNetPipeline,支持用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成,论文提出的 8 种条件模型全部支持。
推荐理由:原文给出完整可复现的代码与性能数字,读者可直接照搬这套省显存的 ControlNet 推理配置。
Hugging Face 推出 🤗 PEFT 库,与 🤗 Transformers 和 🤗 Accelerate 无缝集成,目前支持 LoRA、Prefix Tuning、P-Tuning v2、Prompt Tuning、P-Tuning 等方法。
推荐理由:原文给出了在消费级硬件上微调大模型的具体配置与产出体积对比,可直接迁移复用。
Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。
推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。
Hugging Face 博客系统图解了 RLHF 的三步流程:预训练语言模型、用人类排序数据训练奖励模型、再用 PPO 等强化学习算法微调语言模型。文中说明奖励模型将文本映射为标量奖励,奖励函数由偏好分数减去与初始模型的 KL 散度惩罚构成,以防止模型输出偏离初始模型的乱码。
推荐理由:文章把 RLHF 拆成预训练、奖励模型、PPO 微调三步并给出开源工具清单,便于读者建立完整流程认知。
OpenAI 宣布训练并开源神经网络 Whisper,称其在英文语音识别上接近人类水平的鲁棒性和准确性。
Hugging Face 官方博客介绍 LLM.int8() 8-bit 矩阵乘法技术及其在 transformers 和 accelerate 库中的集成,可将大模型显存占用降至约 1/4 而不损失性能。
推荐理由:从数据类型基础讲到量化原理与集成细节,读者可据此理解大模型显存占用的成因与 8-bit 推理的落地方式。
Hugging Face 发布 BLOOM,这是首个完全透明训练的多语言大语言模型,拥有 176B 参数,可生成 46 种自然语言和 13 种编程语言的文本。该项目由 70+ 国家、250+ 机构的 1000 多名研究人员协作完成,在法国巴黎南部的 Jean Zay 超算上训练 117 天(3 月 11 日至 7 月 6 日),算力资助价值约 €3M。
推荐理由:原文交代了训练协作规模与开放许可细节,读者可据此理解大模型研究门槛如何被降低。
OpenAI 发布 Triton 1.0,一款类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能可与专家手写代码相当。
推荐理由:原文点明了 Triton 1.0 面向无 CUDA 经验研究者且性能接近专家水平,读者可据此判断它对 GPU 编程门槛的影响。
OpenAI 发布 Jukebox,一个能以原始音频形式生成多种音乐流派和歌手风格音乐的神经网络,其中包含初步的歌唱能力。OpenAI 同时开源了模型权重和代码,并提供了一个用于浏览生成样本的工具。
推荐理由:原文说明了模型能生成的音频形态与开放程度,读者可据此判断其可复用性。
OpenAI 在发布 124M 小模型、分阶段发布 355M 中模型及相关误用与社会效益研究后,正式发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,方便组织之间发起模型共享合作,并公布技术报告介绍其与 AI 研究社区协调发布规范的经验。
推荐理由:原文交代了分阶段发布路径与配套法律协议,读者可了解其模型共享合作的落地方式。