Hugging Face 博客详解 Mixture of Experts(MoE)
Hugging Face 官方博客发布 Mixture of Experts Explained,系统讲解 MoE 的组成、稀疏性、负载均衡、Switch Transformers、微调挑战与推理部署技巧。
推荐理由:系统梳理了 MoE 的原理、训练与推理权衡,读者可据此判断何时选用稀疏模型。
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
Hugging Face 官方博客发布 Mixture of Experts Explained,系统讲解 MoE 的组成、稀疏性、负载均衡、Switch Transformers、微调挑战与推理部署技巧。
推荐理由:系统梳理了 MoE 的原理、训练与推理权衡,读者可据此判断何时选用稀疏模型。
Hugging Face 官方博客给出生产环境优化 LLM 的三类技术并附实测:低精度量化、Flash Attention 与面向长文本的架构改进。
推荐理由:原文用同一模型的实测显存与耗时数据,把量化、Flash Attention 和 KV cache 优化的取舍讲得可直接迁移。
Hugging Face 博客解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何显著低于 LLaMA 论文报告值。
推荐理由:通过对比三套 MMLU 实现的分数差异,读者能理解评测分数为何不可直接跨库比较。
Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。
推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。
Hugging Face 官方博客讲解如何把 BigCode 的 16B 参数开源代码模型 StarCoder 微调成对话式编码助手 StarChat。
推荐理由:完整给出从数据准备、ChatML 格式化到 DeepSpeed 训练与评测的可复现流程,适合想动手微调代码模型的读者。
Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。
推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。
Hugging Face 官方博客复盘了 2023 年 2 月土耳其地震后志愿者团队如何用机器学习构建救援应用 afetharita 的实践。
推荐理由:复盘了灾后救援中从数据标注到模型部署的完整 MLOps 流程,可迁移方法具体。
Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。
推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。
Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。
推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。
Hugging Face 博客系统图解了 RLHF 的三步流程:预训练语言模型、用人类排序数据训练奖励模型、再用 PPO 等强化学习算法微调语言模型。文中说明奖励模型将文本映射为标量奖励,奖励函数由偏好分数减去与初始模型的 KL 散度惩罚构成,以防止模型输出偏离初始模型的乱码。
推荐理由:文章把 RLHF 拆成预训练、奖励模型、PPO 微调三步并给出开源工具清单,便于读者建立完整流程认知。
Hugging Face 官方博客介绍 LLM.int8() 8-bit 矩阵乘法技术及其在 transformers 和 accelerate 库中的集成,可将大模型显存占用降至约 1/4 而不损失性能。
推荐理由:从数据类型基础讲到量化原理与集成细节,读者可据此理解大模型显存占用的成因与 8-bit 推理的落地方式。