OpenAI 为 GPT-4o 开放微调功能
OpenAI 宣布 GPT-4o 现已支持微调(fine-tuning)。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
OpenAI 宣布 GPT-4o 现已支持微调(fine-tuning)。
Hugging Face 发布 SmolLM 小语言模型系列,包含 135M、360M、1.7B 三种参数规模,并同步开源 SmolLM-Corpus 训练语料。
推荐理由:原文公开了数据配比与消融实验细节,读者可迁移其小模型数据筛选方法。
Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。
推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。
Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。
Hugging Face 博客展示了用开源 LLM(Mixtral-8x7B-Instruct-v0.1)生成合成数据、再用 AutoTrain 微调约 0.13B 参数 RoBERTa-base 的完整流程。
推荐理由:通过具体成本与碳排数字对比,读者可直接判断何时该用合成数据训练专用小模型而非调用 LLM API。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源基于 Slurm 集群、由 TGI 和 vLLM 支撑的可扩展合成数据生成工具 llm-swarm。
推荐理由:完整给出用开源模型做 Constitutional AI 的可复用配方与评测数据,便于迁移实践。
Hugging Face 发布 2023 年开源 LLM 年度回顾,梳理了从 BLOOM、OPT、GLM-130B 到 LLaMA、Llama 2、Mistral、Qwen、Yi 等模型的发布脉络,以及 Chinchilla 范式转变带来的小模型加更多数据趋势。
推荐理由:系统梳理了开源 LLM 的技术要素与全年脉络,可作为理解开源模型生态的入门地图。
Hugging Face 官方博客发布 Mixture of Experts Explained,系统讲解 MoE 的组成、稀疏性、负载均衡、Switch Transformers、微调挑战与推理部署技巧。
推荐理由:系统梳理了 MoE 的原理、训练与推理权衡,读者可据此判断何时选用稀疏模型。
Hugging Face 官方博客宣布 TII 的 Falcon 180B 加入 HuggingFace 生态,这是当时最大的公开可用语言模型,拥有 180B 参数、在 RefinedWeb 数据集上训练 3.5 trillion tokens,是开源模型中最长的单轮预训练。
推荐理由:文章给出了硬件需求和量化实测,读者可据此评估自己能否跑起这个 180B 模型。
Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。
推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。
Hugging Face 官方博客介绍 Falcon 系列模型(Falcon-40B 与 Falcon-7B,由阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布)接入其生态的完整用法。
推荐理由:文章系统梳理了 Falcon 在 Hugging Face 生态中的推理、量化与微调路径,可直接迁移为落地参考。
Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。
推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。
Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。
推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。
Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。
推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。
Hugging Face 官方正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调在消费级硬件上更易实现。文中给出三步流程:用 8-bit 精度加载活跃模型、通过 peft 添加可训练的低秩适配器、利用 disable_adapters 复用同一模型同时得到参考与活跃 logits,从而省去两份模型副本。
推荐理由:原文拆解了 8-bit 加载、LoRA 适配器与复用同一模型的三步流程,读者可直接迁移到自己的显存受限训练场景。
Hugging Face 推出 🤗 PEFT 库,与 🤗 Transformers 和 🤗 Accelerate 无缝集成,目前支持 LoRA、Prefix Tuning、P-Tuning v2、Prompt Tuning、P-Tuning 等方法。
推荐理由:原文给出了在消费级硬件上微调大模型的具体配置与产出体积对比,可直接迁移复用。
Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。
推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。
Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。
推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。
OpenAI 发布 InstructGPT 系列语言模型,称其遵循用户意图的能力优于 GPT-3,同时更真实、毒性更低,采用对齐研究中的人类参与训练技术,现已在 API 中设为默认语言模型。
推荐理由:说明了用人类反馈对齐技术让模型更好遵循指令并降低毒性,可迁移至同类模型训练。
OpenAI 发布关于神经语言模型缩放定律(Scaling laws for neural language models)的研究,材料抓取失败,仅标题可用,具体内容未提供。