跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 41–60 条 · 共 63 条
8月20日周二
7月16日周二
6月27日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 新开放模型 Gemma 2 的技术细节与生态集成

    Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。

    推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。

3月20日周三
  1. Hugging Face Blog62

    Hugging Face 开源 Cosmopedia 合成数据集与 cosmo-1b 模型

    Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

    推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。

2月16日周五
2月1日周四
12月18日周一
  1. Hugging Face Blog60

    Hugging Face 2023 年开源 LLM 年度回顾

    Hugging Face 发布 2023 年开源 LLM 年度回顾,梳理了从 BLOOM、OPT、GLM-130B 到 LLaMA、Llama 2、Mistral、Qwen、Yi 等模型的发布脉络,以及 Chinchilla 范式转变带来的小模型加更多数据趋势。

    推荐理由:系统梳理了开源 LLM 的技术要素与全年脉络,可作为理解开源模型生态的入门地图。

12月11日周一
9月6日周三
  1. Hugging Face Blog76

    Hugging Face 迎来 TII 的 Falcon 180B 开源模型

    Hugging Face 官方博客宣布 TII 的 Falcon 180B 加入 HuggingFace 生态,这是当时最大的公开可用语言模型,拥有 180B 参数、在 RefinedWeb 数据集上训练 3.5 trillion tokens,是开源模型中最长的单轮预训练。

    推荐理由:文章给出了硬件需求和量化实测,读者可据此评估自己能否跑起这个 180B 模型。

7月18日周二
  1. Hugging Face Blog88

    Hugging Face 全面支持 Meta Llama 2 发布并提供推理与微调指南

    Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。

    推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。

6月5日周一
5月24日周三
  1. Hugging Face Blog88

    Hugging Face 推出基于 bitsandbytes 的 4-bit 量化与 QLoRA 集成

    Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。

    推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。

5月16日周二
  1. Hugging Face Blog60

    BigCode 背后的大规模近似去重实践

    Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。

    推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。

4月5日周三
  1. Hugging Face Blog71

    Hugging Face 发布 StackLLaMA:用 RLHF 训练 LLaMA 回答 Stack Exchange 问题的实战指南

    Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。

    推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。

3月9日周四
  1. Hugging Face Blog68

    Hugging Face 官方发布 TRL 与 PEFT 集成,24GB 消费级 GPU 可用 RLHF 微调 20B 模型

    Hugging Face 官方正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调在消费级硬件上更易实现。文中给出三步流程:用 8-bit 精度加载活跃模型、通过 peft 添加可训练的低秩适配器、利用 disable_adapters 复用同一模型同时得到参考与活跃 logits,从而省去两份模型副本。

    推荐理由:原文拆解了 8-bit 加载、LoRA 适配器与复用同一模型的三步流程,读者可直接迁移到自己的显存受限训练场景。

2月10日周五
1月26日周四
  1. Hugging Face Blog65

    Hugging Face 介绍如何用 LoRA 高效微调 Stable Diffusion

    Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。

    推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。

1月24日周二
  1. Hugging Face Blog60

    Hugging Face 解读让对话智能体更有用的关键技术

    Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。

    推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。

1月27日周四
1月23日周四