跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

最新精选

第 41–51 条 · 共 51 条
12月11日周一
9月15日周五
6月23日周五
5月16日周二
  1. Hugging Face Blog60

    BigCode 背后的大规模近似去重实践

    Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。

    推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。

5月9日周二
4月5日周三
  1. Hugging Face Blog71

    Hugging Face 发布 StackLLaMA:用 RLHF 训练 LLaMA 回答 Stack Exchange 问题的实战指南

    Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。

    推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。

3月3日周五
1月26日周四
  1. Hugging Face Blog65

    Hugging Face 介绍如何用 LoRA 高效微调 Stable Diffusion

    Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。

    推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。

1月24日周二
  1. Hugging Face Blog60

    Hugging Face 解读让对话智能体更有用的关键技术

    Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。

    推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。

12月9日周五
  1. Hugging Face Blog60

    Hugging Face 图解 RLHF:从人类反馈强化学习的三步训练流程

    Hugging Face 博客系统图解了 RLHF 的三步流程:预训练语言模型、用人类排序数据训练奖励模型、再用 PPO 等强化学习算法微调语言模型。文中说明奖励模型将文本映射为标量奖励,奖励函数由偏好分数减去与初始模型的 KL 散度惩罚构成,以防止模型输出偏离初始模型的乱码。

    推荐理由:文章把 RLHF 拆成预训练、奖励模型、PPO 微调三步并给出开源工具清单,便于读者建立完整流程认知。

8月17日周三