跳到正文
原文
Hugging Face Blog·· 2023-04-05精选AI 评分71

Hugging Face 发布 StackLLaMA:用 RLHF 训练 LLaMA 回答 Stack Exchange 问题的实战指南

StackLLaMA: A hands-on guide to train LLaMA with RLHF

AI 导读

Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。

推荐理由

教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。

来源:Hugging Face Blog · huggingface.co