Hugging Face Blog·· 2023-04-05精选AI 评分71
Hugging Face 发布 StackLLaMA:用 RLHF 训练 LLaMA 回答 Stack Exchange 问题的实战指南
StackLLaMA: A hands-on guide to train LLaMA with RLHF
AI 导读
Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。
推荐理由
教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。
来源:Hugging Face Blog · huggingface.co