Hugging Face Blog·· 2025-01-31精选AI 评分61
用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment 教程
Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial
AI 导读
Hugging Face 博客用 GRPO 和 Countdown Game 在 4x NVIDIA H100 上复现 DeepSeek R1 的 aha moment,训练 Qwen2.5-3B-Instruct 学会自我验证与搜索。
推荐理由
教程给出可复现的 GRPO 训练配置与超参调整过程,读者可据此在自有硬件上复现类似实验。
来源:Hugging Face Blog · huggingface.co