Hugging Face Blog·· 27 天前AI 评分56
用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出合规率
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 发布教程,用 TRL 库的 GRPO 对 LFM2.5-350M 做 LoRA 微调,约 500 条样本、100 步训练,在 IFStruct 基准上通过率从 22.6% 提升到 29.7%,其中 JSON 从 18.0% 升至 31.9%,YAML 基本持平。
来源:Hugging Face Blog · huggingface.co