跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 21–40 条 · 共 63 条
3月10日周二
  1. Hugging Face Blog62

    Hugging Face 用七个维度对比16个开源异步RL训练库

    Hugging Face Blog 发布长文,为 TRL 的异步训练器设计做调研,按七个维度(编排原语、rollout buffer 设计、权重同步协议、staleness 管理、partial rollout 处理、LoRA 支持、分布式训练后端)对比了16个从零围绕异步训练构建的开源库。

    推荐理由:文章用七个维度拆解了16个开源RL库的异步训练设计,读者可据此对比选型并理解各自权衡。

2月3日周二
  1. Hugging Face Blog68

    Photoroom 发布 PRX 文生图模型训练设计消融实验报告

    Photoroom 在 Hugging Face Blog 发布 PRX 文生图模型训练系列第二篇,以 PRX-1.2B 在 256×256 Flux VAE 潜空间的 Flow Matching 基线(100k 步、1M MidJourneyV6 合成数据、AdamW lr 1e-4)为参照,系统消融四类训练技巧并报告 FID、CMMD、DINO-MMD 与吞吐变化。

    推荐理由:以统一基线系统消融十余种训练技巧,给出各方法在质量与吞吐上的真实取舍,可直接迁移到自己的训练配置。

12月11日周四
12月4日周四
  1. Hugging Face Blog64

    Hugging Face 推出 Skills 让 Claude 微调开源 LLM 的教程

    Hugging Face 发布 hf-llm-trainer skill,让 Claude Code 等编码智能体通过对话完成开源 LLM 微调的全流程,包括校验数据集、选择硬件、生成并提交训练任务、监控进度以及把模型推到 Hub。

    推荐理由:教程给出了从数据校验到成本估算的完整闭环,读者可据此评估用对话完成微调的可行性。

12月1日周一
10月29日周三
  1. Hugging Face Blog67

    Hugging Face 分析全球算力格局变化:中国国产芯片与开源模型的相互推动

    Hugging Face 博文分析了全球 AI 算力格局的变化:美国出口管制与中国国产芯片发展相互关联,近几个月中国高性能开源模型的推理已开始由华为 Ascend、Cambricon 等国产芯片承载,部分模型也开始用国产芯片训练。

    推荐理由:梳理了美国出口管制与中国国产芯片、开源模型发展之间的相互作用,可帮助读者理解全球算力格局变化的来龙去脉。

10月28日周二
10月27日周一
  1. Hugging Face Blog62

    Hugging Face datasets 流式加载提速,启动请求最多减少 100 倍

    Hugging Face 官方博客宣布 datasets 库的 streaming=True 流式加载获得大幅优化:数据文件解析时间快 10 倍、启动请求最多减少 100 倍、流式速度最高提升 2 倍,在 256 并发 worker 下零崩溃。

    推荐理由:原文拆解了启动与流式两个阶段的具体优化手段,读者可迁移其缓存与预取思路到自己的数据管线。

10月24日周五
  1. Hugging Face Blog70

    LeRobot v0.4.0 发布:数据集 v3.0、PI0.5 与 GR00T N1.5 集成及硬件插件系统

    LeRobot 发布 v0.4.0,推出 LeRobotDataset v3.0(分块 episode 格式、Parquet 统一元数据,支持 OXE 级 >400GB 数据集)、lerobot-edit-dataset CLI 编辑工具,以及面向模型和硬件的两类 Processors 数据处理管线。

    推荐理由:原文逐项列出了数据集、仿真、训练与硬件接入的改动,读者可据此评估开源机器人学习工作流会如何变化。

9月10日周三
9月9日周二
  1. Hugging Face Blog61

    Hugging Face 发布 mmBERT 多语言编码器模型

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 构建的大规模多语言编码器模型,使用 3T+ tokens、覆盖 1800 多种语言训练,是首个在性能与速度上超越 XLM-R 的同类模型。

    推荐理由:原文给出三阶段训练与低资源语言在衰减阶段快速学习的细节,可迁移其渐进式多语言训练思路。

8月14日周四
  1. Hugging Face Blog60

    Hugging Face 开源 Kimina-Prover-RL 训练管线并发布 1.7B 与 0.6B 模型

    Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。

    推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。

8月8日周五
  1. Hugging Face Blog65

    Hugging Face 推出开源无代码数据工具 AI Sheets

    Hugging Face 发布开源无代码工具 AI Sheets,用于用 AI 模型构建、转换和丰富数据集,可本地部署或部署到 Hub,通过 Inference Providers 或本地模型调用 Hub 上的数千个开放模型,包括 OpenAI 的 gpt-oss。

    推荐理由:原文给出了免安装入口、导入与生成两种起步方式以及 few-shot 反馈机制,读者可据此判断它如何嵌入现有数据工作流。

7月16日周三
  1. Hugging Face Blog61

    Hugging Face 发布 Ettin 系列配对编码器与解码器模型

    Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。

    推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。

3月12日周三
3月11日周二
  1. Hugging Face Blog66

    Hugging Face 与 Yaak 推出最大开源自动驾驶数据集 L2D

    Hugging Face LeRobot 团队与 Yaak 联合发布 Learning to Drive(L2D)开源自动驾驶数据集,R4 版本包含 90+ TB 多模态数据、5000+ 小时驾驶、来自德国 30 个城市的 6 路环视摄像头与完整车辆状态。

    推荐理由:对比表和分阶段发布计划让读者能直接评估该数据集相对现有开源数据集的规模与可用性差异。

2月14日周五
2月11日周二
  1. Hugging Face Blog61

    Hugging Face Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 512 张 H100 本地跑 DeepSeek R1 生成 800k 条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 判分过滤后保留 220k 道题的正确轨迹。

    推荐理由:原文公开了数据生成与过滤的完整流水线和训练对照结果,读者可据此复现或迁移到其他领域。

2月2日周日
1月31日周五