跳到正文
原文
Hugging Face Blog·· 2024-03-20精选AI 评分62

Hugging Face 开源 Cosmopedia 合成数据集与 cosmo-1b 模型

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

推荐理由

原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。

来源:Hugging Face Blog · huggingface.co