跳到正文
原文
Hugging Face Blog·· 2025-09-09精选AI 评分61

Hugging Face 发布 mmBERT 多语言编码器模型

mmBERT: ModernBERT goes Multilingual

AI 导读

Hugging Face 发布 mmBERT,一个基于 ModernBERT 构建的大规模多语言编码器模型,使用 3T+ tokens、覆盖 1800 多种语言训练,是首个在性能与速度上超越 XLM-R 的同类模型。

推荐理由

原文给出三阶段训练与低资源语言在衰减阶段快速学习的细节,可迁移其渐进式多语言训练思路。

来源:Hugging Face Blog · huggingface.co