跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

179条精选相关主题产品更新论文研究开源生态

最新精选

第 121–140 条 · 共 179 条
4月30日周三
4月29日周二
4月16日周三
4月14日周一
4月5日周六
  1. Hugging Face Blog88

    Hugging Face 迎来 Meta Llama 4 Maverick 与 Scout 模型

    Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。

    推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。

3月27日周四
3月25日周二
3月18日周二
  1. Hugging Face Blog74

    NVIDIA 在 GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 与 Isaac GR00T N1 三项开源成果

    NVIDIA 在 GTC 大会上发布三项面向物理 AI 开发者的开源成果:世界基础模型 Cosmos Transfer、开源数据集 Physical AI Dataset,以及首个通用人形机器人推理开源模型 Isaac GR00T N1。

    推荐理由:梳理了三项开源发布的具体规格与架构细节,便于开发者评估可直接复用的模型与数据资源。

3月17日周一
  1. Mistral AI74

    Mistral AI 发布 Mistral Small 3.1 模型

    Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。

    推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。

3月12日周三
  1. Hugging Face Blog84

    Google 发布 Gemma 3:多模态、多语言、128k 上下文的开源 LLM

    Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。

    推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。

3月4日周二
2月27日周四
2月21日周五
  1. Hugging Face Blog65

    Google 发布多模态视觉语言编码器 SigLIP 2

    Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。

    推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。

2月20日周四
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM2 系列视频理解模型

    Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。

    推荐理由:原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。

1月31日周五
1月23日周四
12月20日周五
12月17日周二
12月9日周一
9月25日周三