跳到正文

#模型发布

今日 1 条
6月11日周四
  1. Google DeepMind74

    Google DeepMind 开源实验性扩散文本模型 DiffusionGemma,推理提速最高 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。

    推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。

6月9日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。

    推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。

5月22日周五
  1. Mistral AI74

    Mistral 发布 128B 开源权重模型 Mistral Medium 3.5 并推出 Vibe 远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。

    推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。

5月18日周一
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。

    推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。

    推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。

4月16日周四
4月13日周一
4月3日周五
3月25日周三
3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。

    推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。

3月17日周二
2月5日周四
12月9日周二
12月3日周三
7月30日周三
7月15日周二
  1. Mistral AI75

    Mistral AI 开源 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。

    推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。

7月11日周五
6月10日周二
5月28日周三
5月21日周三
5月7日周三
  1. Mistral AI74

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 宣布发布 Mistral Medium 3,称其在各项基准上达到 Claude Sonnet 3.7 的 90% 或更高水平,API 价格为 $0.4 输入 / $2 输出每 M token,并在编码与多模态理解等专业场景领先于 Llama 4 Maverick 和 Cohere Command A。

    推荐理由:原文给出了性能对标、价格与部署方式,读者可据此判断它在企业场景中替代更大模型的可行性。

3月17日周一
  1. Mistral AI74

    Mistral AI 发布 Mistral Small 3.1 模型

    Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。

    推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。