跳到正文

#语音

今日 0 条
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。

9月16日周三
8月11日周二
4月16日周四
3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。

    推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。

2月5日周四