Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。
NVIDIA Magpie Multilingual TTS 发布新版本,364M 参数开放权重模型支持 12 种语言,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,并扩大印地语和日语的 code-switching 支持。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,通过在文本中嵌入自然语言 audio tags 实现对语音风格、语速和表达的细粒度控制。
推荐理由:原文给出了基准分数和开放入口,读者可据此判断其在语音生成上的定位与可用性。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。
推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。
Mistral AI 发布 Voxtral Transcribe 2 系列,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime,后者以 Apache 2.0 开源权重在 Hugging Face 发布。
推荐理由:原文给出两款模型的延迟、词错率与价格对比,读者可据此评估其在语音工作流中的替换价值。