用 vLLM-Omni 在 SageMaker AI 上构建实时语音应用(Part 1)
AWS 发布 vLLM-Omni DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并附 Gradio 示例应用。
AWS 发布 vLLM-Omni DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并附 Gradio 示例应用。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型到全托管实时推理端点,仅需几秒参考音频即可完成声音克隆,无需重新训练。Qwen3-TTS 支持 10 种语言、流式生成与跨语言克隆,输出 24 kHz 音频,由 vLLM-Omni 容器提供服务。该方案让数据保留在 AWS 环境内,成本随算力用量而非按字符计费。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的对话式 AI 带来近实时的视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
AWS 推出 WhisperX Deep Learning Container,可部署到 Amazon SageMaker AI 实时或异步端点,为语音转写补齐逐词时间戳与说话人标注。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。
Voice Arena 与 Hugging Face 合作向 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,Hindi 成为该多语言标签页上的首个 Indic 语言。
推荐理由:原文用分区 WER 差异和 lattice 打分对比说明单一 WER 的盲区,读者可据此理解榜单评测的可迁移设计。
Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、格式化的文本,已在 Gemini app 和 Android 的 Rambler 等功能中使用,现通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 向开发者开放。
推荐理由:原文给出了 WER、延迟等量化指标和 Chirp 3 对比,读者可据此评估其在真实场景的可用性。
Hugging Face 发布研究,提出三种测试来量化语音识别中的基准优化(benchmaxxing)现象,并评测了 11 个广泛使用的开源 ASR 模型。
推荐理由:研究给出三种可量化探测方法与具体数据,读者可据此理解公开语音基准分数虚高的机制并改进自己的评测选择。
NVIDIA Magpie Multilingual TTS 发布新版本,364M 参数开放权重模型支持 12 种语言,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,并扩大印地语和日语的 code-switching 支持。
Hugging Face 推出 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个领先闭源与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。
Hugging Face 与 Cerebras 合作推出基于 Gemma 4 的实时语音 AI 演示,将开放的级联语音管线与 Cerebras 的推理速度结合,实现更自然的对话响应。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。
推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,通过在文本中嵌入自然语言 audio tags 实现对语音风格、语速和表达的细粒度控制。
推荐理由:原文给出了基准分数和开放入口,读者可据此判断其在语音生成上的定位与可用性。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。
推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。
Google Research 发布开源语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、逾 1 亿使用者,以 CC-BY-4.0 许可开放。数据集包含约 1,846 小时 ASR 转录自然语音与超过 565 小时高保真 TTS 录音,由非洲学术与社区组织主导采集,合作方包括 Makerere University、University of Ghana 等。
Mistral AI 发布 Voxtral Transcribe 2 系列,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime,后者以 Apache 2.0 开源权重在 Hugging Face 发布。
推荐理由:原文给出两款模型的延迟、词错率与价格对比,读者可据此评估其在语音工作流中的替换价值。