Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的对话式 AI 带来近实时的视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的对话式 AI 带来近实时的视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。