DetectifAI:祖父遭深度伪造语音诈骗后,创始人推出端侧语音检测 SDK
DetectifAI 推出可在智能手机操作系统内运行的紧凑 AI 模型,能在通话、语音消息等场景即时判断声音是否由 AI 生成,且音频不离开设备。该公司以 SDK 形式授权给手机厂商,目前已为印度金融机构每月处理超过 100,000 通电话,提供深度伪造检测与说话人验证。据 FBI 数据,美国人去年因 AI 驱动诈骗损失近 $900 million,较 2024 年增长 24%。
DetectifAI 推出可在智能手机操作系统内运行的紧凑 AI 模型,能在通话、语音消息等场景即时判断声音是否由 AI 生成,且音频不离开设备。该公司以 SDK 形式授权给手机厂商,目前已为印度金融机构每月处理超过 100,000 通电话,提供深度伪造检测与说话人验证。据 FBI 数据,美国人去年因 AI 驱动诈骗损失近 $900 million,较 2024 年增长 24%。
ElevenLabs 发布 Eleven v4 语音模型,能更准确地遵循情绪、停顿和音效等指令,并在长篇制作中保持音色一致。新架构同时支撑 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。
AWS 发布 vLLM-Omni DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并附 Gradio 示例应用。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的对话式 AI 带来近实时的视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
Meta 在 Connect 2026 上发布个人智能体 Muse 的语音与实时视频能力、Muse Realtime Avatar、Mac 电脑操作、Muse Mail 以及 1,500+ 连接器应用,并推出 Ray-Ban Meta Gen 3、售价 1,299 美元的 Meta VR Glasses、FDA 认证助听功能和 12 月发货的钥匙扣设备 Muse Charm。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与多语言覆盖的具体能力与开放入口。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。