Google DeepMind 发布手语转文字模型 SL2T,落地 Gboard 与 Live Transcribe
Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。
推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。
Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。
推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。
NVIDIA Magpie Multilingual TTS 发布新版本,364M 参数开放权重模型支持 12 种语言,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,并扩大印地语和日语的 code-switching 支持。
Meta 发布 Muse Glimmer-30B,一款从 Muse 蒸馏至 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析、个人助手等注重隐私的场景。
推荐理由:原文给出架构细节与部署入口,读者可据此判断本地智能体场景下的落地成本与可行性。
Google Research 宣布将 Multi-Token Prediction (MTP) 架构改造后接入已冻结的 Gemini Nano v3 模型,并已部署到 Pixel 9 和 10 系列,让 AI Notification Summaries 和 Proofread 等端侧功能生成更快、更省电。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。
推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。
Google DeepMind 发布 Gemma 4 12B,定位为可在 16GB RAM 消费级笔记本本地运行的智能体多模态模型,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:原文说明了无编码器架构如何省下延迟与显存,读者可据此判断本地多模态部署的可行性。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。
Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。