Google Research 发布端到端实时语音到语音翻译模型
Google Research 介绍了一种端到端实时语音到语音翻译(S2ST)模型,可保留原说话人声音进行实时翻译,延迟仅 2 秒,而现有级联式方案通常有 4–5 秒延迟并存在误差累积。
推荐理由:原文对比了级联方案的延迟与误差累积问题,读者可据此理解端到端流式架构带来的改进方向。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google Research 介绍了一种端到端实时语音到语音翻译(S2ST)模型,可保留原说话人声音进行实时翻译,延迟仅 2 秒,而现有级联式方案通常有 4–5 秒延迟并存在误差累积。
推荐理由:原文对比了级联方案的延迟与误差累积问题,读者可据此理解端到端流式架构带来的改进方向。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在 Gemini API 中以 preview 提供,200k tokens 及以下提示词定价为 $2/百万输入 tokens。
推荐理由:原文给出定价、基准分数和接入入口,读者可据此评估它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先推出 Gemini 3 Pro preview,并同步上线 Gemini app、AI Studio、Vertex AI、Gemini CLI 及 Search 的 AI Mode,首次在 Search 第一天接入。
推荐理由:官方给出了各基准的具体分数与开放入口,读者可据此评估其相对 2.5 Pro 的实际提升。
Google Research 发布论文并推出 Generative UI,让模型针对任意提示词动态生成网页、游戏、工具和应用等交互界面,该能力以 dynamic view 和 visual layout 两项实验形式在 Gemini 应用上线。
推荐理由:原文说明了实现所需的三项关键设计和评测对比口径,读者可据此判断生成式 UI 目前的能力边界。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使其从指令跟随者进化为可思考目标、与用户对话并随时间自我改进的游戏伙伴。
推荐理由:原文说明了从指令跟随到推理与自我改进的架构变化,读者可据此理解具身智能研究的路径取舍。
ChatGPT 推出群聊功能,用户可以和他人以及 ChatGPT 在同一个对话中协作。
Google 宣布基于 Gemini 模型打造的个人健康教练将在未来一周内向美国 Fitbit Premium Android 用户推出可选公开预览,iOS 版本随后扩展。
推荐理由:原文拆解了健康教练背后的多智能体框架与评测体系,读者可了解其如何把通用模型落到具体健康场景。
Hugging Face 宣布为开源工具 AI Sheets 加入视觉支持,用户可在表格中直接查看、分析、提取图片信息,生成新图并实时编辑,底层通过 Inference Providers 调用数千个开源模型。
推荐理由:通过手写食谱的完整示例,读者可以看到从图片抽取到结构化导出的可迁移工作流。
Hugging Face 发布指南介绍如何挑选和使用开源 OCR 模型,覆盖模型能力、输出格式(DocTag、HTML、Markdown、JSON)、评测基准与成本对比。
推荐理由:文章给出模型能力、输出格式与成本的对照维度,读者可据此为自己的文档场景挑选 OCR 模型。
OpenAI 发布 Sora 2 系统卡,介绍其新一代视频与音频生成模型。Sora 2 在 Sora 基础上引入更准确的物理表现、更强的真实感、同步音频、增强的可控性以及更广的风格范围等此前视频模型难以实现的能力。
OpenAI 宣布推出 Sora 2 视频模型和 Sora 应用,称针对前沿视频模型与全新社交创作平台带来的新型安全挑战,将安全作为基础,并以具体保护措施作为其做法的锚点。
推荐理由:官方说明了面向视频模型与社交创作平台的具体安全保护措施,可了解其安全设计思路。
OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。
Mistral AI 为 Le Chat 推出一批新功能,包括预览版 Deep Research 模式、基于 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言 Think 模式、Projects 文件夹,以及与 Black Forest Labs 合作的图像编辑。
推荐理由:原文逐项说明了新功能的定位与底层模型,读者可据此判断 Le Chat 在研究、语音、推理场景的能力边界。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。
推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。
推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。
H Company 在 Hugging Face 开源了 Holo1 系列 Action VLM(含 Holo1-3B 和 Holo1-7B)以及包含 1,639 个人类式 UI 任务的多模态定位基准 WebClick。
推荐理由:给出了模型规格、基准成绩与单任务成本,读者可据此评估开源 GUI 自动化方案的性价比。
Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。
推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。
Meta 发布 Llama Guard 4,一个 12B 稠密多模态安全模型,以及两款新的 Llama Prompt Guard 2 分类器(86M 和 22M 参数)。
推荐理由:原文给出了从 Llama 4 Scout 剪枝为稠密模型的架构细节和与上一代的对比数据,便于判断其部署成本与效果取舍。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
NVIDIA 在 GTC 大会上发布三项面向物理 AI 开发者的开源成果:世界基础模型 Cosmos Transfer、开源数据集 Physical AI Dataset,以及首个通用人形机器人推理开源模型 Isaac GR00T N1。
推荐理由:梳理了三项开源发布的具体规格与架构细节,便于开发者评估可直接复用的模型与数据资源。