Google 发布 MedGemma 1.5 4B 医学多模态模型与 MedASR 医疗语音识别模型
Google 发布 MedGemma 1.5 4B,支持 CT、MRI、全片病理等高维医学影像解读,以及胸片时序回顾、解剖定位和检验报告结构化抽取,并同步推出面向医疗听写的开源语音识别模型 MedASR。
推荐理由:原文给出了各医学影像模态的具体基准提升数字,读者可据此判断该模型在实际医疗场景中的可用程度。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google 发布 MedGemma 1.5 4B,支持 CT、MRI、全片病理等高维医学影像解读,以及胸片时序回顾、解剖定位和检验报告结构化抽取,并同步推出面向医疗听写的开源语音识别模型 MedASR。
推荐理由:原文给出了各医学影像模态的具体基准提升数字,读者可据此判断该模型在实际医疗场景中的可用程度。
OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编程模型,具备长程推理、大规模代码转换和增强的网络安全能力。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼得、成本更低,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI、Gemini Enterprise 开放预览,并成为 Gemini app 与 Search AI Mode 的默认模型。
推荐理由:原文给出多项基准分数、定价与速度对比,读者可据此判断它在成本与能力上的取舍位置。
OpenAI 于 2025 年推出更快的 ChatGPT Images 体验,并在 API 中提供 GPT-Image-1.5,同时介绍最新的 ChatGPT Images 2.5。
OpenAI 发布 GPT-5.2,称其为迄今数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 state-of-the-art 结果。文章说明这些提升如何转化为实际研究进展,包括解决一个开放的理论问题和生成可靠的数学证明。
推荐理由:原文点出该模型在数学与科学基准上的提升如何转化为解决开放理论问题的实际进展。
OpenAI 发布 GPT-5.2,称其是面向日常专业工作的最先进前沿模型,具备 state-of-the-art 的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中可用,用于驱动更快、更可靠的 agentic workflows。
推荐理由:官方定位说明它面向日常专业工作,读者可据此判断与既有模型的取舍。
Mistral AI 发布 Devstral 2 系列编码模型,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,前者在 SWE-bench Verified 上取得 72.2%。
推荐理由:原文给出两个尺寸的参数、SWE-bench 分数与部署门槛,读者可据此判断它在自托管编码场景中的可行性。
Mistral AI 宣布推出 Mistral 3 模型家族,包括 14B、8B、3B 三款稠密小模型和旗舰 Mistral Large 3(41B 激活参数、675B 总参数的稀疏 MoE),全部以 Apache 2.0 许可开源。
推荐理由:原文给出了模型规格、许可证与部署入口,读者可据此评估其在开源模型中的定位与可用性。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),一款基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 通过 Gemini API 开启付费预览。
推荐理由:原文列出了分辨率、输入数量和文字渲染等具体能力边界,便于开发者判断是否迁移。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro,主打更强推理与世界知识带来的精准图像生成与编辑。
推荐理由:原文列明了能力变化与各产品线的开放范围,读者可据此判断它会怎样接入现有工作流。
OpenAI 发布 GPT-5.1-Codex-Max,这是面向 Codex 的更快、更智能的 agentic 编码模型,面向长时运行的项目级任务设计,增强了推理能力和 token 效率。
推荐理由:原文点明该模型面向项目级长任务并强调推理与 token 效率,读者可据此判断其与既有 Codex 模型的定位差异。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在 Gemini API 中以 preview 提供,200k tokens 及以下提示词定价为 $2/百万输入 tokens。
推荐理由:原文给出定价、基准分数和接入入口,读者可据此评估它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,先推出 Gemini 3 Pro preview,并同步上线 Gemini app、AI Studio、Vertex AI、Gemini CLI 及 Search 的 AI Mode,首次在 Search 第一天接入。
推荐理由:官方给出了各基准的具体分数与开放入口,读者可据此评估其相对 2.5 Pro 的实际提升。
Google DeepMind 和 Google Research 发布 WeatherNext 2 天气预报模型,预报生成速度提升 8x、分辨率可达 1 小时,单次输入可生成数百种可能情景,每个预测在单个 TPU 上耗时不到一分钟。
推荐理由:原文说明了新模型的建模思路和落地入口,读者可据此判断它如何进入现有天气查询与业务流程。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使其从指令跟随者进化为可思考目标、与用户对话并随时间自我改进的游戏伙伴。
推荐理由:原文说明了从指令跟随到推理与自我改进的架构变化,读者可据此理解具身智能研究的路径取舍。
GPT-5.1 现已在 API 中提供,带来更快的自适应推理、扩展的提示词缓存、改进的编码性能,以及新的 apply_patch 和 shell 工具。
推荐理由:官方点明了面向开发者的具体接口变化,读者可据此评估对现有工作流的影响。
OpenAI 宣布升级 GPT-5 系列,推出更温暖、更强能力的 GPT-5.1,并新增定制 ChatGPT 语气和风格的方式,今日开始向付费用户推出。
推荐理由:官方说明了模型语气与可定制性的变化,读者可据此判断它对日常对话体验的影响。
OpenAI 发布 Sora 2 系统卡,介绍其新一代视频与音频生成模型。Sora 2 在 Sora 基础上引入更准确的物理表现、更强的真实感、同步音频、增强的可控性以及更广的风格范围等此前视频模型难以实现的能力。
OpenAI 发布视频生成模型 Sora 2,具备同步对话与音效生成能力。原文同时说明 Sora 产品已不再可用。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 构建的大规模多语言编码器模型,使用 3T+ tokens、覆盖 1800 多种语言训练,是首个在性能与速度上超越 XLM-R 的同类模型。
推荐理由:原文给出三阶段训练与低资源语言在衰减阶段快速学习的细节,可迁移其渐进式多语言训练思路。