Liquid AI 开源 LFM2.5 系列 DSpark 草稿模型,推理最高提速 3.2 倍
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款模型发布 DSpark 草稿模型检查点,加入投机解码路径,在不改变输出质量的前提下带来最高 3.18 倍 GPU 吞吐提升和最高 2.87 倍端侧提速,并将 LFM2.5-2.6B 的函数调用延迟平均降低 57%。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款模型发布 DSpark 草稿模型检查点,加入投机解码路径,在不改变输出质量的前提下带来最高 3.18 倍 GPU 吞吐提升和最高 2.87 倍端侧提速,并将 LFM2.5-2.6B 的函数调用延迟平均降低 57%。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的高效模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文给出多项基准对比与定价,读者可据此评估它相对 3.6 Flash 的实际提升幅度。
Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。
推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。
NVIDIA Magpie Multilingual TTS 发布新版本,364M 参数开放权重模型支持 12 种语言,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,并扩大印地语和日语的 code-switching 支持。
Meta 发布 Muse Glimmer-30B,一款从 Muse 蒸馏至 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析、个人助手等注重隐私的场景。
推荐理由:原文给出架构细节与部署入口,读者可据此判断本地智能体场景下的落地成本与可行性。
Google DeepMind 在 Nature 发文称其 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,三天预报精度相当于旧模型的两天,领先幅度超过 24 小时,约相当于十年气象学进展。
推荐理由:原文给出了模型在低分辨率下取得高精度这一反直觉发现及其开放权重的入口,读者可据此评估其对现有预报工作流的可迁移价值。
Mistral AI 以 Apache 2.0 协议开源 3B 多模态安全分类模型 Shieldstral,它把内容审核建模为二元问答任务,推理时用自然语言写入策略即可返回校准的连续安全分数,无需重训,统一处理文本与图像。
推荐理由:原文说明了把内容审核改写成自然语言问答的做法,读者可据此理解它如何在不重训的前提下适配不同产品策略。
Microsoft Research 开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:原文给出三个领域的训练配方与具体分数,读者可据此评估小参数开源模型在真实任务上的能力边界。
Microsoft Research 发布 Echoverse,一套面向计算机使用智能体的深度可演化训练环境,包含十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与数据库接地验证器。
推荐理由:原文用对照实验说明深度与多样性比环境数量更能带来迁移,可为构建计算机使用智能体训练环境提供方法参考。
Google DeepMind 宣布音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线。新版本在音乐性、歌词、人声和创作控制四方面升级:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度和结构意识提升,人声更真实且情感更细腻、发音更清晰,并支持更方便地控制输出的节奏和时长。
Google DeepMind 发布三款 Gemini 新模型:Gemini 3.6 Flash 主打编码、知识工作与多模态,按 Artificial Analysis Index 输出 token 消耗比 3.5 Flash 少 17%。
推荐理由:原文给出三款模型的定价与基准对比,可据此评估其在智能体工作流中的成本与能力取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,通过 CodeMender 以限量试点方式先向政府和可信伙伴开放。
推荐理由:原文说明了轻量模型在代码安全场景相对大模型的成本与调用优势,以及受限开放策略的考量。
DharmaOCR 在葡萄牙语专用 benchmark 上以 0.925 分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。
Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。
推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。
Mistral AI 发布首个面向具身导航的 8B 模型 Robostral Navigate,仅用单个普通 RGB 相机(无深度传感器或 LiDAR)即可让机器人自主导航,在 R2R-CE validation unseen 上取得 76.6% 成功率,validation seen 为 79.4%,比最佳单相机方案高 9.7 点、比使用深度或多相机的最佳系统高 4.5 点。
Mistral AI 发布 Leanstral 1.5,一款 Apache-2.0 许可、119B 总参数 6B 激活参数的免费模型,权重已上线 Hugging Face 并提供免费 API 端点 leanstral-1-5。
推荐理由:原文给出基准成绩、成本对比和测试时扩展曲线,读者可据此判断其在形式化验证任务上的性价比与能力边界。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)图像模型与 Gemini Omni Flash(gemini-omni-flash-preview)视频生成与对话式编辑模型。
推荐理由:原文给出了两款模型的定位分工与串联用法,读者可据此判断如何组合图像与视频生成搭建工作流。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参调优和特征工程,单次前向传播即可在未见过的表格上生成预测。
推荐理由:原文说明了混合注意力架构与合成数据训练如何替代传统特征工程和调参流程,便于评估其对现有工作流的替代空间。
Google Research 宣布将 Multi-Token Prediction (MTP) 架构改造后接入已冻结的 Gemini Nano v3 模型,并已部署到 Pixel 9 和 10 系列,让 AI Notification Summaries 和 Proofread 等端侧功能生成更快、更省电。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。
推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。
Google DeepMind 发布 Gemma 4 12B,定位为可在 16GB RAM 消费级笔记本本地运行的智能体多模态模型,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:原文说明了无编码器架构如何省下延迟与显存,读者可据此判断本地多模态部署的可行性。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。
推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。
推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。
Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。
推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,通过在文本中嵌入自然语言 audio tags 实现对语音风格、语速和表达的细粒度控制。
推荐理由:原文给出了基准分数和开放入口,读者可据此判断其在语音生成上的定位与可用性。
Google DeepMind 发布 Gemini Robotics-ER 1.6,作为机器人高层推理模型,可通过 Gemini API 和 Google AI Studio 调用,并原生调用 Google Search、VLA 及第三方函数。
推荐理由:原文说明了仪器读数能力的实现路径,读者可了解具身推理如何结合代码执行解决真实巡检问题。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。
Google Research 推出压缩算法 TurboQuant(将在 ICLR 2026 发布),通过 PolarQuant 与 QJL 两项技术在零精度损失下大幅压缩模型体积,消除传统向量量化的内存开销。
Google Research 在 Google Earth AI 计划下推出自监督框架 S2Vec,通过 S2 Geometry 分区将建成环境栅格化为多层图像,再用 masked autoencoding(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、中位收入等指标。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。
推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。
Mistral AI 宣布发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态与 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可开源。
推荐理由:原文给出了架构参数与延迟吞吐数据,读者可据此评估其替代多模型组合的可行性。
Mistral AI 发布并开源 Leanstral,首个专为 Lean 4 设计的代码智能体,采用高稀疏架构、6B 活跃参数,以 Apache 2.0 许可发布权重,同时在 Mistral Vibe 中提供 agent 模式并开放免费 API 端点 labs-leanstral-2603。
Mistral AI 发布 Voxtral Transcribe 2 系列,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime,后者以 Apache 2.0 开源权重在 Hugging Face 发布。
推荐理由:原文给出两款模型的延迟、词错率与价格对比,读者可据此评估其在语音工作流中的替换价值。
Mistral AI 发布 Devstral 2 系列编码模型,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,前者在 SWE-bench Verified 上取得 72.2%。
推荐理由:原文给出两个尺寸的参数、SWE-bench 分数与部署门槛,读者可据此判断它在自托管编码场景中的可行性。
Mistral AI 宣布推出 Mistral 3 模型家族,包括 14B、8B、3B 三款稠密小模型和旗舰 Mistral Large 3(41B 激活参数、675B 总参数的稀疏 MoE),全部以 Apache 2.0 许可开源。
推荐理由:原文给出了模型规格、许可证与部署入口,读者可据此评估其在开源模型中的定位与可用性。
Mistral AI 宣布 Codestral 25.08,其补全接受率提升 30%、建议保留代码多 10%、失控生成减少 50%,chat 模式在 IF eval v8 指令遵循上提升 5%、MultiplE 代码能力平均提升 5%。
推荐理由:原文给出了具体指标变化和部署方式,读者可据此判断其在企业私有化场景中的可用性。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。
推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 并升级 Devstral Small 1.1,主打智能体编码能力。
推荐理由:原文给出两个模型的分数、价格与部署方式,读者可据此比较开源与API两条路线的成本性能取舍。