Google 发布 EmbeddingGemma 多语言嵌入模型
Google 发布 EmbeddingGemma(google/embeddinggemma-300m),一款 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200 MB,在 MTEB 上是 500M 以下排名最高的纯文本多语言嵌入模型。
推荐理由:给出了架构改动、多框架接入方式和微调脚本,读者可据此判断如何在端侧 RAG 中落地该模型。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google 发布 EmbeddingGemma(google/embeddinggemma-300m),一款 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200 MB,在 MTEB 上是 500M 以下排名最高的纯文本多语言嵌入模型。
推荐理由:给出了架构改动、多框架接入方式和微调脚本,读者可据此判断如何在端侧 RAG 中落地该模型。
Hugging Face 与 AI-MO 开源了 kimina-prover-rl 训练管线,用于 Lean 4 形式化定理证明,采用受 DeepSeek-R1 启发的先推理后生成范式,基于 GRPO 与 Verl 框架,训练配方以 recipe/kimina-prover-rl 形式随 Verl fork 发布。
推荐理由:原文给出了完整的训练配方与开源入口,读者可据此复现小参数模型上的强化学习定理证明流程。
OpenAI 在其 API 平台推出 GPT-5,提供高推理性能、面向开发者的新增控制项,并在真实编码任务上取得同级最佳结果。
推荐理由:原文点明了面向开发者的推理性能、控制项与编码任务表现,可据此判断其对 API 工作流的适用方向。
OpenAI 发布 GPT-5 System Card,介绍统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间调度,以针对不同任务和开发者使用场景优化快速与智能响应。
推荐理由:系统卡说明了统一模型路由如何在不同任务间分配主模型与思考模型,便于理解其响应速度与能力的取舍设计。
OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。
Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。
推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可证并遵循 gpt-oss 使用政策提供下载。
推荐理由:官方模型卡说明了开放权重与许可方式,读者可据此评估其可商用性和部署门槛。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证,主打低成本下的强真实世界性能。原文称二者在推理任务上超越同规模开放模型,具备较强的工具使用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:原文说明了模型规模、许可证与部署目标,读者可据此判断其在消费级硬件上的可用性。
Mistral AI 宣布 Codestral 25.08,其补全接受率提升 30%、建议保留代码多 10%、失控生成减少 50%,chat 模式在 IF eval v8 指令遵循上提升 5%、MultiplE 代码能力平均提升 5%。
推荐理由:原文给出了具体指标变化和部署方式,读者可据此判断其在企业私有化场景中的可用性。
Hugging Face Blog 发布 Ettin 系列,包含 17M 到 1B 六种规模的成对 encoder-only 与 decoder-only 模型,使用相同的 2T token 公开数据、架构和训练配方,仅在注意力模式和训练目标上不同。
推荐理由:用同一套数据和配方同时训练编码器与解码器,读者可据此看到架构本身的真实差异。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。
推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 并升级 Devstral Small 1.1,主打智能体编码能力。
推荐理由:原文给出两个模型的分数、价格与部署方式,读者可据此比较开源与API两条路线的成本性能取舍。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。
推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。
推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。
Mistral AI 发布首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数,Apache 2.0 许可)和企业版 Magistral Medium。
推荐理由:原文给出两个变体的参数规模、AIME2024 分数与开放许可,便于读者评估其与现有推理模型的差距。
H Company 在 Hugging Face 开源了 Holo1 系列 Action VLM(含 Holo1-3B 和 Holo1-7B)以及包含 1,639 个人类式 UI 任务的多模态定位基准 WebClick。
推荐理由:给出了模型规格、基准成绩与单任务成本,读者可据此评估开源 GUI 自动化方案的性价比。
Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。
推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。
Mistral AI 与 All Hands AI 合作发布 Devstral,一款面向软件工程任务的智能体 LLM,以 Apache 2.0 许可开源。
推荐理由:原文给出了具体跑分、可本地部署的硬件门槛和 API 价格,读者可据此评估它能否替代现有编码模型。
Falcon-LLM 团队发布 Falcon-H1 系列共 6 个开源模型(0.5B、1.5B、1.5B-Deep、3B、7B、34B),均提供 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:原文披露了混合架构的取舍与反直觉的数据策略,可迁移借鉴其训练方法论。
Mistral AI 宣布发布 Mistral Medium 3,称其在各项基准上达到 Claude Sonnet 3.7 的 90% 或更高水平,API 价格为 $0.4 输入 / $2 输出每 M token,并在编码与多模态理解等专业场景领先于 Llama 4 Maverick 和 Cohere Command A。
推荐理由:原文给出了性能对标、价格与部署方式,读者可据此判断它在企业场景中替代更大模型的可行性。