OpenAI 在 API 平台推出 GPT-5
OpenAI 在其 API 平台推出 GPT-5,提供高推理性能、面向开发者的新增控制项,并在真实编码任务上取得同级最佳结果。
推荐理由:原文点明了面向开发者的推理性能、控制项与编码任务表现,可据此判断其对 API 工作流的适用方向。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
OpenAI 在其 API 平台推出 GPT-5,提供高推理性能、面向开发者的新增控制项,并在真实编码任务上取得同级最佳结果。
推荐理由:原文点明了面向开发者的推理性能、控制项与编码任务表现,可据此判断其对 API 工作流的适用方向。
OpenAI 发布 GPT-5 System Card,介绍统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间调度,以针对不同任务和开发者使用场景优化快速与智能响应。
推荐理由:系统卡说明了统一模型路由如何在不同任务间分配主模型与思考模型,便于理解其响应速度与能力的取舍设计。
OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。
Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。
推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可证并遵循 gpt-oss 使用政策提供下载。
推荐理由:官方模型卡说明了开放权重与许可方式,读者可据此评估其可商用性和部署门槛。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证,主打低成本下的强真实世界性能。原文称二者在推理任务上超越同规模开放模型,具备较强的工具使用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:原文说明了模型规模、许可证与部署目标,读者可据此判断其在消费级硬件上的可用性。
Mistral AI 为 Le Chat 推出一批新功能,包括预览版 Deep Research 模式、基于 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言 Think 模式、Projects 文件夹,以及与 Black Forest Labs 合作的图像编辑。
推荐理由:原文逐项说明了新功能的定位与底层模型,读者可据此判断 Le Chat 在研究、语音、推理场景的能力边界。
Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。
推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。
Mistral AI 发布首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数,Apache 2.0 许可)和企业版 Magistral Medium。
推荐理由:原文给出两个变体的参数规模、AIME2024 分数与开放许可,便于读者评估其与现有推理模型的差距。
Falcon-LLM 团队发布 Falcon-H1 系列共 6 个开源模型(0.5B、1.5B、1.5B-Deep、3B、7B、34B),均提供 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:原文披露了混合架构的取舍与反直觉的数据策略,可迁移借鉴其训练方法论。
OpenAI 发布 o3 和 o4-mini,称其为迄今最智能、最强大的模型,具备完整的工具访问能力。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
DeepSeek-V3 0324 上周悄然登陆 Hugging Face Hub,它是 R1 推理模型底层基座 DeepSeek-V3 的更新版本,架构与原版相同并改用 MIT 许可证。
推荐理由:文章梳理了新模型的基准提升与部署方式,并给出开源模型下载和使用的安全注意事项。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个微调代码模型,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型,OlympicCoder-32B 在 50 次提交限制下还超过 o1-mini 和 DeepSeek-R1。
推荐理由:文中给出的五条训练经验可直接迁移到用推理轨迹微调代码模型的实践中。
Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 512 张 H100 本地跑 DeepSeek R1 生成 800k 条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 判分过滤后保留 220k 道题的正确轨迹。
推荐理由:原文公开了数据生成与过滤的完整流水线和训练对照结果,读者可据此复现或迁移到其他领域。
Hugging Face 发布 Open-R1 项目首周更新,称已在 MATH-500 Benchmark 上基本复现 DeepSeek-R1 蒸馏模型的报告分数,并上线了公开评测 leaderboard。
推荐理由:汇总了复现进度、训练管线细节和社区数据集,读者可据此评估开源复现 DeepSeek-R1 的可行性与路径。
OpenAI 通过官方新闻页发布 o3-mini 模型,本次抓取失败,仅标题可用,正文内容缺失。
Hugging Face 博客用 GRPO 和 Countdown Game 在 4x NVIDIA H100 上复现 DeepSeek R1 的 aha moment,训练 Qwen2.5-3B-Instruct 学会自我验证与搜索。
推荐理由:教程给出可复现的 GRPO 训练配置与超参调整过程,读者可据此在自有硬件上复现类似实验。
Hugging Face 在 Hub 模型页上线 fal、Replicate、Sambanova、Together AI 四家 serverless 推理提供商的集成,并同步接入 JS 和 Python 客户端 SDK。
推荐理由:原文给出了统一接入方式、计费规则和可直接复用的调用示例,读者可据此判断如何在自己项目中切换推理提供商。
Hugging Face 发布 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据与训练管线、验证其技术报告中的主张,并推动开源推理模型的发展。
推荐理由:原文拆解了 DeepSeek-R1 训练配方中尚未公开的部分,并给出 Open-R1 的三步复现路线,便于读者理解开源社区如何补齐这些环节。