跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 41–60 条 · 共 78 条
8月7日周四
  1. OpenAI News75

    OpenAI 在 API 平台推出 GPT-5

    OpenAI 在其 API 平台推出 GPT-5,提供高推理性能、面向开发者的新增控制项,并在真实编码任务上取得同级最佳结果。

    推荐理由:原文点明了面向开发者的推理性能、控制项与编码任务表现,可据此判断其对 API 工作流的适用方向。

  2. OpenAI News72

    OpenAI 发布 GPT-5 System Card,说明统一模型路由机制

    OpenAI 发布 GPT-5 System Card,介绍统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间调度,以针对不同任务和开发者使用场景优化快速与智能响应。

    推荐理由:系统卡说明了统一模型路由如何在不同任务间分配主模型与思考模型,便于理解其响应速度与能力的取舍设计。

  3. OpenAI News81

    OpenAI 发布 GPT-5

    OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。

8月5日周二
  1. Hugging Face Blog92

    Hugging Face 欢迎 OpenAI 开源 gpt-oss 模型家族并给出部署指南

    Hugging Face 发布博客介绍 OpenAI 新开源的 gpt-oss 模型家族,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可,120B 可装入单张 H100,20B 可在 16GB 显存内运行。

    推荐理由:系统梳理了 gpt-oss 在不同硬件上的推理优化选择,可直接作为本地部署的参考。

  2. OpenAI News81

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 开放权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证,主打低成本下的强真实世界性能。原文称二者在推理任务上超越同规模开放模型,具备较强的工具使用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:原文说明了模型规模、许可证与部署目标,读者可据此判断其在消费级硬件上的可用性。

7月17日周四
  1. Mistral AI60

    Mistral AI 为 Le Chat 推出 Deep Research、语音模式等新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括预览版 Deep Research 模式、基于 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言 Think 模式、Projects 文件夹,以及与 Black Forest Labs 合作的图像编辑。

    推荐理由:原文逐项说明了新功能的定位与底层模型,读者可据此判断 Le Chat 在研究、语音、推理场景的能力边界。

7月8日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 3B 模型 SmolLM3:多语言、128k 长上下文与双模式推理

    Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。

    推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。

6月10日周二
5月21日周三
4月16日周三
4月5日周六
  1. Hugging Face Blog88

    Hugging Face 迎来 Meta Llama 4 Maverick 与 Scout 模型

    Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。

    推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。

3月27日周四
3月12日周三
2月11日周二
  1. Hugging Face Blog61

    Hugging Face Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 512 张 H100 本地跑 DeepSeek R1 生成 800k 条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 判分过滤后保留 220k 道题的正确轨迹。

    推荐理由:原文公开了数据生成与过滤的完整流水线和训练对照结果,读者可据此复现或迁移到其他领域。

2月2日周日
1月31日周五
1月28日周二
  1. Hugging Face Blog72

    Hugging Face 发起 Open-R1 项目,系统复现 DeepSeek-R1 的数据与训练流程

    Hugging Face 发布 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据与训练管线、验证其技术报告中的主张,并推动开源推理模型的发展。

    推荐理由:原文拆解了 DeepSeek-R1 训练配方中尚未公开的部分,并给出 Open-R1 的三步复现路线,便于读者理解开源社区如何补齐这些环节。