OpenAI 推出面向开发者的 GPT-5.1 API
GPT-5.1 现已在 API 中提供,带来更快的自适应推理、扩展的提示词缓存、改进的编码性能,以及新的 apply_patch 和 shell 工具。
推荐理由:官方点明了面向开发者的具体接口变化,读者可据此评估对现有工作流的影响。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
GPT-5.1 现已在 API 中提供,带来更快的自适应推理、扩展的提示词缓存、改进的编码性能,以及新的 apply_patch 和 shell 工具。
推荐理由:官方点明了面向开发者的具体接口变化,读者可据此评估对现有工作流的影响。
Hugging Face BigCode 团队宣布推出 BigCodeArena,一个通过实际执行代码来评测代码生成模型的人机协同平台,用户可提交任务、让两个模型生成方案、执行并投票,结果汇总为排行榜。
推荐理由:原文给出平台机制、社区投票数据和分层排名,读者可据此理解执行反馈如何改变代码模型评测方式。
OpenAI 宣布 Codex 正式开放使用(generally available),面向开发者新增 Slack 集成、Codex SDK,以及用量仪表盘和工作区管理等管理工具,让 Codex 更易于规模化使用和管理。
OpenAI 在其 API 平台推出 GPT-5,提供高推理性能、面向开发者的新增控制项,并在真实编码任务上取得同级最佳结果。
推荐理由:原文点明了面向开发者的推理性能、控制项与编码任务表现,可据此判断其对 API 工作流的适用方向。
OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。
Mistral AI 宣布 Codestral 25.08,其补全接受率提升 30%、建议保留代码多 10%、失控生成减少 50%,chat 模式在 IF eval v8 指令遵循上提升 5%、MultiplE 代码能力平均提升 5%。
推荐理由:原文给出了具体指标变化和部署方式,读者可据此判断其在企业私有化场景中的可用性。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 并升级 Devstral Small 1.1,主打智能体编码能力。
推荐理由:原文给出两个模型的分数、价格与部署方式,读者可据此比较开源与API两条路线的成本性能取舍。
Mistral AI 与 All Hands AI 合作发布 Devstral,一款面向软件工程任务的智能体 LLM,以 Apache 2.0 许可开源。
推荐理由:原文给出了具体跑分、可本地部署的硬件门槛和 API 价格,读者可据此评估它能否替代现有编码模型。
OpenAI 官方发布 Codex,原文仅提供标题,未包含正文细节。
OpenAI 在 API 中推出 GPT-4.1 系列模型,称其在编码、指令遵循和长上下文理解方面均有全面提升,同时发布首款 nano 模型,即日起面向全球开发者开放。
推荐理由:官方点明了编码、指令遵循和长上下文三处主要提升,读者可据此判断是否值得接入。
DeepSeek-V3 0324 上周悄然登陆 Hugging Face Hub,它是 R1 推理模型底层基座 DeepSeek-V3 的更新版本,架构与原版相同并改用 MIT 许可证。
推荐理由:文章梳理了新模型的基准提升与部署方式,并给出开源模型下载和使用的安全注意事项。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个微调代码模型,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型,OlympicCoder-32B 在 50 次提交限制下还超过 o1-mini 和 DeepSeek-R1。
推荐理由:文中给出的五条训练经验可直接迁移到用推理轨迹微调代码模型的实践中。
OpenAI 官方宣布为 ChatGPT 推出 canvas,一种新的写作与编程交互方式。当前 feed 仅提供标题,未包含更多功能细节。
BigCode 发布开源代码大模型 StarCoder2,含 3B、7B、15B 三个尺寸,全部基于新数据集 The Stack v2 训练,模型、数据集及训练代码均开放。
推荐理由:原文列出了三个尺寸的训练规模与数据集对比,读者可据此判断小模型能否替代更大模型。
Hugging Face 宣布在自身生态中集成 Meta 的 Code Llama 模型家族,包含 7B、13B、34B 三种参数规模,以及 Python 专精版和指令微调版,采用与 Llama 2 相同的宽松社区许可并可商用。
推荐理由:原文给出模型规格、上下文窗口扩展方法和多语言榜单成绩,便于评估其在代码任务上的定位。
Hugging Face 官方博客讲解如何把 BigCode 的 16B 参数开源代码模型 StarCoder 微调成对话式编码助手 StarChat。
推荐理由:完整给出从数据准备、ChatML 格式化到 DeepSpeed 训练与评测的可复现流程,适合想动手微调代码模型的读者。
Hugging Face 与 ServiceNow 联合的 BigCode 项目发布代码大模型 StarCoder 和 StarCoderBase,基于 80+ 编程语言等许可数据训练,约 15B 参数、1 trillion tokens。
推荐理由:原文给出评测数据和提示词技巧,读者可了解开源代码模型的水平及提升分数的具体做法。