Anthropic 发布 Sonnet 5.5,称其更快更省且智能体编码超过 Opus 5.5
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%、token 消耗速率显著更低,主打日常任务与编码。
推荐理由:对比了 Sonnet 5.5 与前代及 Opus 的定位差异,可帮助判断选型时速度与成本的权衡。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%、token 消耗速率显著更低,主打日常任务与编码。
推荐理由:对比了 Sonnet 5.5 与前代及 Opus 的定位差异,可帮助判断选型时速度与成本的权衡。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其擅长用代码生成讲解视频。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:Grok 4.7 上线 Amazon Bedrock 的接入方式与四档推理强度配置,可供评估长任务智能体的成本与延迟取舍。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数任务成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的思考预算、编码表现与免费层能力,可据此判断它与 Opus 5.5 及竞品免费档的差距。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,单任务成本最多降低 30%,在多项基准上接近 Opus 5.5。
推荐理由:梳理了 Sonnet 5.5 与 Opus 5.5、GPT-6 系列的基准与价格对照,可据此判断中端模型的性价比位置。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修补。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上的提升,以及面向安全防御的 Cyber 变体与 Fairwind 计划,构成一次可对照的模型迭代。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的高效模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文给出多项基准对比与定价,读者可据此评估它相对 3.6 Flash 的实际提升幅度。
Microsoft Research 开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:原文给出三个领域的训练配方与具体分数,读者可据此评估小参数开源模型在真实任务上的能力边界。
Google DeepMind 发布三款 Gemini 新模型:Gemini 3.6 Flash 主打编码、知识工作与多模态,按 Artificial Analysis Index 输出 token 消耗比 3.5 Flash 少 17%。
推荐理由:原文给出三款模型的定价与基准对比,可据此评估其在智能体工作流中的成本与能力取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,通过 CodeMender 以限量试点方式先向政府和可信伙伴开放。
推荐理由:原文说明了轻量模型在代码安全场景相对大模型的成本与调用优势,以及受限开放策略的考量。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。
推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。
推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。
Mistral AI 发布并开源 Leanstral,首个专为 Lean 4 设计的代码智能体,采用高稀疏架构、6B 活跃参数,以 Apache 2.0 许可发布权重,同时在 Mistral Vibe 中提供 agent 模式并开放免费 API 端点 labs-leanstral-2603。
Mistral AI 发布 Devstral 2 系列编码模型,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,前者在 SWE-bench Verified 上取得 72.2%。
推荐理由:原文给出两个尺寸的参数、SWE-bench 分数与部署门槛,读者可据此判断它在自托管编码场景中的可行性。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,称其在真实代码数据检索上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。