Anthropic 发布 Sonnet 5.5,称其更快更省且智能体编码超过 Opus 5.5
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%、token 消耗速率显著更低,主打日常任务与编码。
推荐理由:对比了 Sonnet 5.5 与前代及 Opus 的定位差异,可帮助判断选型时速度与成本的权衡。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%、token 消耗速率显著更低,主打日常任务与编码。
推荐理由:对比了 Sonnet 5.5 与前代及 Opus 的定位差异,可帮助判断选型时速度与成本的权衡。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其擅长用代码生成讲解视频。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:Grok 4.7 上线 Amazon Bedrock 的接入方式与四档推理强度配置,可供评估长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。
Runway 本月早些时候发布 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并提出 WorldPrompt 输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修补。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上的提升,以及面向安全防御的 Cyber 变体与 Fairwind 计划,构成一次可对照的模型迭代。
IBM Granite 团队发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密 decoder-only 尺寸,均以 Apache 2.0 开源,支持 thinking/non-thinking 切换、低强度思考模式与原生工具调用。
推荐理由:原文完整拆解了从预训练到多阶段RL的构建流程,可迁移了解推理模型的训练配方。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的高效模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文给出多项基准对比与定价,读者可据此评估它相对 3.6 Flash 的实际提升幅度。
Meta 发布 Muse Glimmer-30B,一款从 Muse 蒸馏至 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析、个人助手等注重隐私的场景。
推荐理由:原文给出架构细节与部署入口,读者可据此判断本地智能体场景下的落地成本与可行性。
Microsoft Research 开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:原文给出三个领域的训练配方与具体分数,读者可据此评估小参数开源模型在真实任务上的能力边界。
Microsoft Research 发布 Echoverse,一套面向计算机使用智能体的深度可演化训练环境,包含十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与数据库接地验证器。
推荐理由:原文用对照实验说明深度与多样性比环境数量更能带来迁移,可为构建计算机使用智能体训练环境提供方法参考。
Google DeepMind 发布三款 Gemini 新模型:Gemini 3.6 Flash 主打编码、知识工作与多模态,按 Artificial Analysis Index 输出 token 消耗比 3.5 Flash 少 17%。
推荐理由:原文给出三款模型的定价与基准对比,可据此评估其在智能体工作流中的成本与能力取舍。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。
推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。