Mistral 发布 128B 开源权重模型 Mistral Medium 3.5 并推出 Vibe 远程智能体
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。
推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。
推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。
Google 发布基于 Gemini 的科研工具 ERA,其论文今日刊于 Nature,同时开始通过 Gemini for Science 更广泛开放由 AlphaEvolve 和 ERA 构建的实验工具 Computational Discovery。
推荐理由:原文列出 ERA 在多个学科基准和五个开放科学问题上的具体结果,读者可据此判断这类工具当前能覆盖的研究范围。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室如何用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新颖的候选遗传因子,其中部分假设经实验室验证,能成功推动细胞进入更年轻状态。它还把原本最长需耗时六个月的筛选数据与文献对照分析工作压缩到几天。
推荐理由:原文给出 Co-Scientist 在真实实验室中把文献分析从数月压缩到数天的具体用法,可迁移至其他科研数据解读场景。
Google DeepMind 推出 Gemini for Science,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上三个实验工具。
推荐理由:原文列出了三个实验工具的具体能力与开放入口,读者可据此判断它会怎样嵌入现有科研工作流。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。
推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,并推出基于 Gemini 的多智能体系统 Hypothesis Generation,面向个人研究者开放注册,将在未来几周内逐步推出。
推荐理由:原文给出了多智能体分工、验证算力占比和多个已落地案例,读者可据此判断它如何嵌入真实科研流程。
Google DeepMind 发布 AlphaEvolve 一周年影响综述,这一 Gemini 驱动的编码智能体已在多领域落地:基因组学中使 DeepConsensus 变异检测错误降低 30%,电网 AC Optimal Power Flow 可行解求解率从 14% 提升至 88% 以上,自然灾害风险预测准确率提升 5%。
推荐理由:原文按领域梳理了 AlphaEvolve 一年来的落地成果与量化数据,便于读者判断这类算法发现型智能体的实际影响范围。
Mistral AI 宣布 Workflows 进入公开预览,作为企业 AI 的编排层,提供持久执行、可观测性和容错能力,帮助组织把 AI 流程从概念验证推进到生产。
推荐理由:原文拆解了企业 AI 落地的典型失败模式并给出对应机制,可迁移判断生产化编排层该具备什么。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动,新增自定义 subagents、多选澄清、斜杠命令技能、统一 agent 模式和自动更新。
推荐理由:原文列出了 2.0 的具体控制能力和定价表,读者可据此判断它是否匹配自己的开发工作流。
Mistral AI 发布 Devstral 2 系列编码模型,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,前者在 SWE-bench Verified 上取得 72.2%。
推荐理由:原文给出两个尺寸的参数、SWE-bench 分数与部署门槛,读者可据此判断它在自托管编码场景中的可行性。
Mistral AI 为 Le Chat 发布 20+ 个基于 MCP 的安全连接器(beta)与 Memories 记忆功能(beta),覆盖 Databricks、Snowflake、GitHub、Atlassian、Stripe 等数据、生产力、开发、自动化与商务工具,支持搜索、总结与执行操作,并可接入任意远程 MCP server。
推荐理由:原文列出连接器分类与部署方式,读者可据此判断它如何把企业工作流接入助手。
Mistral AI 宣布 Codestral 25.08,其补全接受率提升 30%、建议保留代码多 10%、失控生成减少 50%,chat 模式在 IF eval v8 指令遵循上提升 5%、MultiplE 代码能力平均提升 5%。
推荐理由:原文给出了具体指标变化和部署方式,读者可据此判断其在企业私有化场景中的可用性。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 并升级 Devstral Small 1.1,主打智能体编码能力。
推荐理由:原文给出两个模型的分数、价格与部署方式,读者可据此比较开源与API两条路线的成本性能取舍。
Mistral AI 发布 Agents API,将 Mistral 模型与代码执行、web search、图像生成、MCP 工具等内置连接器结合,提供跨会话持久记忆和智能体编排能力,作为 Chat Completion API 的补充。
推荐理由:原文列出内置连接器、状态化会话与多智能体编排的具体能力,可据此评估其对智能体开发工作流的实际影响。
Mistral AI 与 All Hands AI 合作发布 Devstral,一款面向软件工程任务的智能体 LLM,以 Apache 2.0 许可开源。
推荐理由:原文给出了具体跑分、可本地部署的硬件门槛和 API 价格,读者可据此评估它能否替代现有编码模型。