Hugging Face 模型页接入 Every Eval Ever 评测结果
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,贡献者可用转换器把 EEE 记录写成 Hugging Face 所需的 YAML 文件,评测分数会显示在模型页并汇入基准排行榜,同时带来源徽章链回完整 EEE 记录。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,贡献者可用转换器把 EEE 记录写成 Hugging Face 所需的 YAML 文件,评测分数会显示在模型页并汇入基准排行榜,同时带来源徽章链回完整 EEE 记录。
Google Research 宣布将 Multi-Token Prediction (MTP) 架构改造后接入已冻结的 Gemini Nano v3 模型,并已部署到 Pixel 9 和 10 系列,让 AI Notification Summaries 和 Proofread 等端侧功能生成更快、更省电。
Google DeepMind 宣布 computer use 现已成为 Gemini 3.5 Flash 的内置工具,此前该能力仅作为独立的 Gemini 2.5 computer use 模型提供,如今原生集成进主 Gemini Flash 模型。
推荐理由:原文说明了 computer use 从独立模型变为内置工具的路径变化,以及配套的两项企业防护机制,便于评估其在自动化任务中的落地方式。
Mistral AI 为 Connectors 推出多项新能力:GA 的增强管理控制可按 workspace 或 org 设置连接器访问并逐个开关工具,GA 的带连接器作用域的 API 密钥用于防止自动化任务冒用身份,GA 的多账号连接器允许一个连接器绑定多个登录账号。
Mistral 发布 Mistral OCR 4 文档解析模型,除提取文本外还返回 bounding boxes、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:原文给出基准分数与已知评分缺陷的对照,读者可据此判断该模型在真实文档场景中的可用边界。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三地规划部门合作,推出基于 Gemini 的 AI 规划审批原型,目标把房主规划申请的决策时间缩短 50%。
Google Research 联合牛津大学发布英国全境树篱、石墙与小片林地的矢量数据集,将此前的 Farmscapes 2020 像素级地图转化为可用于景观修复与碳核算的可操作清单。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的先进 AI 的纵深防御框架,即使模型对齐不完美也能提供系统级安全保障。
推荐理由:原文给出了威胁建模、监督机制和分级响应的具体设计,可迁移为部署内部智能体时的安全参考框架。
Google 宣布 Gemini Enterprise Agent Platform 托管版 Cross-Corpus Retrieval(由 Agentic RAG 驱动)进入公开预览,通过规划、改写、路由等多智能体协作处理多源多跳查询。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象水文部门把 AI 洪水预测接入自有工作流。
Mistral AI 在 AI Now Summit 2026 发布面向工业工程的一体化 AI 堆栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产流程,同时保障数据安全与知识产权控制。
Mistral AI 宣布 Le Chat 升级为 Vibe,一个统一覆盖工作与编码的 AI 智能体,对话、设置与套餐全部迁移。
推荐理由:原文详细列出 Work Mode 与 Code Mode 的具体能力和接入面,读者可据此判断它如何嵌入现有工作流。
Mistral AI 宣布以公开预览形式发布开源框架 Search Toolkit,把数据摄取、检索和评测整合进统一接口,覆盖云端、本地和边缘部署。其内置 BM25 稀疏检索、稠密向量检索与混合配置,以及 recall、precision、MRR、NDCG 等评测指标;Agent 可通过 MCP Connectors 从 CRM、代码仓库等源系统拉取实时数据。
Google Research 推出基于零信任聚合的私有分析服务,结合新的格基密码聚合协议与 TEE,实现设备单次消息提交即可完成聚合,无需多轮在线交互。该方案已集成到 Google 机密联邦分析系统,用于改进 Android SafetyCore 分类器准确率,同时保证用户内容仅保留在设备端。
Mistral AI 宣布将 Emmi AI 并入公司,推出面向 AI 原生工业工程的 physics AI 能力,作为企业解决方案的新基础模块,与现有模型、agentic 工作流工具和安全部署能力共同构成覆盖工程全生命周期的技术栈。
Mistral AI 在 Studio 发布 Connectors,内置连接器与自定义 MCP 现已通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与 human-in-the-loop 审批流。
Google 发布基于 Gemini 的科研工具 ERA,其论文今日刊于 Nature,同时开始通过 Gemini for Science 更广泛开放由 AlphaEvolve 和 ERA 构建的实验工具 Computational Discovery。
推荐理由:原文列出 ERA 在多个学科基准和五个开放科学问题上的具体结果,读者可据此判断这类工具当前能覆盖的研究范围。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室如何用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新颖的候选遗传因子,其中部分假设经实验室验证,能成功推动细胞进入更年轻状态。它还把原本最长需耗时六个月的筛选数据与文献对照分析工作压缩到几天。
推荐理由:原文给出 Co-Scientist 在真实实验室中把文献分析从数月压缩到数天的具体用法,可迁移至其他科研数据解读场景。
Google DeepMind 在 Project Genie 中推出由 Street View 支撑的新能力,可将生成世界的起点锚定在真实地点影像上,并向全球符合条件的 Google AI Ultra $200 订阅者(18+)逐步开放。
Google DeepMind 推出 Gemini for Science,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上三个实验工具。
推荐理由:原文列出了三个实验工具的具体能力与开放入口,读者可据此判断它会怎样嵌入现有科研工作流。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具:SynthID 已为超过 100 billion 张图片视频和 60,000 年音频加水印,Gemini app 的 SynthID 验证已被使用 50 million 次,现扩展到 Search 并将在数周内进入 Chrome。
推荐理由:原文列出了 SynthID 与 C2PA 在多产品线的落地节奏和采用规模,可据此判断内容溯源工具的普及路径。
Google DeepMind 介绍剑桥大学 Clare Bryant 教授使用 Co-Scientist 寻找病原体跨物种传播引发重症的分子开关。Bryant 先后输入课题摘要与完整基金申请书,工具生成并排序假设,最终锁定她此前未关注的蛋白并细化到具体氨基酸,团队正构建含相应突变的细胞系验证。她表示原本需两到三年的实验工作如今有望在六个月内完成。
Google DeepMind 介绍 Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 连接衰老生物学中分散的研究发现并生成值得测试的假设。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,并推出基于 Gemini 的多智能体系统 Hypothesis Generation,面向个人研究者开放注册,将在未来几周内逐步推出。
推荐理由:原文给出了多智能体分工、验证算力占比和多个已落地案例,读者可据此判断它如何嵌入真实科研流程。
Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。
推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。
Mistral AI 宣布 Workflows 进入公开预览,作为企业 AI 的编排层,提供持久执行、可观测性和容错能力,帮助组织把 AI 流程从概念验证推进到生产。
推荐理由:原文拆解了企业 AI 落地的典型失败模式并给出对应机制,可迁移判断生产化编排层该具备什么。
Google Research 宣布该方法已作为 Auto frame 功能的一部分在 Google Photos 上线,可用生成式 AI 在拍照后自动改变相机视角重新构图。
推荐理由:原文拆解了3D估计与生成补全两阶段流程,读者可理解视角重合成如何在保留原内容的同时补出隐藏区域。
Google Research 与纽约大学合作推出 Vantage,一个面向高中和大学学生的研究实验,通过生成式 AI 在模拟环境中评估批判性思维、协作、创造性思维等未来技能,现已在 Google Labs 提供英文版注册。
Google Research 发布两个面向学术工作流的智能体框架:PaperVizAgent(原名 PaperBanana)用于绘制学术图表,ScholarPeer 用于自动同行评审。
Mistral AI 发布 CLI 工具 Spaces,用三条命令即可从零跑起带热重载、数据库和 Dockerfile 的多服务项目。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,提出四条交互原则:保持工作流不被打断、指哪看哪捕捉视觉与语义上下文、用“这个/那个”等自然简写替代冗长提示词、把像素转化为可交互的结构化实体。
Google Research 宣布推出 Vibe Coding XR 工作流,结合 Gemini 与开源的 XR Blocks 框架,把自然语言直接转化为具备物理感知的 Android XR 应用,60 秒内即可完成。
Mistral AI 推出 Forge,帮助企业用自有专有知识训练前沿级 AI 模型,已与 ASML、Ericsson、European Space Agency 等机构合作。Forge 支持预训练、后训练和强化学习,兼容 dense 与 MoE 架构及多模态输入,并可由 Mistral Vibe 这类自主 agent 用自然语言完成微调、超参搜索与合成数据生成,同时监控指标防止基准回退。
Google Research 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市地区山洪风险。
推荐理由:原文说明了山洪预警缺乏历史数据的难点及用新闻报道构造训练集的做法,可迁移借鉴。
Google Research 发布 Groundsource,一个用 Gemini 把非结构化新闻报道转化为结构化历史数据的可扩展框架,首个开放数据集覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件记录。
Google Research 发布开源语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、逾 1 亿使用者,以 CC-BY-4.0 许可开放。数据集包含约 1,846 小时 ASR 转录自然语音与超过 565 小时高保真 TTS 录音,由非洲学术与社区组织主导采集,合作方包括 Makerere University、University of Ghana 等。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动,新增自定义 subagents、多选澄清、斜杠命令技能、统一 agent 模式和自动更新。
推荐理由:原文列出了 2.0 的具体控制能力和定价表,读者可据此判断它是否匹配自己的开发工作流。
Mistral AI 发布 Mistral OCR 3(模型名 mistral-ocr-2512),在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率达 74%,并称其精度超过企业级与 AI 原生 OCR 方案。
Mistral AI 宣布推出 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,现已开放 private beta 报名。
Mistral AI 为 Le Chat 推出 Memories(beta)记忆功能,采用自动保存、可见召回的混合方式,围绕透明、可控、可迁移三条原则设计:用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并可导出和导入记忆。