Hugging Face 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项 benchmark 中 7 项反超全精度原版
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
Hugging Face 官方博客介绍其为 Papers with Code 复兴构建的混合搜索系统:PostgreSQL 全文检索提供词法基线,pgvector 加语义召回,再用 RRF 融合排序,目前维护超过 110,000 篇来自 arXiv 和 Daily Papers 的论文向量。
推荐理由:文章拆解了离线批量与在线查询两条路径的分工方式,以及冷启动降级到全文检索的兜底设计,可迁移性强。
Hugging Face 构建了一个约束感知 GPU 分配器,在 7 个基准场景下与 FIFO 调度器对比,相同硬件与负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在全部场景中提升,最高达 105%。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层和第三方开源模型接入放在同一套基础设施上,可观察主权 AI 的落地方式。
Multiverse Computing 发布论文 Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss,提出两项系统改动:一次性缓存教师 top-100 logits 使教师无需驻留显存,以及不生成完整词表×序列矩阵的分块 KL 损失。
Baseten 正式成为 Hugging Face Hub 的 Inference Providers 服务商,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Hugging Face 指出,AI 行业的下一个真实瓶颈正从模型智能转向 GPU 利用率,闲置 GPU 就像停在地面的飞机,成本按小时累积而产出只在计算时产生。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
Diffusers 现可通过 from_pretrained() 直接加载 Nunchaku 量化检查点,无需单独推理引擎或本地 CUDA 编译。
Hugging Face Blog 与 IBM Research 撰文指出,在 agentic 系统中做模型路由远不止分类问题,而是系统优化问题。
Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。
推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 NVIDIA A100-SXM4-80GB 逐一 profile 注意力实现:手写朴素注意力、把 masked_fill 改成 masked_fill_ 的原地版本,以及 SDPA 的 math、efficient、flash、cudnn 四个后端。
推荐理由:通过同一注意力实现在 profiler 下的六种形态对比,读者能学会先猜测再看 trace 的具体分析方法。
Mistral Studio 为 Prompts 和 Skills 提供集中式系统记录,支持版本控制、归属管理和可追溯性,让 AI 行为可治理、可发现。Studio 提供不可变版本、回滚、清晰归属、分类标签和审计日志,业务专家可直接编辑并经 CI/CD 流程发布生产版本,Skills 可作为 MCP servers 从 Studio 直接调用。该功能现已向 Mistral Studio 客户开放。
Hugging Face 宣布 transformers 的 vLLM 建模后端在多种 LLM 架构上已达到或超过 vLLM 手写原生实现的速度,模型作者只需加 --model-impl transformers 标志即可免费获得极速推理。
Hugging Face 与 Amazon SageMaker AI 推出深链集成,支持模型页上的 Customize on SageMaker AI 和 Deploy on SageMaker AI 按钮一键直达 SageMaker Studio,模型预加载、环境自动配置。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute,并推出 Hugging Face models on Foundry,把 Hugging Face 生态的开源权重模型以每周更新的精选目录形式提供,可一键部署到 Foundry Managed Compute。
伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Hugging Face 与 SkyPilot 联合发布 store: hf 存储后端,用一个 hf:// URL 和已有的 HF_TOKEN 就能把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务。
Hugging Face 官方博客介绍 Kernels 项目近期的重大更新,Hub 上新增了 kernel 仓库类型,可展示 kernel 支持的加速器、操作系统和后端版本,并提升可发现性。
Google Research 在 CIDR 发布论文提出线性弹性缓存(linear elastic caching),将页面淘汰建模为 ski rental 问题,用轻量级决策树模型动态预测页面 TTL,在内存占用与缓存未命中之间权衡以降低总拥有成本(TCO)。
Mistral AI 为 Connectors 推出多项新能力:GA 的增强管理控制可按 workspace 或 org 设置连接器访问并逐个开关工具,GA 的带连接器作用域的 API 密钥用于防止自动化任务冒用身份,GA 的多账号连接器允许一个连接器绑定多个登录账号。
Google Research 与 University of California San Diego 合作探索 phone cluster computing,把退役智能手机的主板取出组集群,作为通用计算平台复用。
Mistral AI 在 AI Now Summit 2026 发布面向工业工程的一体化 AI 堆栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产流程,同时保障数据安全与知识产权控制。
Mistral AI 在 Studio 发布 Connectors,内置连接器与自定义 MCP 现已通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与 human-in-the-loop 审批流。
Mistral AI 宣布 Workflows 进入公开预览,作为企业 AI 的编排层,提供持久执行、可观测性和容错能力,帮助组织把 AI 流程从概念验证推进到生产。
推荐理由:原文拆解了企业 AI 落地的典型失败模式并给出对应机制,可迁移判断生产化编排层该具备什么。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。
Mistral AI 发布 CLI 工具 Spaces,用三条命令即可从零跑起带热重载、数据库和 Dockerfile 的多服务项目。
Mistral AI 在 Engineering Deep Dive 系列首篇文章中复盘了排查 vLLM 内存泄漏的过程:在 Mistral Medium 3.1 配合 Prefill/Decode 分离式部署且启用 graph compilation 时,系统内存以 400 MB/分钟线性增长。
推荐理由:逐层递进的排查路径和每种工具的失效原因,对定位同类底层内存问题有直接可迁移的方法价值。
Mistral AI 宣布推出 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,现已开放 private beta 报名。
Mistral AI 宣布推出 Mistral Compute,这是一套面向客户的私有集成AI基础设施,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。