ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源归属正确",专门检测把某来源的事实错误归到另一来源的跨来源混淆。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源归属正确",专门检测把某来源的事实错误归到另一来源的跨来源混淆。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型仅增加 280M 参数(约 8.9%),并首日支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA Warp 与 MuJoCo Warp(MJWarp)可将兼容的 MuJoCo 模型扩展到最多 2,048 个并行 GPU 仿真环境,用于机器人仿真与学习工作流。MJWarp 基于 NVIDIA Warp 用 CUDA kernel 推进物理仿真,保持同一 MJCF 模型;Warp 支持可微 kernel,并在 1.15 版本引入确定性执行模式。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,继续主导 oMLX 并支持 MLX 社区。oMLX 由此从副业转为全职维护且获资金支持的项目,仍保持 Apache 2.0 开源许可。Hugging Face 计划让 oMLX 充当新想法的试验场,并简化 transformers 模型定义到 MLX 参考实现的转换流程。
Hugging Face 在 transformers 中加入 GGUF 支持,用户可通过 from_pretrained 传入 gguf_file 直接加载 Hub 上的量化检查点并在本地生成。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的对比数据与当前限制。
Hugging Face 发布 tokenizers v1 候选版本,在 Apple M4 Max 单线程下编码速度比 v0.23 快 3 至 30 倍,八线程扩展效率为线性的 76%,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出 v1 与 v0.23 的逐项基准对比和实现改动,可据此判断分词器在训练与推理管线中的实际提速空间。
Hugging Face 博客介绍了 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer:在 AppWorld test_normal(168 任务)上,GPT-4.1 驱动的 ReAct agent 平均 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,存在 24.4pp 的一致性差距。
Hugging Face 博客展示了一个基于 TRL v1.14 AsyncGRPOTrainer 的跨 Hugging Face Jobs 异步 GRPO 训练方案:训练端只训练 LoRA 适配器,通过 Storage Bucket 挂载的共享文件系统把几 MB 的适配器传给 vLLM,无需 NCCL。
推荐理由:原文给出五轮对照实验的完整指标变化,读者可据此学会用 AsyncGRPO 指标定位训练瓶颈并复现提速路径。
Hugging Face 官方博客发布 Workflow1111,用 Gradio Workflow 单一画布重建了 AUTOMATIC1111 stable-diffusion-webui 的大部分功能。
Hugging Face 发布 NeoMME,一个 260M 和 800M 两种规格的多模态多语言编码器家族,用单个双向 Transformer 同时处理文本 token 和原始图像 patch,从零以掩码离散扩散目标训练,不依赖预训练视觉塔或因果语言模型。
作者用 TRL 和 OpenEnv 开源复现了 Surya Narreddi 训练语言模型写 p5.brush 代码画水彩的配方,参考池数据集、RL 环境、训练脚本和模型全部公开,整条流水线可在 Hugging Face 上一条命令跑通。
推荐理由:文章完整拆解了用 TRL 和 OpenEnv 复现审美奖励训练的全过程,含三组奖励配比对比与踩坑记录,可直接迁移。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地持久记忆层,一条命令即可安装并自动索引每轮对话。
推荐理由:原文说明了本地索引与可迁移数据集的设计取舍,读者可据此判断它与托管记忆服务的差异。
Hugging Face WebAI 团队发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,首批包含 207 个 kernel,以独立仓库形式发布,Apache-2.0 许可,每个 kernel 附带 manifest、正确性测试、benchmark 用例和 WGSL shader 模板。
推荐理由:原文给出了与 ORT WebGPU 的对比数据和单 kernel 仓库结构,读者可据此评估浏览器端推理优化的实际收益与复用方式。
Voice Arena 与 Hugging Face 合作向 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,Hindi 成为该多语言标签页上的首个 Indic 语言。
推荐理由:原文用分区 WER 差异和 lattice 打分对比说明单一 WER 的盲区,读者可据此理解榜单评测的可迁移设计。
Hugging Face 官方博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型及其完整训练方法,用于 ColBERT 式后期交互检索。
推荐理由:原文给出可复现的完整训练脚本与关键超参取舍,读者可据此在消费级 GPU 上自建领域多向量检索模型。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。
Hugging Face 官方博客介绍内置在 Gradio 中的 gr.Workflow,它把 AI 应用流水线描述成带类型节点的图,提供可拖拽画布,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:通过多个可直接复用的示例,展示了把流水线声明为图后自动获得 API 与部署的开发方式。
Hugging Face 官方博客介绍其为 Papers with Code 复兴构建的混合搜索系统:PostgreSQL 全文检索提供词法基线,pgvector 加语义召回,再用 RRF 融合排序,目前维护超过 110,000 篇来自 arXiv 和 Daily Papers 的论文向量。
推荐理由:文章拆解了离线批量与在线查询两条路径的分工方式,以及冷启动降级到全文检索的兜底设计,可迁移性强。
Hugging Face 发布研究,提出三种测试来量化语音识别中的基准优化(benchmaxxing)现象,并评测了 11 个广泛使用的开源 ASR 模型。
推荐理由:研究给出三种可量化探测方法与具体数据,读者可据此理解公开语音基准分数虚高的机制并改进自己的评测选择。
Hugging Face Blog 发文介绍 ALTK-Evolve 在 AppWorld 585 个多步任务、八个模型上的评测,结论是 Agent 记忆不是开关而是需按模型校准的剂量:有余量的强模型适合注入完整指南集,弱模型适合紧凑核心加按任务检索,饱和模型无可测增益。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用同一套 API 加载 PyLate、Stanford-NLP ColBERT 和 colpali-engine 检查点,支持 ColBERT 式晚期交互检索。
推荐理由:原文给出索引体积代价的具体数据和四种向量库的实测耗时,读者可据此评估落地成本。
Hugging Face 官方博客介绍了 Strands Robots 中的流式数据回路:用一个 Robot() 对象把机器人演示录制进 Hugging Face Storage Buckets、只同步变化字节、直接从 Hub 流式读取训练,再把 checkpoint 以 mode="real" 部署回硬件,全程保持 LeRobot 磁盘格式。
Hugging Face 与 alphaXiv 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1,221 名社区成员自带编码智能体,在 19 天内发布 6,816 个 Trackio logbook,尝试复现 2,226 篇论文(占会议 34%),共判定 35,908 条 claim。
推荐理由:原文用 2,226 篇论文的复现数据给出可复现性分布,并归纳出人类在智能体科研中的新角色定位。
Meta 发布 Muse Glimmer-30B,一款从 Muse 蒸馏至 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析、个人助手等注重隐私的场景。
推荐理由:原文给出架构细节与部署入口,读者可据此判断本地智能体场景下的落地成本与可行性。
Baseten 正式成为 Hugging Face Hub 的 Inference Providers 服务商,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Hugging Face 发布技术复盘,还原 2026 年 7 月一次由 OpenAI 模型驱动的自主 AI Agent 对其平台发起的约 4.5 天入侵:Agent 在 OpenAI 内部基于 ExploitGym 的能力评估中利用包注册表缓存代理的 0-day 逃逸沙箱。
推荐理由:原文逐条还原攻击链与防御修复项,读者可对照自查自身系统的信任边界与凭据策略。
Diffusers 现可通过 from_pretrained() 直接加载 Nunchaku 量化检查点,无需单独推理引擎或本地 CUDA 编译。
Hugging Face 与 Pollen Robotics 发布开源系统 Grabette,用手持夹爪录制人类演示并自动生成机器人可用数据集,无需机器人、实验室或遥操作设备。
Hugging Face 披露本周其生产基础设施遭入侵,攻击端到端由自主 AI 智能体系统驱动,恶意数据集利用数据处理管线中两条代码执行路径在处理 worker 上执行代码,进而提权、窃取云与集群凭据并在多个内部集群横向移动,攻击框架执行了超过 17,000 条记录事件。
推荐理由:原文披露了攻击路径与防御方用开源模型自救的取舍,读者可据此理解智能体攻击落地形态与自建模型的防御价值。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 NVIDIA A100-SXM4-80GB 逐一 profile 注意力实现:手写朴素注意力、把 masked_fill 改成 masked_fill_ 的原地版本,以及 SDPA 的 math、efficient、flash、cudnn 四个后端。
推荐理由:通过同一注意力实现在 profiler 下的六种形态对比,读者能学会先猜测再看 trace 的具体分析方法。
Hugging Face 宣布 transformers 的 vLLM 建模后端在多种 LLM 架构上已达到或超过 vLLM 手写原生实现的速度,模型作者只需加 --model-impl transformers 标志即可免费获得极速推理。
Hugging Face 与 Amazon SageMaker AI 推出深链集成,支持模型页上的 Customize on SageMaker AI 和 Deploy on SageMaker AI 按钮一键直达 SageMaker Studio,模型预加载、环境自动配置。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute,并推出 Hugging Face models on Foundry,把 Hugging Face 生态的开源权重模型以每周更新的精选目录形式提供,可一键部署到 Foundry Managed Compute。
LeRobot v0.6.0 发布,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:原文系统梳理了机器人学习闭环各环节的新增能力,读者可据此了解开源机器人栈的当前边界。
Hugging Face 与 SkyPilot 联合发布 store: hf 存储后端,用一个 hf:// URL 和已有的 HF_TOKEN 就能把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务。
Hugging Face 官方博客介绍 Kernels 项目近期的重大更新,Hub 上新增了 kernel 仓库类型,可展示 kernel 支持的加速器、操作系统和后端版本,并提升可发现性。
Hugging Face 与 Cerebras 合作推出基于 Gemma 4 的实时语音 AI 演示,将开放的级联语音管线与 Cerebras 的推理速度结合,实现更自然的对话响应。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参调优和特征工程,单次前向传播即可在未见过的表格上生成预测。
推荐理由:原文说明了混合注意力架构与合成数据训练如何替代传统特征工程和调参流程,便于评估其对现有工作流的替代空间。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,贡献者可用转换器把 EEE 记录写成 Hugging Face 所需的 YAML 文件,评测分数会显示在模型页并汇入基准排行榜,同时带来源徽章链回完整 EEE 记录。