跳到正文

#部署/工程

今日 2 条
8月25日周二
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 解析 Papers with Code 混合搜索的架构与实践

    Hugging Face 官方博客介绍其为 Papers with Code 复兴构建的混合搜索系统:PostgreSQL 全文检索提供词法基线,pgvector 加语义召回,再用 RRF 融合排序,目前维护超过 110,000 篇来自 arXiv 和 Daily Papers 的论文向量。

    推荐理由:文章拆解了离线批量与在线查询两条路径的分工方式,以及冷启动降级到全文检索的兜底设计,可迁移性强。

8月18日周二
8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与 Priority Tier,并接入 GLM-5.2 等第三方开源模型

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、SLA 优先级层和第三方开源模型接入放在同一套基础设施上,可观察主权 AI 的落地方式。

8月10日周一
8月6日周四
7月30日周四
7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

7月23日周四
7月16日周四
7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 的多模态模型 Inkling 及 Inkling-Small

    Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。

    推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。

7月10日周五
  1. Hugging Face Blog60

    PyTorch Profiling 系列第三篇:在 profiler 下对比六种注意力实现

    Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 NVIDIA A100-SXM4-80GB 逐一 profile 注意力实现:手写朴素注意力、把 masked_fill 改成 masked_fill_ 的原地版本,以及 SDPA 的 math、efficient、flash、cudnn 四个后端。

    推荐理由:通过同一注意力实现在 profiler 下的六种形态对比,读者能学会先猜测再看 trace 的具体分析方法。

7月9日周四
  1. Mistral AI45

    Mistral Studio 为 Prompts 和 Skills 提供系统化记录

    Mistral Studio 为 Prompts 和 Skills 提供集中式系统记录,支持版本控制、归属管理和可追溯性,让 AI 行为可治理、可发现。Studio 提供不可变版本、回滚、清晰归属、分类标签和审计日志,业务专家可直接编辑并经 CI/CD 流程发布生产版本,Skills 可作为 MCP servers 从 Studio 直接调用。该功能现已向 Mistral Studio 客户开放。

7月8日周三
7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。

7月6日周一
6月25日周四
6月24日周三
6月13日周六
5月28日周四
5月22日周五
4月27日周一
4月20日周一
  1. Berkeley AI Research32

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。

3月31日周二
1月22日周四
  1. Mistral AI61

    Mistral AI 排查 vLLM 分离式部署内存泄漏:UCX mmap hook 是元凶

    Mistral AI 在 Engineering Deep Dive 系列首篇文章中复盘了排查 vLLM 内存泄漏的过程:在 Mistral Medium 3.1 配合 Prefill/Decode 分离式部署且启用 graph compilation 时,系统内存以 400 MB/分钟线性增长。

    推荐理由:逐层递进的排查路径和每种工具的失效原因,对定位同类底层内存问题有直接可迁移的方法价值。

10月24日周五
6月11日周三