跳到正文

#部署/工程

今日 0 条
9月29日周二
  1. MIT Technology Review · AI12

    HPE:当 AI 走向生产,如何让 AI 从支出变成资产

    HPE 提出,当 AI 从试验走向生产、形成客服与 IT 等常驻智能体工作负载后,按 token 逐次消费的模式会让 AI 支出变成难以预测的月度变动成本。企业需按自身工作负载测算"自持容量的盈亏平衡点",判断持续用量是否足以支撑自建容量。HPE 引用 Deloitte 2026 企业 AI 报告称,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的企业占比预计半年内翻倍。

  2. AWS Machine Learning Blog62

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。

  3. AWS Machine Learning Blog22

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。

9月28日周一
  1. AWS Machine Learning Blog22

    Amazon Textract 适配器跨账户生命周期自动化管理

    AWS 发布方案,用 CloudFormation 和 Terraform 模板自动化 Amazon Textract 适配器跨账户生命周期管理,将适配器 ID 外置到 Systems Manager Parameter Store 后,生产环境更新无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。方案包含预分类路由、生产安全配置,并支持将训练好的适配器从训练环境推广到生产环境。

9月26日周六
9月25日周五
  1. Ars Technica · AI56

    Google 首颗 Suncatcher 轨道数据中心测试卫星将于 10 月 1 日发射

    Google 宣布其 Project Suncatcher 首颗实验卫星将于 10 月 1 日发射,用于验证其 AI 卫星星座设想。这颗名为 MVP 的卫星约冰箱大小,内置 4 颗 Google 自研 TPU AI 加速器,太阳能板仅提供约 1 千瓦电力。卫星由 Planet Labs 已建成的平台改造而来,原计划 2027 年发射两颗定制卫星,Google 选择提前推进。

9月24日周四
  1. Latent Space34

    Foundries vs Navigators:AI 如何降低科学研究的成本

    Endura Therapeutics 的 Adrian Sanborn 提出,AI 对科学的影响分为两类:Foundries 用新一代测序、多重检测和物理自动化把实验数据生成速度提升一个数量级,但真正差异化资产是实验数据本身;Navigators 则把 AI 嵌入公司日常流程,用更快的代码和决策加速实验迭代。导航式改造无需专有模型或海量数据集,早期初创公司因没有遗留系统而推进最快。

  2. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。

  3. Google DeepMind62

    Google 为 Private AI Compute 引入安全服务端持久记忆

    Google 公布 Private AI Compute 的新架构,将持久化服务端记忆引入该平台,使 AI 助手能在跨设备场景下保留上下文。数据存放在加密存储中,解密密钥仅保留在用户个人设备上,模型需要访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、处理并重新加密。

    推荐理由:Google 公开了 Private AI Compute 的服务端持久记忆架构,读者可了解云端 AI 如何在保留设备端隐私标准的前提下跨设备记忆。

9月22日周二
  1. NVIDIA Blog22

    NVIDIA 埃及 AI 生态从赋能走向规模化落地

    NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,其埃及深度学习学院学员规模一年增长超十倍,非洲已培训超 8.5 万名开发者,尼日利亚成为该学院全球第二大市场。非洲已有四座 AI 工厂宣布或上线,另有 656 兆瓦新增算力在建,Cassava Technologies 计划在埃及、肯尼亚、尼日利亚和摩洛哥部署,投资或达 7.2 亿美元。

9月21日周一
  1. Hugging Face Blog62

    Hugging Face 发布 tokenizers v1:编码提速 3 至 30 倍

    Hugging Face 发布 tokenizers v1 候选版本,在 Apple M4 Max 单线程下编码速度比 v0.23 快 3 至 30 倍,八线程扩展效率为线性的 76%,且输出 token ID 与 v0.23 完全一致。

    推荐理由:原文给出 v1 与 v0.23 的逐项基准对比和实现改动,可据此判断分词器在训练与推理管线中的实际提速空间。

9月17日周四
  1. GitHub Blog · AI & ML75

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust 的实践复盘

    GitHub 工程师 Stephen Toub 复盘用 GitHub Copilot 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust 的过程,代码主要由 AI 智能体编写,横跨 128 个 PR 并增量上线,性能提升数个数量级。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含多智能体协作与提示缓存数据。

9月10日周四
  1. Mistral AI26

    Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,同时保有数据和由此产生的智能的所有权。Cloudera 平台上运行着 30 exabytes 的客户管理数据。

9月9日周三
  1. Mistral AI62

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 物理油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,用自定义解析器生成调用树并让上百个智能体补文档,再以规划、编码、测试、审查的智能体工作流逐模块迁移,由人工审查 PR 把关。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,含一致性校验与人工审查节点的取舍。

8月25日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU kernel

    Import AI 470 关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速最明显,对数学研究贡献较小,对 AI 研究本身尚无显著加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。Hawkeye 则用于构建更好的 GPU kernel。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与 Priority Tier,并接入 GLM-5.2 等第三方开源模型

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、SLA 优先级层和第三方开源模型接入放在同一套基础设施上,可观察主权 AI 的落地方式。

7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。

4月20日周一
  1. Berkeley AI Research32

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。