跳到正文

#部署/工程

今日 2 条
今天9月30日周三
9月29日周二
  1. AWS Machine Learning Blog62

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。

  2. AWS Machine Learning Blog22

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。

9月28日周一
  1. AWS Machine Learning Blog22

    Amazon Textract 适配器跨账户生命周期自动化管理

    AWS 发布方案,用 CloudFormation 和 Terraform 模板自动化 Amazon Textract 适配器跨账户生命周期管理,将适配器 ID 外置到 Systems Manager Parameter Store 后,生产环境更新无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。方案包含预分类路由、生产安全配置,并支持将训练好的适配器从训练环境推广到生产环境。

9月26日周六
  1. AWS Machine Learning Blog44

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时个性化语音

    Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型到全托管实时推理端点,仅需几秒参考音频即可完成声音克隆,无需重新训练。Qwen3-TTS 支持 10 种语言、流式生成与跨语言克隆,输出 24 kHz 音频,由 vLLM-Omni 容器提供服务。该方案让数据保留在 AWS 环境内,成本随算力用量而非按字符计费。

9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。

  2. Google DeepMind62

    Google 为 Private AI Compute 引入安全服务端持久记忆

    Google 公布 Private AI Compute 的新架构,将持久化服务端记忆引入该平台,使 AI 助手能在跨设备场景下保留上下文。数据存放在加密存储中,解密密钥仅保留在用户个人设备上,模型需要访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、处理并重新加密。

    推荐理由:Google 公开了 Private AI Compute 的服务端持久记忆架构,读者可了解云端 AI 如何在保留设备端隐私标准的前提下跨设备记忆。

9月22日周二
  1. NVIDIA Blog22

    NVIDIA 埃及 AI 生态从赋能走向规模化落地

    NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,其埃及深度学习学院学员规模一年增长超十倍,非洲已培训超 8.5 万名开发者,尼日利亚成为该学院全球第二大市场。非洲已有四座 AI 工厂宣布或上线,另有 656 兆瓦新增算力在建,Cassava Technologies 计划在埃及、肯尼亚、尼日利亚和摩洛哥部署,投资或达 7.2 亿美元。

9月21日周一
  1. Hugging Face Blog62

    Hugging Face 发布 tokenizers v1:编码提速 3 至 30 倍

    Hugging Face 发布 tokenizers v1 候选版本,在 Apple M4 Max 单线程下编码速度比 v0.23 快 3 至 30 倍,八线程扩展效率为线性的 76%,且输出 token ID 与 v0.23 完全一致。

    推荐理由:原文给出 v1 与 v0.23 的逐项基准对比和实现改动,可据此判断分词器在训练与推理管线中的实际提速空间。

9月17日周四
  1. GitHub Blog · AI & ML75

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust 的实践复盘

    GitHub 工程师 Stephen Toub 复盘用 GitHub Copilot 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust 的过程,代码主要由 AI 智能体编写,横跨 128 个 PR 并增量上线,性能提升数个数量级。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含多智能体协作与提示缓存数据。

9月16日周三
  1. NVIDIA Blog60

    NVIDIA DSX 通过 MaxLPS 与 Flex 提升 AI 工厂每兆瓦产出

    NVIDIA 介绍 DSX 平台如何在固定电力预算下提升 AI 工厂产出:Lambda 在 HGX B200 服务器上首次验证 DSX MaxLPS,用与 16 节点满功率相同的预算运行 19 节点,集群 token 吞吐从约 4 million tokens per second 提升到 5 million(+24%),性能功耗比提升 23%。

    推荐理由:原文给出了 Lambda 实测的吞吐与能效数字,以及电网信号自动降载的生产案例,可据此评估其对电力受限场景的实际价值。

9月10日周四
  1. Mistral AI26

    Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,同时保有数据和由此产生的智能的所有权。Cloudera 平台上运行着 30 exabytes 的客户管理数据。

9月9日周三
  1. Mistral AI62

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 物理油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,用自定义解析器生成调用树并让上百个智能体补文档,再以规划、编码、测试、审查的智能体工作流逐模块迁移,由人工审查 PR 把关。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,含一致性校验与人工审查节点的取舍。

9月1日周二
  1. Hugging Face Blog69

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU kernel 与浏览器端基准工具 Fleet

    Hugging Face WebAI 团队发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,首批包含 207 个 kernel,以独立仓库形式发布,Apache-2.0 许可,每个 kernel 附带 manifest、正确性测试、benchmark 用例和 WGSL shader 模板。

    推荐理由:原文给出了与 ORT WebGPU 的对比数据和单 kernel 仓库结构,读者可据此评估浏览器端推理优化的实际收益与复用方式。

8月25日周二