Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现方案
Condé Nast 联合 AWS Generative AI Innovation Center,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo embedding 模型对视频转录、视觉与音频信号联合编码,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
Condé Nast 联合 AWS Generative AI Innovation Center,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo embedding 模型对视频转录、视觉与音频信号联合编码,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
AWS 分享了基于 Amazon Quick 和 Amazon Bedrock AgentCore 构建合同智能平台的架构,用结构化提取替代 RAG 语义检索来回答跨数百份合同的聚合类问题。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。
AWS 发布 vLLM-Omni DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并附 Gradio 示例应用。
AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,同时与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
亚马逊云科技介绍用 Amazon Nova Act 结合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布方案,用 CloudFormation 和 Terraform 模板自动化 Amazon Textract 适配器跨账户生命周期管理,将适配器 ID 外置到 Systems Manager Parameter Store 后,生产环境更新无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。方案包含预分类路由、生产安全配置,并支持将训练好的适配器从训练环境推广到生产环境。
AWS 结合 Amazon EKS、EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS 官方博客介绍 NarrateAI 在 Amazon Bedrock 上落地的五项生产级质量保障技术:自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性校验,实测约 99.3% 数值准确率、约 13 秒开始流式返回。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型到全托管实时推理端点,仅需几秒参考音频即可完成声音克隆,无需重新训练。Qwen3-TTS 支持 10 种语言、流式生成与跨语言克隆,输出 24 kHz 音频,由 vLLM-Omni 容器提供服务。该方案让数据保留在 AWS 环境内,成本随算力用量而非按字符计费。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为工业气体与焊接分销商构建了自助式租赁分析方案,业务用户无需 IT 介入即可用自然语言查询租赁数据。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Data Fabric(CDF)可让训练算力与数据分处不同 AWS Region,无需复制数据即可远程读取。
AWS 推出 WhisperX Deep Learning Container,可部署到 Amazon SageMaker AI 实时或异步端点,为语音转写补齐逐词时间戳与说话人标注。
AWS 介绍如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体架构,让数据留在各自 AWS 账户内、仅在查询时按需流出。
Aderant 通过 Amazon Bedrock 调用 Amazon Nova Lite 构建 Intelligent Ticket Analyzer,自动完成支持工单的上下文收集、分类与路由,服务 38 人 SierraOps 团队。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型仅增加 280M 参数(约 8.9%),并首日支持 llama.cpp、MLX-VLM 和 SGLang。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日登陆 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
NVIDIA Warp 与 MuJoCo Warp(MJWarp)可将兼容的 MuJoCo 模型扩展到最多 2,048 个并行 GPU 仿真环境,用于机器人仿真与学习工作流。MJWarp 基于 NVIDIA Warp 用 CUDA kernel 推进物理仿真,保持同一 MJCF 模型;Warp 支持可微 kernel,并在 1.15 版本引入确定性执行模式。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 和 MCP 构建内部 AI 助手 HAL,将分散在各门户、wiki 中的碎片化知识整合为统一知识层,让工程师在 IDE 或聊天窗口内几秒内获得答案,取代过去跨三四个门户查找的流程。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度改为惰性测量、修正锚定在用户当前浏览位置,避免滚动跳动。
微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。
Google 公布 Private AI Compute 的新架构,将持久化服务端记忆引入该平台,使 AI 助手能在跨设备场景下保留上下文。数据存放在加密存储中,解密密钥仅保留在用户个人设备上,模型需要访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、处理并重新加密。
推荐理由:Google 公开了 Private AI Compute 的服务端持久记忆架构,读者可了解云端 AI 如何在保留设备端隐私标准的前提下跨设备记忆。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,支持 ROS Lyrical 与 Ubuntu 24.04,并新增面向 AI 智能体的 Isaac 技能与 agent-ready 文档。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断物理 AI 开发方式的变化。
Hugging Face 在 transformers 中加入 GGUF 支持,用户可通过 from_pretrained 传入 gguf_file 直接加载 Hub 上的量化检查点并在本地生成。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的对比数据与当前限制。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 发布 Halos 全栈安全系统,覆盖物理 AI 从硬件、软件到 AI 行为与部署验证的每一层。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,其埃及深度学习学院学员规模一年增长超十倍,非洲已培训超 8.5 万名开发者,尼日利亚成为该学院全球第二大市场。非洲已有四座 AI 工厂宣布或上线,另有 656 兆瓦新增算力在建,Cassava Technologies 计划在埃及、肯尼亚、尼日利亚和摩洛哥部署,投资或达 7.2 亿美元。
NVIDIA 提出 AI 安全是工程问题,需在模型、harness、runtime 等 Agent 技术栈每一层部署可执行边界、可追溯身份与防护证据。开源安全 runtime NVIDIA OpenShell 在 Agent 推理之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已基于其构建。
Hugging Face 发布 tokenizers v1 候选版本,在 Apple M4 Max 单线程下编码速度比 v0.23 快 3 至 30 倍,八线程扩展效率为线性的 76%,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出 v1 与 v0.23 的逐项基准对比和实现改动,可据此判断分词器在训练与推理管线中的实际提速空间。
GitHub 工程师 Stephen Toub 复盘用 GitHub Copilot 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust 的过程,代码主要由 AI 智能体编写,横跨 128 个 PR 并增量上线,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含多智能体协作与提示缓存数据。
NVIDIA 宣布 Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中亮相,在 Qwen3-VL 上吞吐量较 GB300 NVL72 最高提升 3.7 倍,在 DeepSeek-R1 上最高提升 2.5 倍。
推荐理由:原文给出与上代系统的吞吐对比和扩展效率数据,读者可据此评估其推理经济性影响。
Emerald AI、Google 和 NVIDIA 宣布启动 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。
NVIDIA 介绍 DSX 平台如何在固定电力预算下提升 AI 工厂产出:Lambda 在 HGX B200 服务器上首次验证 DSX MaxLPS,用与 16 节点满功率相同的预算运行 19 节点,集群 token 吞吐从约 4 million tokens per second 提升到 5 million(+24%),性能功耗比提升 23%。
推荐理由:原文给出了 Lambda 实测的吞吐与能效数字,以及电网信号自动降载的生产案例,可据此评估其对电力受限场景的实际价值。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,将 AI 基础设施指标从峰值性能转向经验证的 agentic tokens per megawatt。
推荐理由:原文给出多组能效与吞吐数字,读者可据此评估每兆瓦产出这一新指标如何影响 AI 工厂选型。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,同时保有数据和由此产生的智能的所有权。Cloudera 平台上运行着 30 exabytes 的客户管理数据。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 物理油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值一致性校验框架,用自定义解析器生成调用树并让上百个智能体补文档,再以规划、编码、测试、审查的智能体工作流逐模块迁移,由人工审查 PR 把关。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,含一致性校验与人工审查节点的取舍。
Hugging Face WebAI 团队发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,首批包含 207 个 kernel,以独立仓库形式发布,Apache-2.0 许可,每个 kernel 附带 manifest、正确性测试、benchmark 用例和 WGSL shader 模板。
推荐理由:原文给出了与 ORT WebGPU 的对比数据和单 kernel 仓库结构,读者可据此评估浏览器端推理优化的实际收益与复用方式。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。