Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现方案
Condé Nast 联合 AWS Generative AI Innovation Center,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo embedding 模型对视频转录、视觉与音频信号联合编码,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
Condé Nast 联合 AWS Generative AI Innovation Center,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo embedding 模型对视频转录、视觉与音频信号联合编码,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
AWS 分享了基于 Amazon Quick 和 Amazon Bedrock AgentCore 构建合同智能平台的架构,用结构化提取替代 RAG 语义检索来回答跨数百份合同的聚合类问题。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为工业气体与焊接分销商构建了自助式租赁分析方案,业务用户无需 IT 介入即可用自然语言查询租赁数据。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 和 MCP 构建内部 AI 助手 HAL,将分散在各门户、wiki 中的碎片化知识整合为统一知识层,让工程师在 IDE 或聊天窗口内几秒内获得答案,取代过去跨三四个门户查找的流程。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,可组合使用;RAG 并未消亡,它让模型基于训练数据外的文档、内部知识和代码库上下文作答,避免浪费 token 并减少不完整回答。
Hugging Face 发布 NeoMME,一个 260M 和 800M 两种规格的多模态多语言编码器家族,用单个双向 Transformer 同时处理文本 token 和原始图像 patch,从零以掩码离散扩散目标训练,不依赖预训练视觉塔或因果语言模型。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地持久记忆层,一条命令即可安装并自动索引每轮对话。
推荐理由:原文说明了本地索引与可迁移数据集的设计取舍,读者可据此判断它与托管记忆服务的差异。
Hugging Face 官方博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型及其完整训练方法,用于 ColBERT 式后期交互检索。
推荐理由:原文给出可复现的完整训练脚本与关键超参取舍,读者可据此在消费级 GPU 上自建领域多向量检索模型。
Hugging Face 官方博客介绍其为 Papers with Code 复兴构建的混合搜索系统:PostgreSQL 全文检索提供词法基线,pgvector 加语义召回,再用 RRF 融合排序,目前维护超过 110,000 篇来自 arXiv 和 Daily Papers 的论文向量。
推荐理由:文章拆解了离线批量与在线查询两条路径的分工方式,以及冷启动降级到全文检索的兜底设计,可迁移性强。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:Mistral 公开了 Agentic Search 的检索循环设计与 FinanceBench、OfficeQA Pro 基准数据,可对比传统 RAG 的差距。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用同一套 API 加载 PyLate、Stanford-NLP ColBERT 和 colpali-engine 检查点,支持 ColBERT 式晚期交互检索。
推荐理由:原文给出索引体积代价的具体数据和四种向量库的实测耗时,读者可据此评估落地成本。
Google Research 将在 COLM 2026 发表的论文指出,即使对简单单跳事实问题,开启推理也能召回关闭推理时几乎无法得到的答案。
Mistral 发布 Mistral OCR 4 文档解析模型,除提取文本外还返回 bounding boxes、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:原文给出基准分数与已知评分缺陷的对照,读者可据此判断该模型在真实文档场景中的可用边界。
Google 宣布 Gemini Enterprise Agent Platform 托管版 Cross-Corpus Retrieval(由 Agentic RAG 驱动)进入公开预览,通过规划、改写、路由等多智能体协作处理多源多跳查询。
Mistral AI 宣布以公开预览形式发布开源框架 Search Toolkit,把数据摄取、检索和评测整合进统一接口,覆盖云端、本地和边缘部署。其内置 BM25 稀疏检索、稠密向量检索与混合配置,以及 recall、precision、MRR、NDCG 等评测指标;Agent 可通过 MCP Connectors 从 CRM、代码仓库等源系统拉取实时数据。
Google Research 与 Cornell University 合作在 PNAS 发表论文,用 67 道高温超导专家问题评测 6 个 LLM(GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及自建 RAG 系统),由专家按 0-2 分六项指标盲评。
Google Research 发布 Groundsource,一个用 Gemini 把非结构化新闻报道转化为结构化历史数据的可扩展框架,首个开放数据集覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件记录。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,称其在真实代码数据检索上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 介绍了用 LLM as a Judge 评估 RAG 系统的方法:由一个 judge LLM 按数值、二元或定性量表给 generator LLM 的答案打分,并在评测数据集上取平均得到总分。