GPT-6.1 Sol 在 Amazon Bedrock 正式可用
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的任务成本匹配 GPT-6 Astra,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点、推理投入更低。
推荐理由:原文给出了成本与能力的对比数据,读者可据此评估它在智能体工作流中的性价比取舍。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的任务成本匹配 GPT-6 Astra,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点、推理投入更低。
推荐理由:原文给出了成本与能力的对比数据,读者可据此评估它在智能体工作流中的性价比取舍。
OpenAI 发布主动式助手 dots,可在复杂项目和日常任务中持续推进工作,官方强调用户在此过程中保持掌控。
OpenAI 发布 GPT-6.1 Sol,定位为面向编码、计算机使用和专业工作的接近 Astra 智能水平的模型,其 API 输入和输出 token 价格为 Astra 标准价格的五分之一。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用轻量"转向阻尼器"网络统一推理时引导与微调两类控制方法。
OpenAI DevDay 2026 公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及面向开发者的多项新工具。
Condé Nast 联合 AWS Generative AI Innovation Center,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo embedding 模型对视频转录、视觉与音频信号联合编码,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
AWS 分享了基于 Amazon Quick 和 Amazon Bedrock AgentCore 构建合同智能平台的架构,用结构化提取替代 RAG 语义检索来回答跨数百份合同的聚合类问题。
Amazon Quick 各组件的提示词写法各有差异:Quick Research 需明确目标、受众与聚焦领域并可拆分子问题、筛选数据源,Quick Flows 要写清触发时间、数据源、计算与输出格式并用编号步骤组织复杂逻辑,Quick Sight 查询需包含业务问题、指标与维度。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型系列,已上线 Hugging Face。给定带标签的表格,它在单次前向传播中直接预测新行标签,支持分类与回归,无需训练、调优或特征工程。
推荐理由:原文交代了模型架构与人工数据预训练流程,读者可据此理解表格基础模型如何在免调优下兼顾精度与效率。
Amazon Quick 发布提示词工程系列文章第一篇,讲解跨组件通用的提示词原则与结构化框架。核心原则包括用具体指标、时间范围和范围限定替代模糊请求,提供业务上下文以校准输出,以及用 few-shot 示例直接演示所需格式。文章介绍 CRISPE 框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度构建完整提示词,帮助团队减少迭代、复用提示模式。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,从缩小搜索空间到选出候选化合物仅用一个周末,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,读者可了解 AI 参与药物发现的具体流程与验证结果。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源归属正确",专门检测把某来源的事实错误归到另一来源的跨来源混淆。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:Grok 4.7 上线 Amazon Bedrock 的接入方式与四档推理强度配置,可供评估长任务智能体的成本与延迟取舍。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 与自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
OpenAI 发布了面向前沿 AI 训练的安全案例(safety cases)早期指南,覆盖技术防护措施、运营实践以及对模型失准(misalignment)事件的调查。该指南为前沿 AI 训练阶段的安全论证提供了初步框架。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并提出更强的防护措施与支持,以加强澳大利亚的网络防御。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。
AWS 发布 vLLM-Omni DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并附 Gradio 示例应用。
AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,同时与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
亚马逊云科技介绍用 Amazon Nova Act 结合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布方案,用 CloudFormation 和 Terraform 模板自动化 Amazon Textract 适配器跨账户生命周期管理,将适配器 ID 外置到 Systems Manager Parameter Store 后,生产环境更新无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。方案包含预分类路由、生产安全配置,并支持将训练好的适配器从训练环境推广到生产环境。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。
OpenAI 向 Lenfest AI Collaborative and Fellowship Program 追加 500 万美元资金,并提供最高 500 万美元的软件额度和工程支持。该项目由 Lenfest Institute 主导,面向新闻机构的 AI 转型。
OpenAI 正在征集使用 Codex 的开发者、研究者和创作者的真实故事,邀请他们分享用 Codex 完成的项目与经历,参与 Codex Originals 计划的下一阶段。
GPT-6 Astra 完成 50 个标签页的税务工作簿速度是 GPT-5.6 Sol 的 2 倍,其更强的用户意图理解能力让 Basis 对实际使用更有信心。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理产品,销售额提升 60%,节省 75+ 小时。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户通过 /create-canvas 技能用自然语言描述需求即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 以扩展形式保存,可随项目共享或作为个人扩展复用,用户与智能体可同时操作并即时同步状态。Awesome Copilot 社区已提供发布说明、看板、issue 分诊等现成 canvas 扩展。
AWS 结合 Amazon EKS、EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS 官方博客介绍 NarrateAI 在 Amazon Bedrock 上落地的五项生产级质量保障技术:自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性校验,实测约 99.3% 数值准确率、约 13 秒开始流式返回。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型到全托管实时推理端点,仅需几秒参考音频即可完成声音克隆,无需重新训练。Qwen3-TTS 支持 10 种语言、流式生成与跨语言克隆,输出 24 kHz 音频,由 vLLM-Omni 容器提供服务。该方案让数据保留在 AWS 环境内,成本随算力用量而非按字符计费。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为工业气体与焊接分销商构建了自助式租赁分析方案,业务用户无需 IT 介入即可用自然语言查询租赁数据。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Data Fabric(CDF)可让训练算力与数据分处不同 AWS Region,无需复制数据即可远程读取。
GitHub Copilot 提出 canvas 概念,即在 GitHub Copilot 应用内运行的小型全栈应用,无浏览器外壳,可与 agent 双向通信,也能调用第三方 API 并在本地执行代码。
Google 研究团队发布 AI video co-director 等多智能体框架,在 Gemini 和 Veo 之上编排多镜头长视频生成,缓解语义漂移与级联失败。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,读者可了解多镜头一致性的具体解法与评测基准。
GitHub Security Lab 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness、分诊崩溃并生成漏洞报告。
推荐理由:GitHub Security Lab 开源了面向 C/C++ 的自主模糊测试流水线,读者可了解 LLM 智能体如何接管写 harness、追覆盖率与崩溃分诊。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的对话式 AI 带来近实时的视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言同步与异步工具调用如何用于企业对话场景。
AWS 推出 WhisperX Deep Learning Container,可部署到 Amazon SageMaker AI 实时或异步端点,为语音转写补齐逐词时间戳与说话人标注。
AWS 介绍如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体架构,让数据留在各自 AWS 账户内、仅在查询时按需流出。