跳到正文

全部动态

今日 10 条
今天9月30日周三
  1. AWS Machine Learning Blog66

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的任务成本匹配 GPT-6 Astra,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点、推理投入更低。

    推荐理由:原文给出了成本与能力的对比数据,读者可据此评估它在智能体工作流中的性价比取舍。

  2. AWS Machine Learning Blog36

    Amazon Quick 各组件的提示词模式与常见陷阱

    Amazon Quick 各组件的提示词写法各有差异:Quick Research 需明确目标、受众与聚焦领域并可拆分子问题、筛选数据源,Quick Flows 要写清触发时间、数据源、计算与输出格式并用编号步骤组织复杂逻辑,Quick Sight 查询需包含业务问题、指标与维度。

  3. Hugging Face Blog74

    NVIDIA 开源表格基础模型 Kumo Tabular,在四个榜单排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型系列,已上线 Hugging Face。给定带标签的表格,它在单次前向传播中直接预测新行标签,支持分类与回归,无需训练、调优或特征工程。

    推荐理由:原文交代了模型架构与人工数据预训练流程,读者可据此理解表格基础模型如何在免调优下兼顾精度与效率。

  4. AWS Machine Learning Blog34

    Amazon Quick 提示词工程基础(上):通用原则与结构化框架

    Amazon Quick 发布提示词工程系列文章第一篇,讲解跨组件通用的提示词原则与结构化框架。核心原则包括用具体指标、时间范围和范围限定替代模糊请求,提供业务上下文以校准输出,以及用 few-shot 示例直接演示所需格式。文章介绍 CRISPE 框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度构建完整提示词,帮助团队减少迭代、复用提示模式。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,从缩小搜索空间到选出候选化合物仅用一个周末,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,读者可了解 AI 参与药物发现的具体流程与验证结果。

  2. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源归属正确",专门检测把某来源的事实错误归到另一来源的跨来源混淆。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。

  3. AWS Machine Learning Blog60

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:Grok 4.7 上线 Amazon Bedrock 的接入方式与四档推理强度配置,可供评估长任务智能体的成本与延迟取舍。

  4. Microsoft Research18

    微软亚洲研究院新加坡成立一周年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 与自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

  5. AWS Machine Learning Blog62

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向聚焦编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:官方给出 Sonnet 5.5 在 Amazon Bedrock 上的能力定位与调用示例,可据此判断它适合承接哪类持续运行的编码任务。

  6. AWS Machine Learning Blog22

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上部署同一个 vLLM-Omni DLC 镜像的两个端点:实时端点跑 FLUX.2-klein-4B 生成图像,异步端点跑 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词送入视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。

9月28日周一
  1. AWS Machine Learning Blog22

    Amazon Textract 适配器跨账户生命周期自动化管理

    AWS 发布方案,用 CloudFormation 和 Terraform 模板自动化 Amazon Textract 适配器跨账户生命周期管理,将适配器 ID 外置到 Systems Manager Parameter Store 后,生产环境更新无需重新部署应用,原本需数小时至数天的协调工作缩短到数秒。方案包含预分类路由、生产安全配置,并支持将训练好的适配器从训练环境推广到生产环境。

  2. Hugging Face Blog78

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时开源权重与全部评测轨迹,读者可据此比较通用计算机操作智能体在成本与能力上的取舍。

9月26日周六
  1. GitHub Blog · AI & ML40

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户通过 /create-canvas 技能用自然语言描述需求即可生成看板、发布清单或仪表盘等工具,无需编写代码。canvas 以扩展形式保存,可随项目共享或作为个人扩展复用,用户与智能体可同时操作并即时同步状态。Awesome Copilot 社区已提供发布说明、看板、issue 分诊等现成 canvas 扩展。

  2. AWS Machine Learning Blog44

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时个性化语音

    Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型到全托管实时推理端点,仅需几秒参考音频即可完成声音克隆,无需重新训练。Qwen3-TTS 支持 10 种语言、流式生成与跨语言克隆,输出 24 kHz 音频,由 vLLM-Omni 容器提供服务。该方案让数据保留在 AWS 环境内,成本随算力用量而非按字符计费。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness、分诊崩溃并生成漏洞报告。

    推荐理由:GitHub Security Lab 开源了面向 C/C++ 的自主模糊测试流水线,读者可了解 LLM 智能体如何接管写 harness、追覆盖率与崩溃分诊。