跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

106条精选相关主题图像生成AI 视频语音与音频

最新精选

第 61–80 条 · 共 106 条
11月19日周三
  1. Google Research74

    Google Research 发布端到端实时语音到语音翻译模型

    Google Research 介绍了一种端到端实时语音到语音翻译(S2ST)模型,可保留原说话人声音进行实时翻译,延迟仅 2 秒,而现有级联式方案通常有 4–5 秒延迟并存在误差累积。

    推荐理由:原文对比了级联方案的延迟与误差累积问题,读者可据此理解端到端流式架构带来的改进方向。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3 系列模型

    Google DeepMind 发布 Gemini 3,先推出 Gemini 3 Pro preview,并同步上线 Gemini app、AI Studio、Vertex AI、Gemini CLI 及 Search 的 AI Mode,首次在 Search 第一天接入。

    推荐理由:官方给出了各基准的具体分数与开放入口,读者可据此评估其相对 2.5 Pro 的实际提升。

  3. Google Research74

    Google 推出 Generative UI:Gemini 应用与 AI Mode 上线动态界面实验

    Google Research 发布论文并推出 Generative UI,让模型针对任意提示词动态生成网页、游戏、工具和应用等交互界面,该能力以 dynamic view 和 visual layout 两项实验形式在 Gemini 应用上线。

    推荐理由:原文说明了实现所需的三项关键设计和评测对比口径,读者可据此判断生成式 UI 目前的能力边界。

11月13日周四
10月28日周二
10月21日周二
  1. Hugging Face Blog60

    Hugging Face AI Sheets 新增视觉能力,可在表格中提取、生成与编辑图片

    Hugging Face 宣布为开源工具 AI Sheets 加入视觉支持,用户可在表格中直接查看、分析、提取图片信息,生成新图并实时编辑,底层通过 Inference Providers 调用数千个开源模型。

    推荐理由:通过手写食谱的完整示例,读者可以看到从图片抽取到结构化导出的可迁移工作流。

9月30日周二
  1. OpenAI News67

    OpenAI 发布 Sora 2 系统卡

    OpenAI 发布 Sora 2 系统卡,介绍其新一代视频与音频生成模型。Sora 2 在 Sora 基础上引入更准确的物理表现、更强的真实感、同步音频、增强的可控性以及更广的风格范围等此前视频模型难以实现的能力。

  2. OpenAI News60

    OpenAI 以安全为基础推出 Sora 2 与 Sora 应用

    OpenAI 宣布推出 Sora 2 视频模型和 Sora 应用,称针对前沿视频模型与全新社交创作平台带来的新型安全挑战,将安全作为基础,并以具体保护措施作为其做法的锚点。

    推荐理由:官方说明了面向视频模型与社交创作平台的具体安全保护措施,可了解其安全设计思路。

8月7日周四
  1. OpenAI News81

    OpenAI 发布 GPT-5

    OpenAI 宣布推出 GPT-5,称其为迄今最好的 AI 系统,相比此前所有模型在智能上有显著跃升,在编码、数学、写作、健康、视觉感知等多个领域达到 state-of-the-art 表现。

7月17日周四
  1. Mistral AI60

    Mistral AI 为 Le Chat 推出 Deep Research、语音模式等新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括预览版 Deep Research 模式、基于 Voxtral 的语音模式、由推理模型 Magistral 驱动的多语言 Think 模式、Projects 文件夹,以及与 Black Forest Labs 合作的图像编辑。

    推荐理由:原文逐项说明了新功能的定位与底层模型,读者可据此判断 Le Chat 在研究、语音、推理场景的能力边界。

7月8日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 3B 模型 SmolLM3:多语言、128k 长上下文与双模式推理

    Hugging Face 发布完全开源的 3B 模型 SmolLM3,包含 Base 与 Instruct/Reasoning 两个版本,用 11.2T tokens 训练,性能超过 Llama-3.2-3B 和 Qwen2.5-3B,并与 4B 级模型(Qwen3、Gemma3)竞争。

    推荐理由:完整公开了三阶段预训练配方与双模式推理的构建方法,可迁移给自建小模型的团队。

6月26日周四
  1. Hugging Face Blog81

    Gemma 3n 在开源生态全面开放可用

    Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。

    推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。

6月3日周二
  1. Hugging Face Blog74

    Hugging Face 发布开源 450M 视觉语言动作模型 SmolVLA

    Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。

    推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。

4月29日周二
4月5日周六
  1. Hugging Face Blog88

    Hugging Face 迎来 Meta Llama 4 Maverick 与 Scout 模型

    Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。

    推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。

3月18日周二
  1. Hugging Face Blog74

    NVIDIA 在 GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 与 Isaac GR00T N1 三项开源成果

    NVIDIA 在 GTC 大会上发布三项面向物理 AI 开发者的开源成果:世界基础模型 Cosmos Transfer、开源数据集 Physical AI Dataset,以及首个通用人形机器人推理开源模型 Isaac GR00T N1。

    推荐理由:梳理了三项开源发布的具体规格与架构细节,便于开发者评估可直接复用的模型与数据资源。