跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

106条精选相关主题图像生成AI 视频语音与音频

最新精选

第 81–100 条 · 共 106 条
3月17日周一
  1. Mistral AI74

    Mistral AI 发布 Mistral Small 3.1 模型

    Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。

    推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。

3月12日周三
  1. Hugging Face Blog84

    Google 发布 Gemma 3:多模态、多语言、128k 上下文的开源 LLM

    Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。

    推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。

3月7日周五
3月4日周二
2月21日周五
  1. Hugging Face Blog65

    Google 发布多模态视觉语言编码器 SigLIP 2

    Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。

    推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。

2月20日周四
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM2 系列视频理解模型

    Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。

    推荐理由:原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。

1月23日周四
10月22日周二
10月1日周二
9月25日周三
7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

5月14日周二
  1. Hugging Face Blog65

    Hugging Face 介绍 Google PaliGemma 开源视觉语言模型系列

    Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。

    推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。

5月13日周一
4月15日周一
  1. Hugging Face Blog63

    Hugging Face 发布 8B 多模态模型 Idefics2

    Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。

    推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。

2月15日周四
  1. OpenAI News82

    OpenAI 发布视频生成模型 Sora,探索世界模拟器路线

    OpenAI 发布视频生成模型 Sora,可在文本条件下生成一分钟高保真视频。该模型基于在视频与图像潜码的时空 patch 上运行的 Transformer 架构,对不同时长、分辨率和宽高比的视频与图像联合训练,其结果表明扩大视频生成模型规模是构建物理世界通用模拟器的可行路径。

    推荐理由:原文点明扩大视频生成规模是通向物理世界通用模拟器的路径,提供了技术路线的关键判断。

11月6日周一
9月25日周一