跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

106条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–106 条 · 共 106 条
8月22日周二
5月18日周四
  1. OpenAI News75

    OpenAI 发布 ChatGPT iOS 应用

    OpenAI 发布 ChatGPT iOS 应用,官方介绍该应用可同步对话、支持语音输入,并把最新的模型改进带到移动端。

    推荐理由:官方点明了同步、语音输入和最新模型三项能力,读者可据此判断移动端与网页端的差异。

3月14日周二
  1. OpenAI News87

    OpenAI 发布 GPT-4 多模态模型

    OpenAI 发布 GPT-4,称其为该公司扩展深度学习进程中的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多种专业和学术基准上展现人类水平表现,同时在许多真实场景中仍不及人类。

    推荐理由:原文点明了GPT-4的多模态输入能力和基准表现定位,读者可据此理解这一代模型相对前代的关键变化。

1月5日周二
4月30日周四
  1. OpenAI News62

    OpenAI 开源音乐生成模型 Jukebox

    OpenAI 发布 Jukebox,一个能以原始音频形式生成多种音乐流派和歌手风格音乐的神经网络,其中包含初步的歌唱能力。OpenAI 同时开源了模型权重和代码,并提供了一个用于浏览生成样本的工具。

    推荐理由:原文说明了模型能生成的音频形态与开放程度,读者可据此判断其可复用性。