Hugging Face 开源发布多模态模型 IDEFICS
Hugging Face 发布开放获取的视觉语言模型 IDEFICS,作为 DeepMind 未公开的 Flamingo 的开放复现,可接受任意图像与文本序列输入并生成文本输出。
推荐理由:原文交代了复现所用的公开数据与模型组件,读者可据此理解开放复现闭源模型的具体路径。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Hugging Face 发布开放获取的视觉语言模型 IDEFICS,作为 DeepMind 未公开的 Flamingo 的开放复现,可接受任意图像与文本序列输入并生成文本输出。
推荐理由:原文交代了复现所用的公开数据与模型组件,读者可据此理解开放复现闭源模型的具体路径。
OpenAI 发布 ChatGPT iOS 应用,官方介绍该应用可同步对话、支持语音输入,并把最新的模型改进带到移动端。
推荐理由:官方点明了同步、语音输入和最新模型三项能力,读者可据此判断移动端与网页端的差异。
OpenAI 发布 GPT-4,称其为该公司扩展深度学习进程中的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多种专业和学术基准上展现人类水平表现,同时在许多真实场景中仍不及人类。
推荐理由:原文点明了GPT-4的多模态输入能力和基准表现定位,读者可据此理解这一代模型相对前代的关键变化。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别的视觉类别名称即可应用于任意视觉分类基准,其零样本能力与 GPT-2 和 GPT-3 类似。
OpenAI 宣布训练出名为 DALL·E 的神经网络,可根据文本描述为自然语言可表达的广泛概念生成图像。
推荐理由:原文点明了从文本生成图像这一能力方向,读者可据此理解多模态生成的早期定位。
OpenAI 发布 Jukebox,一个能以原始音频形式生成多种音乐流派和歌手风格音乐的神经网络,其中包含初步的歌唱能力。OpenAI 同时开源了模型权重和代码,并提供了一个用于浏览生成样本的工具。
推荐理由:原文说明了模型能生成的音频形态与开放程度,读者可据此判断其可复用性。