跳到正文
原文
Hugging Face Blog·· 2025-02-20精选AI 评分62

Hugging Face 发布 SmolVLM2 系列视频理解模型

SmolVLM2: Bringing Video Understanding to Every Device

AI 导读

Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。

推荐理由

原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。

来源:Hugging Face Blog · huggingface.co