跳到正文
原文
Hugging Face Blog·· 2025-06-03精选AI 评分74

Hugging Face 发布开源 450M 视觉语言动作模型 SmolVLA

SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data

AI 导读

Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。

推荐理由

原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。

来源:Hugging Face Blog · huggingface.co