Hugging Face 发布开源 450M 视觉语言动作模型 SmolVLA
Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。
推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 发布 SmolVLA-450M,一款 450M 参数的开源视觉语言动作模型,可在消费级硬件上运行,仅用 lerobot 标签下的社区共享数据集预训练,在 LIBERO、Meta-World 仿真及 SO100、SO101 真实任务上超过更大的 VLA 和 ACT 基线。
推荐理由:原文给出了训练数据规模、架构取舍和异步推理收益,读者可据此评估小模型 VLA 在消费级硬件上的可行性。
Hugging Face 在 TRL 中通过 PR #3394 引入 vLLM colocate 模式,让训练与推理共享同一组 GPU、在同一进程组内轮流执行,取代此前需要独立 GPU 和 HTTP 通信的 server 模式。
推荐理由:原文给出 colocate 模式的实测加速数据和踩坑清单,可帮助判断何时该从 server 模式迁移。
Hugging Face 发布教程,介绍如何用 Python 构建约 70 行代码的 MCP 驱动 Tiny Agent,并宣布 tiny-agents 已支持 AGENTS.md 标准。
推荐理由:文章拆解了 MCPClient 与 Agent 的关键代码,读者可据此理解一个 MCP 智能体如何用极少代码搭起来。
Falcon-LLM 团队发布 Falcon-H1 系列共 6 个开源模型(0.5B、1.5B、1.5B-Deep、3B、7B、34B),均提供 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:原文披露了混合架构的取舍与反直觉的数据策略,可迁移借鉴其训练方法论。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义枢纽:只要模型架构被 transformers 支持,就预期在生态其他部分同样被支持。
推荐理由:原文说明了 Transformers 作为模型定义标准如何打通训练、推理与本地部署链路,读者可据此理解生态碎片化的应对方式。
Hugging Face 发布 Tiny Agent,用约 50 行 TypeScript 代码实现一个由 MCP 驱动的 Agent,核心思路是 MCP 客户端之上套一个 while 循环。
推荐理由:文章把 MCP 客户端与 Agent 的实现拆解到 50 行代码级别,读者可直接照搬这套 while 循环结构到自己的项目。
Hugging Face 宣布收购成立 9 年的开源机器人公司 Pollen Robotics,这是继 Gradio、XetHub 之后其第五次收购,并将开售首款开源人形机器人 Reachy 2,售价 $70,000,已在 Cornell、Carnegie Mellon 等实验室使用。
推荐理由:梳理了 Hugging Face 从 LeRobot 到收购 Pollen Robotics 的完整布局,便于理解其开源机器人路线。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
NVIDIA 在 GTC 大会上发布三项面向物理 AI 开发者的开源成果:世界基础模型 Cosmos Transfer、开源数据集 Physical AI Dataset,以及首个通用人形机器人推理开源模型 Isaac GR00T N1。
推荐理由:梳理了三项开源发布的具体规格与架构细节,便于开发者评估可直接复用的模型与数据资源。
Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。
Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。
推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个微调代码模型,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型,OlympicCoder-32B 在 50 次提交限制下还超过 o1-mini 和 DeepSeek-R1。
推荐理由:文中给出的五条训练经验可直接迁移到用推理轨迹微调代码模型的实践中。
Hugging Face LeRobot 团队与 Yaak 联合发布 Learning to Drive(L2D)开源自动驾驶数据集,R4 版本包含 90+ TB 多模态数据、5000+ 小时驾驶、来自德国 30 个城市的 6 路环视摄像头与完整车辆状态。
推荐理由:对比表和分阶段发布计划让读者能直接评估该数据集相对现有开源数据集的规模与可用性差异。
Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。
推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。
Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。
推荐理由:原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。
Hugging Face 用 Math-Verify 替换 Open LLM Leaderboard 上的旧数学评测器,重新评估了提交过的全部 3,751 个模型。
推荐理由:原文给出旧评测器的三类解析缺陷与修复后分数变化,读者可据此理解评测口径对排行榜的实际影响。
Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 512 张 H100 本地跑 DeepSeek R1 生成 800k 条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 判分过滤后保留 220k 道题的正确轨迹。
推荐理由:原文公开了数据生成与过滤的完整流水线和训练对照结果,读者可据此复现或迁移到其他领域。
Hugging Face 在 24 小时冲刺中开源复现 OpenAI 的 Deep Research,基于 smolagents 构建的开源智能体在 GAIA 验证集上取得 55.15% 的成绩,超过此前开源框架 Magentic-One 约 46% 的水平。
推荐理由:文中给出了代码动作相对 JSON 的具体优势和可复现的性能差距,读者可据此判断智能体框架选型的影响。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个 Vision-Language-Action 模型移植到 LeRobot 仓库,提供模型集合与 PyTorch 版本。
推荐理由:原文同时给出模型架构细节与可直接运行的命令,读者可据此在 LeRobot 中复现和微调。
Hugging Face 发布 Open-R1 项目首周更新,称已在 MATH-500 Benchmark 上基本复现 DeepSeek-R1 蒸馏模型的报告分数,并上线了公开评测 leaderboard。
推荐理由:汇总了复现进度、训练管线细节和社区数据集,读者可据此评估开源复现 DeepSeek-R1 的可行性与路径。