Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 官方博客讲解如何借助 WWDC 24 新发布的 Core ML 特性,在 Mac 上以不到 4GB 内存运行 Mistral 7B。
推荐理由:逐步骤给出转换与运行命令,读者可照做在 Mac 上跑起 7B 模型并了解各项新特性的作用。
Hugging Face 与 Apple 合作将 Stable Diffusion XL 移植到 Core ML,发布了 apple/coreml-stable-diffusion-xl-base 完整流水线和 apple/coreml-stable-diffusion-mixed-bit-palettization 版本。
推荐理由:原文给出混合位调色板压缩的逐层比特分配方法与实测体积数据,读者可迁移到自己的 Core ML 模型压缩上。
Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。
推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。