最新精选
第 121–139 条 · 共 139 条- Hugging Face Blog精选AI 评分6464
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。
推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。
- Hugging Face Blog精选AI 评分6464
Hugging Face 发布开放获取的视觉语言模型 IDEFICS,作为 DeepMind 未公开的 Flamingo 的开放复现,可接受任意图像与文本序列输入并生成文本输出。
推荐理由:原文交代了复现所用的公开数据与模型组件,读者可据此理解开放复现闭源模型的具体路径。
- Hugging Face Blog精选AI 评分6161
Hugging Face 与 Apple 合作将 Stable Diffusion XL 移植到 Core ML,发布了 apple/coreml-stable-diffusion-xl-base 完整流水线和 apple/coreml-stable-diffusion-mixed-bit-palettization 版本。
推荐理由:原文给出混合位调色板压缩的逐层比特分配方法与实测体积数据,读者可迁移到自己的 Core ML 模型压缩上。
- Hugging Face Blog精选AI 评分8888
Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。
推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。
- Hugging Face Blog精选AI 评分6363
Hugging Face 博客解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何显著低于 LLaMA 论文报告值。
推荐理由:通过对比三套 MMLU 实现的分数差异,读者能理解评测分数为何不可直接跨库比较。
- Hugging Face Blog精选AI 评分6565
Hugging Face 官方博客介绍 Falcon 系列模型(Falcon-40B 与 Falcon-7B,由阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布)接入其生态的完整用法。
推荐理由:文章系统梳理了 Falcon 在 Hugging Face 生态中的推理、量化与微调路径,可直接迁移为落地参考。
- Hugging Face Blog精选AI 评分8888
Hugging Face 与 bitsandbytes 再次合作,在 transformers 中支持以 4-bit 精度运行大部分 HF 模型(含文本、视觉、多模态),并可基于 4bit 模型训练适配器,对应 Dettmers 等人当天发布的 QLoRA 论文。
推荐理由:原文给出 4bit 加载的具体参数配置与显存实测对照,读者可据此在消费级显卡上复现微调方案。
- Hugging Face Blog精选AI 评分6060
Hugging Face 官方博客详细讲解 BigCode 训练数据的文档级近似去重方法,覆盖 MinHash 加 LSH 的完整流程:shingling 分词、指纹计算、LSH 分桶、候选对聚类与去重决策。
推荐理由:系统梳理了 MinHash 加 LSH 的去重流程与四种扩展方案,并给出参数取舍的实验依据,可直接迁移到自有数据集。
- Hugging Face Blog精选AI 评分6060
Hugging Face 官方博客宣布 RWKV 架构已通过 Pull Request 集成进 transformers 库,可通过源码安装或 main 分支使用,支持 pipeline 文本生成与 alpaca 风格的 RWKV-4 Raven 聊天模型调用,并提供 convert_rwkv_checkpoint_to_hf.py 脚本转换原始权重。
推荐理由:原文对比了 RWKV 与 Transformer、RNN 的取舍并给出可直接运行的代码,便于读者判断其适用场景。
- Hugging Face Blog精选AI 评分6464
Hugging Face 在 🤗 Transformers 的 .generate() 中推出新解码方法 assisted generation,用小模型生成候选 token、再由目标模型一次前向验证,在普通硬件上最高可将延迟降低 10x。
推荐理由:原文拆解了延迟瓶颈并给出可复现的加速数字,读者可据此判断该方法是否适配自己的部署场景。
- Hugging Face Blog精选AI 评分6565
Hugging Face 官方博客讲解如何把 BigCode 的 16B 参数开源代码模型 StarCoder 微调成对话式编码助手 StarChat。
推荐理由:完整给出从数据准备、ChatML 格式化到 DeepSpeed 训练与评测的可复现流程,适合想动手微调代码模型的读者。
- Hugging Face Blog精选AI 评分7878
Hugging Face 与 ServiceNow 联合的 BigCode 项目发布代码大模型 StarCoder 和 StarCoderBase,基于 80+ 编程语言等许可数据训练,约 15B 参数、1 trillion tokens。
推荐理由:原文给出评测数据和提示词技巧,读者可了解开源代码模型的水平及提升分数的具体做法。
- Hugging Face Blog精选AI 评分7171
Hugging Face 发布 StackLLaMA 模型与配套教程,展示用 SFT、奖励模型和 RLHF 三步在 LLaMA 7B 上训练 Stack Exchange 问答能力的完整流程,模型已上线 Hub,训练管线收录于 TRL 库。
推荐理由:教程完整给出 RLHF 三阶段的可复现代码与显存估算,读者可据此在单卡上跑通流程。
- Hugging Face Blog精选AI 评分6060
Hugging Face 官方博客复盘了 2023 年 2 月土耳其地震后志愿者团队如何用机器学习构建救援应用 afetharita 的实践。
推荐理由:复盘了灾后救援中从数据标注到模型部署的完整 MLOps 流程,可迁移方法具体。
- Hugging Face Blog精选AI 评分7171
Hugging Face 在 Diffusers 中集成 ControlNet,发布 StableDiffusionControlNetPipeline,支持用深度图、分割图、涂鸦、关键点等空间条件控制 Stable Diffusion 生成,论文提出的 8 种条件模型全部支持。
推荐理由:原文给出完整可复现的代码与性能数字,读者可直接照搬这套省显存的 ControlNet 推理配置。
- Hugging Face Blog精选AI 评分6666
Hugging Face 推出 🤗 PEFT 库,与 🤗 Transformers 和 🤗 Accelerate 无缝集成,目前支持 LoRA、Prefix Tuning、P-Tuning v2、Prompt Tuning、P-Tuning 等方法。
推荐理由:原文给出了在消费级硬件上微调大模型的具体配置与产出体积对比,可直接迁移复用。
- Hugging Face Blog精选AI 评分6565
Hugging Face 官方博客介绍如何在 diffusers 中用 LoRA 微调 Stable Diffusion,训练可在 11 GB 显存的 2080 Ti 上完成,训练出的权重仅约 3 MB,比 UNet 原始体积小约一千倍。
推荐理由:原文给出可直接复用的训练脚本与推理代码,并说明 LoRA 相比全量微调在显存和权重体积上的具体收益。
- Hugging Face Blog精选AI 评分7171
Hugging Face 官方博客介绍 LLM.int8() 8-bit 矩阵乘法技术及其在 transformers 和 accelerate 库中的集成,可将大模型显存占用降至约 1/4 而不损失性能。
推荐理由:从数据类型基础讲到量化原理与集成细节,读者可据此理解大模型显存占用的成因与 8-bit 推理的落地方式。
- Hugging Face Blog精选AI 评分7878
Hugging Face 发布 BLOOM,这是首个完全透明训练的多语言大语言模型,拥有 176B 参数,可生成 46 种自然语言和 13 种编程语言的文本。该项目由 70+ 国家、250+ 机构的 1000 多名研究人员协作完成,在法国巴黎南部的 Jean Zay 超算上训练 117 天(3 月 11 日至 7 月 6 日),算力资助价值约 €3M。
推荐理由:原文交代了训练协作规模与开放许可细节,读者可据此理解大模型研究门槛如何被降低。