跳到正文
原文
Hugging Face Blog·· 2023-08-23精选AI 评分64

Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

Making LLMs lighter with AutoGPTQ and transformers

AI 导读

Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。

推荐理由

原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。

来源:Hugging Face Blog · huggingface.co