Hugging Face 介绍 Google PaliGemma 开源视觉语言模型系列
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体之外新增两种能基于过往观察迭代的智能体(ReactCodeAgent 与 ReactJsonAgent),并加入社区分享功能。
推荐理由:原文给出组件设计与基准结果,读者可据此评估开源智能体框架的实际竞争力。
Meta 发布开源 Llama 3 系列,包含 8B 和 70B 两种参数规模的 base 与 instruct 共 4 个模型,以及基于 Llama 3 8B 微调的 Llama Guard 2,全部已上线 Hugging Face Hub。
推荐理由:原文梳理了 Llama 3 的技术变化与生态集成入口,读者可据此判断如何在自己的工作流中使用它。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。
推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。
Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。
BigCode 发布开源代码大模型 StarCoder2,含 3B、7B、15B 三个尺寸,全部基于新数据集 The Stack v2 训练,模型、数据集及训练代码均开放。
推荐理由:原文列出了三个尺寸的训练规模与数据集对比,读者可据此判断小模型能否替代更大模型。
Google 发布开源大模型系列 Gemma,包含 7B 和 2B 两种参数规模、各有 base 与 instruction-tuned 版本,共 4 个开放模型上线 Hugging Face Hub。
推荐理由:文章给出各尺寸模型的跑分对照和单卡微调命令,读者可据此判断在自有硬件上落地的可行性。
Hugging Face 博客展示了用开源 LLM(Mixtral-8x7B-Instruct-v0.1)生成合成数据、再用 AutoTrain 微调约 0.13B 参数 RoBERTa-base 的完整流程。
推荐理由:通过具体成本与碳排数字对比,读者可直接判断何时该用合成数据训练专用小模型而非调用 LLM API。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源基于 Slurm 集群、由 TGI 和 vLLM 支撑的可扩展合成数据生成工具 llm-swarm。
推荐理由:完整给出用开源模型做 Constitutional AI 的可复用配方与评测数据,便于迁移实践。
Hugging Face 发布 2023 年开源 LLM 年度回顾,梳理了从 BLOOM、OPT、GLM-130B 到 LLaMA、Llama 2、Mistral、Qwen、Yi 等模型的发布脉络,以及 Chinchilla 范式转变带来的小模型加更多数据趋势。
推荐理由:系统梳理了开源 LLM 的技术要素与全年脉络,可作为理解开源模型生态的入门地图。
Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。
推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。
Hugging Face 官方博客发布 Mixture of Experts Explained,系统讲解 MoE 的组成、稀疏性、负载均衡、Switch Transformers、微调挑战与推理部署技巧。
推荐理由:系统梳理了 MoE 的原理、训练与推理权衡,读者可据此判断何时选用稀疏模型。
Hugging Face 官方博客宣布推出 Latent Consistency LoRAs(LCM LoRA),通过只训练少量 LoRA 适配器而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 以 4 步完成推理,替代原本的 25 到 50 步。
推荐理由:给出了各硬件的实测耗时对比,读者可据此判断自己设备上能否跑近实时生成。
Hugging Face 官方博客给出生产环境优化 LLM 的三类技术并附实测:低精度量化、Flash Attention 与面向长文本的架构改进。
推荐理由:原文用同一模型的实测显存与耗时数据,把量化、Flash Attention 和 KV cache 优化的取舍讲得可直接迁移。
Hugging Face 官方博客宣布 TII 的 Falcon 180B 加入 HuggingFace 生态,这是当时最大的公开可用语言模型,拥有 180B 参数、在 RefinedWeb 数据集上训练 3.5 trillion tokens,是开源模型中最长的单轮预训练。
推荐理由:文章给出了硬件需求和量化实测,读者可据此评估自己能否跑起这个 180B 模型。
Hugging Face 宣布在自身生态中集成 Meta 的 Code Llama 模型家族,包含 7B、13B、34B 三种参数规模,以及 Python 专精版和指令微调版,采用与 Llama 2 相同的宽松社区许可并可商用。
推荐理由:原文给出模型规格、上下文窗口扩展方法和多语言榜单成绩,便于评估其在代码任务上的定位。
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。
推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。
Hugging Face 发布开放获取的视觉语言模型 IDEFICS,作为 DeepMind 未公开的 Flamingo 的开放复现,可接受任意图像与文本序列输入并生成文本输出。
推荐理由:原文交代了复现所用的公开数据与模型组件,读者可据此理解开放复现闭源模型的具体路径。
Hugging Face 与 Apple 合作将 Stable Diffusion XL 移植到 Core ML,发布了 apple/coreml-stable-diffusion-xl-base 完整流水线和 apple/coreml-stable-diffusion-mixed-bit-palettization 版本。
推荐理由:原文给出混合位调色板压缩的逐层比特分配方法与实测体积数据,读者可迁移到自己的 Core ML 模型压缩上。
Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。
推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。