Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
Hugging Face 官方博客讲解如何借助 WWDC 24 新发布的 Core ML 特性,在 Mac 上以不到 4GB 内存运行 Mistral 7B。
推荐理由:逐步骤给出转换与运行命令,读者可照做在 Mac 上跑起 7B 模型并了解各项新特性的作用。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:详细拆解了从数据构造到解码算法的完整配方,可迁移方法多。
Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。
推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体之外新增两种能基于过往观察迭代的智能体(ReactCodeAgent 与 ReactJsonAgent),并加入社区分享功能。
推荐理由:原文给出组件设计与基准结果,读者可据此评估开源智能体框架的实际竞争力。
Meta 发布开源 Llama 3 系列,包含 8B 和 70B 两种参数规模的 base 与 instruct 共 4 个模型,以及基于 Llama 3 8B 微调的 Llama Guard 2,全部已上线 Hugging Face Hub。
推荐理由:原文梳理了 Llama 3 的技术变化与生态集成入口,读者可据此判断如何在自己的工作流中使用它。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。
推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。
Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。
BigCode 发布开源代码大模型 StarCoder2,含 3B、7B、15B 三个尺寸,全部基于新数据集 The Stack v2 训练,模型、数据集及训练代码均开放。
推荐理由:原文列出了三个尺寸的训练规模与数据集对比,读者可据此判断小模型能否替代更大模型。
Google 发布开源大模型系列 Gemma,包含 7B 和 2B 两种参数规模、各有 base 与 instruction-tuned 版本,共 4 个开放模型上线 Hugging Face Hub。
推荐理由:文章给出各尺寸模型的跑分对照和单卡微调命令,读者可据此判断在自有硬件上落地的可行性。
Hugging Face 博客展示了用开源 LLM(Mixtral-8x7B-Instruct-v0.1)生成合成数据、再用 AutoTrain 微调约 0.13B 参数 RoBERTa-base 的完整流程。
推荐理由:通过具体成本与碳排数字对比,读者可直接判断何时该用合成数据训练专用小模型而非调用 LLM API。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源基于 Slurm 集群、由 TGI 和 vLLM 支撑的可扩展合成数据生成工具 llm-swarm。
推荐理由:完整给出用开源模型做 Constitutional AI 的可复用配方与评测数据,便于迁移实践。
Hugging Face 发布 2023 年开源 LLM 年度回顾,梳理了从 BLOOM、OPT、GLM-130B 到 LLaMA、Llama 2、Mistral、Qwen、Yi 等模型的发布脉络,以及 Chinchilla 范式转变带来的小模型加更多数据趋势。
推荐理由:系统梳理了开源 LLM 的技术要素与全年脉络,可作为理解开源模型生态的入门地图。
Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。
推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。
Hugging Face 官方博客宣布推出 Latent Consistency LoRAs(LCM LoRA),通过只训练少量 LoRA 适配器而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 以 4 步完成推理,替代原本的 25 到 50 步。
推荐理由:给出了各硬件的实测耗时对比,读者可据此判断自己设备上能否跑近实时生成。
Hugging Face 官方博客给出生产环境优化 LLM 的三类技术并附实测:低精度量化、Flash Attention 与面向长文本的架构改进。
推荐理由:原文用同一模型的实测显存与耗时数据,把量化、Flash Attention 和 KV cache 优化的取舍讲得可直接迁移。
Hugging Face 官方博客宣布 TII 的 Falcon 180B 加入 HuggingFace 生态,这是当时最大的公开可用语言模型,拥有 180B 参数、在 RefinedWeb 数据集上训练 3.5 trillion tokens,是开源模型中最长的单轮预训练。
推荐理由:文章给出了硬件需求和量化实测,读者可据此评估自己能否跑起这个 180B 模型。
Hugging Face 宣布在自身生态中集成 Meta 的 Code Llama 模型家族,包含 7B、13B、34B 三种参数规模,以及 Python 专精版和指令微调版,采用与 Llama 2 相同的宽松社区许可并可商用。
推荐理由:原文给出模型规格、上下文窗口扩展方法和多语言榜单成绩,便于评估其在代码任务上的定位。