OpenAI 发布 o1 模型
OpenAI 官方发布 o1 模型,原文链接为 https://openai.com/index/introducing-openai-o1-preview,抓取失败,仅标题可用,无正文细节。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 官方发布 o1 模型,原文链接为 https://openai.com/index/introducing-openai-o1-preview,抓取失败,仅标题可用,无正文细节。
OpenAI News 发布标题为 Learning to reason with LLMs 的内容,抓取失败,正文不可用,仅标题可用。
OpenAI 宣布 GPT-4o 现已支持微调(fine-tuning)。
Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。
推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
OpenAI 官方发布 GPT-4o mini,定位为成本高效(cost-efficient)的模型。
Hugging Face 发布 SmolLM 小语言模型系列,包含 135M、360M、1.7B 三种参数规模,并同步开源 SmolLM-Corpus 训练语料。
推荐理由:原文公开了数据配比与消融实验细节,读者可迁移其小模型数据筛选方法。
Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。
推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),能够跨音频、视觉和文本进行实时推理。
OpenAI 发布 GPT-4o,并让更多能力在 ChatGPT 中免费可用。
OpenAI 宣布发布其最新旗舰模型 GPT-4o,并让更多能力在 ChatGPT 中免费提供给用户。
Meta 发布开源 Llama 3 系列,包含 8B 和 70B 两种参数规模的 base 与 instruct 共 4 个模型,以及基于 Llama 3 8B 微调的 Llama Guard 2,全部已上线 Hugging Face Hub。
推荐理由:原文梳理了 Llama 3 的技术变化与生态集成入口,读者可据此判断如何在自己的工作流中使用它。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。
推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。
BigCode 发布开源代码大模型 StarCoder2,含 3B、7B、15B 三个尺寸,全部基于新数据集 The Stack v2 训练,模型、数据集及训练代码均开放。
推荐理由:原文列出了三个尺寸的训练规模与数据集对比,读者可据此判断小模型能否替代更大模型。
Google 发布开源大模型系列 Gemma,包含 7B 和 2B 两种参数规模、各有 base 与 instruction-tuned 版本,共 4 个开放模型上线 Hugging Face Hub。
推荐理由:文章给出各尺寸模型的跑分对照和单卡微调命令,读者可据此判断在自有硬件上落地的可行性。
OpenAI 发布视频生成模型 Sora,可在文本条件下生成一分钟高保真视频。该模型基于在视频与图像潜码的时空 patch 上运行的 Transformer 架构,对不同时长、分辨率和宽高比的视频与图像联合训练,其结果表明扩大视频生成模型规模是构建物理世界通用模拟器的可行路径。
推荐理由:原文点明扩大视频生成规模是通向物理世界通用模拟器的路径,提供了技术路线的关键判断。
Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。
推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。
OpenAI 在 DevDay 上宣布多项新模型与开发者产品,包括具备 128K context 且价格更低的 GPT-4 Turbo、新版 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API 等。
推荐理由:原文列出了一次开发者大会上的多项模型与API更新,可据此了解OpenAI当时的产品线变化方向。