跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

179条精选相关主题产品更新论文研究开源生态

最新精选

第 141–160 条 · 共 179 条
9月12日周四
8月20日周二
8月12日周一
  1. Hugging Face Blog66

    Hugging Face 发布 Falcon Mamba 7B:首个强性能无注意力 7B 模型

    Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。

    推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。

7月31日周三
7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

7月18日周四
7月16日周二
6月27日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 新开放模型 Gemma 2 的技术细节与生态集成

    Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。

    推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。

5月14日周二
  1. Hugging Face Blog65

    Hugging Face 介绍 Google PaliGemma 开源视觉语言模型系列

    Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。

    推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。

5月13日周一
4月18日周四
4月15日周一
  1. Hugging Face Blog63

    Hugging Face 发布 8B 多模态模型 Idefics2

    Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。

    推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。

2月28日周三
2月21日周三
2月15日周四
  1. OpenAI News82

    OpenAI 发布视频生成模型 Sora,探索世界模拟器路线

    OpenAI 发布视频生成模型 Sora,可在文本条件下生成一分钟高保真视频。该模型基于在视频与图像潜码的时空 patch 上运行的 Transformer 架构,对不同时长、分辨率和宽高比的视频与图像联合训练,其结果表明扩大视频生成模型规模是构建物理世界通用模拟器的可行路径。

    推荐理由:原文点明扩大视频生成规模是通向物理世界通用模拟器的路径,提供了技术路线的关键判断。

12月11日周一
  1. Hugging Face Blog78

    Hugging Face 完整集成 Mixtral 8x7B 模型

    Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。

    推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。

11月6日周一