Mistral AI 发布 Mistral Small 3.1 模型
Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。
Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。
推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。
Mistral AI 发布 OCR API Mistral OCR,可输入图像和 PDF,按顺序交错提取文本与图像,适合与 RAG 系统配合处理多模态文档。
推荐理由:原文给出基准对比与定价,读者可据此评估它在文档理解任务上替代现有 OCR 方案的空间。
Cohere For AI 发布并开源 Aya Vision 8B 和 32B 两个视觉语言模型,覆盖 23 种语言的图像理解与文本生成任务。
推荐理由:原文给出了数据增强与模型合并带来的具体胜率提升,可迁移的多语言多模态训练思路清晰。
Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。
推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。
Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。
推荐理由:原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。
Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,含 base 与指令微调共四个 checkpoint,可直接通过 transformers、MLX 和 ONNX 加载。
推荐理由:原文对比了视觉编码器与分词优化的取舍,读者可借鉴其在极小模型上做效率权衡的思路。
Hugging Face 官方发布 Transformers.js v3,加入 WebGPU 支持,性能最高可达 WASM 的 100 倍,可通过设置 device: 'webgpu' 启用。
推荐理由:原文列出了 WebGPU 加速与 dtype 量化参数的具体用法,读者可据此判断浏览器端模型部署的性能与体积取舍。
OpenAI 宣布开发者现在可以使用图像和文本微调 GPT-4o,以提升模型的视觉能力。
推荐理由:官方宣布开放图像微调入口,读者可据此判断视觉能力定制是否进入可落地阶段。
Meta 与 Hugging Face 合作发布 Llama 3.2 系列,共 10 个开放权重模型上线 Hub,包括 5 个多模态模型和 5 个纯文本模型。
推荐理由:原文给出各尺寸模型的显存需求与本地运行方式,读者可据此判断能否在自己的设备上跑起来。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。
推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),能够跨音频、视觉和文本进行实时推理。
OpenAI 发布 GPT-4o,并让更多能力在 ChatGPT 中免费可用。
OpenAI 宣布发布其最新旗舰模型 GPT-4o,并让更多能力在 ChatGPT 中免费提供给用户。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,采用 Apache 2.0 开源许可,可接受任意文本与图像序列输入并生成文本回答,具备图像问答、文档信息抽取和基础算术等能力。
推荐理由:给出了模型能力、基准对比和训练数据构成,读者可据此判断 8B 规模开源多模态模型的可用水平。
OpenAI 发布视频生成模型 Sora,可在文本条件下生成一分钟高保真视频。该模型基于在视频与图像潜码的时空 patch 上运行的 Transformer 架构,对不同时长、分辨率和宽高比的视频与图像联合训练,其结果表明扩大视频生成模型规模是构建物理世界通用模拟器的可行路径。
推荐理由:原文点明扩大视频生成规模是通向物理世界通用模拟器的路径,提供了技术路线的关键判断。
OpenAI 在 DevDay 上宣布多项新模型与开发者产品,包括具备 128K context 且价格更低的 GPT-4 Turbo、新版 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API 等。
推荐理由:原文列出了一次开发者大会上的多项模型与API更新,可据此了解OpenAI当时的产品线变化方向。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍 GPT-4V 的相关信息。
OpenAI 官方宣布 ChatGPT 现在可以看、听和说,即支持图像输入、音频理解与语音输出能力。