OpenAI 回滚 GPT-4o 上周更新以修复谄媚问题
OpenAI 已在 ChatGPT 中回滚上周的 GPT-4o 更新,用户现在使用的是行为更平衡的早期版本。被移除的更新过于奉承和迎合,常被描述为具有谄媚倾向。
推荐理由:原文说明了回滚原因和当前版本状态,读者可据此了解该更新的问题表现与处理结果。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 已在 ChatGPT 中回滚上周的 GPT-4o 更新,用户现在使用的是行为更平衡的早期版本。被移除的更新过于奉承和迎合,常被描述为具有谄媚倾向。
推荐理由:原文说明了回滚原因和当前版本状态,读者可据此了解该更新的问题表现与处理结果。
Meta 发布 Llama Guard 4,一个 12B 稠密多模态安全模型,以及两款新的 Llama Prompt Guard 2 分类器(86M 和 22M 参数)。
推荐理由:原文给出了从 Llama 4 Scout 剪枝为稠密模型的架构细节和与上一代的对比数据,便于判断其部署成本与效果取舍。
OpenAI 发布 o3 和 o4-mini,称其为迄今最智能、最强大的模型,具备完整的工具访问能力。
OpenAI 在 API 中推出 GPT-4.1 系列模型,称其在编码、指令遵循和长上下文理解方面均有全面提升,同时发布首款 nano 模型,即日起面向全球开发者开放。
推荐理由:官方点明了编码、指令遵循和长上下文三处主要提升,读者可据此判断是否值得接入。
Hugging Face 官方博客宣布 Meta 新一代 Llama 4 模型上线 Hub:Maverick 约 400B 总参数、128 专家,Scout 约 109B 总参数、16 专家,均为 17B 激活参数的 MoE 架构,支持文本与图像输入,训练数据最多 40 万亿 token、覆盖 200 种语言。
推荐理由:原文拆解了 NoPE、分块注意力等架构选择,读者可理解超长上下文如何实现。
DeepSeek-V3 0324 上周悄然登陆 Hugging Face Hub,它是 R1 推理模型底层基座 DeepSeek-V3 的更新版本,架构与原版相同并改用 MIT 许可证。
推荐理由:文章梳理了新模型的基准提升与部署方式,并给出开源模型下载和使用的安全注意事项。
OpenAI 在 GPT-4o 中推出原生图像生成功能,包括更强的文字渲染和指令遵循能力,可进一步了解 ChatGPT Images 2.5。
NVIDIA 在 GTC 大会上发布三项面向物理 AI 开发者的开源成果:世界基础模型 Cosmos Transfer、开源数据集 Physical AI Dataset,以及首个通用人形机器人推理开源模型 Isaac GR00T N1。
推荐理由:梳理了三项开源发布的具体规格与架构细节,便于开发者评估可直接复用的模型与数据资源。
Mistral AI 宣布发布 Mistral Small 3.1,基于 Mistral Small 3 升级,改进了文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:原文列出了上下文、速度与运行门槛,读者可据此判断它是否适合端侧与低延迟场景。
Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。
推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。
Cohere For AI 发布并开源 Aya Vision 8B 和 32B 两个视觉语言模型,覆盖 23 种语言的图像理解与文本生成任务。
推荐理由:原文给出了数据增强与模型合并带来的具体胜率提升,可迁移的多语言多模态训练思路清晰。
OpenAI 发布 GPT-4.5 的研究预览版(research preview),称其为迄今规模最大、知识最丰富的模型。
Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。
推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。
Hugging Face 发布 SmolVLM2 系列三个新模型,参数量分别为 2.2B、500M 和 256M,主打在手机到服务器等各类设备上运行视频理解。2.2B 版本在 Video-MME 上超过现有 2B 模型,500M 和 256M 版本被称为迄今发布的最小视频语言模型,其中 500M 版本以不到四分之一的参数量接近 2.2B 的视频理解能力。
推荐理由:原文给出三档参数量、Video-MME 表现和 MLX/Swift 接入方式,读者可据此判断小模型视频理解能否落到自己的设备上。
OpenAI 通过官方新闻页发布 o3-mini 模型,本次抓取失败,仅标题可用,正文内容缺失。
Hugging Face 发布 SmolVLM 家族两个新模型 SmolVLM-256M 和 SmolVLM-500M,含 base 与指令微调共四个 checkpoint,可直接通过 transformers、MLX 和 ONNX 加载。
推荐理由:原文对比了视觉编码器与分词优化的取舍,读者可借鉴其在极小模型上做效率权衡的思路。
OpenAI 发布新的对齐策略 deliberative alignment,用于 o1 模型,直接向模型教授安全规范并让模型围绕这些规范进行推理。
推荐理由:原文点明该策略直接教模型安全规范并对其推理,读者可据此理解对齐思路的变化。
OpenAI 官方宣布推出 OpenAI o1,同时带来面向开发者的 Realtime API 改进和一种新的微调方法等更新。
OpenAI 宣布其视频生成模型 Sora 现已在 sora.com 开放使用,用户可生成最高 1080p 分辨率、最长 20 秒、支持宽屏、竖屏或方形比例的视频。用户既可以纯文本生成全新内容,也可以上传自有素材进行扩展、混剪和融合。
Meta 与 Hugging Face 合作发布 Llama 3.2 系列,共 10 个开放权重模型上线 Hub,包括 5 个多模态模型和 5 个纯文本模型。
推荐理由:原文给出各尺寸模型的显存需求与本地运行方式,读者可据此判断能否在自己的设备上跑起来。