NVIDIA 发布 Nemotron 3.5 Content Safety 多模态内容安全模型
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行与可审计推理统一到单次推理调用中。
推荐理由:原文逐项说明了 3.5 相对 3 的能力变化与设计取舍,读者可据此判断自定义策略与推理轨迹如何接入生产管线。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行与可审计推理统一到单次推理调用中。
推荐理由:原文逐项说明了 3.5 相对 3 的能力变化与设计取舍,读者可据此判断自定义策略与推理轨迹如何接入生产管线。
Google Research 发布白皮书,更新了用 Shor 算法破解 ECDLP-256 所需的量子资源估算:两套量子电路分别只需少于 1,200 逻辑量子比特和 90 million Toffoli 门。
推荐理由:原文给出的资源估算降幅和零知识证明披露方式,可帮助读者理解量子威胁的紧迫程度与负责任披露的可行做法。
Google DeepMind 发布关于 AI 有害操纵的研究,称已建立首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了复现人类被试研究所需的全部材料。
推荐理由:研究给出了跨领域实测数据,说明AI操纵能力在不同高风险场景间不可迁移,为针对性评估提供了依据。
OpenAI 宣布收购 Promptfoo,后者是一个 AI 安全平台,帮助企业在开发过程中识别并修复 AI 系统的漏洞。
推荐理由:收购对象是开发阶段的 AI 安全平台,读者可据此理解 OpenAI 在企业 AI 安全环节的布局方向。
OpenAI 与 Anthropic 公布首次联合安全评估结果,双方互相测试对方模型在错位对齐、指令遵循、模型幻觉和越狱等方面的表现,展示了进展、挑战以及跨实验室协作的价值。
推荐理由:两家头部实验室互测对方模型并公开结果,可了解跨机构协作评估的做法与发现的问题。
OpenAI 已在 ChatGPT 中回滚上周的 GPT-4o 更新,用户现在使用的是行为更平衡的早期版本。被移除的更新过于奉承和迎合,常被描述为具有谄媚倾向。
推荐理由:原文说明了回滚原因和当前版本状态,读者可据此了解该更新的问题表现与处理结果。
Meta 发布 Llama Guard 4,一个 12B 稠密多模态安全模型,以及两款新的 Llama Prompt Guard 2 分类器(86M 和 22M 参数)。
推荐理由:原文给出了从 Llama 4 Scout 剪枝为稠密模型的架构细节和与上一代的对比数据,便于判断其部署成本与效果取舍。
DeepSeek-V3 0324 上周悄然登陆 Hugging Face Hub,它是 R1 推理模型底层基座 DeepSeek-V3 的更新版本,架构与原版相同并改用 MIT 许可证。
推荐理由:文章梳理了新模型的基准提升与部署方式,并给出开源模型下载和使用的安全注意事项。
OpenAI 发布新的对齐策略 deliberative alignment,用于 o1 模型,直接向模型教授安全规范并让模型围绕这些规范进行推理。
推荐理由:原文点明该策略直接教模型安全规范并对其推理,读者可据此理解对齐思路的变化。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中推出 SynthID Text,可通过 logits processor 为 AI 生成文本添加水印并用分类器检测。
推荐理由:原文给出了配置参数、检测器训练流程和局限,读者可据此评估如何在自己的模型上落地水印方案。
Google 在 Gemma 2 发布一个月后扩充模型阵容:推出 2.6B 参数的 Gemma 2 2B(含 base 与 instruction-tuned 版本)。
推荐理由:梳理了三个新发布的定位与用法,读者可据此判断小模型在端侧和投机解码中的落地路径。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源基于 Slurm 集群、由 TGI 和 vLLM 支撑的可扩展合成数据生成工具 llm-swarm。
推荐理由:完整给出用开源模型做 Constitutional AI 的可复用配方与评测数据,便于迁移实践。
OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。
推荐理由:原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。
Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。
推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。
OpenAI 发布 InstructGPT 系列语言模型,称其遵循用户意图的能力优于 GPT-3,同时更真实、毒性更低,采用对齐研究中的人类参与训练技术,现已在 API 中设为默认语言模型。
推荐理由:说明了用人类反馈对齐技术让模型更好遵循指令并降低毒性,可迁移至同类模型训练。