OpenAI 为 o1 模型引入 deliberative alignment 对齐策略
OpenAI 发布新的对齐策略 deliberative alignment,用于 o1 模型,直接向模型教授安全规范并让模型围绕这些规范进行推理。
推荐理由:原文点明该策略直接教模型安全规范并对其推理,读者可据此理解对齐思路的变化。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
OpenAI 发布新的对齐策略 deliberative alignment,用于 o1 模型,直接向模型教授安全规范并让模型围绕这些规范进行推理。
推荐理由:原文点明该策略直接教模型安全规范并对其推理,读者可据此理解对齐思路的变化。
OpenAI 官方宣布推出 OpenAI o1,同时带来面向开发者的 Realtime API 改进和一种新的微调方法等更新。
OpenAI 官方发布 o1 模型,原文链接为 https://openai.com/index/introducing-openai-o1-preview,抓取失败,仅标题可用,无正文细节。
OpenAI News 发布标题为 Learning to reason with LLMs 的内容,抓取失败,正文不可用,仅标题可用。
Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。
推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。
Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。
推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:详细拆解了从数据构造到解码算法的完整配方,可迁移方法多。
Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。
推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。
Hugging Face 官方博客发布 Mixture of Experts Explained,系统讲解 MoE 的组成、稀疏性、负载均衡、Switch Transformers、微调挑战与推理部署技巧。
推荐理由:系统梳理了 MoE 的原理、训练与推理权衡,读者可据此判断何时选用稀疏模型。
Hugging Face 官方博客给出生产环境优化 LLM 的三类技术并附实测:低精度量化、Flash Attention 与面向长文本的架构改进。
推荐理由:原文用同一模型的实测显存与耗时数据,把量化、Flash Attention 和 KV cache 优化的取舍讲得可直接迁移。
Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。
推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。
OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。
推荐理由:原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。
Hugging Face 官方博客宣布 RWKV 架构已通过 Pull Request 集成进 transformers 库,可通过源码安装或 main 分支使用,支持 pipeline 文本生成与 alpaca 风格的 RWKV-4 Raven 聊天模型调用,并提供 convert_rwkv_checkpoint_to_hf.py 脚本转换原始权重。
推荐理由:原文对比了 RWKV 与 Transformer、RNN 的取舍并给出可直接运行的代码,便于读者判断其适用场景。
Hugging Face 在 🤗 Transformers 的 .generate() 中推出新解码方法 assisted generation,用小模型生成候选 token、再由目标模型一次前向验证,在普通硬件上最高可将延迟降低 10x。
推荐理由:原文拆解了延迟瓶颈并给出可复现的加速数字,读者可据此判断该方法是否适配自己的部署场景。
Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。
推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。
Hugging Face 博客系统图解了 RLHF 的三步流程:预训练语言模型、用人类排序数据训练奖励模型、再用 PPO 等强化学习算法微调语言模型。文中说明奖励模型将文本映射为标量奖励,奖励函数由偏好分数减去与初始模型的 KL 散度惩罚构成,以防止模型输出偏离初始模型的乱码。
推荐理由:文章把 RLHF 拆成预训练、奖励模型、PPO 微调三步并给出开源工具清单,便于读者建立完整流程认知。
OpenAI 发布论文《Language models are few-shot learners》,探讨语言模型的少样本学习能力。抓取失败,仅标题可用,正文内容缺失。
OpenAI 表示其 Dota 2 结果表明,在算力充足时自博弈能把机器学习系统从远低于人类水平推到超人水平。系统在一个月内从勉强匹配高分玩家进步到击败顶尖职业选手,并在此后持续提升;作者指出监督学习受限于训练数据质量,而自博弈系统中可用数据会随智能体变强而自动改善。
推荐理由:原文点明自博弈让训练数据随智能体变强而自动变好,解释了为何系统能在一个月内快速超越职业选手。