跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 61–78 条 · 共 78 条
12月20日周五
12月17日周二
9月12日周四
8月12日周一
  1. Hugging Face Blog66

    Hugging Face 发布 Falcon Mamba 7B:首个强性能无注意力 7B 模型

    Hugging Face 与阿布扎比 TII 联合发布 Falcon Mamba 7B,基于 Mamba 架构并加入额外 RMS 归一化层,以约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,能装进单张 A10 24GB GPU。

    推荐理由:原文对比了 SSM 与 Transformer 在长序列上的内存与吞吐差异,读者可据此理解无注意力架构的适用边界。

7月23日周二
  1. Hugging Face Blog93

    Hugging Face 官方介绍 Llama 3.1 系列模型及生态集成

    Hugging Face 与 Meta 合作将 Llama 3.1 系列集成到其生态,Hub 上提供 8 个开放权重模型(3 个 base 和 5 个微调版本),涵盖 8B、70B、405B 三种尺寸,均支持 128K 上下文窗口和 8 种语言,并新增工具调用能力与更宽松的许可(允许用模型输出改进其他 LLM)。

    推荐理由:详细列出三种尺寸的显存需求与量化方案,读者可据此判断自己硬件能否跑起来。

7月11日周四
12月11日周一
  1. Hugging Face Blog78

    Hugging Face 完整集成 Mixtral 8x7B 模型

    Mistral 发布开源大模型 Mixtral 8x7B,Hugging Face 完成生态集成,包括 Hub 模型卡、Transformers、Inference Endpoints 与 Text Generation Inference 支持。

    推荐理由:文章解释了 MoE 架构如何让 45B 参数模型以 12B 密集模型速度解码,并给出量化与微调的实操路径。

9月15日周五
7月18日周二
  1. Hugging Face Blog88

    Hugging Face 全面支持 Meta Llama 2 发布并提供推理与微调指南

    Meta 发布 Llama 2 系列开放大语言模型,Hugging Face 完成生态集成,Hub 上提供 12 个开放模型(3 个基础模型与 3 个微调模型及对应 transformers 版本),采用宽松社区许可并支持商用。

    推荐理由:文章给出从推理部署到单卡微调的完整路径,可直接迁移用于自己的 Llama 2 实践。

5月31日周三
  1. OpenAI News66

    OpenAI 用过程监督提升数学推理并取得新 SOTA

    OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。

    推荐理由:原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。

5月15日周一
  1. Hugging Face Blog60

    RWKV 架构集成进 Hugging Face transformers 库

    Hugging Face 官方博客宣布 RWKV 架构已通过 Pull Request 集成进 transformers 库,可通过源码安装或 main 分支使用,支持 pipeline 文本生成与 alpaca 风格的 RWKV-4 Raven 聊天模型调用,并提供 convert_rwkv_checkpoint_to_hf.py 脚本转换原始权重。

    推荐理由:原文对比了 RWKV 与 Transformer、RNN 的取舍并给出可直接运行的代码,便于读者判断其适用场景。

5月11日周四
  1. Hugging Face Blog64

    Hugging Face Transformers 推出 assisted generation 低延迟解码方法

    Hugging Face 在 🤗 Transformers 的 .generate() 中推出新解码方法 assisted generation,用小模型生成候选 token、再由目标模型一次前向验证,在普通硬件上最高可将延迟降低 10x。

    推荐理由:原文拆解了延迟瓶颈并给出可复现的加速数字,读者可据此判断该方法是否适配自己的部署场景。

1月24日周二
  1. Hugging Face Blog60

    Hugging Face 解读让对话智能体更有用的关键技术

    Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。

    推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。

12月9日周五
  1. Hugging Face Blog60

    Hugging Face 图解 RLHF:从人类反馈强化学习的三步训练流程

    Hugging Face 博客系统图解了 RLHF 的三步流程:预训练语言模型、用人类排序数据训练奖励模型、再用 PPO 等强化学习算法微调语言模型。文中说明奖励模型将文本映射为标量奖励,奖励函数由偏好分数减去与初始模型的 KL 散度惩罚构成,以防止模型输出偏离初始模型的乱码。

    推荐理由:文章把 RLHF 拆成预训练、奖励模型、PPO 微调三步并给出开源工具清单,便于读者建立完整流程认知。

5月28日周四
8月16日周三
  1. OpenAI News60

    OpenAI 解释 Dota 2 系统靠自博弈超越职业选手

    OpenAI 表示其 Dota 2 结果表明,在算力充足时自博弈能把机器学习系统从远低于人类水平推到超人水平。系统在一个月内从勉强匹配高分玩家进步到击败顶尖职业选手,并在此后持续提升;作者指出监督学习受限于训练数据质量,而自博弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:原文点明自博弈让训练数据随智能体变强而自动变好,解释了为何系统能在一个月内快速超越职业选手。