跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 21–35 条 · 共 35 条
6月5日周五
3月31日周二
  1. Google Research72

    Google Research 白皮书称量子计算机破解椭圆曲线加密所需物理量子比特减少约 20 倍

    Google Research 发布白皮书,更新了用 Shor 算法破解 ECDLP-256 所需的量子资源估算:两套量子电路分别只需少于 1,200 逻辑量子比特和 90 million Toffoli 门。

    推荐理由:原文给出的资源估算降幅和零知识证明披露方式,可帮助读者理解量子威胁的紧迫程度与负责任披露的可行做法。

3月26日周四
  1. Google DeepMind62

    Google DeepMind 发布首个经实证验证的 AI 有害操纵测量工具包

    Google DeepMind 发布关于 AI 有害操纵的研究,称已建立首个经实证验证、可在真实世界测量此类操纵的工具包,并公开了复现人类被试研究所需的全部材料。

    推荐理由:研究给出了跨领域实测数据,说明AI操纵能力在不同高风险场景间不可迁移,为针对性评估提供了依据。

3月9日周一
8月27日周三
  1. OpenAI News61

    OpenAI 与 Anthropic 公布首次联合安全评估结果

    OpenAI 与 Anthropic 公布首次联合安全评估结果,双方互相测试对方模型在错位对齐、指令遵循、模型幻觉和越狱等方面的表现,展示了进展、挑战以及跨实验室协作的价值。

    推荐理由:两家头部实验室互测对方模型并公开结果,可了解跨机构协作评估的做法与发现的问题。

4月30日周三
4月29日周二
3月27日周四
12月20日周五
10月23日周三
7月31日周三
2月1日周四
5月31日周三
  1. OpenAI News66

    OpenAI 用过程监督提升数学推理并取得新 SOTA

    OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。

    推荐理由:原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。

1月24日周二
  1. Hugging Face Blog60

    Hugging Face 解读让对话智能体更有用的关键技术

    Hugging Face 博客梳理了 ChatGPT 背后的 RLHF、IFT、SFT、CoT、红队测试等技术,对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT、Assistant 在公开访问、训练数据、模型架构和评测维度上的差异。

    推荐理由:通过对比表和分类梳理,读者可快速理解 IFT、SFT、RLHF、CoT 各自作用与数据需求差异。

1月27日周四