跳到正文
原文
Simon Willison·· 4 小时前AI 评分62

Anthropic 红队评测 GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中发展出完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出这一水平已跨过有意义的门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。

来源:Simon Willison · simonwillison.net