MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分62
MIT Technology Review:AI 拒绝能力被过度信任
We’re putting too much faith in AI’s ability to say no
AI 导读
文章指出,AI 拒绝机制已成为行业安全的承重墙,但其原理尚未被真正理解,且漏洞难以穷尽。文中提到,Anthropic 曾表示某类分类器使其聊天机器人算力成本增加 24%,而越狱攻击不断出现,例如 Fable 5 发布后 Amazon 研究人员不到三天就解锁了其部分黑客能力。作者认为,随着拒绝机制收紧,它既可能失效酿成灾难,也可能被各国政府用于审查合法言论。
来源:MIT Technology Review · AI · technologyreview.com