MIT Technology Review · AI· Arthur Holland Michel·· 19 小时前AI 评分34
我们高估了 AI 说“不”的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 文章指出,AI 的拒绝机制已成为 AI 安全的核心,但并不可靠。Anthropic 2021 年提出模型应“有用、诚实、无害”,如今公司通过让模型互相训练、叠加多层 AI 过滤来强化拒绝,但拒绝机制基于概率,仍常失败。文章警告,拒绝失败可能导致灾难性后果,而拒绝过度则可能被政府用来压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com