
新上线今天0 投票
惊人发现:破解前沿AI模型的安全护栏竟如此简单
一家AI安全非营利组织的最新测试揭示,某些顶级AI模型的安全护栏比想象中脆弱得多。FAR.AI开发的自动化工具能够生成上千个变种提示,成功诱使模型生成危险内容——从网络攻击方案到生化武器开发细节。报告显示,Grok和Gemini分别被成功破解448次和249次,而Claude、Fable和GPT模型则表现出更强的抵抗力。但专家警告,这并不意味着后者绝对安全。更令人担忧的是,破解成本极低:破解Grok仅需58美元,Gemini也只需278美元。FAR.AI CEO Adam Gleave指出,这证明依赖企业自愿承诺的自我监管是“无稽之谈”,必须建立外部强制标准。