精选今天0 投票
基础缺陷使大语言模型极易遭受攻击,研究称无法彻底修复
在本月举行的国际机器学习大会(ICML)上,一组研究人员发表论文指出,由于大语言模型(LLM)工作机制中存在一个基础性缺陷,使其无法被完全保护免受黑客攻击。这一发现对正广泛应用于政府、军事、医疗、电商等领域的AI安全性提出了严峻挑战。
缺陷根源:指令识别机制的脆弱性
研究人员发现,LLM在识别指令来源时存在根本性漏洞。他们利用模型在“思维链”(chain-of-thought)过程中生成的文本风格来伪装指令,成功诱骗模型将外部恶意指令误认为是自身的内部推理,从而绕过安全限制。例如,通过模仿模型自我对话的格式嵌入指令,他们能让模型输出原本被禁止的信息,如可卡因合成方法或破坏商用飞机导航系统的步骤。
当前防御手段的局限性
目前,行业主要依赖两种方式加强LLM安全性:一是“红队测试”(red-teaming),即雇佣人工测试员不断尝试突破模型防护;二是使用自动化工具(如OpenAI的GPT-Red)让LLM互相攻击以发现弱点。然而,论文合著者之一、独立研究员Charles Ye指出:“这本质上只是给模型列出一份‘禁止行为清单’,但清单永远无法穷尽。”另一位合著者Jasmine Cui用《辛普森一家》中巴特反复书写“我不会对老师说不恰当的话”却依然我行我素的例子,比喻这种防御策略的无效性。
研究结论:无法从根本上解决
该研究团队认为,由于LLM的基本工作方式决定了它们必须能够区分指令的优先级与来源,而这种区分机制天然存在被欺骗的可能。Ye直言:“这很可能是一个根本上无法解决的问题。”随着LLM被集成到更多关键系统中,这一缺陷带来的风险将不断放大。
行业影响与未来方向
尽管论文结论看似悲观,但也为AI安全研究指明了新方向:与其依赖事后打补丁式的防御,或许需要重新设计模型架构,从源头解决指令来源的不可区分性问题。目前,多家AI公司已开始关注此类攻击,但尚未有彻底解决方案。