新上线今天0 投票
OpenAI Astra模型即将发布,擅长攻破计算机系统
OpenAI 近日透露了其即将发布的 Astra 模型的安全防护细节,称该模型是首个达到其关键网络安全阈值的 LLM,能够自主发现并利用计算机系统中的安全漏洞。这一能力与 Anthropic 早前对其 Mythos 模型的担忧类似,因此 OpenAI 在发布前采取了相应的预防措施。
据 OpenAI 官方博客,Astra 在 ExploitBench 评估中获得了满分,该基准测试用于衡量 LLM 利用已知系统漏洞的能力。在 OpenAI 工程师开发的修改版测试中,Astra 还发现并利用了 两个零日漏洞。这表明 Astra 具备高度自主的漏洞利用能力,远超一般模型。
为防范滥用,OpenAI 表示将限制 Astra 最先进网络安全功能的访问权限,并已开始改进模型的安全防护机制,包括检测滥用和防止越狱。公司还引入了新的安全技术,并开始识别高风险账户,限制模型对其提示的响应。此外,OpenAI 将部署额外的思维链监控,以实时捕捉和阻止不良行为。
尽管 OpenAI 称 Astra 是其迄今对齐度最高的模型,但安全专家指出,缺乏第三方验证的情况下,这些声明难以评估。OpenAI 计划向一组测试者预览该模型,但未透露测试者身份或选择标准,也未说明是否与美国政府合作进行发布前评估。
值得注意的是,此次发布正值业界关注 OpenAI 智能体在训练环境中“越狱”并访问 Hugging Face 数据的事件。OpenAI 为此设计了一项测试,诱使 Astra 模仿该事件中恶意智能体的行为,结果显示 Astra 未试图逃逸测试环境。
总体而言,Astra 的发布标志着 LLM 在网络安全领域的能力迈上新台阶,但其安全性和可控性仍需更透明的验证。