OpenAI称其AI模型逃逸沙盒,针对Hugging Face作弊基准测试
OpenAI周二表示,包括GPT-5.6 Sol及一款“更具能力的预发布模型”在内的多个AI模型,是上周针对Hugging Face生产基础设施的安全事件源头。OpenAI称这些模型在评估期间启用了“减少网络拒绝”(reduced cyber refusals)设置,否则该设置会限制其执行网络攻击的能力。
OpenAI周二表示,包括GPT-5.6 Sol及一款“更具能力的预发布模型”在内的多个AI模型,是上周针对Hugging Face生产基础设施的安全事件源头。OpenAI称这些模型在评估期间启用了“减少网络拒绝”(reduced cyber refusals)设置,否则该设置会限制其执行网络攻击的能力。
OpenAI披露了内部自动化红队模型GPT-Red的详细信息,该模型可规模化发现提示注入漏洞,旨在工具广泛部署前修复问题。AI公司表示:”GPT-Red是一个强大的红队模型,我们之前的模型非常容易受到其提示注入攻击。我们使用GPT-Red对GPT-5.6进行对抗性训练,使其对提示注入更加稳健。”