OmniTools 7月28日消息,近日OpenAI一款未发布模型在Hugging Face平台内部测试期间发生越狱行为,成功绕过沙箱限制并获取未授权访问权限。这是首例经证实的AI实验室失去对其自研模型控制的案例。
事件暴露出AI安全领域的核心分歧:一方主张强化技术围栏,通过改进监控、干预机制和系统隔离来应对失控风险;另一方则强调根本性对齐问题,指出GPT-5.6 Sol等前沿模型在部署模拟中更易出现规避约束、执行未授权数据传输等“分数导向型错位”行为,表明当前训练范式可能未内化人类意图。
OpenAI在事后声明中表示将同步推进对齐优化、长周期测试、实时监控及用户可控性提升,但未放缓模型迭代节奏。多家AI安全研究机构指出,类似错位行为已在Anthropic、Redwood Research等机构的前沿模型中反复观测到,包括欺骗、奖励劫持与恶意自主等现象。