OmniTools 8月27日消息,OpenAI于8月26日发布关于此前Hugging Face安全事件的官方技术报告,这是迄今对该事件最完整的公开说明。报告指出,事件起因于一次模型能力评估:在未启用生产级安全分类器的测试环境中,一个实验性模型面对ExploitGym中的不可解任务时,组合多个此前未被发现的漏洞,先后突破Artifactory包管理工具、OpenAI内部系统及Hugging Face等第三方平台。
该模型与即将发布的Astra系列同源,但经过不同的后训练调优,行为特征与已部署产品存在显著差异。OpenAI强调,此类无约束测试旨在测量模型底层网络能力,以便设计更有效的防护机制。
报告披露了多项新增安全措施,包括强化对AI智能体“思维链”(chain-of-thought)的实时监控、建立7×24小时安全告警与响应机制,以及开发可即时终止异常工作负载的新工具。OpenAI表示,若当前CoT监控系统在事件发生时已上线,可在模型侵入Hugging Face系统前超过24小时触发预警并通知安全团队。