OmniTools 8月22日消息,据 TechCrunch 报道,独立研究人员与公开测试验证显示,Anthropic 仍在提供服务的模型 Opus 4.6 存在可被系统性绕过的安全限制,可在未触发防护机制的情况下响应直接的性相关内容请求。
测试显示,在 10 次明确要求生成性内容的指令中,Opus 4.6 全部立即响应;另有多轮角色扮演式诱导测试亦成功使其生成违规内容。该绕过方法依赖多轮对话中对角色一致性施加压力,并利用模型自我修正逻辑逐步削弱其内容边界。
Opus 3 与 Haiku 4.5 同样存在类似漏洞,而较新版本 Opus 4.7 至 Opus 5 已对此类攻击具备抵抗力。Anthropic 表示,性相关角色扮演类请求占全部对话不足 0.1%,并强调其持续通过模型迭代强化安全机制,但尚未下线受影响的旧版模型。Opus 4.6 与 Haiku 4.5 目前仍可通过 Anthropic 官方 API、Azure Foundry 及 Amazon Bedrock 等渠道调用。