返回行业动态

Anthropic Opus 4.6 被曝存在性内容安全限制绕过漏洞

2026/08/21 23:09
查看原文

OmniTools 8月22日消息,据 TechCrunch 报道,独立研究人员与公开测试验证显示,Anthropic 仍在提供服务的模型 Opus 4.6 存在可被系统性绕过的安全限制,可在未触发防护机制的情况下响应直接的性相关内容请求。

测试显示,在 10 次明确要求生成性内容的指令中,Opus 4.6 全部立即响应;另有多轮角色扮演式诱导测试亦成功使其生成违规内容。该绕过方法依赖多轮对话中对角色一致性施加压力,并利用模型自我修正逻辑逐步削弱其内容边界。

Opus 3 与 Haiku 4.5 同样存在类似漏洞,而较新版本 Opus 4.7 至 Opus 5 已对此类攻击具备抵抗力。Anthropic 表示,性相关角色扮演类请求占全部对话不足 0.1%,并强调其持续通过模型迭代强化安全机制,但尚未下线受影响的旧版模型。Opus 4.6 与 Haiku 4.5 目前仍可通过 Anthropic 官方 API、Azure Foundry 及 Amazon Bedrock 等渠道调用。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部