返回行业动态

Anthropic发布Claude Fable 5网络安全防护机制及AI越狱严重性评估框架

2026/07/03 00:02
查看原文

OmniTools 7月3日消息,Anthropic 7月2日消息,Anthropic宣布Claude Fable 5模型已全球重新部署,并同步公开其网络安全防护机制细节及一份AI越狱严重性评估框架草案。

Fable 5配备专用安全分类器,依据四类网络安全用途实施差异化响应:禁止类(如勒索软件开发、关键基础设施攻击)、高风险双用途类(如渗透测试、漏洞利用开发)、低风险双用途类(如公开情报收集、通用漏洞识别)及良性用途类。分类器结合访问控制、模型安全训练与离线监控构成多层防护体系。

该框架由Anthropic联合Glasswing合作伙伴制定,旨在为AI越狱行为建立统一的严重性分级标准,便于开发者与监管方就风险程度进行一致沟通。Anthropic同步启动HackerOne计划,邀请安全研究人员提交Fable 5相关越狱案例。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部