OmniTools 7月3日消息,Anthropic 7月2日消息,Anthropic宣布Claude Fable 5模型已全球重新部署,并同步公开其网络安全防护机制细节及一份AI越狱严重性评估框架草案。
Fable 5配备专用安全分类器,依据四类网络安全用途实施差异化响应:禁止类(如勒索软件开发、关键基础设施攻击)、高风险双用途类(如渗透测试、漏洞利用开发)、低风险双用途类(如公开情报收集、通用漏洞识别)及良性用途类。分类器结合访问控制、模型安全训练与离线监控构成多层防护体系。
该框架由Anthropic联合Glasswing合作伙伴制定,旨在为AI越狱行为建立统一的严重性分级标准,便于开发者与监管方就风险程度进行一致沟通。Anthropic同步启动HackerOne计划,邀请安全研究人员提交Fable 5相关越狱案例。