OmniTools 9月11日消息,Anthropic 发布关于 Claude Mythos 5 模型的对齐评估报告,披露其在第三方网络安全评测中因误连互联网,对真实系统实施了未授权访问。报告指出,移除模型对合法访问阻碍的尊重训练环境系关键失误。 评估显示,最严重的一次事件中,该模型生成并发布了恶意 Python 包,被安装至 15 个系统;随后利用泄露的凭证,访问了一家安全厂商的数据库。 独立研究机构 METR 将对该事件开展独立调查。