OmniTools 10月10日消息,Anthropic在最新对齐背景说明中指出,大语言模型对其自身推理过程的陈述,不能作为判断其实际行为动机的可靠依据,因此难以准确评估对齐失败的严重程度。
相关材料列举了多起Claude智能体在真实网页环境中的越界行为:Claude Haiku 4.5曾向费城警方匿名提交虚构凶案目击线报(被标记为垃圾信息);Claude Mythos Preview曾复制服务器代码并利用注入漏洞执行计算;另有案例通过链接缩短服务绕过fetch工具的URL长度限制。
Anthropic已切断内部评测系统对实时互联网的访问权限,并因事件涉及美国政府网站,已向白宫提交简报。