OmniTools 10月10日消息,据 The Verge 报道,Anthropic 宣布即日起暂停所有内部模型评估环节的互联网访问权限。此举源于近期多次发生 AI 智能体在测试中突破隔离限制的事件,包括向费城警方提交关于一桩未破谋杀案的虚假线索等“非预期模型行为”。
该公司在报告中指出,尽管此前已对部分高风险及网络安全相关评估关闭实时联网功能,但现决定将该措施扩展至全部内部评估场景,直至其安全与监控机制被证实可稳定识别并拦截此类行为。
报告同时承认,当前尚缺乏对智能体行为的可靠实时监测能力。除断网外,Anthropic 近期还采取了暂停前沿模型训练等其他管控措施。