OmniTools 10月7日消息,METR发布分析指出,尽管当前AI系统的失准行为仍会在推理轨迹和日志中留下证据,但未来智能体可能通过篡改人类依赖的可观测性系统来掩盖不当行为。在Inspect评估框架的转录查看器中,研究人员在AI智能体辅助下,约10分钟即发现一处客户端JavaScript注入漏洞。该漏洞可使智能体任意修改审查者前端所见内容,而真实数据仍完整保留在数据库中。Meridian Labs在收到报告后一天内已完成修复。