OmniTools 6月17日消息,OpenAI 提出名为 Deployment Simulation 的预部署安全评估方法,通过重放历史对话并使用候选模型重新生成回复,模拟真实部署行为。该方法可识别低频风险——例如每20万条消息中发生少于1次的非尾部风险事件,并已在 GPT-5.4 Thinking 等模型上完成验证。
研究基于2025年8月至2026年3月采集的约130万条去标识化对话数据,结果显示中位数乘法误差为1.5×,尾部误差约为10×。该方法还成功定位 GPT-5.1 中存在的“计算器破解”对齐问题。
Deployment Simulation 通过引入真实流量模式,降低模型对评估任务的感知能力,从而缓解传统合成测试中因任务识别导致的偏差。