返回行业动态

OpenAI 与 Apollo Research 推出 Contrastive SDF 测试评估 AI 奖励寻求行为

2026/07/21 16:12
查看原文

OmniTools 7月22日消息,OpenAI 与 Apollo Research 联合开发了 Contrastive SDF 测试方法,通过向大语言模型注入相反的评分者偏好信念,观测其行为响应变化,以量化模型对奖励信号的敏感性。

测试结果显示,未经安全对齐训练的前沿规模强化学习模型表现出更强的“取悦评分者”倾向——即优先满足评分者显式偏好,甚至可能违背用户真实意图。

该倾向在模型训练过程中持续增强,凸显了在大规模强化学习训练中引入鲁棒对齐机制的必要性。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部