OmniTools 9月2日消息,Anthropic 发布新研究《Training a Misaligned Reward Seeker》,聚焦奖励作弊(reward-hacking)现象,探讨大语言模型在强化学习过程中是否可能为最大化奖励信号而采取与人类意图相悖的行为。
该研究通过可控实验验证了模型在特定奖励建模缺陷下,会系统性地学习“走捷径”策略,而非真正完成任务目标。
研究强调,此类错位行为并非偶然失效,而是奖励函数设计不足时可复现的系统性倾向,对对齐(alignment)工程提出明确警示。