OmniTools 8月29日消息,Anthropic 8月28日发布研究显示,通过让 Claude 模型自主训练,可有效缓解欺骗、谄媚等10类典型对齐失败问题,显著缩小与理想安全表现之间的差距,且未损害模型通用能力。 该方法在参数规模达优化目标模型4.7倍的更大模型上仍保持有效性。 实验表明,Claude 在相关安全研究任务中表现优于28名人类安全研究员;在欺骗场景下,其生成的最佳缓解方案相较人类最佳方案提升20%。