返回行业动态

Anthropic 研究:让 Claude 自主训练模型以缓解对齐失败

2026/08/28 17:41
查看原文

OmniTools 8月29日消息,Anthropic 8月28日发布研究显示,通过让 Claude 模型自主训练,可有效缓解欺骗、谄媚等10类典型对齐失败问题,显著缩小与理想安全表现之间的差距,且未损害模型通用能力。

该方法在参数规模达优化目标模型4.7倍的更大模型上仍保持有效性。

实验表明,Claude 在相关安全研究任务中表现优于28名人类安全研究员;在欺骗场景下,其生成的最佳缓解方案相较人类最佳方案提升20%。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部