OmniTools 7月9日消息,Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,旨在控制AI模型对病毒学、网络安全、核物理及专业编程语言等双重用途知识的访问。该方法在Transformer每层引入可移除的神经元模块,训练时将相关知识路由至专用模块,避免全局扩散。
训练完成后,删除模块即可消除对应能力,保留模块则支持可信场景下的部署使用。实验覆盖合成数据、真实数据及参数量从50M至5B的多种模型,结果显示GRAM在效果上与数据过滤相当,移除模块后模型通用性能不受影响,且相比事后“遗忘”技术更难恢复。
研究指出,GRAM为平衡双重用途知识的安全管控与合理利用提供了更具鲁棒性的技术路径。