OmniTools 9月21日消息,Multiverse Computing 9月21日消息,研究团队提出一种新型大语言模型(LLM)深度剪枝方法,将选择移除哪些 Transformer 模块的问题建模为受约束的二元优化(CBO)问题,并映射至伊辛玻璃(Ising glass)自旋系统——一种具有全连接相互作用和固定自旋数的无序物理系统。
该方法通过二阶泰勒展开近似模型损失函数,构建包含模块独立重要性(对角项)与模块间耦合效应(非对角项)的 Hessian 矩阵,从而捕捉模块间的“多体”依赖关系。实验表明,在 Llama-3.3-70B-Instruct 模型 50% 深度压缩(移除 40/80 模块)且不微调条件下,其 MMLU 得分达 76.9,较当前最优基线方法(Block Influence)高出约 23 个百分点。
该方法已验证适用于异构架构,包括 NVIDIA Nemotron-3-Nano-30B-A3B-FP8(含 Mamba2、注意力与 MoE 层混合堆叠),在 AIME25 和 GPQA 等基准上亦优于基线。研究强调低能激发态(而非仅基态)常对应更优剪枝配置,凸显完整能谱搜索的价值。