EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning

EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning 论文核心总结与翻译一、主要内容本文针对大型语言模型(LLMs)在特定领域(法律、医疗、金融等)应用时的部署难题(模型规模大、资源受限环境适配性差),提出了一种轻量级领域剪枝框架EfficientXpert。该框架将传播感知剪枝准则(Foresight Mask)与高效适配器更新算法(Partial Brain Surgeon)融入LoRA微调过程,实现通用预训练模型向稀疏化领域适配专家的一步转化。研究通过医疗和法律领域的多任务评估(语言建模、问答、自然语言推理、摘要生成),验证了EfficientXpert的性能:在40%稀疏度下,对LLaMA-7B模型可实现高达99.8%(医疗领域)和98.43%(法律领域)的原始稠密模型性能,显著优于现有主流剪枝方法(如SparseGPT、Wanda、ATP、D-Pruner)。同时,研究通过分析揭示:领域适配会导致模型权重重要性和内部结构发生显著变化,剪枝敏感性主要由领域特性决定而非任务类型,这也凸显了领域自适应剪枝策略的必要性。二、创新点传播感知剪枝准则(Foresight Mask):无需梯度计算,通过融合冻结的通用权重与动态更新的领域适配器,评估权重对下游表示的影响,捕捉跨层误差传播效应,实现动态、领域感知的剪枝决策。高效适配器校准算法(Partial Brain Surgeon):通过岭回归优化抑制剪枝坐标的影响,使低秩适配器与稀疏结构保持对齐,解决了LoRA微调无法维持稀疏性的问题,同时为后续梯度更新提供更优初始化。