MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-... 📅 发布时间:2026/9/4 8:48:01 👁 浏览次数: MultiPL-MoE论文总结与关键部分翻译一、论文主要内容总结1. 研究背景与问题当前大型语言模型(LLMs)虽在代码生成领域表现出色(如GPT-4、Qwen2.5-coder),但在多编程语言生成任务中存在显著短板:高资源编程语言(如Python、Java、C++)性能优异,而低资源编程语言(如Rust、Go、Ruby,其在线数据和训练数据均有限)性能极差。现有提升多编程语言能力的方法存在两大问题:一是通过多语言数据继续训练基础模型,计算成本极高;二是通过特定低资源数据微调模型,会导致基础模型原有代码能力严重“灾难性遗忘”。2. 核心思路将多编程语言(MultiPL)视为多自然语言的特殊案例,借鉴自然语言扩展中基于混合专家(MoE)架构的“升级循环”技术(可有效扩展语言能力并避免灾难性遗忘),提出MultiPL-MoE——一种通过混合专家架构实现LLMs多编程语言扩展的模型,在有限计算资源下,同时提升低资源语言性能并保留高资源语言能力。3. 模型架构MultiPL-MoE通过“升级循环”改造基础LLM的前馈网络(FFN)层,核心是结合令牌级MoE与段级MoE,实现细粒度学习令牌语义特征与段级语法特征:令牌级MoE:采用传统“令牌选择专家”路由策略,加入共享专家(固定参数,捕捉通