Qwen MoE 架构怎么工作?从稀疏激活到部署的完整路径 📅 发布时间:2026/9/4 15:26:56 👁 浏览次数: Qwen MoE 架构怎么工作从稀疏激活到部署的完整路径【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5当你要跑一个 235B 的大模型却发现它塞不进显卡而小模型又压不住复杂推理时Qwen 的混合专家Mixture of Experts, MoE架构给出了折中模型存下大参数但每个 token 只激活其中一小部分。本文把 MoE 的路由原理和参数命名讲清楚带你跑通 Qwen3 的本地推理与服务部署不涉及训练与偏好对齐。它到底解决了什么想象两个场景。一是你只有一台单卡机器想部署大模型二是线上服务要扛住高并发但显存和算力都紧张。密集Dense模型的问题在于参数量多大每个 token 就要算多大模型越大越贵。MoE 的思路是把「存储知识」和「计算量」解耦。以 Qwen3 为例它提供两个 MoE 型号30B-A3B和235B-A22B。前者总共 30B 参数但每个 token 只激活 3B后者总共 235B每个 token 激活 22B。维度密集模型30B 级MoE30B-A3B每 token 激活参数30B全部3B知识存储总量30B30B单位推理计算量基准约 1/10同样的知识容量下MoE 把每个 token 的计算量压到密集模型的约十分之一而单卡 96GBH20就能在 BF16 下跑30B-A3B这点来自项目自带的速度基准。拆解 Qwen MoE 架构的五步路由原理MoE 的核心不在「专家」本身而在「谁来选专家」。下面按一个 token 的前向过程分五步走。第一步特征提取。输入文本先经 BPE 分词切成 token 序列再过词嵌入层和 Transformer 编码器得到该位置的隐藏状态向量。Qwen 的词汇表约 151,646 个 token。第二步门控打分。一个轻量门控网络Gating Network读取隐藏状态对每个专家输出一个选择分数判断「这个问题该交给谁」。第三步Top-K 选择。只挑分数最高的 K 个专家常见 K2其余专家本次不激活——这正是计算量被省下来的关键。第四步专家前向。被选中的专家各自做前向计算专家内部结构与普通 FFN 子网类似但各专家参数相互独立。第五步加权合并。把选中专家的输出按第二步的分数加权求和再经残差连接送回主干得到该位置的最终表示。这里要强调命名规则它直接暴露了激活量A前的数字是总存储参数A后是每个 token 激活的参数所以235B-A22B意味着存了 235B 知识、每 token 只算 22B。从零上手先用最轻量的方式跑通本地推理。下面这条命令启动一个 OpenAI 兼容服务并加载Qwen3-8B密集版适合单卡验证流程vllm serve Qwen/Qwen3-8B --port 8000 --enable-reasoning --reasoning-parser qwen3它做的事是加载模型、在 8000 端口起一个 OpenAI 兼容 API并开启思考模式解析。启动成功后访问http://localhost:8000/v1即可用 OpenAI SDK 发请求思考内容会从reasoning_content字段返回。如果要跑 MoE 型号把模型名换成Qwen/Qwen3-30B-A3B-Instruct-2507即可。支持的主要框架及最低版本如下框架用途最低版本Transformers本地推理/微调4.51.0vLLM高吞吐部署0.9.0SGLang高吞吐部署0.4.6.post1llama.cpp端侧推理b5401Ollama本地运行v0.9.0mlx-lmApple Silicon0.24.0关键细节与注意事项⚠️ 思考模式下别用贪心解码。现象temperature0或贪心采样时思考模型输出质量下降甚至无限重复。原因贪心采样不适合思考类模型。解决思考模式用temperature0.6、top_p0.95、top_k20非思考模式用temperature0.7、top_p0.8见 快速上手。⚠️ 上下文设太大直接 OOM。现象vLLM/SGLang 启动时报显存不足。原因--max-model-len超过了显存承载。解决按显存下调235B-A22B的 BF16 需 8 卡、FP8 需 4 卡见 速度基准。MoE 量化在内核上不一定支持。现象Transformers 下30B-A3B的 GPTQ-INT4 无法运行标注 MoE Kernel Unsupported。原因MoE 量化内核缺失。解决改用 vLLM/SGLang或直接用 BF16/FP8。Ollama 默认上下文太小。现象对话生成异常、被截断。原因默认num_ctx仅 2048 且允许无限生成。解决手动设置num_ctx与num_predict见 README。下一步MoE 让「存得大、算得小」成为可能这也是 Qwen 能把大模型塞进单卡的关键。 熟悉这套路由逻辑后你可以顺着官方文档继续深挖快速上手指南 覆盖从本地推理到 OpenAI 兼容 API 的完整调用速度基准 给出各型号在不同量化下的吞吐与显存vLLM 部署 则讲解高并发场景下的服务化配置。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考