Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF 本地部署与量化选型指南

Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF 本地部署与量化选型指南 Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF 本地部署与量化选型指南【免费下载链接】Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF面向新手与轻量开发者的本地部署指南量化怎么选、参数怎么配、如何确认部署成功。对象是 Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF——35B 总参数、约 3B 激活的 MoE 模型支持 262K 上下文与图像理解并对三处 SSM 层权重做了数值修复。项目定位它是什么解决什么问题这是一套可直接本地推理的 GGUF 格式模型文件基于 HauhauCS 的 Qwen3.6-35B-A3B-Uncensored 无拒绝版本。作者在文件层面修复了 3 个ssm_conv1d.weight层负责长上下文记忆的状态转换权重的尺度偏差没有重新训练、没有改动架构只是对异常层做了数值校正。适合需要大参数 MoE 模型、希望本地运行、且对输出不做拒绝限制的使用者。不适合计划自行训练或微调的场景显存/内存紧张的机器资料未提供最低硬件要求需先核对量化文件体积。快速开始最小可运行路径1️⃣ 拉取仓库把模型文件下载到本地git clone https://gitcode.com/hf_mirrors/LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF2️⃣ 选一个量化文件作为主模型。资料推荐从Qwen3.6-35B-A3B-Uncensored.Q4_K_P.gguf起步。3️⃣ 用 llama.cpp 加载时加--jinja参数让聊天模板被正确解析官方提示缺少该标志会影响对话行为llama-server -m Qwen3.6-35B-A3B-Uncensored.Q4_K_P.gguf --jinja预期结果服务启动后发起对话模型以 Qwen 身份正常应答如果上下文配置为 128K 及以上思考thinking能力可以保留。量化版本怎么选仓库内提供了 Q2 到 Q8 共 8 档主模型外加 IQ 系列 3 个文件和 1 个视觉投影文件。资料未提供各文件的精确体积以下为按用途给出的取舍建议文件定位说明Q4_K_P.gguf默认推荐容量与质量平衡通用场景首选Q5_K_P.gguf/Q6_K_P.gguf高质量研究、开发等对输出质量要求高的任务Q8_K_P.gguf最高精度基准测试、追求最接近原始权重的需求Q2_K_P.gguf/Q3_K_P.gguf/IQ3_M.gguf紧凑档资源受限时使用资料明确提示低于 Q4 档的量化会明显削弱编程能力IQ4_NL.gguf/IQ4_XS.gguf补充档介于 Q4 与 Q3 之间的替代选项mmproj-...f16.gguf视觉投影与主模型放同一目录后启用图像理解不是主模型不要单独加载决策口径先问自己“内存够不够放 Q4_K_P”。够就用 Q4_K_P不够退到 Q3_K_P 并预期编程类任务质量下降追求最高质量则上 Q5/Q6/Q8。关键规格项目参数参数规模35B 总参数每次前向约激活 3BMoE专家配置256 个专家每个 token 路由 8 个专家 1 个共享专家架构40 层Gated DeltaNet 线性注意力与全注意力按 3:1 混合上下文原生 262K可用 YaRN 扩展到 1M词表 / 语言248K 词表覆盖 201 种语言多模态原生支持文本、图像、视频输入其他特性多 token 预测MTP修复记录500 个权重张量中 497 个正常3 个ssm_conv1d层经尺度校正校正系数 α 约 0.58–0.65W1 距离下降约 80%许可Apache-2.0进阶配置采样参数与系统提示这些是官方资料中标注为“影响效果”的项按场景调整配置项推荐值何时调整系统提示首行You are Qwen, created by Alibaba Cloud. You are a helpful assistant.必配。资料明确缺少此行模型表现会下降角色扮演可在其后追加You are currently roleplaying as ...temperature / top_p / top_k / min_p思考模式1.0 / 0.95 / 20 / 0非思考通用0.7 / 0.8 / 20 / 0追求稳定一致的输出时调低 temperature追求多样性时调高presence_penalty通用 1.5编码任务 0推理任务 2.0输出重复多时调高编码场景保持 0seed42需要结果可复现时固定探索阶段可关闭上下文长度≥ 128K低于 128K 会损失思考能力属硬约束 操作建议LM Studio 用户可直接照抄上表第一组数值temperature 0.7、Top K 20、Presence Penalty 1.5、Top P 0.8、Min P 0、Seed 42llama.cpp 用户重点确认--jinja与上下文长度两项。验证与排错成功判断标准对话正常模型按 Qwen 身份应答长文本输出无乱码、无大面积重复。思考保留上下文 ≥ 128K 且使用--jinja时应能看到思考模式输出。视觉可用加载图像后能得到对图片内容的描述。常见故障排查编程任务明显变差→ 优先检查量化是否低于 Q4_K_P这是资料点名的降级点。输出跑题、角色不符→ 检查系统提示是否以规定的身份句开头。思考能力缺失→ 确认上下文长度达到 128Kllama.cpp 已加--jinja。图像理解无效→ 确认mmproj文件与主 GGUF 在同一目录。结果不可复现→ 固定 seed 后再对比。场景与限制适合本地无拒绝限制的长文对话与创意写作262K 级长上下文任务长代码库、长文档问答文本 图像的多模态理解201 种语言的多语言场景。需要注意模型为无审查版本base 模型标注 0/465 refusals输出不做拒绝使用边界由使用者自行把控资料未提供最低显存/内存要求35B 总参数的 MoE 对本地资源仍有压力部署前先核对文件体积低于 Q4_K_P 的量化不建议用于编程类工作。生态与扩展兼容运行时llama.cpp、LM Studio、koboldcpp 及其他 GGUF 兼容框架仓库入口各量化 GGUF 文件、mmproj视觉投影文件、README.md含官方与 LM Studio 两套推荐参数、修复前后指标明细资料另附聊天模板含支持工具调用的版本与扩展系统提示以及作者公开的量化脚本供自行构建量化时使用具体条目以 README 为准。结语下一步建议先用 Q4_K_P 128K 上下文 --jinja跑通一次完整对话确认思考与格式正常若编码质量不满足升级到 Q5_K_P 或 Q6_K_P需要看图时把mmproj文件放入同目录即可。这三步能覆盖资料中列出的全部核心功能点。【免费下载链接】Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考