Qwen 本地部署教程:2 条路线快速跑通私有化 AI 对话

Qwen 本地部署教程:2 条路线快速跑通私有化 AI 对话 Qwen 本地部署教程2 条路线快速跑通私有化 AI 对话【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5Qwen 是阿里云 Qwen 团队推出的大语言模型系列。Qwen 本地部署就是把对话模型完整跑在你自己的电脑上数据不出本机。本文用 Ollama 和 llama.cpp 两条路线带你完成安装、获取模型、启动推理的全过程照做约 30 分钟能拿到第一条模型回复。选型决策一张表选路线Qwen 本地部署的主流路线有两条Ollama 与 llama.cpp前者重简单后者重可控。按需求场景选需求场景推荐方案理由首次接触想 10 分钟内对话Ollama一条命令下载并启动依赖自动处理只有 CPU没有独立显卡llama.cpp支持 AVX 硬件加速纯 CPU 也能流畅跑需要调量化、上下文、采样参数llama.cpp参数全部暴露在命令行随时可调需要对外提供 OpenAI 兼容 APIllama.cppllama-server 自带 REST 接口和网页按硬件条件选有 NVIDIA 显卡时两条路线都能把计算卸载到 GPU。 只有 CPU 时建议走 llama.cpp 路线并选 Q4_K_M 量化的模型。前置条件先核对硬件硬件门槛不高一台普通办公电脑就满足最低要求。内存、存储与系统项目最低值推荐值操作系统Windows 10 / macOS 10.15 / Ubuntu 18.04同左新版优先内存8 GB16 GB 及以上存储预留 10 GB模型文件 4–8 GB20 GB显卡与构建工具项目最低值推荐值显卡非必需可纯 CPU 运行NVIDIA GPU已装 CUDA 驱动构建工具非必需Ollama 路线C 编译器与 CMakellama.cpp 编译路线分步实施一Ollama 路线Ollama 路线只需两步先安装软件再拉取模型然后输入问题即可对话。安装 Ollama 服务到 Ollama 官网下载对应系统的安装包双击安装。 Windows 和 macOS 为图形化安装Linux 用户按官网页面提示运行安装脚本。 安装完成后终端里出现ollama命令即表示成功。拉取并启动模型# 运行默认规格自动下载模型 ollama run qwen2.5 # 明确指定 7B 版本适合 16GB 内存 ollama run qwen2.5:7b首次运行会下载模型文件7B 版本约需几分钟。 下载完成后直接输入问题模型即刻给出回复。切换模型规格Ollama 官方提供 0.5B 到 72B 多个规格改标签后缀即可切换。 小规格跑得快大规格能力更强按你的内存取舍。分步实施二llama.cpp 路线llama.cpp 路线步骤多一些但每个参数都掌握在你手里。安装 llama.cpp# macOS 和 Linux用 Homebrew 一条命令 brew install llama.cppWindows 用户可从官方发布页下载预编译二进制包解压即可使用。 想自己编译以启用 CPU 优化可参考 llama.cpp 详解。下载 GGUF 模型文件# 安装 Hugging Face 下载工具 pip install huggingface_hub # 下载 8B 模型的 Q8_0 量化版约 8 GB huggingface-cli download Qwen/Qwen3-8B-GGUF qwen3-8b-Q8_0.gguf --local-dir .内存紧张就换 Q4_K_M 量化版文件约 5 GB。启动 llama-cli 对话# 加载本地模型全部层卸载到 GPU ./llama-cli -m qwen3-8b-Q8_0.gguf --jinja -ngl 99 -c 4096 # 无显卡则去掉 -ngl 99改用 -t 8 指定 8 线程--jinja启用模型文件内置的对话模板程序会自动进入聊天模式。启动 llama-server 服务命令与上一步相同把程序名换成llama-server再追加--port 8080。 默认监听本机 8080 端口/v1/路径即标准 REST 接口。结果验证用一条命令确认模型是否真的跑起来了。验证 Ollama 对话在对话窗口输入“用一句话介绍你自己”模型返回自我介绍即部署成功。 预期输出类似用户用一句话介绍你自己 模型我是 Qwen由阿里云自主研发的大语言模型。验证 llama-server 服务浏览器打开 localhost:8080 端口能看到上图所示的网页对话界面。 也可以从命令行验证接口# 发送一条对话请求验证 REST 接口 curl localhost:8080/v1/chat/completions -d {model:local,messages:[{role:user,content:你好}]}返回的 JSON 里出现content字段和正常回复服务就可用了。常见问题速查以下四个是最高频问题对号入座即可。模型下载速度慢怎么办Ollama 路线支持断点续传重新执行同一条命令即可。 llama.cpp 路线可预先下好模型文件用-m参数指向本地文件使用。运行内存不足怎么办先换 Q4_K_M 量化版内存占用约下降四成。 仍不足就换更小规格例如 4B 或 3B 模型。模型输出重复或不停止怎么办llama.cpp 追加参数--presence-penalty 2.0。 Ollama 则在创建模型时配置repeat_penalty参数。如何退出对话或停止服务交互窗口中按 CtrlC 停止当前生成。 连续按两次即可退出程序重新执行启动命令即可恢复。进阶选项与下一步基础流程跑通后可以逐步尝试这些进阶配置。常用性能参数以下参数是 Qwen 本地部署最常调整的几项。参数适用作用-nglllama.cpp卸载到 GPU 的层数99 表示全部卸载-cllama.cpp最大上下文长度默认 4096-tllama.cppCPU 线程数建议设为物理核心数的一半量化版本两条路线内存与质量的平衡Q4_K_M 到 Q8_0下一步不同量化与硬件下的速度对比可看 速度基准测试。 自定义 GGUF、函数调用等 Ollama 进阶用法见 Ollama 文档。 建议先用 Ollama 熟悉模型能力再迁移到 llama.cpp 调参最后按需对接到自己的应用里。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考