通义千问 CLI 教程:三步跑起本地 AI 对话助手

通义千问 CLI 教程:三步跑起本地 AI 对话助手 通义千问 CLI 教程三步跑起本地 AI 对话助手【免费下载链接】QwenThe official repo of Qwen (通义千问) chat pretrained large language model proposed by Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen想让大模型只在终端里干活、数据不出本机通义千问 CLI 是阿里云开源 Qwen 的命令行入口一条命令就能在本地跑起对话、写代码、翻译和长文总结。 谁适合用它适合想在本地跑大模型、又不想搭复杂 Web 环境的你终端党cli_demo.py直接进交互输入即答流式输出适合边写边查显存有限者1.8B 模型 Int4 量化后生成 2048 token 约 2.9GB7B 约 8.2GB消费级显卡能扛服务化用户内置 OpenAI 风格接口 openai_api.py本地起个 API 给现有工具接二次开发微调、量化、部署脚本都放在仓库里能直接照着改 三步先跑起来第 1 步 安装依赖需要 Python 3.8、PyTorch 1.12、transformers 4.32。clone 下来装依赖即可git clone https://gitcode.com/GitHub_Trending/qw/Qwen cd Qwen pip install -r requirements.txt第 2 步 启动 CLI默认加载 7B Chat 模型首次会自动下载权重python cli_demo.py看到欢迎语和User提示符就成功了。没有 GPU 就加--cpu-only显存不够就换-c Qwen/Qwen-1.8B-Chat指定更小的模型。第 3 步 第一条对话直接输入问题回车等回复。想查命令随时敲:h。 核心能力拆解智能对话与知识问答中文问答和日常答疑是主力场景。输入把这段报错翻译成能执行的修复建议输出定位到索引越界原因给出带注释的修正代码代码生成与调试能写片段、也能解释算法HumanEval 0-shot 上 7B 约 29.9。输入用 Python 写一个带类型注解的快速排序输出完整可运行函数附边界情况说明长文本理解7B/72B 支持 32K 上下文大海捞针测试里长文检索命中率稳定。系统提示词定制1.8B/72B Chat 对系统提示词做过专门训练能角色扮演、改语言风格、设任务边界。工具调用基于 ReAct 原则支持函数调用和代码解释器工具选择准确率 7B 约 95.5%。 放进你的真实工作流场景一本地代码助手任务审一段函数。怎么配启动后敲:conf top_k5降低发散再贴入代码。得到逐行的问题清单和重写建议不用把代码发给外部服务。场景二长文档总结任务压一份 3 万字的报告。怎么问:conf max_new_tokens2048放开输出长度直接丢全文。得到结构化摘要关键结论带原文定位。场景三接进现有系统任务让脚本调用模型。怎么配跑python openai_api.py按 OpenAI SDK 方式改base_url指向http://localhost:8000/v1。得到一个本地私有 API支持流式和函数调用。 参数怎么调在 CLI 里用:conf 键值实时改:reset-conf一键还原:conf temperature0.5 :conf top_p0.8 :conf max_new_tokens512 :his生成参数建议区间影响适合任务temperature0.3~0.9越低越稳越高越发散技术问答取低创意写作取高top_p0.7~0.95采样候选池大小配合 temperature 微调top_k5~50只在前 k 个词里选收敛输出、防跑题max_new_tokens256~2048回复长度上限长文总结往上放seed任意整数固定随机性复现同一结果实战技巧长对话跑偏就:clh清历史再:cl清屏避免旧上下文带偏显存紧就上-c指定 Int4/Int8 量化权重速度更快、占用更小长序列先确认config.json里use_dynamic_ntk、use_logn_attn为true再更新代码️ 排错指南输出出现乱码旧版 tokenizer 逐 token 解码会产生无意义字节串。更新到最新代码即可默认配置已规避。回答跟指令对不上多半是加载了基础模型Qwen而不是Qwen-Chat。后者才做过对齐前者行为完全不同。报qwen.tiktokennot found这是分词器的合并文件普通 clone 拉不下来。用git lfs install后再 clone或单独补下该文件。flash-attention 装不上它是可选加速项只支持 Turing 之后的 NVIDIA 卡。不装也能正常跑不影响功能。显存装不下换更小模型、上 Int4/Int8、或把模型拆到多卡实在不行就--cpu-only慢慢跑。长序列又慢又差升级到最新代码并确认上面提到的 NTK 两个开关为true。 下一步与资源入口跑通 CLI 后用 recipes/ 里的 vLLM、FastChat 笔记把吞吐拉上去想定制领域知识看 finetune/ 的全参/LoRA/Q-LoRA 脚本量化再走 run_gptq.py深入模型细节读 tech_memo.md 和技术报告 QWEN_TECHNICAL_REPORT.pdf关键入口交互主程序 cli_demo.py Web 版 web_demo.py系统提示词写法 examples/system_prompt.md 工具调用 examples/react_prompt.md遇到问题先查 FAQ.md再看 README.md 的 Deployment 章节需要说明本仓库是 Qwen第一代系列的入口后续迭代已迁移到 Qwen2若追新特性建议留意该系列的最新仓库。【免费下载链接】QwenThe official repo of Qwen (通义千问) chat pretrained large language model proposed by Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考