从克隆仓库到打开聊天窗口:Text Generation Web UI 本地部署与调参笔记 📅 发布时间:2026/8/31 7:54:46 👁 浏览次数: 从克隆仓库到打开聊天窗口Text Generation Web UI 本地部署与调参笔记【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenText Generation Web UI下文简称 TGW是一个基于 Gradio 的文本生成界面克隆仓库、把模型文件放进指定目录就能在浏览器里和本地大模型对话。模型加载、提示词模板拼装、采样参数配置全部发生在服务端浏览器只负责显示和输入不上传任何内容。本文按部署 → 页面操作流 → 后端选型 → 参数数值的顺序写清每一步做了什么、为什么这么做适合会用终端但不熟 LLM 工具链的工程师以及想零配置跑起大模型网页版的普通用户。 如何完成 TGW 本地启动克隆、装环境、开端口启动路径很短。先拉代码git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui仓库根目录按平台各放了一个入口脚本start_linux.sh、start_windows.bat、start_macos.sh以 Linux 为例./start_linux.sh首次运行会自动下载 Miniforge在installer_files/下建好 Conda 环境并装好依赖然后拉起server.py——这一步要等几分钟之后每次启动都会很快。启动完成后浏览器访问http://127.0.0.1:7860即进入文本生成界面。如果你已手动装好 Conda 环境也可以直接python server.py。想让某些参数每次启动都生效比如自动加载某个模型把它们一行一个写进user_data/CMD_FLAGS.txt即可例如加一行--model my-model.gguf。模型来源把 GGUF 单文件模型放进 user_data/models/ 就能被自动识别多文件 safetensors 模型则放在该目录下的子文件夹中。 打开页面之后从输入框到切换后端的操作流默认落在 Chat 标签页。在底部输入框打字、点 Send模型回复会流式打出来把鼠标悬停在对话区上会出现 ☰ 菜单里面是 Regenerate重新生成最后一条、Continue续写当前回复、Impersonate让模型替你生成用户发言、分支和历史对话管理。真正决定怎么和模型说话的是侧栏的 Mode 下拉框按 CtrlS 可展开侧栏共三档instruct面向指令微调模型提示词按训练时的模板拼装可以理解为离线版对话框chat面向基座模型或角色扮演场景提示词是简单的角色名: 发言交替格式chat-instruct两者混合——用指令模型的模板去驱动一个自定义角色适合拿指令模型跑角色对话。在 Model 标签页加载模型时界面会尝试从 GGUF 元数据或tokenizer_config.json自动检测指令模板并填好参数一般不用手动改模板。角色加载则在 Character 下拉框完成可选项来自 user_data/characters/内置的 Assistant 和 Example 可直接体验换后端和换模型都在 Model 标签页完成loader 一栏默认自动检测按模型格式猜也可以手动指定 Transformers、llama.cpp、ExLlamav3、TensorRT-LLM 之一切换后无需重启服务。 后端与硬件适配如何为当前显卡选对 loader后端CUDANVIDIAROCmAMDCPUApple SiliconTransformers✅ 多文件 safetensors 模型首选支持 bf16/8bit/4bit 量化✅ 装requirements_amd.txt✅ 加--cpu速度慢✅ 走 MPSllama.cpp✅ GGUF 模型默认后端✅✅ CPU 场景默认mmap 省内存✅ExLlamaV3✅ 仅支持 EXL3 量化模型❌❌❌TensorRT-LLM✅ 仅 NVIDIA 高性能推理❌❌❌依赖文件按硬件分好requirements/full/下有requirements.txtNVIDIA、requirements_amd.txt、requirements_cpu_only.txt、requirements_apple_silicon.txt选错文件装出来的 PyTorch 跑不对硬件。实践上的默认选择是GGUF 模型走 llama.cpp多文件全精度模型走 Transformers手上有 EXL3 模型且只有 NVIDIA 卡才上 ExLlamaV3。⚙️ 温度与重复惩罚怎么调三组可感知的数值采样参数在 Parameters 标签页下面是三组可以直接套用的组合创意续写温度 0.8 top-p 0.95。词表选择更发散偶尔蹦出意料之外的句式代价是长文本容易跑题。角色对话温度 0.7 重复惩罚 1.2。惩罚值大于 1 时对已出现过的 token 降权能明显压住同一句式反复说的现象调到 1.3 以上句子开始生硬断句不建议再加。代码与可复现输出关掉 do_sample或 top_k1 温度任意同样输入逐字复现同样输出方便对比改动前后的差异。仓库在 user_data/presets/ 里放好了现成预设其中 Deterministic 就是第 3 组do_sample: false, top_k: 1Creative 则用 min-p 0.02 配 XTC 采样器。不确定时先跑预设再用单参数微调。 扩展生态LoRA 微调、OpenAI 兼容 API 与语音绘图扩展何时开LoRA低秩适配一种只训练少量附加权重的轻量微调方法Training 标签页支持在对话或多轮文本数据集上训练可断点续训。只有当通用模型在你业务场景下的语气或格式持续不合要求、且手里有几百条以上整理好的样本时才值得开。OpenAI 兼容 API启动时加--api即暴露兼容 OpenAI Chat/Completions 和 Anthropic Messages 的端点支持工具调用。已有脚本依赖 OpenAI SDK、只想把请求指到本机时再开只用网页的话它占着端口没别的收益。语音与绘图扩展extensions/ 内置 silero_tts、coqui_tts文字转语音、whisper_stt语音输入、sd_api_pictures调外部 Stable Diffusion 出图等按需勾选启用即可。工具调用user_data/tools/下每个.py文件是一个可被模型调用的函数计算器、网页搜索、掷骰子让模型在对话中执行动作时才需要。先按默认组合跑llama.cpp 加载一个 GGUF 模型采样用默认值。等遇到显存装不下或响应慢再对照上表换后端效果不满意时只动温度和重复惩罚两个参数其余保持默认。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考