Xinference 内置模型 deepseek-coder-instruct 完全指南:规格矩阵、推理引擎与实战部署

Xinference 内置模型 deepseek-coder-instruct 完全指南:规格矩阵、推理引擎与实战部署 Xinference 内置模型 deepseek-coder-instruct 完全指南规格矩阵、推理引擎与实战部署【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferencedeepseek-coder-instruct 是 Xorbits InferenceXinference内置的代码生成类大语言模型LLM基于 deepseek-coder-base 初始化并使用 20 亿 token 的指令数据微调而成。本文以 deepseek-coder-instruct 模型文档 为主体结合 模型注册表 与 命令行入口源码系统梳理该模型的 14 种规格Model Spec、四种模型格式、可用的推理引擎与完整启动命令帮助你在 Xinference 中快速拉起并调用该代码模型。模型概览在 Xinference 的内置模型注册表 llm_family.json 中deepseek-coder-instruct注册条目的核心元信息如下字段值Model Namedeepseek-coder-instructContext Length16384Languagesen, zhAbilitieschatModel Descriptioninitialized from deepseek-coder-base and fine-tuned on 2B tokens of instruction dataArchitecturesLlamaForCausalLMmodel_type: llamaFeaturedfalse该模型的能力是chat对话/指令跟随上下文长度为 16384 token支持英文与中文。作为 DeepSeek 官方推出的代码模型系列它的定位是面向代码补全、代码解释、代码生成等编程任务同时也会拒绝回答政治敏感、安全隐私等与计算机科学无关的问题这一系统行为内置于其 chat template 中详见下文源码分析。14 种模型规格全景在 Xinference 中同一个模型名deepseek-coder-instruct下注册了14 种规格Model Spec由「模型格式 × 参数量 × 量化方式 × 引擎」四个维度组合而成。参数量覆盖 1.3B、6.7B、7B、33B 四档模型格式覆盖 pytorch、ggufv2、gptq、awq 四种。规格矩阵一览序号模型格式参数量量化方式可用引擎模型 ID1pytorch1_3 BillionnonevLLM、Transformers、SGLangdeepseek-ai/deepseek-coder-1.3b-instruct2pytorch6_7 BillionnonevLLM、Transformers、SGLangdeepseek-ai/deepseek-coder-6.7b-instruct3pytorch7 BillionnonevLLM、Transformers、SGLangdeepseek-ai/deepseek-coder-7b-instruct-v1.54pytorch33 BillionnonevLLM、Transformers、SGLangdeepseek-ai/deepseek-coder-33b-instruct5ggufv21_3 BillionQ2_K、Q3_K_L、Q3_K_M、Q3_K_S、Q4_0、Q4_K_M、Q4_K_S、Q5_0、Q5_K_M、Q5_K_S、Q6_K、Q8_0vLLM、llama.cppTheBloke/deepseek-coder-1.3b-instruct-GGUF6ggufv26_7 BillionQ2_K、Q3_K_L、Q3_K_M、Q3_K_S、Q4_0、Q4_K_M、Q4_K_S、Q5_0、Q5_K_M、Q5_K_S、Q6_K、Q8_0vLLM、llama.cppTheBloke/deepseek-coder-6.7B-instruct-GGUF7ggufv27 BillionQ3_K_L、Q3_K_M、Q3_K_S、Q4_0、Q4_K_M、Q4_K_S、Q5_0、Q5_K_M、Q5_K_S、Q6_K、Q8_0vLLM、llama.cppLoneStriker/deepseek-coder-7b-instruct-v1.5-GGUF8ggufv233 BillionQ2_K、Q3_K_L、Q3_K_M、Q3_K_S、Q4_0、Q4_K_M、Q4_K_S、Q5_0、Q5_K_M、Q5_K_S、Q6_K、Q8_0vLLM、llama.cppTheBloke/deepseek-coder-33B-instruct-GGUF9gptq1_3 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-1.3b-instruct-GPTQ10gptq6_7 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-6.7B-instruct-GPTQ11gptq33 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-33B-instruct-GPTQ12awq1_3 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-1.3b-instruct-AWQ13awq6_7 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-6.7B-instruct-AWQ14awq33 BillionInt4vLLM、Transformers、SGLangTheBloke/deepseek-coder-33B-instruct-AWQ以上规格数据与 llm_family.json 中deepseek-coder-instruct的model_specs数组完全一致模型仓库 ID 来自 Hugging Face / ModelScope 上对应格式的官方或社区仓库。四种格式的适用场景pytorch原始权重格式不经过量化none精度最高适合有充足 GPU 显存的场景支持 vLLM、Transformers、SGLang 三种引擎灵活度最高。ggufv2llama.cpp 生态的量化格式提供从 Q2_K 到 Q8_0 共 12 档量化其中 7Bv1.5规格不含 Q2_K 档支持 vLLM 与 llama.cpp 引擎适合低显存环境或 CPU 推理。gptqGPTQ 权重量化格式统一为 Int4 量化支持 vLLM、Transformers、SGLang。awqAWQ 权重量化格式统一为 Int4 量化支持 vLLM、Transformers、SGLang。使用 CLI 启动模型启动该模型的核心命令格式如下其中${engine}、${quantization}需替换为上方规格矩阵中对应的取值xinference launch --model-engine ${engine} \ --model-name deepseek-coder-instruct \ --size-in-billions ${size} \ --model-format ${format} \ --quantization ${quantization}按格式给出全部 14 条启动命令pytorch 格式量化取 none引擎在 vLLM / Transformers / SGLang 中三选一# 1.3B xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 1_3 --model-format pytorch --quantization ${quantization} # 6.7B xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 6_7 --model-format pytorch --quantization ${quantization} # 7B xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 7 --model-format pytorch --quantization ${quantization} # 33B xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 33 --model-format pytorch --quantization ${quantization}ggufv2 格式引擎在 vLLM / llama.cpp 中二选一quantization 从 Q2_K~Q8_0 中选择7B 规格无 Q2_Kxinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 1_3 --model-format ggufv2 --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 6_7 --model-format ggufv2 --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 7 --model-format ggufv2 --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 33 --model-format ggufv2 --quantization ${quantization}gptq 格式Int4引擎在 vLLM / Transformers / SGLang 中三选一xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 1_3 --model-format gptq --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 6_7 --model-format gptq --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 33 --model-format gptq --quantization ${quantization}awq 格式Int4引擎在 vLLM / Transformers / SGLang 中三选一xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 1_3 --model-format awq --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 6_7 --model-format awq --quantization ${quantization} xinference launch --model-engine ${engine} --model-name deepseek-coder-instruct --size-in-billions 33 --model-format awq --quantization ${quantization}注意gptq 与 awq 格式下没有 7B 档v1.5的注册规格因此 7B 档仅存在于 pytorch 与 ggufv2 两种格式中。启动参数逐项说明对应源码实现命令行入口 cmdline.py 中xinference launch的核心选项与deepseek-coder-instruct的使用一一对应CLI 参数短选项必填说明--model-name-n是模型名称此处固定为deepseek-coder-instruct--model-type-t否模型类型默认LLM--model-engine-enLLM 必填推理引擎如 vLLM、Transformers、SGLang、llama.cpp--size-in-billions-s是参数量档位1_3、6_7、7、33--model-format-f是模型格式pytorch、ggufv2、gptq、awq--quantization-q是量化方式none / Q2_K~Q8_0 / Int4--model-uid-u否模型实例唯一 ID默认等于模型名可自定义--replica-r否副本数默认 1--n-worker无否worker 数默认 1--n-gpu无否GPU 数量默认auto--lora-modules-lm否LoRA 模块配置格式namepath--worker-ip无否分布式场景下指定运行的 worker IP--gpu-idx无否指定 worker 上可用的 GPU 序号逗号分隔--model-path-mp否本地模型路径--api-key-ak否访问启用鉴权的 Xinference API 所需的密钥--trust-remote-code无否是否信任 Hub 上自定义 modeling 文件默认 True其中有一个重要的强制校验逻辑在model_launch函数中当model_type LLM且未指定--model-engine时会直接抛出ValueError(--model-engine is required for LLM models.)见 cmdline.py。也就是说LLM 模型包括deepseek-coder-instruct必须显式声明引擎不能省略。这也是上方所有启动命令都带有--model-engine ${engine}占位的原因。其他有用的运维参数还包括--quantization-config为 Transformers 引擎传入 bitsandbytes 量化配置、--enable-thinking是否开启混合推理模型的思考模式等。启动时若不指定--endpoint默认连接本机http://localhost:9997。从源码看该模型的注册结构与对话协议注册条目结构deepseek-coder-instruct在 llm_family.json 中的注册条目为version: 2每个model_specs元素由model_format、model_size_in_billions、model_src组成其中model_src下按huggingface与modelscope两个模型源分别登记quantizations、model_id部分条目还固定了model_revision如 pytorch 1.3B 对应 revision2df081ceaca101a867fef2844e44f4d6a4857039以保证可复现性。ggufv2 格式还额外声明了model_file_name_template如deepseek-coder-1.3b-instruct.{quantization}.gguf用于按所选量化档位拼接实际下载的文件名。从注册表可以确认pytorch 与 ggufv2 规格中 1.3B、6.7B、33B 同时提供 Hugging Face 与 ModelScope 两个下载源7B v1.5 仅 Hugging Face而 gptq、awq 规格只登记了 Hugging Face 源。Chat Template 与停止符该模型条目的chat_template见 llm_family.json保留了 DeepSeek Coder 官方的对话格式起始标记为begin▁of▁sentence若消息列表中没有 system 消息会自动注入系统提示You are an AI programming assistant, utilizing the Deepseek Coder model, developed by Deepseek Company, and you only answer questions related to computer science. ...即仅回答计算机科学相关问题对政治敏感、安全隐私等非 CS 问题拒绝回答用户消息包装为### Instruction:\n{content}\n模型回复包装为### Response:\n{content}\n|EOT|\n生成结束时附带|EOT|结束标记。同时注册表还登记了stop_token_ids: [32021]与stop: [|EOT|]见 llm_family.jsonXinference 会在解码时据此截断输出确保只返回### Response:之后的内容不会把后续的### Instruction:一起吐出。引擎依赖的虚拟环境声明在 llm_family.json 中该模型声明了按引擎区分的依赖包virtualenv: { packages: [ #transformers_dependencies# ; #engine# \Transformers\, #llama_cpp_dependencies# ; #engine# \llama.cpp\, #vllm_dependencies# ; #engine# \vllm\, #system_numpy# ; #engine# \vllm\ ] }这说明选择不同引擎时Xinference 会自动装配对应的依赖环境Transformers 引擎需要 transformers 系依赖llama.cpp 引擎需要 llama.cpp 系依赖vLLM 引擎需要 vllm 系依赖与系统 numpy。对于依赖较旧的模型官方还推荐启用模型虚拟环境特性以保证兼容运行。使用 Python Client 启动与对话除了 CLI也可以通过 Xinference 的 Python 客户端启动该模型对应 模型通用文档 中描述的 LLM 启动方式LLM 必须同时指定参数量、模型格式与引擎from xinference.client import Client client Client(http://localhost:9997) # 启动 1.3B pytorch 格式使用 Transformers 引擎 model_uid client.launch_model( model_namedeepseek-coder-instruct, model_size_in_billions1_3, model_formatpytorch, quantizationnone, model_engineTransformers, ) print(model_uid) # 发起代码对话 completion client.chat( model_uid, [{role: user, content: 用 Python 实现一个快速排序并附注释。}], ) print(completion[choices][0][message][content])其中model_size_in_billions、model_format、quantization需要与规格矩阵严格匹配否则 Xinference 会因找不到对应model_specs条目而报错。查看、终止与日常运维查看已注册的内置模型xinference registrations --model-type LLM或通过 REST APIGET /v1/model_registrations/LLM查询可确认deepseek-coder-instruct及全部内置 LLM 的注册信息。列出正在运行的模型xinference list返回结果中deepseek-coder-instruct实例的 UID 默认即为deepseek-coder-instruct多实例共存时建议通过--model-uid区分。终止模型释放资源xinference terminate --model-uid deepseek-coder-instruct对应 REST API 为DELETE /v1/models/MODEL_UIDPython 侧为client.terminate_model(model_uid...)。分布式 / 多副本可通过--n-worker、--n-gpu、--replica、--worker-ip、--gpu-idx组合控制资源分布vLLM 引擎下还支持--replica-config声明 prefill / decode 分离PD 分离的部署形态。小结deepseek-coder-instruct是 Xinference 内置体系中规格最齐全的代码模型之一4 档参数量 × 4 种模型格式 × 多档量化配以 vLLM、Transformers、SGLang、llama.cpp 四种引擎的灵活组合既能用 1.3B 轻量档在低配机器上快速体验也能用 33B 大规模档支撑严肃的代码生成任务。本文列出的规格矩阵、14 条启动命令与源码级参数说明均可在当前仓库中逐一核对模型元数据见 llm_family.json命令行参数解析见 cmdline.py通用启动、列表、终止流程见 模型通用文档。按照上方命令选择合适规格即可一键部署。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考