SWIFT大模型微调指南:单卡跑通600+模型 📅 发布时间:2026/9/11 12:45:41 👁 浏览次数: SWIFT大模型微调指南单卡跑通600模型【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swift你手头有一张24G显存的显卡想把7B模型按业务需求调一版。SWIFTms-swift是魔搭社区的大模型微调框架它替你解决三件事自动下载模型和数据、把训练参数收敛成一条命令、训练完直接接上推理与部署。框架覆盖600多个文本模型和400多个多模态模型单卡LoRA微调7B模型最低约13GB显存。单卡跑通第一个SWIFT微调任务安装一条命令pip install ms-swift -U需要源码版本时先git clone https://gitcode.com/GitHub_Trending/swift1/swift再执行pip install -e .。装完直接跑第一条训练命令。这是官方文档里的10分钟示例单卡3090对Qwen3-4B做LoRA微调显存占用约13GBCUDA_VISIBLE_DEVICES0 \ swift sft \ --model Qwen/Qwen3-4B-Instruct-2507 \ --tuner_type lora \ --dataset AI-ModelScope/alpaca-gpt4-data-zh#500 \ --torch_dtype bfloat16 \ --num_train_epochs 1 \ --per_device_train_batch_size 1 \ --learning_rate 1e-4 \ --lora_rank 8 \ --max_length 2048 \ --output_dir output几个参数--tuner_type lora表示只训练低秩矩阵不动原始权重#500表示从内置数据集采样500条适合先验证流程模型默认从ModelScope下载换用HuggingFace加--use_hf true。训练时终端会持续打印 loss、学习率、显存占用和训练速度判断是否正常就看这几列能力拆解四个最常用的部分显存不够时的LoRA与QLoRA轻量微调能做什么LoRA把7B模型的训练显存压到13GB级别QLoRA再把权重量化到4位8G显存的显卡也能跑。怎么用加--tuner_type lora即可开启LoRAQLoRA只需多两个参数swift sft \ --model Qwen/Qwen2.5-7B-Instruct \ --quant_method bnb \ --quant_bits 4 \ --tuner_type lora \ --per_device_train_batch_size 1适合谁消费级显卡8–24G上做参数高效微调的人。完整示例在 examples/train/qlora/。GRPO强化学习SFT之后的对齐训练能做什么内置GRPO、DAPO、GSPO、SAPO等GRPO族算法用规则或奖励模型给输出打分把模型往做对题的方向推常用于数学、代码和Agent任务。怎么用入口命令是swift rlhf --rlhf_type grpoexamples/train/grpo/ 下有按场景分好的脚本可直接抄。适合谁已经做完SFT、想进一步提升推理准确率的人。Web UI不开终端的训练面板能做什么在界面上选模型、数据集、超参数启动训练、推理、导出、评测四类任务多卡机器上可并行开多个任务。怎么用终端执行swift web-ui --lang zh然后打开浏览器即可。适合谁不熟悉命令行的人或需要同时管理多个实验的人。量化导出与部署上线能做什么训练完用swift export导出AWQ、GPTQ等4位量化权重再用swift deploy配vLLM或SGLang起OpenAI兼容服务从模型调好了走到接口可调了。怎么用参考 examples/deploy/ 和 examples/export/ 里的脚本。适合谁要把微调结果交给业务方调用的最后一步。一个真实需求24G单卡SWIFT微调客服问答场景Qwen2.5-7B-Instruct自有客服问答jsonl约5000条硬件单张RTX 409024G目标是让模型回复贴合客服口径训练完推到预发环境验证。关键命令片段swift sft \ --model Qwen/Qwen2.5-7B-Instruct \ --dataset ./data/customer-service.jsonl \ --tuner_type lora \ --lora_rank 8 \ --num_train_epochs 3 \ --learning_rate 2e-4 \ --per_device_train_batch_size 1 \ --gradient_accumulation_steps 8 \ --output_dir output/customer-service参数建议值理由--lora_rank87B模型上8足够效果不够再升到16--learning_rate2e-4LoRA常用区间1e-4到5e-4--gradient_accumulation_steps8显存只放得下batch 1时用累积等效到batch 8--num_train_epochs35000条数据偏少超过5轮容易过拟合训练完先跑swift infer带上新adapter对话验证没问题再swift deploy --infer_backend vllm起服务。常见坑4个高频问题Q17B模型LoRA训练OOM结论上4位量化显存直接降一个量级。修复加--quant_method bnb --quant_bits 4。Q2加了量化还紧张结论开梯度检查点用约30%的训练速度换显存。修复加--gradient_checkpointing true。Q3想先花几分钟验证流程再正式跑结论限制步数即可。修复加--max_steps 10确认数据加载和保存都正常。Q4模型或数据集下载失败结论默认走ModelScope源网络不通就换源。修复加--use_hf true。到这里安装、训练、量化、部署四个环节各有一条最短路径。SWIFT大模型微调的完整参数清单见 docs/README.md按模型分类的现成脚本在 examples/。建议先用上面的10分钟示例跑通第一个任务再换成你自己的模型和数据。【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swift创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考