小白程序员必备:收藏这份MedicalGPT医疗大模型训练项目,轻松入门大模型开发!

小白程序员必备:收藏这份MedicalGPT医疗大模型训练项目,轻松入门大模型开发! MedicalGPT是一个开源的医疗大模型训练项目涵盖了增量预训练、有监督微调、RLHF、DPO、OPD及Agent工具调用等环节。该项目不仅有助于理解医疗大模型的训练过程还提供了可直接上手的脚本、数据样例和模型适合初学者学习和实践。今天想和大家分享一个开源的医疗大模型训练项目——MedicalGPT。它把增量预训练、有监督微调、RLHF、DPO、OPD以及 Agent 工具调用等环节串到了一起既能帮助我们看懂医疗大模型是怎样一步步训练出来的也提供了可以直接上手的脚本、数据样例和模型。如果你正准备学习或实践医疗大模型这个项目会是一个很实在的参考。 项目介绍MedicalGPT 训练医疗大模型实现了包括增量预训练、有监督微调、RLHF(奖励建模、强化学习训练)、DPO(直接偏好优化)和独立OPD(On-Policy Distillation)。RLHF training pipeline来自Andrej Karpathy的演讲PDF State of GPT视频 VideoDPO方法来自论文Direct Preference Optimization:Your Language Model is Secretly a Reward ModelORPO方法来自论文ORPO: Monolithic Preference Optimization without Reference Model 最新进展[2026/04/20] v2.7版本支持了 OPD(On-Policy Distillation) 蒸馏训练新增独立training/opd_training.py训练入口、scripts/run_opd.sh启动脚本并补充了OPD参数与使用文档详见Release-v2.7[2026/04/09] v2.6版本支持了 [Agent工具调用/Function Call] 模型微调训练新增了支持不同模型的工具数据格式转换和解析代码。并在data目录下补充了toolcall数据样例。详见Release-v2.6[2026/04/07] v2.5版本支持了 Qwen3.5 系列模型包括Base、Instruct和MoE变体PT/SFT/DPO/ORPO/GRPO全流程适配新增qwen3、qwen3_5、qwen3_nothink、qwen3_5_nothink对话模板支持DeepSpeed ZeRO-3 MoE训练详见Release-v2.5[2025/04/18] v2.4版本支持了LoRA和全参的 GRPO 训练方法GRPO通过纯RL方法可以体验aha moment详见Release-v2.4 核心功能基于ChatGPT Training Pipeline本项目实现了领域模型–医疗行业语言大模型的训练第一阶段PT(Continue PreTraining)增量预训练在海量领域文档数据上二次预训练GPT模型以适应领域数据分布可选第二阶段SFT(Supervised Fine-tuning)有监督微调构造指令微调数据集在预训练模型基础上做指令精调以对齐指令意图并注入领域知识第三阶段RLHF(Reinforcement Learning from Human Feedback)基于人类反馈对语言模型进行强化学习分为两步RM(Reward Model)奖励模型建模构造人类偏好排序数据集训练奖励模型用来建模人类偏好主要是HHH原则具体是helpful, honest, harmlessRL(Reinforcement Learning)强化学习用奖励模型来训练SFT模型生成模型使用奖励或惩罚来更新其策略以便生成更高质量、更符合人类偏好的文本DPO(Direct Preference Optimization)直接偏好优化方法DPO通过直接优化语言模型来实现对其行为的精确控制而无需使用复杂的强化学习也可以有效学习到人类偏好DPO相较于RLHF更容易实现且易于训练效果更好ORPO比值比偏好优化不需要参考模型ref_model的优化方法通过ORPOLLM可以同时学习SFT和对齐将两个过程整合为单一步骤缓解模型灾难性遗忘问题OPD(On-Policy Distillation)独立蒸馏训练使用更强的teacher模型对student在自身rollout轨迹上的输出分布进行监督首版不和PPO/GRPO联训训练产物可以像SFT一样独立部署 训练流程Training Stage:StageIntroductionPython scriptShell scriptContinue Pretraining增量预训练pretraining.pyrun_pt.shSupervised Fine-tuning有监督微调supervised_finetuning.pyrun_sft.shOn-Policy Distillation独立OPD蒸馏opd_training.pyrun_opd.shDirect Preference Optimization直接偏好优化dpo_training.pyrun_dpo.shReward Modeling奖励模型建模reward_modeling.pyrun_rm.shReinforcement Learning强化学习ppo_training.pyrun_ppo.shORPO概率偏好优化orpo_training.pyrun_orpo.sh提供完整PTSFTDPO全阶段串起来训练的pipelinerun_training_dpo_pipeline.ipynb 运行完大概需要15分钟提供完整PTSFTRLHF全阶段串起来训练的pipelinerun_training_ppo_pipeline.ipynb 运行完大概需要20分钟支持Agent工具调用微调训练Agent FinetuningSFT和DPO阶段均支持。详见下方 Agent 训练 章节支持独立 OPD 训练复用data/sft的 ShareGPT 多轮数据格式训练输出与 SFT/LoRA 一样可直接部署如果是LoRA训练可继续使用tools/merge_peft_adapter.py合并权重提供基于知识库文件的LLM问答功能RAGchatpdf.py训练参数说明 | 训练参数说明wiki数据集 | 数据集wiki扩充词表 | 扩充词表wikiFAQ | FAQ_wikiAgent 模型训练本项目支持通过 SFT 和 DPO 两种方式训练具有工具调用Function Call / Tool Use能力的 Agent 模型。核心原理 Tool Call 本质上是特殊的多轮对话在标准的human/gpt角色之外新增了function_call模型决定调用工具和observation工具返回结果两种角色。Template 系统统一处理所有角色有工具描述就拼接到 system message没有就跳过对 loss 计算和训练过程完全透明。数据格式 统一使用 jsonl一行一条ShareGPT 格式。SFT 数据data/sft/glaive_toolcall_zh_demo.jsonl{conversations: [{from: human, value: 帮我查一下北京天气}, {from: function_call, value: {/name/: /get_weather/, /arguments/: {/city/: /北京/}}}, {from: observation, value: {/temperature/: /28°C/, /weather/: /晴/}}, {from: gpt, value: 北京今天天气晴朗气温28°C。}], tools: [...]}DPO 数据data/reward/toolcall_dpo_zh_demo.jsonl{conversations: [{from: human, value: 帮我查一下北京天气}], tools: [...], chosen: Action: get_weather/nAction Input: {/city/: /北京/}, rejected: 北京今天天气晴朗气温25度。}注意 所有训练数据统一为.jsonl格式。chosen/rejected为纯字符串。如有.json文件JSON 数组可用python tools/convert_dataset.py --in_file data.json --out_file data.jsonl --data_type json2jsonl转换。支持的 tool_formattool_format适用模型说明default通用Action/Action Input 格式qwenQwen2.5/Qwen3/Qwen3.5tool_callXML格式qwen3Qwen3同qwen别名qwen3.5Qwen3.5同qwen别名glm4GLM-4ChatGLM 工具格式llama3LLaMA-3.xJSON function call 格式mistralMistral[AVAILABLE_TOOLS]格式混合训练 普通问答SFT数据和Tool Call数据可以一起训练只需将两类数据文件放在同一个--train_file_dir目录下即可。没有tools字段的数据会按照普通SFT/DPO流程处理。训练命令 Tool Call 数据与普通数据混合在同一目录下直接使用标准训练脚本加--tool_format参数即可# SFTdata/sft/ 目录下同时包含普通问答和 tool call 数据 bash scripts/run_sft.sh # DPOdata/reward/ 目录下同时包含普通偏好和 tool call 偏好数据 bash scripts/run_dpo.sh关键参数说明--tool_format default指定工具调用的文本格式可选default, glm4, llama3, mistral, qwen无需单独的 agent 训练脚本普通数据和 tool call 数据自动混合训练已发布模型ModelBase ModelIntroductionshibing624/ziya-llama-13b-medical-loraIDEA-CCNL/Ziya-LLaMA-13B-v1在240万条中英文医疗数据集shibing624/medical上SFT微调了一版Ziya-LLaMA-13B模型医疗问答效果有提升发布微调后的LoRA权重(单轮对话)shibing624/ziya-llama-13b-medical-mergedIDEA-CCNL/Ziya-LLaMA-13B-v1在240万条中英文医疗数据集shibing624/medical上SFT微调了一版Ziya-LLaMA-13B模型医疗问答效果有提升发布微调后的完整模型权重(单轮对话)shibing624/vicuna-baichuan-13b-chat-lorabaichuan-inc/Baichuan-13B-Chat在10万条多语言ShareGPT GPT4多轮对话数据集shibing624/sharegpt_gpt4 和 医疗数据集shibing624/medical 上SFT微调了一版baichuan-13b-chat多轮问答模型日常问答和医疗问答效果有提升发布微调后的LoRA权重shibing624/vicuna-baichuan-13b-chatbaichuan-inc/Baichuan-13B-Chat在10万条多语言ShareGPT GPT4多轮对话数据集shibing624/sharegpt_gpt4 和 医疗数据集shibing624/medical 上SFT微调了一版baichuan-13b-chat多轮问答模型日常问答和医疗问答效果有提升发布微调后的完整模型权重shibing624/llama-3-8b-instruct-262k-chineseLlama-3-8B-Instruct-262k在2万条中英文偏好数据集shibing624/DPO-En-Zh-20k-Preference上使用ORPO方法微调得到的超长文本多轮对话模型适用于RAG、多轮对话演示shibing624/vicuna-baichuan-13b-chat模型效果具体case见Inference Examples▶️ 模型演示我们提供了一个简洁的基于gradio的交互式web界面启动服务后可通过浏览器访问输入问题模型会返回答案。启动服务命令如下CUDA_VISIBLE_DEVICES0 python demo/gradio_demo.py --base_model path_to_llama_hf_dir --lora_model path_to_lora_dir参数说明--base_model {base_model}存放HF格式的LLaMA模型权重和配置文件的目录也可使用HF Model Hub模型调用名称--lora_model {lora_model}LoRA文件所在目录也可使用HF Model Hub模型调用名称。若lora权重已经合并到预训练模型则删除–lora_model参数--tokenizer_path {tokenizer_path}存放对应tokenizer的目录。若不提供此参数则其默认值与–base_model相同--template_name模板名称如vicuna、alpaca等。若不提供此参数则其默认值是vicuna--only_cpu: 仅使用CPU进行推理--resize_emb是否调整embedding大小若不调整则使用预训练模型的embedding大小默认不调整 安装更新依赖requirements.txt会不时更新以适配最新功能使用以下命令更新依赖:git clone https://github.com/shibing624/MedicalGPT cd MedicalGPT pip install -r requirements.txt --upgrade硬件需求显存/VRAM估算值训练方法精度7B13B30B70B110B8x7B8x22B全参数AMP(自动混合精度)120GB240GB600GB1200GB2000GB900GB2400GB全参数1660GB120GB300GB600GB900GB400GB1200GBLoRA1616GB32GB64GB160GB240GB120GB320GBQLoRA810GB20GB40GB80GB140GB60GB160GBQLoRA46GB12GB24GB48GB72GB30GB96GBQLoRA24GB8GB16GB24GB48GB18GB48GB 数据集医疗数据集240万条中文医疗数据集(包括预训练、指令微调和奖励数据集)shibing624/medical22万条中文医疗对话数据集(华佗项目)shibing624/huatuo_medical_qa_sharegpt 【本项目支持格式】最后2026 年一晃已经过半AI 大模型的热潮不仅没有降温反而持续升温金融行业用大模型做风控、医疗依靠 AI 解析影像电商、制造、教育各行各业都在把 AI 融入日常业务。曾经热闹的 “百模大战”早就告别单纯比拼模型参数正式进入落地应用时代。现在企业疯狂紧缺一类人才懂业务、懂 AI、能做出可上线项目的大模型开发工程师岗位缺口大薪资待遇十分可观。风口再好不如手握高薪 offer 实在。行情火热普通人、程序员该怎样从零入门大模型抓住这波机会今天整理好【2026 最新版】AI 大模型全套免费学习资源覆盖零基础入门、项目实战、理论知识、大厂面试从基础一路进阶。所有资料分类归档没有多余杂料无套路免费分享给想要入局 AI 赛道的程序员与零基础小白扫码免费领取全部内容1、大模型系统化完整学习路线2、大模型经典书籍文档3、AI 大模型最新行业研究报告4、企业级实战项目 完整配套源码5、大厂大模型面试真题汇总6、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】