【内涵】QWenvl系列 📅 发布时间:2026/8/28 8:30:16 👁 浏览次数: 【内涵】拆解QWenvl【内涵】拆解QWenvl1. 训练阶段1.1 数据预处理1.2 tokenizer1.3 Backbone1.3.1 encoder1.3.1.1 LLM1.3.1.2 VIT1.3.1.3 Merge1.3.2 decoder1.3.3 loss1.3.4 peft2. 训练框架2.1 工程框架3. 推理阶段3.1 定性来看demo3.2 定量来看指标4. 其他5. 其他【内涵】拆解QWenvl截止到2026年8月QWenvl一共出到了系列3估计今后应该改系列就会archive, 不再更新了。原因是发现8月份即将发布的QWen3.8本身就是一个vision-language模型。1. 训练阶段1.1 数据预处理定制存在于各个模型的模型文件中接口transformers库中的AutoProcessor统一的内部处理过程: AutoProcessor内部操作1.2 tokenizer定制存在于各个模型的模型文件中接口transformers库中的AutoTokenizer统一的内部处理过程: AutoTokenizer内部操作1.3 Backbone定制transformers库中的Qwen2VLForConditionalGeneration问题为什么backbone这里不是定制接口统一内部处理的三板斧了1.3.1 encoder1.3.1.1 LLM1.3.1.2 VIT1.3.1.3 Merge1.3.2 decoder1.3.3 loss1.3.4 peft2. 训练框架2.1 工程框架transformer.Trainer3. 推理阶段pdft库的PeftModel3.1 定性来看demo3.2 定量来看指标4. 其他传统的公式识别的tokenizer5. 其他如果想运行本文章的sft代码以及获得可以用于sft的公式识别数据见github工程https://github.com/johnson-magic/FormulaRecognizer.git。本实践本身对于硬件资源的要求并不高一块12G显存的机器就可以运行。