基于实测的子网络选择:面向本地部署检索增强工厂智能体

基于实测的子网络选择:面向本地部署检索增强工厂智能体 基于实测的子网络选择面向本地部署检索增强工厂智能体arXiv2609.02760v1摘要本地部署助手可以让工厂工人通过对话方式访问机器技术文档。但能够完成该任务的大模型往往无法运行在车间边缘硬件上。本文发现经过结构化压缩与检索增强适配后模型参数量不再是回答质量的可靠预测指标模型通用能力随参数量几乎线性下降但检索增强回答质量并不遵循该规律。因此本文将部署问题重新定义为适配完成后的子网络选择问题在可配置的通用能力下限、内存预算约束下依据评测得到的回答质量、设备实测吞吐为每台设备分配最优子网络单纯以尺寸、速度或者质量为单一优化目标都会损失部分能力或者推理吞吐。本文采用权重共享超网络通过三明治式原位蒸馏训练降低选择阶段开销。在工厂操作手册案例研究中单纯做子网络抽取回答质量相比未剪枝模型下降13.7%经过检索增强蒸馏之后损失缩小至4.6%挽回三分之二的性能损失。同一套助手可以部署在三类异构边缘硬件待机功耗仅1.3‑5W。关键词大语言模型知识蒸馏超网络模型压缩检索增强生成RAG边缘AI智能制造1 引言工厂工人在机器旁需要快速查阅技术文档。大语言模型可以为技术资料提供自然语言交互接口也已有工作将LLM能力映射到制造任务、实现基于意图的智能体自动化。但是这类方案前提是设备本地具备高性能模型而车间现场大多是工业控制器、嵌入式盒子文档、摄像头图像数据不允许离开厂区不能上云。该场景面临核心矛盾能够可靠回答技术问题的模型参数量达数十亿而边缘硬件内存通常只有2‑8GB。云卸载会带来延迟、持续成本、数据主权风险为每一台设备单独训练小模型成本高昂单纯结构化剪枝又会破坏模型通用基础能力。本文不把压缩看作单一步骤设计一套多阶段流水线训练权重共享超网络采用三明治式原位蒸馏硬件感知选择阶段为每个部署目标设备选出最合适子网络检索增强蒸馏阶段使用工厂专属文档进一步特化子网络将得到的轻量模型集成至工具增强运行时完成部署。两项关键实证发现廉价代理指标不能很好表征候选子网络真实表现基于KL散度的质量代理指标和参数量完全秩相关无法捕捉适配后质量反转现象。通用能力下限约束非常关键很多在质量‑吞吐折中看起来不错的子网络会因为基础通用能力不足被直接淘汰。本文核心主张应用适配会改变压缩候选模型的性能排序因此部署阶段的选择必须放在适配之后完成依据实测的应用质量与设备吞吐并增加通用能力约束。本文研究三个研究问题RQ1同一个权重共享超网络经过结构化剪枝后得到的子网络经过检索增强适配能否保持有竞争力RAG回答质量RQ2在通用能力下限约束下基于硬件实测的选择方案是否优于仅依靠参数量或者代理指标的选择策略RQ3整套流水线是否可以在异构边缘硬件上实现实用的本地部署工厂助手主要贡献实测驱动、带能力约束的子网络选择方法三阶段流程在可配置通用能力下限、内存预算下结合评测回答质量、设备实测吞吐为每台设备选定子网络依靠权重共享超网络与三点吞吐预测器大幅降低选型开销。面向可部署LLM的两阶段蒸馏流水线第一阶段三明治式原位蒸馏训练权重共享超网络第二阶段检索增强蒸馏从完整教师模型通过LoRA向抽取后的子网络迁移工厂领域知识。案例研究部署与评测实现文档工具增强的制造助手在三类边缘硬件平台上统一评测回答忠实度、工具路由、延迟、内存、功耗指标。2 相关工作2.1 大模型压缩主流压缩手段结构化剪枝恢复训练、知识蒸馏、LoRA低秩适配、量化。权重共享超网络可以一次性训练大量子网络做到一次训练多设备特化部署。现有硬件感知基准、设备实测工作已经扩展到大模型尺度但现有超网络方案大多在适配任务之前完成子网络筛选。本文证明筛选应当放在任务适配之后。2.2 检索增强生成RAG检索增强生成让模型依靠外部检索文档而不是内部参数知识回答问题。RA(\mathcal{F})T属于检索感知微调训练时混入干扰检索片段。本文第二阶段蒸馏目标借鉴RA(\mathcal{F})T范式。2.3 工业场景大模型智能体已有工作提出面向制造的意图驱动智能体、网络基础设施编排、任务编排助手框架。但这类工作大多假设使用云端大模型资源受限工业边缘设备如何实现整套能力仍然存在空白本文填补该缺口。3 超网络蒸馏与子网络抽取整套流水线如下图训练共享超网络基于Llama‑3.2三明治原位KD蒸馏得到包含11个候选子网络的校准搜索空间对全部候选子网络做检索增强适配硬件感知选型在能力下限、内存预算约束下依据实测质量、吞吐选出每台设备最优子网络导出量化模型作为智能体推理内核部署到边缘。图1 流水线总览一次训练超网络全部候选做适配按设备选型部署。3.1 超网络与搜索空间本文基于Llama‑3.2‑3B‑Instruct、Llama‑3.2‑1B‑Instruct构建弹性超网络。Transformer层在两个维度做弹性可变网络深度、每层MLP中间维度保持残差维度、注意力几何结构不变剪枝后恢复代价最高。经过校准3B基础模型得到11个候选子网络参数量区间2.20‑3.21B1B版本区间0.90‑1.24B最大候选即为原始未剪枝模型。子网络通过对共享权重张量切片就地激活不需要实例化独立学生模型。3.2 三明治式原位蒸馏在任何子网络被固定导出之前超网络在通用指令数据集Alpaca‑GPT4上微调。遵循Slimmable‑Networks思路每一步优化同时训练完整超网络M3个采样子网络把完整网络输出分布作为原位教师信号。采样做重要性校准通道预先按重要性排序子网络从11点校准网格均匀采样。单步损失函数LstepLCE(zfull,y)∑i1M[αLCE(zi,y)βτ2KL ⁣(pfullτ ∥ piτ)] \mathcal{L}_{\text{step}}\mathcal{L}_{\mathrm{CE}}(z_{\text{full}},y)\sum_{i1}^{M}\big[\alpha\mathcal{L}_{\mathrm{CE}}(z_{i},y)\beta\tau^{2}\mathrm{KL}\!\big(p^{\tau}_{\text{full}}\,\|\,p^{\tau}_{i}\big)\big]Lstep​LCE​(zfull​,y)i1∑M​[αLCE​(zi​,y)βτ2KL(pfullτ​∥piτ​)]zfullz_{\text{full}}zfull​完整网络logitsziz_izi​子网络logitsyyy真实token标签pτp^\taupτ温度软化后分布KL散度生产配置α0.8,β0.2,τ1.0\alpha0.8,\beta0.2,\tau1.0α0.8,β0.2,τ1.0全部前向传播梯度累加到共享权重把大容量模型行为迁移到小候选子网络不需要额外独立教师推理通道。3.3 子网络抽取超网络训练完成后把网格中的候选子网络导出为独立checkpoint。候选来自11点校准网格对参数量区间分箱每个箱内保留WikiText困惑度最优配置同时保留最小、完整模型。抽取流程参考子网络选择相关文献。3.4 硬件感知子网络选择核心发现仅靠代理指标不可靠KL代理指标与参数量完全秩相关无法捕捉适配后性能反转。选型分为三步代理指标做初步方向参考真实评测每一个候选子网络经过适配、导出实测工具路由准确率、RAG回答质量、设备吞吐、延迟、内存、功耗带约束优化选择目标函数KaTeX parse error: Cant use function \( in math mode at position 31: …_{r\in\mathcal{\̲(̲\mathcal{F}\)}}…Q~r\tilde{Q}_rQ~​r​min‑max归一化后RAG评测质量T~r\tilde{T}_rT~r​min‑max归一化设备实测吞吐KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲w0.5\)平局优先选吞吐更高的子网络可行集KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{F}\)}约束Cr≥ϕ CfullC_{r}\geq\phi\,C_{\text{full}}Cr​≥ϕCfull​ARC‑Easy通用能力下限ϕ0.8\phi0.8ϕ0.8同时内存Mr≤Mmax⁡M_r\le M_{\max}Mr​≤Mmax​设备内存上限。通用能力下限ϕ\phiϕ是部署策略参数会直接改变选型结果很多无约束折中选出的子网络会因为通用能力不足被直接淘汰。三点吞吐预测器在每台设备上仅对参数量跨度上3个锚点子网络实测吞吐拟合简单模型tok/sa/nparams\mathrm{tok/s}a/n_{\mathrm{params}}tok/sa/nparams​预测其余8个候选。预测平均绝对误差2.5‑3.1%。新设备部署只需要测3个锚点完整网格测试从28.8小时降低至6.0小时。4 抽取后检索增强蒸馏蒸馏数据集数据源187页工厂操作手册切分为1460个重叠100token文本块。基于语法约束JSON解码生成问答对得到686训练问答对633条离线测试集使用未剪枝原始模型教师在生产prompt模板、top‑4检索上下文条件下重新回答问题参考RA(\mathcal{F})T50%概率把top‑4中1‑2条替换为低排名干扰检索片段教会学生模型忽略误导上下文。目标函数抽取后的子网络权重冻结在注意力、MLP投影层使用统一秩KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲r8\)LoRA适配器训练。只对回答token计算损失Lpostα′ LCEβ′ τ′2 KL ⁣(pTτ′ ∥ pSτ′) \mathcal{L}_{\text{post}}\alpha^{\prime}\,\mathcal{L}_{\mathrm{CE}}\beta^{\prime}\,\tau^{\prime 2}\,\mathrm{KL}\!\big(p^{\tau^{\prime}}_{T}\,\|\,p^{\tau^{\prime}}_{S}\big)Lpost​α′LCE​β′τ′2KL(pTτ′​∥pSτ′​)pTp_TpT​教师分布pSp_SpS​学生分布部署配置α′β′0.5,τ′2.0\alpha\beta0.5,\tau2.0α′β′0.5,τ′2.0。同时混入工具路由演示样本共同训练。模型合并与导出训练结束LoRA权重合并进主权重。GPU设备导出ONNX后训练量化W8A16INT8权重(\mathcal{F})P16激活输出头保持全精度ARM CPU设备导出Q4_K_M GGU(\mathcal{F})格式供llama.cpp推理3B‑rank6子网络GGU(\mathcal{F})(Q4_K_M)占用1.85GBONNX W8A16占用2.1GB。1B‑rank5GGU(\mathcal{F})占用781MB。5 检索增强智能体部署图2本地工具增强RAG助手架构用户查询输入选中的轻量子网络内核grammar‑constrained JSON输出工具调用两条工具路径①文档检索器稠密嵌入top‑4②YOLO‑11视觉人物检测工具获取工具返回结果模型合成接地回答。整套系统完全本地运行文档、摄像头图像不会离开厂区内网。GPU设备ONNX Runtime GenAI推理ARM设备llama.cpp推理工具调用采用语法约束解码保证输出合法JSON。6 实验设置模型Llama‑3.2‑3B‑Instruct、Llama‑3.2‑1B‑Instruct构建超网络部署子网络按前文硬件选择流程选出。数据集超网络训练Alpaca‑GPT4第二阶段工厂手册QA 686训练样本633离线测试40条工具路由查询。评测指标RAG回答质量忠实度、回答相关性、上下文利用率使用Claude Opus 4.8 LLM‑as‑Judge打分全部样本交叉打乱在同一个评测会话消除Judge漂移效率指标TT(\mathcal{F})T首token时间、TPS解码速度、峰值内存、每次推理功耗、待机功耗工具路由准确率。基线方案未剪枝原始模型RAG、未做第二阶段适配的抽取模型、普通监督微调、多组蒸馏消融配置。硬件平台Jetson Orin Nano 8GBGPU15W模式RevPi Connect 5 4GB工业DIN导轨工控机Arduino UNO Q 2GB嵌入式板卡。计算开销超网络训练开销最大3B版本约51小时1B版本约22.8小时第二阶段LoRA蒸馏每个变体约12分钟。7 实验结果与分析7.1 能力‑模型尺寸关系ModelParamsSizeQualityΔBase 3B RAG (W8A16)3.21B2.42 GB0.848ref.Extracted, no Stage 22.77B2.1 GB0.732−13.7% Stage‑2 KD2.77B2.1 GB0.809−4.6%表1部署rank6子网络633条测试问题。单纯抽取子网络质量下降13.7%经过检索增强蒸馏损失收窄到4.6%挽回三分之二性能。通用能力ARC‑Easy随参数量几乎线性下降R20.93R^20.93R20.93但是RAG评测质量和参数量相关性较弱R20.76R^20.76R20.76部分中等尺寸子网络可以媲美最大候选。证明参数量不能作为适配后质量代理选型必须放在适配之后。7.2 第二阶段蒸馏消融实验ConfigurationQualityΔ vs baseBase (unpruned) RAG0.791ref.Extracted, no adaptation0.701−11.4%supervised (\mathcal{F})T, context‑free QA0.654−17.3%task loss on grounded data (α0.95\alpha0.95α0.95)0.727−8.1% KD (αβ0.5,τ2\alpha\beta0.5,\tau2αβ0.5,τ2)0.760−3.9% RA(\mathcal{F})T distractors (ours, deployed)0.765−3.3%表2 rank4子网络消融。无上下文普通监督微调反而让质量进一步下降完整配方任务损失KDRA(\mathcal{F})T干扰片段得到最优结果。7.3 效率折中与选型结果不同选型策略对比RevPi 3B网格StrategyRankQualityTPSARC ret.Smallest / fastest feasible110.5375.2369%Largest feasible (params)10.7243.25100%Quality‑only20.7272.99101%Q/T blend, no floor70.6784.2874%Q/T blend floor (ours)60.7263.3783%只追求最小尺寸/最大速度通用能力大幅衰减只追求质量会牺牲吞吐本文带通用能力下限的折中方案同时兼顾质量、吞吐、基础通用能力。下限ϕ\phiϕ在0.15‑0.85区间变化大部分情况下稳定选出rank6子网络。7.4 接地问答与工具路由部署内核Jetson、RevPi选用3B‑rank6Arduino UNO Q选用1B‑rank5。加入37条路由演示样本训练后工具路由在40条测试查询上全部正确代价RAG指标小幅下降1.3‑2.5个点。跨硬件完整评测结果PlatformSub‑netParams(\mathcal{F})aithf.Ans. rel.Ctx. util.TT(\mathcal{F})T(s)TPSE2E(s)Mem(GB)E/inf.(J)Standby(W)Jetson Orin Nano 8 GB3B r62.77B0.7730.8450.8110.239.9520.335.91174.96RevPi Connect 5 4 GB3B r62.77B0.7730.8450.8115.634.0076.872.31702.48Arduino UNO Q 2 GB1B r51.12B0.5910.7490.68215.14.53138.580.631491.30表4跨平台评测。同一套助手可以从2GB小单板运行到Jetson待机功耗1.3‑4.96W。7.5 消融实验超网络两个关键组件校准采样、超网络蒸馏。大尺寸候选两者差距不大在部署常用的中等rank超网络蒸馏是性能核心来源去掉蒸馏质量直接掉到0.44‑0.50校准采样在大rank带来收益小rank反而会略差部署区间带来正向收益。7.6 讨论检索器全程固定RAG分数受检索召回上限约束使用LLM‑as‑Judge打分交叉会话消除漂移但Judge本身仍然存在固有偏差ϕ0.8\phi0.8ϕ0.8通用能力下限是合理经验值改变该阈值会改变选型结果小模型本身存在短板多步推理、长工具链、视觉计数查询仍然不可靠检索完全失败时下游无法修复。8 跨平台部署研究权重共享方案下新设备部署成本很低只需要在目标硬件测3个锚点子网络用预测器得到全部候选吞吐再执行约束优化选出rank。Jetson Orin Nano 8GBW8A16 ONNX Runtime GenAI子网络3B‑rank6RevPi Connect5工业DIN‑Railllama.cpp Q4_K_M GGU(\mathcal{F})子网络3B‑rank6Arduino UNO Q 2GB内存不足以跑3B选用1B‑rank5。文档索引、prompt、路由语法、测试查询全部完全相同仅模型权重、量化格式、推理运行时不同。图4演示截图Jetson平台Web界面①文档检索回答机器按键问题②调用YOLO视觉工具做画面人数检测。评测维度RAG质量交叉打乱会话Judge打分延迟TT(\mathcal{F})T、TPS、端到端E2E资源峰值内存、单推理焦耳能耗、60秒待机功耗。实测Jetson端完整查询约20秒CPU工控机需要1‑2分钟。单推理能耗三个平台接近待机功耗差异4倍低占空比场景待机功耗主导总能耗。9 结论经过应用层适配之后模型参数量不再是回答质量的可靠排序指标。因此必须在任务适配完成之后结合设备实测吞吐、同时增加通用能力下限约束来选出部署子网络仅优化尺寸、速度、质量单一目标会损失性能。在工厂操作手册案例中选出的子网络保留未剪枝模型约95%的RAG回答质量工具路由全部正确同一助手可部署从2GB Arduino UNO Q到Jetson Orin Nano多种边缘硬件。新硬件接入仅需要测试3个锚点子网络即可完成选型。未来工作方向拓展校准网格之外的子网络搜索空间增加完整智能体循环端‑到‑端可追踪评测。