YOLO-IOD: Towards Real Time Incremental Object Detection——迈向实时增量目标检测 📅 发布时间:2026/9/11 18:10:46 👁 浏览次数: 论文针对增量目标检测任务提出了一个基于YOLO框架的实时解决方案。以下是其核心研究内容的全面总结一、研究背景与问题任务定义增量目标检测要求模型在持续学习新类别时不遗忘旧类别知识。现有局限主流IOD方法多基于Faster R-CNN或DETR不适用于实时YOLO系列且直接套用会导致严重性能下降。核心挑战识别作者首次系统指出YOLO在增量学习中的三类知识冲突前景-背景混淆未标注的旧/新类别目标被误判为背景尤其被YOLO的强数据增强放大。参数干扰不同任务共享参数更新新任务会破坏旧任务表征。错配知识蒸馏教师与学生模型类别分布不一致导致蒸馏失效。二、提出方法YOLO-IOD基于预训练YOLO-World开放词汇检测器通过分阶段参数高效微调实现增量学习包含三个核心模块模块全称功能CPR冲突感知伪标签精炼缓解前景-背景混淆① 增强伪标签损失置信度加权熵正则化② 聚类未知伪标签用开放词汇检测发现未来目标聚为未知超类。IKS基于重要性的内核选择缓解参数干扰基于Fisher信息估计卷积核重要性仅更新当前任务相关的Top-K核基础阶段20%增量阶段12%其余冻结。CAKD跨阶段非对称知识蒸馏解决错配蒸馏冲突采用双教师旧检测器当前检测器将学生特征分别传入两个教师的检测头实现不对称蒸馏同时保留旧知识并适应新类别。三、新基准LoCo COCO现有基准缺陷类别划分任意且同一图像可在多个阶段重复出现造成数据泄漏虚高伪标签方法性能。LoCo COCO设计基于类别共现矩阵进行图聚类将常共现类别分到同一任务减少跨阶段图像重叠对仍重叠的图像随机分配给其中一个任务确保每张图像仅出现一次。意义更贴近真实应用场景提供更公平的IOD评估。四、实验与结果数据集MS COCO 2017传统划分 LoCo COCO新划分。对比方法涵盖两阶段BPF, RGR、DETR系列CL-DETR, SDDGR, DCA、开放词汇方法TLR, GCD并在YOLO-World上复现ERD、RGR。主要结果单步设置4040, 7010YOLO-IOD显著优于所有对比方法RelGap相对性能差距低至2.7%和3.9%接近联合训练上界。多步设置40-10, 40-20, 20-20, 10-10在长序列8阶段下仍保持低遗忘RelGap仅8.8%远超RGR20.3%和CL-DETR48.1%。LoCo COCO上所有方法AP均有下降0.6%~2.0%但YOLO-IOD仍领先第二名5.9~8.5 AP验证其鲁棒性。消融实验三个模块CPR, IKS, CAKD各自均有显著增益组合后效果最佳CAKD双教师优于单教师IKS核选择比例12%为最优平衡点。五、贡献总结首次系统识别并定义YOLO在IOD中的三类知识冲突。提出YOLO-IOD——首个面向YOLO的实时增量检测框架集成CPR、IKS、CAKD三大模块有效平衡可塑性与稳定性。设计LoCo COCO基准消除数据泄漏更贴近现实应用。在传统和新型基准上均达到最先进性能且保持实时推理速度。YOLO-IOD成功将实时检测与增量学习结合通过针对性解决知识冲突在多个设置下实现了最低的遗忘率和最高的检测精度为现实场景中的持续目标检测提供了有效方案。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要当前的增量目标检测IOD方法主要依赖于Faster R-CNN或DETR系列检测器然而这些方法不适用于实时的YOLO检测框架。在本文中我们首先确定了导致基于YOLO的增量检测器发生灾难性遗忘的三类主要知识冲突前景-背景混淆、参数干扰和错配的知识蒸馏。随后我们介绍了YOLO-IOD一个实时的增量目标检测IOD框架该框架构建于预训练的YOLO-World模型之上通过分阶段参数高效微调过程来促进增量学习。具体而言YOLO-IOD包含三个主要组成部分1冲突感知伪标签精炼CPR它通过利用伪标签的置信度水平并识别与未来任务相关的潜在目标来减轻前景-背景混淆。2基于重要性的内核选择IKS它在当前学习阶段识别并更新与当前任务相关的关键卷积核。3跨阶段非对称知识蒸馏CAKD它通过将学生目标检测器的特征分别传递给前一个和当前教师检测器的检测头来解决错配的知识蒸馏冲突从而在现有类别和新引入类别之间实现非对称蒸馏。我们进一步引入了LoCo COCO一个更现实的基准测试它消除了阶段间的数据泄露。在传统基准测试和LoCo COCO基准测试上的实验表明YOLO-IOD以最小的遗忘实现了优越的性能。引言增量目标检测IOD的目标是在连续学习新任务的过程中持续获取新的目标类别同时保留过去学到的知识。尽管近期的工作Mo等人2024Liu等人2023在IOD方面取得了显著进展但大多数现有方法都建立在诸如Faster R-CNNRen等人2015或DETRCarion等人2020等检测器之上。当这些开发的方法应用于实时的YOLO系列检测器Redmon等人2016时它们通常会在泛化性能上遭受显著下降并且难以保持先前类别的先验知识这主要是由于任务间的知识冲突所致。图1三种主要知识冲突的图示a前景-背景混淆b参数干扰以及c错配的知识蒸馏冲突。在这项工作中我们首先将基于YOLO的增量检测器中遗忘的根本原因确定为三种主要类型的知识冲突如图1所示1前景-背景混淆其中未标注的先前和未来任务的目标在训练期间被错误地分类为背景。这个问题对于YOLO检测器尤为关键因为它们依赖于诸如Mosaic和MixUp等激进的数据增强技术这些技术假设标注是准确的。在IOD设置中伪标签中的噪声会被这些增强方法放大从而损害模型性能。2参数干扰。这个问题源于不同任务经常依赖于模型内相交的参数子集。针对新任务的更新可能会改变这些共享参数从而可能破坏先前学到的表示并导致对早期任务的灾难性遗忘。3错配的知识蒸馏冲突即教师模型和学生模型针对不匹配的类别分布进行优化违反了标准知识蒸馏中两个模型共享一致学习目标的核心假设。YOLO系列检测器以在空间网格上进行密集预测而闻名受到这个问题的显著影响。为了克服上述挑战我们提出了YOLO-IOD一个实时的IOD框架它构建于预训练的YOLO-WorldCheng等人2024模型之上并在每个增量学习阶段进行参数高效的微调。YOLO-IOD包含三个旨在解决已识别知识冲突的主要模块1冲突感知伪标签精炼CPR它通过结合两种策略来缓解前景-背景混淆增强伪标签损失通过基于预测的置信度和不确定性进行加权提高来自伪标签的监督的可靠性以及聚类未知伪标签通过执行开放词汇目标检测和特征空间聚类来识别来自未来任务的潜在目标。2基于重要性的内核选择IKS它通过基于费舍尔信息的微分重要性估计选择并仅微调与任务相关的重要卷积核从而减轻参数干扰。以及3跨阶段非对称知识蒸馏CAKD它通过将跨阶段的学生特征分别传递给旧的和当前的教师检测器的检测头来解决错配的知识蒸馏冲突从而在旧类别和新类别之间实现非对称蒸馏。此外当前的IOD基准测试并不适合实际应用因为它们随意划分类别忽略了类别的自然共现并且允许图像在增量阶段重复出现。在实际情况下某些类别如汽车和行人经常一起出现而其他类别如汽车和船只则不然。必须严格防止阶段间图像重叠以避免数据泄露。这引发了一个问题在当前基准测试上观察到的性能是否能有效地转化为实际应用特别是对于最近依赖于伪标签的IOD方法。因此我们引入了LoCo COCO一个新的基准测试旨在消除阶段间图像重叠并遵循类别共现统计为IOD提供一个更公平、更现实的评估基准。我们的贡献可以总结如下我们介绍了YOLO-IOD一个集成的、实时的IOD框架并指出了遗忘的三个原因前景-背景混淆、参数干扰和错配的知识蒸馏冲突。YOLO-IOD包含了三个旨在减轻遗忘的创新模块特别强调了双教师CAKD模块。该模块通过将目标学生检测器的特征分别传递给前一个和当前教师检测器的检测头解决了错配知识蒸馏的挑战。我们引入了LoCo COCO一个实用的基准测试旨在消除阶段间的图像重叠并考虑类别共现从而能够对增量目标检测进行更公平的评估。在多种设置下对传统COCO和LoCo COCO基准测试的大量实验表明我们的方法在保持实时推理速度的同时持续达到了最先进的性能。相关工作增量学习增量学习使模型能够在不遗忘先前知识的情况下获取新信息Schlimmer和Granger Jr1986Li和Hoiem2017。方法包括基于重演的方法即重播或生成来自先前任务的样本Rebuffi等人2017Lopez-Paz和Ranzato2017Shin等人2017基于正则化的方法即约束重要参数以维持稳定性Kirkpatrick等人2017Luo等人2025Yang等人2023Wu等人2025基于架构的方法即为任务分配特定的子网络Von Oswald等人2019Rypeśé等人2024以及知识蒸馏即通过教师-学生学习传递来自过去任务的信息Tao等人2020Chen和Chang2023Asadi等人2023。最近使用基础模型的持续学习也引起了许多兴趣包括诸如L2PWang等人2022、CODA-PromptSmith等人2023和VPT-NSP2Lu等人2024等方法。增量目标检测与分类相比IOD涉及更复杂的场景和更大的挑战因为它需要同时定位和分类目标。在IOD中由于检测框架中丰富的特征表示和多级监督信号蒸馏尤其有效。ERDFengWang和Yuan2022引入了弹性响应蒸馏自适应地传递知识。BPFMo等人2024通过双教师模型桥接过去-未来知识CL-DETRLiu等人2023将蒸馏应用于DETR架构强调来自旧模型的可靠预测。然而这些方法通过仅选择那些与新标签不重合的旧任务输出来作为蒸馏目标从而解决知识蒸馏问题。这种策略不适用于YOLO风格的密集预测。此外这种方法只能从教师模型中蒸馏部分知识无法完全解决潜在的冲突。我们提出了CAKD它通过使用检测头抑制无关特征的响应提供跨阶段非对称知识蒸馏。预备知识和基准测试问题定义图2YOLO-IOD的整体架构。我们的方法集成了三个组件来解决IOD中的知识冲突1冲突感知伪标签精炼CPR2基于重要性的内核选择IKS以及3跨阶段非对称知识蒸馏CAKD。方法总体框架所提出的YOLO-IOD利用预训练的YOLO-World作为其基础模型。如图2所示YOLO-IOD通过分阶段的部分微调来执行增量学习其中参数更新由基于重要性的内核选择指导。整体架构由三个组件组成。在左上部分冲突感知伪标签精炼CPR通过增强的伪标签损失生成高质量的旧任务监督以减轻来自先前任务的前景-背景混淆同时通过聚类未知伪标签解决未来任务上潜在的前景-背景混淆。在图2的左下部分基于重要性的内核选择IKS确定在每个增量阶段要更新哪些卷积核从而在允许对新类别进行部分微调的同时保留来自先前任务的关键知识。最后跨阶段非对称知识蒸馏CAKD实现了两种不同的知识蒸馏损失。第一种是比较旧检测器Mt−1与目标检测器Mt方法是将它们各自的密集特征输入到旧检测器Mt−1的检测头中。第二种是比较当前检测器Mst在阶段数据集Dt上训练的、标注了类别Ct的检测器与目标检测器Mt方法是利用当前检测器检测头内的密集特征。冲突感知伪标签精炼CPR包含两个组成部分。增强伪标签损失利用置信度感知监督和熵正则化来更好地利用伪标签。同时聚类未知伪标签结合了开放词汇目标检测和特征聚类为未来任务中未标注的目标提供一致的监督。增强伪标签损失。IOD中传统的伪标签方法依赖于置信度阈值来选择可靠的伪标签这引入了基于置信度的选择偏差。这种偏差导致低置信度类别在训练过程中逐渐被忽略。此外高于阈值的伪标签被统一对待而不考虑其实际可靠性导致监督信号不一致。为了解决这个问题我们提出了一种增强伪标签损失将每个伪标签的置信度分数ss视为软监督目标结合了置信度感知加权和熵正则化实验实验设置数据集和指标。为了评估我们的方法我们使用MS COCO 2017Lin等人2014数据集并遵循先前研究Mo等人2024Kim等人2024中建立的协议。我们还在提出的LoCo COCO基准测试上进行了评估以提供更现实的评估。我们使用标准COCO指标在IoU阈值0.5-0.95上的mAP、mAP0.5和mAP0.75。我们还报告了与联合训练相比的AbsGap绝对mAP差距和RelGap相对mAP差距以量化灾难性遗忘。实现细节。我们的方法在YOLO-World (X)上实现。我们在4块RTX 3090 GPU上使用批量大小16学习率为2×10−5主干网络和2×10−4颈部网络和检测头。训练使用AdamWLoshchilov和Hutter2017优化器进行20个epoch在第10个epoch后禁用mosaic增强。在IKS模块中基础阶段选择的核比例KK设置为20%20%增量阶段设置为12%。与最先进方法的比较我们在COCO上的单步和多步IOD设置下评估了我们的方法。我们将YOLO-IOD与最近的最先进方法进行了比较包括两阶段检测器BPE, RGR、基于DETR的方法CL-DETR, SDDGRKim等人2024, DCAZhang等人2025以及基于开放词汇模型的方法TLRZhang等人2024, GCDWang, Wang和Lin2025。此外我们在YOLO-World架构上复现了经典的基于响应蒸馏的方法ERD和最近的生成重演方法RGR以进行进一步比较。单步增量设置。我们首先评估了在4040和7010设置下的性能分别增加了40类和10类。如表1所示YOLO-IOD相对于先前方法取得了持续的性能提升。具体来说在4040配置下我们的方法比先前的最佳方法RGR在AP上提高了1.5AbsGap仅为1.5并将与联合训练的相对性能差距从5.5%显著降低到2.7%。在7010设置下YOLO-IOD在AP上比RGR高出3.3%并且相对于上界实现了极低的RelGap3.9%同时在所有指标上保持了强劲的性能。请注意RGR是一种基于生成重演的方法而我们的方法完全不需要重演。多步增量设置。为了更好反映现实世界中新类别不断被引入的场景我们在多阶段评估40-10, 40-20的基础上增加了更长的20-20和10-10设置每个阶段分别增加20或10个类别直到所有80个类别被学完。这些更长的配置对于评估增量检测器在现实部署场景中的表现尤为重要。如表2所示我们的方法在这些长期设置中持续取得最佳性能相比RGR的AP提升从3.3%到6.3%不等。值得注意的是在具有8个增量阶段、极具挑战性的10-10设置下YOLO-IOD表现出了卓越的性能在最终阶段仅达到8.8%的RelGap显著优于RGR20.3% RelGap和CL-DETR48.1% RelGap。结果表明YOLO-IOD通过充分解决知识冲突可以成功地适用于需要持续适应新兴目标类别的现实场景。在LoCo COCO上的评估我们在更现实的LoCo COCO基准测试上评估了近期方法和我们的YOLO-IOD如表3所示。与原始的COCO基准相比所有方法在LoCo COCO上的AP下降了0.6%到2.0%这表明了先前增量设置中数据泄露的影响。尽管如此YOLO-IOD在所有增量场景中持续实现了强劲的性能即使消除了阶段间图像重叠也展现出了鲁棒性。具体来说在4040、7010和4020设置中YOLO-IOD分别比先前的最佳方法GCD在AP上高出7.5、5.9和8.5。这些结果突显了YOLO-IOD对于现实持续检测的实用价值以及LoCo COCO作为IOD实用评估基准的必要性。消融研究主要组件的有效性。如表4所示我们逐步添加模块以展示它们在70-10和40-10设置中的各自贡献。从达到48.4% AP70-10和44.3% AP40-10的标准伪标签基线开始添加CPR显著将性能提高到50.3%和47.3%证明了其在减轻前景-背景混淆方面的有效性。整合IKS进一步将结果提升到70-10的51.5% AP和40-10的49.1% AP突显了选择性参数更新的价值。值得注意的是当单独应用CAKD时AP从70-10的48.4%上升到50.8%从40-10的44.3%上升到49.2%展示了其强大的蒸馏能力。当CAKD与先前模块结合时可以获得进一步的增益将AP从70-10的51.5%提高到52.4%从40-10的49.1%提高到50.6%。这些结果证实了所有三个组件CPR、IKS和CAKD协同工作每个组件都贡献了显著的性能提升并共同解决了根本的知识冲突。因此完整的YOLO-IOD框架取得了优越的结果。CAKD消融研究。如图3所示我们比较了三种CAKD变体仅使用旧教师检测器、仅使用当前教师检测器以及完整的双教师。在早期阶段仅当前变体通过促进对新类别的快速适应而表现更好。随着任务的积累仅旧变体在保留先前知识方面变得更加有效反映了从可塑性到稳定性的转变。完整的CAKD始终取得最佳结果验证了结合两种知识来源的非对称蒸馏的优势。IKS核选择比例KK的影响。如图4所示较小的比例例如5%限制了模型的适应能力而较大的比例例如20%由于过度更新参数而引发遗忘。我们观察到当设置K12%时达到了最佳的权衡强调了在IOD中调节待更新参数数量的重要性。结论本研究介绍了YOLO-IOD一个新颖的实时IOD框架它利用了预训练的YOLO-World模型。通过部署三个精心设计的模块冲突感知伪标签精炼、基于重要性的内核选择和跨阶段非对称知识蒸馏有效地解决了前景-背景混淆、参数干扰和错配知识蒸馏的挑战YOLO-IOD在保留先前知识和获取检测新类别目标的能力之间实现了最佳平衡。此外我们提出了LoCo COCO基准测试成功地减轻了数据泄露并使类别划分与现实世界的共现情况相一致。YOLO-IOD在各种单步和多步设置下的传统COCO基准测试和LoCo COCO基准测试上都表现出了卓越的性能。