PATE —— 新的 “时序异常” 评估指标

PATE —— 新的 “时序异常” 评估指标

如有侵权或其他问题,欢迎留言联系更正或删除。

出处:KDD 2024

代码链接: https://github.com/Raminghorbanii/PATE

一 动机介绍

(1) “时序异常检测” 任务应该关注的要点:

① 早期检测(Early Detection):如上图的 a1 与 p11;

基于数据模式在时间维度上的微妙变化,潜在的时序异常在其完全显现前被检测出;

② 延迟检测(Delayed Detection):如上图的 a1 与 p12;

当异常事件未被立即检测到,而在稍后被检测出;

③ 启动响应时间(Onset Response Time):如上图的 a2 与 p21、p22,p21更优;

指异常检测与事件开始间的距离;(* PS. 跟 Imdiffusion 内的 ADD差不多?)

④ 预测覆盖级别(Coverage level of Predictions):如上图的 a3 与 p31、p32,p31更优;

指预测覆盖实际异常的范围,预测的有效性可通过它成功捕获了多少异常来衡量;

(2) PATE 与现有指标的全面比较:

二 Method

(1) 事件分类:

① 预测事件分类(Prediction events categories):

Ⅰ True - Detection:准确检测且无任何遗漏,如:p1、p6-2;

Ⅱ Post - Buffer - Detection:延后预测,预测事件落入 “后缓冲区”,如:p2、p6-3;

缓冲区大小可由专家根据具体应用需求相应调整,若缺乏专家知识,可设定一系列长度的缓冲区;

Ⅲ Pre-Buffer Detection:提前预警预测,预测事件落入 “前缓冲区”,如:p4、p6-1;

缓冲区大小可由专家根据具体应用需求相应调整,若缺乏专家知识,可设定一系列长度的缓冲区;

注意:“前缓冲区” 不与 “后缓冲区” 重叠,“后缓冲区” 优先级高于 “前缓冲区”;

个人理解:这代表 PATE 更重视对 时序异常 的 “全部检出”;

Ⅳ Outside:完全处于缓冲区外的预测事件,如:p3、p7(此处p7可能绘制错误)

② 异常事件分类(Anomaly events categories):

Ⅰ Total Missed Anomalies:完全遗漏异常,如:a4 和 p7;

Ⅱ Partial Missed Anomalies:部分检出异常,如:a2 和 p5;

(2) 各类事件 对应的权重分配:

Ⅰ True - Detection:

Ⅱ Post - Buffer - Detection:

针对 TP 的计算:

公式解读:

* 核心思想:

① 考虑整个异常事件的影响:传统的异常检测方法可能只关注异常事件的起点或终点,而这种方法通过计算点 t 与异常事件中所有点的距离,全面考虑了异常事件的影响;

② 权重随距离减递:点 t 距离异常事件越远,其权重越低,反映了异常事件的影响随时间逐渐减弱;

③ 归一化处理:通过分母的归一化,确保权重值在合理范围内,便于后续分析。

针对 FP 的计算:(直接与 TP 相反)

Ⅲ Outside Weights:

Ⅳ Pre-Buffer Detection Weights:(与 Ⅱ 思想雷同,此处仅展示公式)

针对 TP 的计算:

针对 FP 的计算:

Ⅴ Total Missed Anomalies Weights:

Ⅵ Partial Missed Anomaly Weights:

(3) PATE 的最终分数:

具体实验一:

部分重要结论:(其余结论较为符合直觉)

① s1 和 s5 对比,s5 分数更高,是因为 s5 更可能为滞后预测,而 s1 更可能是随机噪音;(几乎为0)

① s2 和 s4 对比,s2分数更高,是因为 s2 更靠前,异常检测的实时性极为重要;

具体实验二:不同的数据集由于其数据特性,应当被选择不同长度的缓冲区,而 PATE 的先进之处还在于缓冲区大小的选择只会影响绝对值,不会影响模型评估时的 “相对排名”:

PS. 在本文的附录内,还介绍了一种新颖指标:PATE - F1 !

另外, VUS 系列指标通过更改原始标签,给出了不切实际的分数,另外,使用 VUS 评估理论最优时序异常分数,未达理论最大值1 !