分类模型输出0.8,是否能把它解释为“相似样本中约八成会发生目标事件”?模型把正样本排在负样本前面、默认阈值下分对类别,以及输出概率是否接近实际发生频率,是三个不同问题。需要按风险概率决定是否复检时,后一个问题尤其重要。本文在可复现的模拟二分类数据上,把训练、校准、阈值开发和最终测试四份数据分开。比较原始随机森林概率与 sigmoid、isotonic 两种校准结果,再用事先写明的示例误判成本选择阈值。测试集只做最终检查,不参与挑选校准器或阈值。文章目录排序、分类准确率与概率可靠性有什么区别如何用可靠性图和 Brier 分数发现问题什么时候选择 sigmoid 或 isotonic 校准用独立测试数据验证校准前后的变化概率变准以后怎样设定决策阈值总结排序、分类准确率与概率可靠性有什么区别ROC AUC 衡量随机抽取的正样本排在负样本前面的能力;准确率依赖一个具体阈值;校准关心一批预测概率约为0.8的样本,真实正类比例是否也接近0.8。AUC 高的模型仍可能过度自信,校准较好的模型也未必有更强的排序能力。指标或检查它回答的问题不能替代什么ROC AUC正负样本的排序区分程度概率是否可解释、实际触发阈值是否合适。可靠性图概率分组的均值与真实发生率是否接近每个单独样本的概率一定准确。Brier 分数概率与二元结果的均方差,越低越好业务误判成本,或固定阈值下的工作量。阈值成本在给定误报与漏报代价时,决策是否可接受模型概率本身是否校准。因此,若概率只用于排序,首先关心排序质量;若要把0.8当作风险频率解释,就需要做校准诊断;若要安排人工复检,还必须根据错误代价与容量约束决定阈值。