一个分类模型的准确率达到 89%,是否就能投入使用?如果目标是找出需要复检的少数样本,模型把所有样本都判为“无需复检”,也可能得到这样的数字。判断模型有没有价值,不能只看分数高低,而要先问:不用输入特征、只凭训练集标签分布,能得到什么结果?本文把DummyClassifier和DummyRegressor当作“最低限度的参照”,用可复现的模拟分类与回归实验说明基线如何改变结论。重点不是给算法排固定名次,而是建立“确定业务目标 → 选择恰当基线与指标 → 在同一划分下比较 → 独立验证”的判断思路。模拟数据不代表真实业务效果。文章目录高准确率为什么仍可能没有价值先决定指标,再决定比较方式用可复现的实验比较模型与基线读懂实验结果,而不是只看最高分把基线比较转成选型决策总结高准确率为什么仍可能没有价值假设要从产品检测记录中识别需要复检的样本,而真正需要复检的样本只占约 10%。如果始终预测“无需复检”,普通准确率仍可能接近 90%,但需要复检的产品一个也找不出来。此时,准确率回答的是“整体猜对了多少”,没有单独回答“漏掉了多少需要复检的产品”。一个有用的基线应与任务和指标对应,而不是随意选一个很弱的模型充数:任务与目标可先建立的基线基线回答的问题类别不均衡的分类,先看普通准确率DummyClassifier(strategy="prior")只按训练集多数类预测,复杂模型是否连多数类规则都没有超过?分类目标重视少数类检出同一个 Dummy 模型,再看正类召回率与平衡准确率高准确率是否只是类别比例带来的表面优势?连续数值预测,以平均绝对误差衡量DummyRegressor(strategy="mean")或strategy="median"使用输入特征的模型是否比固定预测一个训练集统计量更有用?Dummy