前司有二手车价格预测的业务,原先采用的是较为常见的多因子时间序列方法,但由于数据问题,给甲方做解释非常不简单。所以我提出可一个新的框架。因为前司已经all in ai了,发出来一起探讨下。
一、问题背景:数据约束与方法调整
多因子时间序列方法在实际推进过程中,遇到了几个比较明显的约束:
第一,数据时间跨度较短。
二手车相关数据(尤其是价格指数、库存、结构数据等)可获得的历史区间有限,难以支撑时间序列模型进行有效训练和验证。
第二,数据质量与口径不稳定。
不同来源的数据在统计口径、更新频率上存在差异,一些关键变量(如二手车库存)缺乏统一、连续的高频数据。
第三,因子难以做截面与时间维度的验证。
在样本量不足的情况下,多因子模型容易出现“拟合有效但不可外推”的问题,参数稳定性无法验证。
在这种情况下,如果继续沿用原有方法,模型结果容易出现两类问题:
- 对历史拟合较好,但对未来预测不稳定
- 对输入变量较为敏感,容易产生难以解释的波动
基于上述约束,模型从“统计驱动”转向“结构驱动”,构建了一个简化的预测框架。其核心目标不是提高短期预测精度,而是在数据有限的情况下:
- 保持结果稳定
- 保证变量具备可解释性
- 在中长期趋势上提供方向性判断
同时,在使用上引入季度复核机制,对模型进行定期校准。在变量选择上,需要提前确立变量长期目标值,以保障结果的稳定。所以,基本上就是先对整个新车、二手车市场做完整的发展判断,再选择变量。
二、市场阶段判断:仍处成长向成熟过渡期
从行业发展阶段来看,中国汽车市场尚未进入成熟期。
从人均GDP、人口结构以及行业发展节奏等维度对比,中国当前阶段大致对应美国上世纪60年代末至70年代,即从成长后期逐步进入结构重塑阶段。
从保有量角度也可以得到类似结论:
- 当前中国汽车千人保有量约为210(2022年)
- 市场普遍认为成熟期水平在400左右
即目前仍处于成熟期的一半左右。
在此基础上可以对成熟期规模进行估算:
汽车总保有量:约5.6亿辆(按14亿人口、千人400计算)
新车销量:按5%报废更新比例,对应约2800万辆
这一比例与成熟市场经验基本一致。
三、二手车市场空间:交易量仍有提升空间
相比新车市场,二手车市场发展相对滞后。
参考日本和韩国市场,可以用两种方式估算成熟水平:
- 二手车 / 新车 ≈ 1.6,对应约4500万辆
- 二手车 / 保有量 ≈ 9%,对应约5000万辆
而当前中国二手车交易量约为1800万辆(2023年预估),仍有接近2倍提升空间。
这意味着当前市场在供需两端都存在一定约束,交易尚未充分释放。
四、价格指数的长期趋势:市场完善带来的下行压力
从长期来看,二手车价格指数的变化,与市场成熟度密切相关。
当前市场存在以下特征:
- 二手车 / 新车比例偏低,需求尚未充分释放
- 二手车 / 保有量比例偏低,供给流通不充分
这种状态通常对应较高的交易成本,例如信息不透明、流通效率低等。
随着市场逐步完善:
- 流通效率提升
- 交易成本下降
- 供需释放
- 价格中枢存在下行空间。
五、中期结构变化:新能源渗透的影响
在中期维度上,新能源渗透率是影响价格的重要变量。
随着新能源车占比提升,对燃油车形成替代,进而影响二手车价格。
这一影响具有阶段性:
- 初期受续航限制
- 中期受充电便利性约束
- 后期受成本和使用体验驱动
在模型中,对这一影响采用线性近似处理。该处理主要用于刻画中期趋势,而非精确描述每一阶段变化。
六、短周期波动:以库存为主要观测变量
在短期维度上,价格波动主要通过库存反映。
由于二手车库存数据较为缺乏,模型采用新车库存作为替代变量,原因在于:
- 数据获取更稳定
- 更新频率更高
- 与行业供需周期具有较强一致性
在需求相对稳定的情况下:
- 库存上升 → 供给压力增加 → 价格下行
- 库存下降 → 供给收紧 → 价格回升
整体周期约为一年,但会受到春节等季节性因素影响。
在该框架下,短期波动主要由库存承接。
七、模型结构:趋势 + 结构 + 周期
基于上述分析,将价格指数拆解为三个部分:
- 长期趋势(市场完善度)
- 中期结构(新能源渗透率)
- 短期周期(库存)
1. 新能源渗透率
在新能源快速发展阶段(如2021–2022年),其对价格的影响较为集中。
模型估计结果:若渗透率达到90%,价格指数较当前下降约21.5ppt
2. 市场完善度
用交易量进行间接解释:
当前交易量约1800万辆,距离成熟期仍有约3000万辆空间
对应价格指数下降约17ppt
3. 库存
库存用于刻画短期供给变化,是当前数据中最具时效性的指标。
在模型中承担短周期波动的主要解释作用。
总结
该框架在设计上具有以下特点:
- 不依赖长时间序列数据
- 变量数量较少,结构清晰
- 结果相对稳定,不易出现异常波动
- 主要用于刻画趋势,而非捕捉短期拐点
整体上,这是一个在数据约束条件下构建的简化预测方法,通过结构划分替代统计验证,用稳定性换取可解释性和可用性。