- 累积局部效应 ALE:用条件期望修正相关因子下的边际效应
PDP 有个绕不过的死穴:因子彼此相关时,它会把某个因子强行设成某值、其余保留原值,从而外推到根本不存在的样本组合,把相关因子借来的效应算成自己的。ALE(Accumulated Local Effects)换个算法——把因子取值切成窄箱,在每个箱内只用真实存在的样本算『局部差分』(同一批样本换到箱边界两侧的预测之差),再沿因子方向累加。这样它永远不外推、只在数据支撑的邻域里说话。本文用相关系数 0.92 的两个因子做对照:一个是真驱动、一个纯冗余,看 PDP 如何被冗余因子骗、ALE 如何把它的伪效应修正回近零,附纯 numpy 从零实现的 ALE(中阶)。
14 min Chinese - 局部依赖图 PDP:把单个因子与收益的边际关系画成曲线
机器学习因子模型跑出了收益,你却说不清『动量到底怎么影响预测』——因为模型是黑箱,特征重要性只给排名不给形状。PDP(Partial Dependence Plot)把某个因子在其取值范围上扫一遍、其余特征原样保留后对全样本预测求平均,画出这个因子与预测收益的边际曲线:是单调、倒U 还是阶梯,一眼看穿。本文用合成因子数据训练梯度提升树,画动量的倒 U 型甜区、四因子 PDP 面板、动量×规模的二维交互热图,并诚实拆穿 PDP 最致命的陷阱——相关因子下它会强行外推到根本不存在的样本组合、把借来的效应算成自己的(附完整 Python,中阶)。
15 min Chinese
返回