- 分位数回归森林:给出收益分布而非单点预测
传统模型只给「明天涨 3%」一个点预测,却答不出「这个数我有多不确定、最坏会跌多少」。分位数回归森林(QRF, Meinshausen 2006)把随机森林的每个叶节点存成样本集合,预测时直接对落点叶的样本求经验分位——于是一次预测吐出整条条件收益分布,而非一个点。本文用纯 numpy 从零实现回归树 + 随机森林 + QRF,在「异方差 + 左偏」的合成收益上实测:90% 区间经验覆盖 QRF=0.874、OLS-正态=0.902、CRPS QRF=0.531 优于 OLS 正态的 0.563 与线性 QR 的 5.326,并诚实拆穿「森林=平滑均值 / 分位单调 / 样本量免费 / OOB 替代 / 分布外可信」五类真实陷阱(中阶)。
12 min Chinese - 双重机器学习 Double ML 因果估计:把「被混淆的因果」剥离干净
你算出「低波动股跑赢」就敢说低波动「导致」高收益吗?两者可能都被某个隐藏变量驱动——这是因果推断的死穴:混淆。双重机器学习 Double ML (Chernozhukov et al. 2018) 用两阶段机器学习(随机森林纯 numpy 从零实现)估计「处理→结果」之外的所有混淆路径 g(X)/f(X),再用交叉拟合 cross-fitting 残差化,把处理效应 θ 从相关里撬成因果。自洽合成面板(Y=θ·D+g(X)+ε, D=f(X)+ν, g 与 f 共享非线性项)上:朴素 OLS 估到 1.88(真值 1.50,偏差 +0.38)、线性残差化 Double ML 仍 1.90(偏差 +0.40,抓不住非线性混淆)、随机森林 Double ML 压到 1.60(偏差 +0.10,蒙特卡洛 100 次 SD≈0.02);并诚实拆穿 RF 收缩偏误/无交叉拟合必过拟合/混淆变量遗漏/模型误设/PLM 线性假设五类真实陷阱(中阶)。
16 min Chinese
返回