- 累积局部效应 ALE:用条件期望修正相关因子下的边际效应
PDP 有个绕不过的死穴:因子彼此相关时,它会把某个因子强行设成某值、其余保留原值,从而外推到根本不存在的样本组合,把相关因子借来的效应算成自己的。ALE(Accumulated Local Effects)换个算法——把因子取值切成窄箱,在每个箱内只用真实存在的样本算『局部差分』(同一批样本换到箱边界两侧的预测之差),再沿因子方向累加。这样它永远不外推、只在数据支撑的邻域里说话。本文用相关系数 0.92 的两个因子做对照:一个是真驱动、一个纯冗余,看 PDP 如何被冗余因子骗、ALE 如何把它的伪效应修正回近零,附纯 numpy 从零实现的 ALE(中阶)。
14 min Chinese - 命名实体识别金融事件:从新闻里自动抽出公司-事件-时间
关键词正则抽事件有个死穴:它认得『回购』这个词,却认不出『拟以自有资金实施股份回购』里被拆开的实体,更分不清『茅台回购、格力增持』同一句里两家公司各自的动作。命名实体识别(NER)用 BIO 序列标注 + CRF 转移约束,把一条新闻切成『公司-事件-时间』三元组。本文从零讲清 BIO 标注、CRF 为什么能压掉非法标签路径,用合成金融语料对比正则法与序列标注的分类型 F1(公司 0.61 vs 0.90、事件 0.42 vs 0.83),并诚实指出中文分词、嵌套实体、事件归属三大真实陷阱,附完整 Python(中阶)。
17 min Chinese - 局部依赖图 PDP:把单个因子与收益的边际关系画成曲线
机器学习因子模型跑出了收益,你却说不清『动量到底怎么影响预测』——因为模型是黑箱,特征重要性只给排名不给形状。PDP(Partial Dependence Plot)把某个因子在其取值范围上扫一遍、其余特征原样保留后对全样本预测求平均,画出这个因子与预测收益的边际曲线:是单调、倒U 还是阶梯,一眼看穿。本文用合成因子数据训练梯度提升树,画动量的倒 U 型甜区、四因子 PDP 面板、动量×规模的二维交互热图,并诚实拆穿 PDP 最致命的陷阱——相关因子下它会强行外推到根本不存在的样本组合、把借来的效应算成自己的(附完整 Python,中阶)。
15 min Chinese - SHAP 因子解释:用博弈论份额拆开每个特征对预测的贡献
树模型自带的 gain 重要性有两个死穴:它偏爱高基数特征、而且只给全局排名,答不了『这一只股票为什么被模型看多』。SHAP 借来博弈论里的 Shapley 值——把预测当成一场合作博弈,每个因子是玩家,公平分配它对这次预测的贡献。本文讲清 Shapley 值的可加性从哪来、为什么 base value 加上所有 SHAP 值恰好等于 f(x),用合成因子数据做单样本瀑布图、全局重要性对比、依赖图揭示交互效应,并诚实指出相关特征分摊、计算成本、因果幻觉三大陷阱,附完整 Python(中阶)。
15 min Chinese - Autoformer 时序分解预测:用序列分解+自相关机制
Informer 还在点积注意力里挑活跃查询,Autoformer(NeurIPS 2021)直接换了两个零件:一是把「分解」从预处理搬进模型内部——移动平均逐层剥趋势,季节项与趋势项分开建模;二是把点积注意力换成「自相关机制」——用 FFT 以 O(L·logL) 算出自相关谱 R(τ),取 top-k 滞后当候选周期,按 softmax(R(τ)) 权重做时延聚合:预测 = Σ w(τ)·x(t−τ),从「点对点找相似」升级为「整段周期对齐」。纯 numpy 从零实现因果分解 + FFT 自相关 + 时延聚合递推预测,在三重周期(24/96/168)+慢趋势+AR(1)噪声合成序列上做 50 窗口滚动 H=24 多步预测:分解+自相关 MSE=0.257 优于无分解消融 0.263 与季节 naive 0.367,自相关机制自动找到 τ∈{24,96} 真周期;但诚实披露 OLS-96滞后递推 MSE=0.193 仍是全场最优——机制的优雅不等于精度的碾压。附「分解泄漏未来」的一次真实翻车修复(居中移动平均让 AF 版 MSE 虚好 42%),拆穿分解万能/自相关=注意力上位/多步递推免费/top-k 自动对/金融强周期五类陷阱(中阶)。
11 min Chinese - 共形强化学习交易:给 RL 动作一个可验证的覆盖保证
RL 输出一个 Q 值就下单,但点估计不带可靠性凭证——分布一漂移就「自信地犯错」。共形预测包裹任意预测器输出预测区间,有限样本+分布无关保证以 ≥1−α 覆盖真实收益,唯一假设是可交换性。据此设计带可验证下限的交易规则:仅当共形收益下界>0 才出手。纯 numpy 分裂共形+局部自适应,异方差+协变量偏移合成 bandit 上实测:同分布目标覆盖 90% 实测 91.1%(保证兑现);门控把开仓即盈利命中率从 76.9% 抬到 97.4%,代价出手率降到 17.1%。诚实翻车:可交换性破坏→偏移 3.0 时覆盖从 90% 崩到 53.8%;边际覆盖达标≠处处达标——普通等宽区间高波动区只覆盖 49%、低波动区 98%,需局部自适应共形拉回 87%~92%。拆穿保证=永真/边际=条件/区间=预测准/无分布=无假设/覆盖达标即可交易五类陷阱(中阶)。
16 min Chinese - 离线强化学习交易:用 CQL 保守 Q 学习做策略迁移
实盘不允许在线试错,离线 RL 只用历史日志学策略——但直接把 Q 学习搬到固定数据集会灾难:Bellman 目标里的 maxₐQ 专挑没被覆盖的 OOD 动作、把 Q 越推越高(自举高估),部署即崩。CQL(NeurIPS 2020)加保守正则:压低所有动作 logsumexp Q、抬高数据里真实动作 Q,给未见动作上保守下限。纯 numpy 表格版 CQL,在「趋势为主+偶发反转」合成 MDP 上用只覆盖 40% 格子的 800 步窄日志训练,40 个样本外新市场平均实测:Naive-FQI 总收益 −61%/Sharpe −1.18/回撤 65%/胜率 0%,CQL +11.5%/+0.43/7.5%/72%——OOD 动作平均 Q 从 0 压到 −0.44。诚实翻车:α 太小压不住高估、过大退化成行为克隆收益封顶;数据一充足 Naive 反超 CQL。拆穿离线=免费午餐/覆盖不重要/α越大越稳/合成赢=实盘赢/保守必胜五类陷阱(中阶)。
17 min Chinese - Crossformer 跨变量预测:用维度分段注意力建模变量交互
多资产预测里最容易被漏掉的信息,是『变量之间怎么互相带动』——大多数时序 Transformer 把每个变量单独摊平,只在时间轴上做注意力,跨变量的联动全靠模型自己隐式脑补。Crossformer(Zhang & Yan, ICLR 2023)明确把注意力拆成两段:先在时间轴上分段(DSW,维度分段嵌入)压缩局部形态,再用两阶段注意力(TSA)分别在时间段之间、变量维度之间显式建模。本文用纯 numpy 从零拆解『分段嵌入 + 跨时间 + 跨变量』的两阶段结构,在 6 资产共享隐因子的合成序列上诚实实测:跨变量注意力把单步预测 R² 从朴素持平的 0.356 抬到 0.366——增益真实但微小,并拆穿维度注意力万能/跨变量必优/分段无损/关联=因果/直接落地五类真实陷阱(中阶)。
15 min Chinese
返回