- 分位数 RNN 风险预测:用分位损失给出收益区间
点预测答不出「明天最坏跌多少」。分位数 RNN(QRNN)把 RNN 的隐状态接 5 个输出头,用 pinball 损失同时学 τ=0.05/0.25/0.5/0.75/0.95 五条条件分位数——隐状态自动记住波动聚集,区间随市场松紧收放。纯 numpy 从零实现 Elman RNN + 截断 BPTT + 分位损失(手推 pinball 次梯度),在 GARCH(1,1)+t(5) 合成收益上样本外 1000 步实测:QRNN pinball=0.2720 逼近 Oracle(真实 σ+t 分位)的 0.2694,90% 区间覆盖 88.5%,区间宽度与真实波动相关 0.861——碾压滚动历史分位的 0.137;但诚实告败:EWMA-高斯(RiskMetrics,2 个参数)pinball=0.2717 与 QRNN 打平,因为数据生成过程恰好是它的主场。真实翻车实测:独立训练 5 个分位数模型 → 1.9% 时间步分位数交叉(q̂₀.₀₅ > q̂₀.₂₅),联合训练+单调重排才干净;高波动 regime 覆盖率掉到 86.8%。拆穿区间=分布/覆盖率达标=校准/深度必胜EWMA/交叉不重要/合成赢=实盘赢五类陷阱(中阶)。
14 min Chinese - 稳健协方差 MCD 估计:用最小协方差行列式抗住极端值污染
协方差矩阵是组合优化、风险模型、配对交易的地基,但样本协方差有个致命弱点——单点崩溃:只要几个极端值,整个相关结构就被拖歪。合成实验(真实相关 0.7,10% 样本被反向污染):经典相关系数直接崩到 −0.068(连符号都错了),MCD 稳健估计还原到 0.611。距离-距离图上 MCD 把 40 个污染点里的 27 个甩到右上方(FP 仅 1),经典马氏距离只抓到 11 个。最扎心的是组合权重:真实最小方差权重是 (1.04, −0.04),经典协方差给出 (0.62, 0.38)——把该做空的资产配成了 38% 多头,MCD 给出 (0.95, 0.05) 基本还原。核心机制:在所有样本子集里找行列式最小(最紧致)的那 h 个点估协方差,极端值天然行列式大、被排除在外。附一致性校正因子、C-step 迭代、以及『稳健≠无脑抗噪,h 选太大照样被污染拉偏』的反面教材(中高阶)。
17 min Chinese - 得分匹配生成金融序列:用去噪分数匹配合成行情
生成式模型要学分布 p(x) 却卡在归一化常数 Z 上。得分匹配(Hyvärinen 2005)绕开 Z——只学分数 s(x)=∇log p(x),它与 Z 无关。去噪分数匹配 DSM(Vincent 2011)更妙:给数据加噪 x̃=x+σε,让网络学预测 (x−x̃)/σ²,等价于「从噪声指回干净数据的方向」;采样用 Langevin 动力学沿分数场爬向高密度区。这正是当今扩散模型(Diffusion)的数学地基。纯 numpy 从零实现 DSM 闭式最优解(Parzen/Tweedie 去噪器)+ Langevin 采样,在「平静态+危机态」混合的重尾金融收益上实测:生成样本还原资产相关 ρ=0.49(真实 0.54)、下尾联动 P(B跌|A跌)=0.45(真实 0.47),重尾与左偏形状 QQ 图基本对齐;但诚实翻车——Langevin 步长 δ 太大方差爆炸(δ=0.2 时 std 误差 9.7)、太小混合慢覆盖不足,且低密度区分数估计误差随距离线性上升(斜率 7.1),采样进不去稀有危机区。拆穿分数匹配免归一化就免费/单尺度够用/Langevin 随便调/生成即真实/直接造行情五类陷阱(中阶)。
12 min Chinese - Set Transformer 金融表征:用诱导点注意力聚合多资产
组合是集合不是序列,但 DeepSets 的「逐资产编码+对称池化」有个盲区:池化前每个资产互相看不见,成对交互(拥挤度、相似持仓共振)只能靠编码器隐式凑。Set Transformer(ICML 2019)把交互焊进结构:SAB 让集合内元素两两做注意力,PMA 用可学习种子向量做注意力池化,ISAB 用 m 个诱导点把 O(K²) 注意力砍成 O(K·m)。纯 numpy 从零实现 SAB+PMA(手写 einsum 反向传播,梯度校验 1e-9 级),在组合拥挤度聚合任务上实测:SetTransformer R²=0.843 > DeepSets-mean 0.831 ≈ 统计聚合+Ridge 0.830——成对交互任务上有真实但温和的优势;注意力矩阵与真实相似度结构吻合,置换偏移 1.4e-15;ISAB 实测 K=2048 时提速 55 倍。但诚实翻车:n=300 小样本下 SetTransformer 过拟合(train 0.92 / test 0.53),被 DeepSets(0.80)反杀——注意力参数多,先吃数据。拆穿注意力必胜/池化都一样/诱导点无损/交互自动学会/直接上实盘五类陷阱(中阶)。
14 min Chinese - 平滑转移自回归 STAR:用连续过渡函数给 regime 加一条软边界
TAR 的硬门限意味着 y 从 −0.0001 变到 +0.0001 时模型系数瞬间跳变——市场哪有这么听话的开关。STAR 用逻辑过渡函数 G(γ,c) 把两套 AR 系数连续混合:γ 大是硬切换(退化成 TAR),γ 小是渐变,让数据自己决定边界的软硬。纯 numpy 实现 LSTAR 网格估计(γ×c 双重网格+内层 OLS):合成 LSTAR 数据上估出 γ̂=2.5(软边界),RSS 比线性 AR 低 4.4%,比硬 TAR 再低 0.015%。真正的红利在仓位端:G 函数天然输出 0~1 连续状态权重,软仓位择时样本外 Sharpe 4.95 vs 硬 0/1 仓位 4.19,最大回撤 −5.2% vs −10.0%,平均仓位仅 53%。诚实翻车:γ 与 c 联合估计病态(γ 大时似然面平坦),本实验训练集就把 γ=2.5 估成了 6;γ 不可识别时 Luukkonen LM 检验才是正解;软仓位的换手成本被本文忽略。拆穿 STAR 一定优于 TAR/γ 可以精确估计/软边界=模糊无用等陷阱(中阶)。
11 min Chinese - 谱密度估计与周期分析:用傅里叶把隐藏的周期从噪声里拎出来
时域里完全看不见的周期,频域一眼看穿——但代价是三个大坑。合成实验:20 日 + 63 日双周期埋进 AR(1) 噪声(信噪比只有 0.19),肉眼看序列就是一团乱麻,原始周期图毛刺满屏,Welch 平均后双峰清晰浮现。显著性必须对着红噪声基线检验:蒙特卡洛模拟 500 条 AR(1),20 日周期越过 99% 包络,63 日周期只过 95%。反面教材:纯随机游走的谱最大伪峰是中位数的 375 倍,不差分直接做谱分析必然『发现』假周期。最后的择时实验最扎心:用 Welch 峰值频率 19.69 日直接外推,512 日后相位漂移 144°,方向准确率 0.393(比抛硬币还差),日均 -0.34;把频率精调到 20.06 日后,准确率 0.584,日均 +0.32。频率差 0.4%,结果天壤之别——周期交易的生死线不在『有没有周期』,而在『频率估得够不够准』(中高阶)。
17 min Chinese - 门限自回归 TAR 非线性建模:用状态依赖的回归捕捉市场不对称反应
线性 AR 假设涨跌反应对称——但市场明显不是:下跌后反转快、上涨后延续慢。TAR/SETAR 用一个门限把状态空间切成两段,每段各配一套 AR 系数,让『昨天涨还是跌』决定今天用哪个模型。纯 numpy 实现网格搜索门限估计:合成 SETAR 数据上,下状态斜率 −0.20(均值回归)、上状态 +0.36(动量延续),线性 AR 只能给出一条『平均直线』全部拟丢,SETAR 把 RSS 压低 3.4%。样本外择时回测:TAR 择时 Sharpe 4.69 vs 线性 AR 4.19 vs 买入持有 4.46,最大回撤从 −7.6% 收窄到 −6.1%,仓位暴露仅 87.8%。诚实翻车:门限估计的抽样误差不小(真值 0 估出 −0.0034);Hansen 检验下门限参数不可识别导致标准推断失效;两段样本量不平衡时小状态系数噪声大。拆穿门限=拐点万能/RSS 降幅小=无用/TAR 一定赢线性等陷阱(中阶)。
11 min Chinese - 向量误差修正模型 VECM:把协整关系写成向长期均衡的拉力
两条价格各自都是随机游走,差分建模却会把它们之间最值钱的信息——长期均衡关系——直接扔掉。VECM 的答案:在差分方程里加回误差修正项 α(y1−βy2),让偏离均衡的距离本身成为回归的拉力。纯 numpy 走完全流程:Engle-Granger 两步法估出协整系数 1.232(真值 1.25),残差 ADF=−7.24 确认协整;伪回归对照组 R²=0.62 但 ADF 只有 −1.60——高 R² 不等于协整。误差修正系数 α₁=−0.061 (t=−3.8)、α₂=+0.062 (t=+3.8),两腿对向修正,价差半衰期 4.8 天;Johansen 迹检验 54.9 >> 15.5 临界值交叉验证。配对交易样本外 500 天:z>2 开仓、|z|<0.5 平仓、z>4 止损,净 Sharpe 2.08、回撤 3.5%、19 次动作。诚实说明:合成数据协整关系永不破裂,真实市场协整会死(招行/平安、可乐/百事都散过伙);EG 法把 β 的估计误差全部灌进价差;z>4 止损保护不了缓慢漂移型破裂。拆穿相关性=协整、半衰期恒定等经典误区(中阶)。
15 min Chinese
返回