- Autoformer 时序分解预测:用序列分解+自相关机制
Informer 还在点积注意力里挑活跃查询,Autoformer(NeurIPS 2021)直接换了两个零件:一是把「分解」从预处理搬进模型内部——移动平均逐层剥趋势,季节项与趋势项分开建模;二是把点积注意力换成「自相关机制」——用 FFT 以 O(L·logL) 算出自相关谱 R(τ),取 top-k 滞后当候选周期,按 softmax(R(τ)) 权重做时延聚合:预测 = Σ w(τ)·x(t−τ),从「点对点找相似」升级为「整段周期对齐」。纯 numpy 从零实现因果分解 + FFT 自相关 + 时延聚合递推预测,在三重周期(24/96/168)+慢趋势+AR(1)噪声合成序列上做 50 窗口滚动 H=24 多步预测:分解+自相关 MSE=0.257 优于无分解消融 0.263 与季节 naive 0.367,自相关机制自动找到 τ∈{24,96} 真周期;但诚实披露 OLS-96滞后递推 MSE=0.193 仍是全场最优——机制的优雅不等于精度的碾压。附「分解泄漏未来」的一次真实翻车修复(居中移动平均让 AF 版 MSE 虚好 42%),拆穿分解万能/自相关=注意力上位/多步递推免费/top-k 自动对/金融强周期五类陷阱(中阶)。
11 min Chinese - GARCH-EMD 混合波动:用经验模态分解剥离趋势再做 GARCH
直接对收益拟 GARCH(1,1),慢变的结构性波动漂移会污染估计——把长记忆假象塞进 β,持续性虚高到 0.99。混合思路借 Engle-Rangel Spline-GARCH 的乘性分解 σ²_t=g_t·h_t:先用 EMD(经验模态分解)从对数平方收益里剥出慢变方差水平 g_t,对标准化残差再拟合短期 GARCH 因子 h_t。纯 numpy 从零实现 EMD sifting(cubic-spline 包络+端点 clamp)与 GARCH MLE(网格+坐标下降),在「乘性成分」合成收益(慢正弦+陡峭 regime 跳变 × 单位均值 GARCH)上实测:EMD-GARCH 把持续性从纯 GARCH 的 0.99 压回 0.95(剔除伪长记忆),但样本外一步方差预测 QLIKE=−6.57 略输纯 GARCH 的 −6.68——分解修正了参数偏误,却没换来预测精度碾压。附「剥太多 IMF 把 GARCH 聚集也当趋势吸走」与「EMD 端点样条外推不稳」两处真实翻车,拆穿分解万能/持续性越低越好/混合必胜/EMD 因果/端点无害五类陷阱(中阶)。
15 min Chinese - Informer 长序列预测:用概率稀疏注意力砍复杂度
标准 Transformer 注意力是 O(L²):序列拉到 4096 步,一层注意力就要算 1600 万对相似度。Informer(AAAI 2021 最佳论文)的 ProbSparse 注意力抓住一个经验事实——注意力矩阵天然长尾,绝大多数查询行近乎均匀分布、对输出没贡献。它用采样估计每个查询的稀疏度 M(q,K)=max−mean,只让 top-u=c·lnL 个「活跃查询」做完整注意力,懒查询直接输出 V 的均值,复杂度砍到 O(L·lnL)。纯 numpy 从零实现 ProbSparse + 单层注意力回归(手写反向传播、有限差分梯度校验 1e-10 级),实测 L=4096 时提速 53 倍;但诚实披露:在 L=96 的短窗口预测任务上,注意力行不够长尾,c=10 的 ProbSparse 推理 R²=−0.40 远差于 full 推理 0.746,c 扫到 20(u/L≈96%)才恢复 0.727——稀疏近似的前提是分布真的稀疏。另附 OLS-96滞后 R²=0.834 反超注意力的诚实对照,拆穿「ProbSparse 无损/长序列必用 Transformer/加速免费/M 度量万能/金融直接落地」五类真实陷阱(中阶)。
10 min Chinese - 谱密度估计与周期分析:用傅里叶把隐藏的周期从噪声里拎出来
时域里完全看不见的周期,频域一眼看穿——但代价是三个大坑。合成实验:20 日 + 63 日双周期埋进 AR(1) 噪声(信噪比只有 0.19),肉眼看序列就是一团乱麻,原始周期图毛刺满屏,Welch 平均后双峰清晰浮现。显著性必须对着红噪声基线检验:蒙特卡洛模拟 500 条 AR(1),20 日周期越过 99% 包络,63 日周期只过 95%。反面教材:纯随机游走的谱最大伪峰是中位数的 375 倍,不差分直接做谱分析必然『发现』假周期。最后的择时实验最扎心:用 Welch 峰值频率 19.69 日直接外推,512 日后相位漂移 144°,方向准确率 0.393(比抛硬币还差),日均 -0.34;把频率精调到 20.06 日后,准确率 0.584,日均 +0.32。频率差 0.4%,结果天壤之别——周期交易的生死线不在『有没有周期』,而在『频率估得够不够准』(中高阶)。
17 min Chinese - 小波阈值去噪:用多尺度分解把高频噪声和真实跳变分开
去噪的终极难题不是『去掉噪声』,是『别把真实跳变一起磨平』。小波阈值去噪的答案:噪声的能量摊平在所有细节层系数上,真实跳变的能量集中在少数几个大系数上——设一条阈值线,小系数归零、大系数存活,跳变就保住了。合成实验(4 个 ±4~6 元的真实跳变 + std 1.2 的噪声):MAD 从最细层估出 sigma=1.178(真值 1.2),universal threshold 硬阈值把整体 RMSE 从 1.135 压到 0.474;跳变后误差收敛只要 2 天,20 日均线要 5 天,因果均线的跳变后 12 日 RMSE 是小波的 3 倍。但最重要的一节是反面教材:同一个去噪算法,离线全样本版在跳变前一天就开始『预降』(去噪值 99.83 vs 观测 102.99)——它看见了未来。用离线去噪序列做趋势策略总收益 +19.5,换成只用当日以前数据的因果滚动版立刻变成 -16.7。文献里大量『小波去噪+LSTM』的惊人精度,就是死在这一步(中高阶)。
16 min Chinese - 因果卷积金融预测:用膨胀卷积抓长程周期
普通 CNN 做序列预测有个死穴:卷积核宽锁死感受野,要看到 32 步前的周期相位得堆几十层。膨胀卷积(dilated convolution)用「每隔 d 个点采一个样」把感受野从线性拉成指数级——d 逐层翻倍 (1,2,4,8,16),5 层就能覆盖 1+(3−1)·(1+2+4+8+16)=63 步,整根周期纳进窗口;左填充 (k−1)·d 个零保证严格因果、不偷看未来。本文用纯 numpy 从零实现因果膨胀卷积 + 有限差分梯度校验,在多周期正弦叠加合成序列(周期 5/11/17/23/31 步)上实测:膨胀因果 CNN 测试集 R²=0.997、MSE=0.0029,相对普通 CNN(0.996/0.0041) 略有改进,但讽刺的是它仍输给 OLS 线性(0.999/0.0009)——因为任务本质是已知周期的线性叠加,OLS 在精确频率特征上近最优。文章诚实拆穿「膨胀救一切 / 膨胀 CNN 比线性强 / 感受野越大越好 / 因果填充零成本 / 真周期≠可预测」五类真实误区(中阶)。
15 min Chinese - Neural ODE 连续时间建模:把隐藏状态写成微分方程
普通神经网络是「离散层」——你叠 N 层就是 N 次变换,深度=层数、和参数量绑死。Neural ODE(Chen et al. 2018)换了个范式:隐藏状态不靠「第几层」,而靠「积分到时刻 T」得到,dh/dt=f_θ(h,t),从 h(0)=x 用 RK4 积到 h(T) 再读出 y。于是「深度=积分时长 T」,可任意细分、与参数量解耦。本文用纯 numpy 从零实现 RK4 积分 + 把积分计算图展开做反向传播,在「数据来自已知非线性 ODE 流」的合成任务上实测:Neural ODE 测试集 R²=0.992、MSE=0.00204,相对固定深度 MLP(0.989) 改进 25.1%、相对线性(0.158) 改进 99.0%——因为连续流的归纳偏置正好匹配「数据来自连续动力学」。文章诚实拆穿「ODE 比 MLP 强是普适的 / 连续深度免费 / 反向传播廉价 / 数值积分无误差 / 小数据可辨识」五类真实误区(中阶)。
14 min Chinese - TCN 时序卷积交易:用膨胀因果卷积替代 RNN
RNN 记不住长程、又只能串行训练;Transformer 注意力是 O(N²) 显存吃紧。时序卷积网络(TCN,Bai et al. 2018)用「因果膨胀卷积」给出第三条路:感受野随层数指数级扩张、全程并行、且严格不泄漏未来。本文用纯 numpy 从零实现 6 层因果膨胀卷积,在「目标依赖 {1,2,4,8,16,32} 步多尺度滞后」的 tanh 非线性合成序列上实测:TCN 测试集 R²=0.669,相对普通 CNN(0.436) 提升 53.4%、相对朴素基线(−0.009) 碾压;但讽刺的是它仍输给 OLS 线性(0.957)——因为这个任务是线性可加的。文章诚实拆穿「膨胀救一切 / TCN 比线性强 / 感受野越大越好 / 因果填充零成本 / 通道数陷阱」五类真实误区(中阶)。
13 min Chinese
返回