- Set Transformer 金融表征:用诱导点注意力聚合多资产
组合是集合不是序列,但 DeepSets 的「逐资产编码+对称池化」有个盲区:池化前每个资产互相看不见,成对交互(拥挤度、相似持仓共振)只能靠编码器隐式凑。Set Transformer(ICML 2019)把交互焊进结构:SAB 让集合内元素两两做注意力,PMA 用可学习种子向量做注意力池化,ISAB 用 m 个诱导点把 O(K²) 注意力砍成 O(K·m)。纯 numpy 从零实现 SAB+PMA(手写 einsum 反向传播,梯度校验 1e-9 级),在组合拥挤度聚合任务上实测:SetTransformer R²=0.843 > DeepSets-mean 0.831 ≈ 统计聚合+Ridge 0.830——成对交互任务上有真实但温和的优势;注意力矩阵与真实相似度结构吻合,置换偏移 1.4e-15;ISAB 实测 K=2048 时提速 55 倍。但诚实翻车:n=300 小样本下 SetTransformer 过拟合(train 0.92 / test 0.53),被 DeepSets(0.80)反杀——注意力参数多,先吃数据。拆穿注意力必胜/池化都一样/诱导点无损/交互自动学会/直接上实盘五类陷阱(中阶)。
14 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - 因果卷积金融预测:用膨胀卷积抓长程周期
普通 CNN 做序列预测有个死穴:卷积核宽锁死感受野,要看到 32 步前的周期相位得堆几十层。膨胀卷积(dilated convolution)用「每隔 d 个点采一个样」把感受野从线性拉成指数级——d 逐层翻倍 (1,2,4,8,16),5 层就能覆盖 1+(3−1)·(1+2+4+8+16)=63 步,整根周期纳进窗口;左填充 (k−1)·d 个零保证严格因果、不偷看未来。本文用纯 numpy 从零实现因果膨胀卷积 + 有限差分梯度校验,在多周期正弦叠加合成序列(周期 5/11/17/23/31 步)上实测:膨胀因果 CNN 测试集 R²=0.997、MSE=0.0029,相对普通 CNN(0.996/0.0041) 略有改进,但讽刺的是它仍输给 OLS 线性(0.999/0.0009)——因为任务本质是已知周期的线性叠加,OLS 在精确频率特征上近最优。文章诚实拆穿「膨胀救一切 / 膨胀 CNN 比线性强 / 感受野越大越好 / 因果填充零成本 / 真周期≠可预测」五类真实误区(中阶)。
15 min Chinese - Neural ODE 连续时间建模:把隐藏状态写成微分方程
普通神经网络是「离散层」——你叠 N 层就是 N 次变换,深度=层数、和参数量绑死。Neural ODE(Chen et al. 2018)换了个范式:隐藏状态不靠「第几层」,而靠「积分到时刻 T」得到,dh/dt=f_θ(h,t),从 h(0)=x 用 RK4 积到 h(T) 再读出 y。于是「深度=积分时长 T」,可任意细分、与参数量解耦。本文用纯 numpy 从零实现 RK4 积分 + 把积分计算图展开做反向传播,在「数据来自已知非线性 ODE 流」的合成任务上实测:Neural ODE 测试集 R²=0.992、MSE=0.00204,相对固定深度 MLP(0.989) 改进 25.1%、相对线性(0.158) 改进 99.0%——因为连续流的归纳偏置正好匹配「数据来自连续动力学」。文章诚实拆穿「ODE 比 MLP 强是普适的 / 连续深度免费 / 反向传播廉价 / 数值积分无误差 / 小数据可辨识」五类真实误区(中阶)。
14 min Chinese - RNN/LSTM 金融时序预测:用门控记忆捕捉长程依赖
递归神经网络(RNN)靠隐藏状态把「过去」压缩进「现在」,天然适合「给定过去 T 个收益,预测下一期」这类时序任务。但金融序列信噪比极低,RNN 常常「训得动却赢不了线性模型」。本文用纯 numpy 从零实现 Vanilla RNN(BPTT + 梯度裁剪,无任何深度学习框架),在一个含慢因子+波动率聚集+短期动量的合成收益序列上做下一期收益预测,诚实报告结果:RNN 测试集 R²=0.171、方向准确率 0.658、MSE 比 OLS 低 1.1%;而 OLS 本身已比朴素基线低 34.7%。结论不是「RNN 完胜」,而是「在弱信号金融数据上,RNN 的增益是真实的但微小的,真正的价值在它对非线性/波动结构的建模能力,而非暴力拟合」。并附 LSTM 门控代码与四条最易踩的边界(中阶)。
11 min Chinese - TCN 时序卷积交易:用膨胀因果卷积替代 RNN
RNN 记不住长程、又只能串行训练;Transformer 注意力是 O(N²) 显存吃紧。时序卷积网络(TCN,Bai et al. 2018)用「因果膨胀卷积」给出第三条路:感受野随层数指数级扩张、全程并行、且严格不泄漏未来。本文用纯 numpy 从零实现 6 层因果膨胀卷积,在「目标依赖 {1,2,4,8,16,32} 步多尺度滞后」的 tanh 非线性合成序列上实测:TCN 测试集 R²=0.669,相对普通 CNN(0.436) 提升 53.4%、相对朴素基线(−0.009) 碾压;但讽刺的是它仍输给 OLS 线性(0.957)——因为这个任务是线性可加的。文章诚实拆穿「膨胀救一切 / TCN 比线性强 / 感受野越大越好 / 因果填充零成本 / 通道数陷阱」五类真实误区(中阶)。
13 min Chinese - 对比学习金融表征:不用标签,也能把「同行业」和「跨行业」拉开
监督学习要标签,金融标签又贵又滞后。对比学习(Contrastive Learning)走另一条路:不预测「是什么」,只学「什么和什么像」——把同行业股票拉近、跨行业股票推远。本文用纯 numpy 从零实现 SimCLR 风格的 InfoNCE 预训练(两层 MLP 投影头,端到端训练),在 42 支股票 / 3 行业的合成数据上,把它和「直接用原始特征」做下游少标注探针对比:每行业只给 1~3 个标注时,对比表征把分类精度从 0.50/0.54/0.58 抬到 0.57/0.61/0.61,且增益随标注变多而收敛——正是「标签越稀缺越值得预训练」的教科书结论。附完整代码与五类真实陷阱(中阶)。
12 min Chinese - GAN 生成金融序列与数据增强:用造假的数据喂饱你的模型
深度学习模型永远缺数据——尤其小市值、新上市、危机段,样本少得可怜。GAN(Goodfellow 2014)的卖点是"从噪声生成和真实分布几乎一样的合成序列",于是有人想:能不能用 GAN 造一批假 K 线,喂给下游模型做数据增强?本文用纯 numpy 实现(协方差匹配的 WGAN 等价解),在"牛熊 regime + 时变波动"的合成价格上把生成序列的协方差 Frobenius 误差从 199 压到 1.94,边缘分布和逐位移自相关都与真实肉眼难分;并诚实实测"数据增强的红利":小样本(仅 30 真实窗口)+ 高容量下游模型下,7x 增强把最差切分 AUC 从 0.934 拉到 0.963、方差砍半——增强的真正价值是稳住最差情况,不是凭空抬均值。附完整代码与五类真实陷阱(中阶)。
12 min Chinese
返回