- 得分匹配生成金融序列:用去噪分数匹配合成行情
生成式模型要学分布 p(x) 却卡在归一化常数 Z 上。得分匹配(Hyvärinen 2005)绕开 Z——只学分数 s(x)=∇log p(x),它与 Z 无关。去噪分数匹配 DSM(Vincent 2011)更妙:给数据加噪 x̃=x+σε,让网络学预测 (x−x̃)/σ²,等价于「从噪声指回干净数据的方向」;采样用 Langevin 动力学沿分数场爬向高密度区。这正是当今扩散模型(Diffusion)的数学地基。纯 numpy 从零实现 DSM 闭式最优解(Parzen/Tweedie 去噪器)+ Langevin 采样,在「平静态+危机态」混合的重尾金融收益上实测:生成样本还原资产相关 ρ=0.49(真实 0.54)、下尾联动 P(B跌|A跌)=0.45(真实 0.47),重尾与左偏形状 QQ 图基本对齐;但诚实翻车——Langevin 步长 δ 太大方差爆炸(δ=0.2 时 std 误差 9.7)、太小混合慢覆盖不足,且低密度区分数估计误差随距离线性上升(斜率 7.1),采样进不去稀有危机区。拆穿分数匹配免归一化就免费/单尺度够用/Langevin 随便调/生成即真实/直接造行情五类陷阱(中阶)。
12 min Chinese - GAN 生成金融序列与数据增强:用造假的数据喂饱你的模型
深度学习模型永远缺数据——尤其小市值、新上市、危机段,样本少得可怜。GAN(Goodfellow 2014)的卖点是"从噪声生成和真实分布几乎一样的合成序列",于是有人想:能不能用 GAN 造一批假 K 线,喂给下游模型做数据增强?本文用纯 numpy 实现(协方差匹配的 WGAN 等价解),在"牛熊 regime + 时变波动"的合成价格上把生成序列的协方差 Frobenius 误差从 199 压到 1.94,边缘分布和逐位移自相关都与真实肉眼难分;并诚实实测"数据增强的红利":小样本(仅 30 真实窗口)+ 高容量下游模型下,7x 增强把最差切分 AUC 从 0.934 拉到 0.963、方差砍半——增强的真正价值是稳住最差情况,不是凭空抬均值。附完整代码与五类真实陷阱(中阶)。
12 min Chinese - 合成数据增强与对抗训练:提升因子模型的泛化边界
量化因子模型最怕三件事:样本少、过拟合、分布漂移。本文从零实现 MLP 与逻辑回归,演示高斯噪声增强、SMOTE 式混合与 FGSM 对抗训练如何把测试准确率与对抗鲁棒性一起拉起来,并诚实列出会踩的真实陷阱。
14 min Chinese
返回