SAX 符号聚合近似:把连续价格序列离散成可检索的字符串
SAX(Lin-Keogh 2003/2007)把时间序列变成字符串的三步流水线:z-normalize → PAA 分段平均 → 高斯等概率断点离散,128 个点的窗口压成 8 个字符的词。它的杀手锏是 MINDIST 下界性质:词距离永不超过真实欧氏距离——3000 对随机游走实测违反率 0.00%,这让哈希桶预筛选保证零漏检。合成价格实验:5 处植入的 V 形反转模体,SAX 词哈希在 (w=6, a=5) 参数下 F1=1.00 完美检索,全程只有字典查找、无距离计算。参数热力图诚实展示敏感性:F1 从 0.28 到 1.00 剧烈波动,词太短撞词、太长碎片化。三盆冷水:等概率断点的高斯假设被肥尾收益率违反、z-norm 抹掉波动率量纲让盘整与崩盘同词、符号匹配≠预测力。与 Matrix Profile 对比:SAX 是倒排索引式召回,MP 是精确最近邻,实盘管线的正确姿势是 SAX 粗筛 + 欧氏/MP 精排。