- Informer 长序列预测:用概率稀疏注意力砍复杂度
标准 Transformer 注意力是 O(L²):序列拉到 4096 步,一层注意力就要算 1600 万对相似度。Informer(AAAI 2021 最佳论文)的 ProbSparse 注意力抓住一个经验事实——注意力矩阵天然长尾,绝大多数查询行近乎均匀分布、对输出没贡献。它用采样估计每个查询的稀疏度 M(q,K)=max−mean,只让 top-u=c·lnL 个「活跃查询」做完整注意力,懒查询直接输出 V 的均值,复杂度砍到 O(L·lnL)。纯 numpy 从零实现 ProbSparse + 单层注意力回归(手写反向传播、有限差分梯度校验 1e-10 级),实测 L=4096 时提速 53 倍;但诚实披露:在 L=96 的短窗口预测任务上,注意力行不够长尾,c=10 的 ProbSparse 推理 R²=−0.40 远差于 full 推理 0.746,c 扫到 20(u/L≈96%)才恢复 0.727——稀疏近似的前提是分布真的稀疏。另附 OLS-96滞后 R²=0.834 反超注意力的诚实对照,拆穿「ProbSparse 无损/长序列必用 Transformer/加速免费/M 度量万能/金融直接落地」五类真实陷阱(中阶)。
10 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - PatchTST 时序分块预测:把价格切成一块块「补丁」,Transformer 才真正用得上
Transformer 横扫 NLP 后,直接搬到时间序列预测上却常被简单线性模型吊打——问题出在「逐点建模」:把每个时间步当一个 token,注意力算力爆炸、还学不到局部形态。PatchTST(ICLR 2023)用两招破局:把序列切成一段段 patch(分块)当 token、多变量之间通道独立。本文用纯 numpy 复现「分块 vs 逐点」的核心对比,在趋势+双周期+噪声的自洽合成序列上,两者都把朴素基线的 MSE 从 51.6 压到 2.7,并诚实说明分块在这份干净数据上只领先 2.3%、它真正的价值在哪、以及六类真实陷阱(中阶)。
17 min Chinese - TimesNet 周期建模:把价格「折叠」成二维时间块,Transformer 才真正读得懂周期
Transformer 直接搬到时序常被简单线性吊打,病根是「逐点建模」——单个价格点没有语义。TimesNet(Wu et al. 2023)的破局点很巧:既然时间序列里最稳定的结构是「周期」,那就把一维序列按周期 P 折叠成二维「时间块」,让二维卷积去抓「同一相位跨周期」的相关性。本文用纯 numpy 从零实现 FFT 周期检测、1D→2D 折叠、2D 池化回 1D,在「三周期+趋势+脉冲噪声」合成序列上实测:2D 折叠把多周期结构的解释方差从 0% 抬到 31.7%,残差以噪声为主;并诚实拆穿「数据处理的不等式(线性头打不过线性基线)」、周期检测偏 bin、折叠引入伪相关、相位对齐泄漏、端点缺口五类真实陷阱(中阶)。
18 min Chinese - Temporal Fusion Transformer:把多变量时序预测做成可解释黑盒
TFT(Temporal Fusion Transformer,Lim 等 2020)是少有的「既用 Transformer 注意力、又刻意追求可解释」的时序模型。它靠三道门控——变量选择网络(VSN)、时序注意力(TIA)、门控残差——把「哪几个变量重要、过去哪段历史重要、线性还是非线性重要」全部量化出来。本文用自洽合成模型从零复现这三步,给出变量选择 265× 信噪比、多变量融合 SMAPE 比单变量低 43.7% 的实算结果,并诚实指出注意力可解释性的边界,附完整 Python 与六类真实陷阱。
13 min Chinese - Transformer模型股价预测:Attention机制在金融时序中的应用
深入探讨Transformer模型在股价预测中的应用,从Attention机制到时间序列建模,带你用PyTorch构建端到端的股价预测系统
24 min
返回