- Crossformer 跨变量预测:用维度分段注意力建模变量交互
多资产预测里最容易被漏掉的信息,是『变量之间怎么互相带动』——大多数时序 Transformer 把每个变量单独摊平,只在时间轴上做注意力,跨变量的联动全靠模型自己隐式脑补。Crossformer(Zhang & Yan, ICLR 2023)明确把注意力拆成两段:先在时间轴上分段(DSW,维度分段嵌入)压缩局部形态,再用两阶段注意力(TSA)分别在时间段之间、变量维度之间显式建模。本文用纯 numpy 从零拆解『分段嵌入 + 跨时间 + 跨变量』的两阶段结构,在 6 资产共享隐因子的合成序列上诚实实测:跨变量注意力把单步预测 R² 从朴素持平的 0.356 抬到 0.366——增益真实但微小,并拆穿维度注意力万能/跨变量必优/分段无损/关联=因果/直接落地五类真实陷阱(中阶)。
15 min Chinese - Set Transformer 金融表征:用诱导点注意力聚合多资产
组合是集合不是序列,但 DeepSets 的「逐资产编码+对称池化」有个盲区:池化前每个资产互相看不见,成对交互(拥挤度、相似持仓共振)只能靠编码器隐式凑。Set Transformer(ICML 2019)把交互焊进结构:SAB 让集合内元素两两做注意力,PMA 用可学习种子向量做注意力池化,ISAB 用 m 个诱导点把 O(K²) 注意力砍成 O(K·m)。纯 numpy 从零实现 SAB+PMA(手写 einsum 反向传播,梯度校验 1e-9 级),在组合拥挤度聚合任务上实测:SetTransformer R²=0.843 > DeepSets-mean 0.831 ≈ 统计聚合+Ridge 0.830——成对交互任务上有真实但温和的优势;注意力矩阵与真实相似度结构吻合,置换偏移 1.4e-15;ISAB 实测 K=2048 时提速 55 倍。但诚实翻车:n=300 小样本下 SetTransformer 过拟合(train 0.92 / test 0.53),被 DeepSets(0.80)反杀——注意力参数多,先吃数据。拆穿注意力必胜/池化都一样/诱导点无损/交互自动学会/直接上实盘五类陷阱(中阶)。
14 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - Temporal Fusion Transformer:把多变量时序预测做成可解释黑盒
TFT(Temporal Fusion Transformer,Lim 等 2020)是少有的「既用 Transformer 注意力、又刻意追求可解释」的时序模型。它靠三道门控——变量选择网络(VSN)、时序注意力(TIA)、门控残差——把「哪几个变量重要、过去哪段历史重要、线性还是非线性重要」全部量化出来。本文用自洽合成模型从零复现这三步,给出变量选择 265× 信噪比、多变量融合 SMAPE 比单变量低 43.7% 的实算结果,并诚实指出注意力可解释性的边界,附完整 Python 与六类真实陷阱。
13 min Chinese - 注意力机制因子:让模型自己决定看哪些特征
把注意力机制从 NLP 搬进多因子选股:用特征级自注意力让模型自己决定看哪些因子,再门控加权出 1 维注意力因子。合成里门控因子 OOS R²=0.59 远超等权平均 0.15(高阶)。
15 min Chinese - 注意力机制的可解释性:用特征归因解释模型决策
注意力权重只告诉你模型「看了哪里」,不等于「哪里重要」。本文用纯 numpy 搭一个小的特征级自注意力收益预测器,故意只让一个特征携带信号,对比注意力权重与 Integrated Gradients 特征归因——后者能精确锁定真正驱动预测的因子,并给出归因的实战边界。
11 min Chinese
返回