- 流形学习资产表征:用降维把高维因子铺成可看的地图
几十个因子把每只资产变成高维空间里的一个点,但这些点往往不是均匀撒开的——它们卷在一张低维曲面(流形)上,比如『板块轮动相位』这条一维曲线被揉进 30 维。PCA 是线性投影,遇到弯曲流形只会把它拍扁、撕裂:把卷在一起的两端硬凑到一块。Isomap 换个距离度量——不走欧氏直线(会穿过流形空洞造成近邻假象),而走 kNN 图上的最短路径(测地距离,沿曲面爬行),再用经典 MDS 展开。合成实验:一条一维流形(swiss-roll 式)升到 30 维,Isomap 的局部近邻保持率 0.927 碾压 PCA 的 0.681——谁挨着谁的结构被保住了。纯 numpy 从零实现 Isomap(kNN 图→Floyd-Warshall 测地距离→MDS),并诚实暴露它的死穴:对近邻数 k 极敏感(k=3 轴相关 0.65、k=40 到 0.88),k 太小图断裂、太大短路穿洞;样本外无自然投影;测地距离 O(n³)。拆穿降维=可视化即真相/Isomap 必胜 PCA/k 随便选/流形假设永成立五类陷阱(中阶)。
11 min Chinese - 非负矩阵分解 NMF:把资产收益矩阵压成可解释的基与权重
PCA 的成分有正有负,你没法把 PC1 读成『40% 科技 + 30% 消费』——因为它允许负载荷,本质是方差最大的正交方向,不是构成。NMF 强制 W、H 全非负,分解出的每个基就是一个可加的『主题』,每个资产是这些主题的非负叠加,读起来像占比。合成实验:12 个资产由 3 个非负时间主题混合而成,NMF 乘法更新 400 次把重构误差从随机初值压到 2.536,还原的时间基激活与真实基相关 0.82~0.92、权重矩阵相关 0.80~0.91;PCA 拿同样数据,58.3% 的载荷是负的,PC1 根本没法解释成资产构成。秩选择靠误差肘部:K 从 1→2→3 时误差 17.48→10.98→2.52 断崖下跌,K=3 之后拐平(2.52→2.51→2.30)精确对上真实秩。纯 numpy 实现 Lee-Seung 乘法更新,拆穿 NMF 唯一解/成分自动对齐/负值数据也能用/秩越大越好/基一定有金融意义五类陷阱(中阶)。
12 min Chinese - 宏观PCA定价:用少数主成分解释资产收益的截面
12 个资产的日收益协方差矩阵,前 3 个主成分就能解释 92.8% 的截面波动——这意味着资产收益的「联合运动」其实由少数几个宏观因子驱动。本文用 PCA 把高维协方差降维成「宏观因子定价」:先用合成的真实因子结构展示前 3 主成分恰好对应市场/价值成长/商品通胀三因子,再把 PCA 收缩应用于协方差估计,证明在短估计窗口下,最小方差组合因去噪而波动率更低、月度换手率直降 42%,附完整 Python 与五类真实陷阱(中阶)。
13 min Chinese - 动态因子模型(DFM):用少数共同因子把宏观面板压缩成可预测信号
你有 50 个宏观指标,每个都有噪声和各自的惯性,共同趋势被淹没在面板里。动态因子模型(DFM, Stock-Watson 2002)主张:真正驱动一切的只有少数几个『共同因子』。两步法把 8 条指标压成 1 条因子,与真实共同因子的相关从单条指标的 0.51~0.82 拉到 0.91。本文从零复现并拆穿三类真实陷阱(中阶)。
13 min Chinese
返回