RNN 串行训练慢、Transformer 注意力 O(L²) 贵,状态空间模型(SSM,S4/Mamba 一族的骨架)走第三条路:把隐藏状态写成对角线性递推 h_t = a⊙h_{t-1} + b⊙x_t,衰减率 a 按对数均匀铺满短记忆到长记忆,一层状态就是一组不同时间尺度的指数记忆核,推理 O(L·N) 且可并行扫描。本文用纯 numpy 从零实现多时间尺度对角线性 SSM + 统一 Ridge 读出,在两个合成任务上诚实实测:平滑多尺度记忆任务(1800 小样本)上 SSM-16 状态 R²=0.787 完胜 OLS-256 滞后的 0.664;但尖锐 lag-64 任务上被 OLS-128 滞后(0.922)打爆(SSM 只有 0.487)——指数记忆核天然抹平孤立尖锐滞后。并拆穿线性状态无损/状态越多越好/SSM 必胜滞后回归/长程=万能/金融直接落地五类真实陷阱(中阶)。