- 逆强化学习策略偏好推断:从一段「赚钱轨迹」反推出它到底在优化什么
我们知道某择时策略『很能赚钱』,但不知道它凭什么赚——它在奖励什么?逆强化学习(IRL)把这个问题反过来:给一段专家实际走过的轨迹,反推它背后的奖励函数。本文用纯 numpy 从零实现 MaxEnt IRL(Ziebart 2008):特征期望 + 梯度上升学奖励权重 + softmax 访问频率求解。在「专家其实在奖励『动量 + 低波动 + 周期 − 噪声』」的合成市场里,IRL 把奖励权重还原得与真值余弦相似度 0.94,学到的奖励重放出的状态分布与专家 KL=0.06(随机基线 0.23);并诚实拆穿「专家样本不足→奖励不可辨识 / 特征冗余→权重被错分 / 折扣因子误设 / 最大熵温度 / IRL 给的是偏好不是收益」五类真实陷阱(中阶)。
12 min Chinese - 伊辛模型金融临界性:用「自旋翻转」把市场崩盘的相变算出来
伊辛模型(Ising)是统计物理里描述「有序⇄无序」相变的标杆。把它平移到金融:每个自旋是一支股票(上涨 +1 / 下跌 −1),耦合强度 J 就是个股间的「趋同/传染」强度,温度 T 是市场流动性与情绪噪声。当市场从平静(高温无序)滑向恐慌(低温有序)时,会越过一个临界温度 Tc——这时相关性长度发散,全市场一起涨一起跌,正是崩盘的数学相变。本文用纯 numpy 向量化 Metropolis 从零复现二维 Ising,并用 Onsager 精确解对照,证明蒙特卡洛把 Tc 还原到 2.269(真实 2.269),比热尖峰在 2.267、磁化率尖峰在 2.287,并诚实拆穿「一维无相变/红黑更新陷阱/有限尺寸抹平临界/必须锚定二维」四类真实陷阱(中阶)。
13 min Chinese - 卡尔曼滤波动态跟踪:用状态空间模型把噪声里的真值估出来
卡尔曼滤波是状态空间模型下的最优(最小均方)递推估计器:把要追踪的量写成隐藏状态、把带噪观测写成观测方程,每步只需「预测+更新」,卡尔曼增益自动在信状态与信观测之间取最优折中。本文用纯 numpy 从零实现通用卡尔曼滤波,在噪声价格还原真值、时变对冲比β_t在线跟踪、过程噪声Q的U形敏感性三个场景真实跑通,并诚实指出「因果 KF 的 RMSE 会输给偷看未来的移动平均」这条最被忽视的边界(中阶)。
15 min Chinese - 多尺度熵与 DFA:用粗粒化把不同时间尺度的不规则性分开
单尺度样本熵(SampEn)会把白噪声误判成最复杂序列——其实它的复杂度只存在于最细尺度。多尺度熵(MSE)用粗粒化把序列逐尺度平均掉、分尺度重算熵;DFA 用去趋势波动分析给出长程相关的标度指数 α。本文用纯 numpy 从零实现 SampEn/MSE/DFA,在白噪声、1/f 粉红噪声、周期+噪声三类序列上把尺度结构拆开,并诚实指出「MSE 必须用固定容忍半径」这一最易踩的坑(中阶)。
13 min Chinese - Neural ODE 连续时间建模:把隐藏状态写成微分方程
普通神经网络是「离散层」——你叠 N 层就是 N 次变换,深度=层数、和参数量绑死。Neural ODE(Chen et al. 2018)换了个范式:隐藏状态不靠「第几层」,而靠「积分到时刻 T」得到,dh/dt=f_θ(h,t),从 h(0)=x 用 RK4 积到 h(T) 再读出 y。于是「深度=积分时长 T」,可任意细分、与参数量解耦。本文用纯 numpy 从零实现 RK4 积分 + 把积分计算图展开做反向传播,在「数据来自已知非线性 ODE 流」的合成任务上实测:Neural ODE 测试集 R²=0.992、MSE=0.00204,相对固定深度 MLP(0.989) 改进 25.1%、相对线性(0.158) 改进 99.0%——因为连续流的归纳偏置正好匹配「数据来自连续动力学」。文章诚实拆穿「ODE 比 MLP 强是普适的 / 连续深度免费 / 反向传播廉价 / 数值积分无误差 / 小数据可辨识」五类真实误区(中阶)。
14 min Chinese - 序数模式熵:用涨跌排列的「形状」识别市场状态切换
排列熵(PE)的经典用法是「用一个数区分正弦/混沌/噪声」。但真正在量化里值钱的是把它做成实时状态监测器:滑动窗 PE + 模式转移矩阵 + 加权 PE(WPE),能在有序趋势市和无序震荡/危机市之间划出清晰边界。本文从零实现序数模式映射、PE、WPE 与转移矩阵,在「有序-无序」交替合成行情上以 97.6% 正确率识别 regime,并诚实拆穿「PE 量的是结构不是波动」这条最容易被误解的边界(中阶)。
15 min Chinese - 排列熵与复杂度:用序数模式把「混沌」和「随机」一刀切开
怎么用一个数区分「规则的正弦」「混沌的逻辑斯蒂」和「纯随机的白噪声」?排列熵(Permutation Entropy, Bandt & Pompe 2002)只看序列的『升跌形状』——把每个窗口的相对大小排个序、数频率、算香农熵。它不关心幅度、对单调变换/量纲/平移都不变。本文用纯 numpy 从零实现序数模式计数 + 滑动窗 PE,在三类序列上把复杂度量成 0–1,并展示 PE 如何实时追踪 regime 切换(中阶)。
12 min Chinese - 分位数回归森林:给出收益分布而非单点预测
传统模型只给「明天涨 3%」一个点预测,却答不出「这个数我有多不确定、最坏会跌多少」。分位数回归森林(QRF, Meinshausen 2006)把随机森林的每个叶节点存成样本集合,预测时直接对落点叶的样本求经验分位——于是一次预测吐出整条条件收益分布,而非一个点。本文用纯 numpy 从零实现回归树 + 随机森林 + QRF,在「异方差 + 左偏」的合成收益上实测:90% 区间经验覆盖 QRF=0.874、OLS-正态=0.902、CRPS QRF=0.531 优于 OLS 正态的 0.563 与线性 QR 的 5.326,并诚实拆穿「森林=平滑均值 / 分位单调 / 样本量免费 / OOB 替代 / 分布外可信」五类真实陷阱(中阶)。
12 min Chinese
返回