- 概率仓位管理 Bet Sizing:把模型置信度变成头寸大小
模型输出的不只是方向,还有一个被大多数人扔掉的数字:预测概率。Bet Sizing 把它捡回来变成头寸大小——AFML 的映射 m=2Φ(z)−1(z 为概率对 0.5 的标准化偏离)在低置信区间比线性映射 2p−1 更保守、高置信区间加速抬升,天然抑制'刚过 0.5 就重仓'的赌徒行为。1500 日模拟实测同一个预测器三种下注方式:全押 p>0.5 的 Sharpe 1.83/最大回撤 -20.2%,高置信过滤 p>0.6 的 1.79/-7.8%,概率仓位 1.95/-1.8%——收益没变多,但资金暴露按确信度重新分配后回撤压缩一个数量级。两个工程细节决定实盘可行性:仓位离散化(step=0.2 把累计换手压缩 1.5 倍而信号形状不变,否则概率的小数点抖动全变成手续费);并发信号平均法(同一标的多个存活信号取均值聚合,新信号进场老信号结算时仓位平滑过渡)。前提警告:整套体系建立在概率校准之上,未校准的原始分类器输出直接喂进映射函数比全押更危险(中高阶)
14 min Chinese - CUSUM 事件过滤器:只在市场偏离足够大时才采样
逐日开训练样本的隐性成本可精确计量:H=20 标注下相邻标签共享 95% 收益路径,1430 个名义样本的有效独立样本量只有 72.5——模型看到的是同一段行情复印 20 遍。CUSUM 过滤器(Page 1954 质量控制)只在累计偏离越过阈值时开样本:对积累到位的漂移敏感、对反复横跳的噪声免疫,触发即清零天然不重复计数。1500 日三区制模拟实测:固定阈值 h=3% 在高波动段事件密度爆炸 2.4 倍(采样节奏被波动率劫持),换 h=2.5×EWMA σ 自适应后密度回归均匀;CUSUM 用 17% 样本量保住 102% 有效独立信息,单标签唯一性 0.051→0.314 提升 6 倍。AFML 标准管线:bar→CUSUM→三重障碍→元标注四级串联。A 股:日频 CUSUM 天然适配 T+1,涨跌停需暂停累计器(中高阶)
13 min Chinese - 美元 Bar 与信息驱动采样:让每根 K 线携带等量信息
成交量时钟修好了『活动度量』,但在价格翻 3 倍的市场里,同样 100 手在 20 元和 60 元时的经济含义差 3 倍——股数是名义单位,成交额才是经济单位。美元 Bar(每累计 N 元成交额切一根)是信息驱动采样家族对『时钟单位』的最终回答:对拆单免疫(tick 计数会通胀)、对送股拆股天然中性(股数时钟一夜漂移,美元时钟无感)、对价格水平自适应。1000 日受控模拟(价格 3 倍 + 活动增长 + 中段高波动区制)实测:前 100 天校准的固定阈值到末期,tick/成交量 Bar 日均根数从 6 漂到 13.4,美元 Bar 因价格与活动双重增长漂得更凶(27.7)——美元 Bar 对价格敏感是特性也是负担,必须配 EWMA 动态阈值:日常稳定在 6 根、高波动区制自动加密,把趋势性漂移滤掉、只保留『信息爆发时多采样』。统计性质上四种 bar 同场竞技:时间 Bar 峰度 3.52/JB 496/波动聚集显著,三种信息驱动 bar 全部归零——家族内差异远小于『家族 vs 时间时钟』。终点站是 Easley-O'Hara-de Prado 的洞见:美元时钟正是 VPIN 的运行时钟,采样方式与知情交易度量共享同一个世界观。A 股落地注记:手数=100 股恒定使成交量/成交额时钟高度相关,但跨长周期与跨价格档比较时美元 Bar 仍占优(中高阶)。
12 min Chinese - 微观结构熵特征:用信息论度量价格序列的可预测性
「这段行情有多可预测」不必是玄学:把收益二值化成涨跌符号串估计香农熵率——熵=1 bit/符号意味着彻底随机(任何模型命中率上限 50%),熵越低结构越多。受控实验三种机制对照:iid 块熵 0.9996、动量(延续概率 0.75)0.884、均值回复 0.880——熵对「有没有记忆」敏感、对方向色盲,一个特征覆盖两类可交易结构。延续概率 0.5→0.92 扫描给出单调曲线:熵与最优命中率一一对应,是模型无关的可预测性上界。300 符号滚动熵能把动量段与均值回复段从 iid 背景中挖出。两个深坑:块长过大+样本不足时纯随机也能测出 0.7 的假低熵,必须 2^w≪n;所有熵估计器绝对值均有偏差,只能同参数相对比较。AFML 定位:不做择时开关,做元标注二级模型的环境特征(高阶)
13 min Chinese - MDI 与 MDA 特征重要性:识别真正有用的因子特征
回测好看不等于特征有用——不打开黑箱,你不知道模型赚的是 alpha 还是巧合。受控实验(3 信息特征 + 3 冗余复制品 + 6 纯噪声)暴露两套主流工具各自的说谎方式:MDI(树内不纯度减少)给纯噪声也发 0.04+ 的非零重要性且永不为负,替代效应让 I_1 与它的两个复制品 R_1/R_2 三分天下(0.179/0.179/0.167),单看排名会以为有三个独立因子;MDA(OOS 置换退化)把噪声干净归零(≤0.0006)但冗余特征互相'顶班'——置换 I_1 时 R_1/R_2 还在场,损失退化被系统性低估。修复方案是聚类 MDA:相关特征整组同排置换,G1 组重要性 0.247 一举显形,是单列置换的 5 倍。三条铁律:MDI 只可比较不可检验、MDA 必须配 Purged CV 否则泄漏伪装成重要性、特征重要性分析先于回测而非之后。A 股因子普遍多重共线(规模/流动性/波动率纠缠),聚类版几乎是必选项(中高阶)
15 min Chinese - Run Bars 采样:用连续同向成交的长度定义信息事件
失衡 Bar 数净额,Run Bar 数连续性:知情机构能用交替扫单把净失衡做平,但藏不住更长的同向 run——只要必须在信息失效前建完仓,它就必须持续单向交易。12 万笔受控模拟(中段植入 p_buy=0.67)实测:买方 run 均值 2.35→3.96 笔、p95 从 6 到 11;阈值版 Run Bar(run≥10 触发)知情段采样密度自动加密 4.6 倍,bar 长度中位数 237→54 tick——bar 长度本身是免费的知情强度指标,而等 tick Bar 完全无感。bar 内买单占比分布双极化(标准差 0.158 vs 0.089),样本信息密度更高。诚实交代 AFML 原版 EWMA 自举阈值的退化陷阱:实测切出 15245 根中位数 2 tick 的碎 bar,生产级应用固定分位数阈值+保险丝。A 股 Level-2 可跳过 tick rule 直接数 run,但 T+1 下它是特征时钟而非交易时钟(高阶)
12 min Chinese - 样本唯一性加权:重叠标签下的正确样本权重
上一篇 CUSUM 把采样点从 1430 砍到 236,但事件标签的区间重叠依然存在:1500 日模拟中活跃时点平均被 2.9 个标签同时覆盖,平均唯一性仅 0.339——每个样本携带的独立信息只有名义值的三分之一。AFML 第四章给出三件配套工具:concurrency 计数把重叠精确量化到每个时点;唯一性权重 + 收益归因权重让'独立且赚大钱'的样本主导训练;序列 Bootstrap 用动态更新的抽样概率替代均匀抽样,实测抽样集合唯一性 0.312→0.331。关键洞见:这不是可选的调参项,而是让 bagging 的方差缩减公式在金融数据上重新成立的前提——标准 bootstrap 在重叠标签下抽出的是'伪独立'样本,OOB 分数系统性虚高。A 股日频 + T+1 下持有期普遍更长,重叠更severe,加权更必要(中高阶)
14 min Chinese - SADF 结构突变检验:实时监测价格序列的爆炸性泡沫
泡沫的技术定义不是'涨太多',而是价格序列从随机游走切换到爆炸性自回归(ρ>1)——SADF/BSADF 把 ADF 单位根检验改造成实时监测器:右尾检验 + 起点滑动取上确界,让统计量只对'最近一段是否爆炸'敏感。1000 日受控实验(500 日随机游走 + 230 日 ρ=1.012 温和爆炸 + 崩溃)实测:BSADF 在爆炸开始后 65 个交易日越过 95% 临界值报警,峰值 11.3 远超临界值 0.57,崩溃后迅速回落——它同时检测泡沫的生成与破灭。双泡沫实验暴露起点锚定的致命伤:第一轮泡沫崩溃后,锚定 t=0 的扩张窗 ADF 对第二轮泡沫完全失灵(峰值 0.14 不及临界值零头),BSADF 靠滑动起点甩掉旧样本稀释、峰值 2.72 正常报警——这正是 PSY 2015 从 SADF 升级到 GSADF/BSADF 的全部动机。三个诚实边界:65 日检测滞后意味着它是确认工具而非预测工具;临界值必须蒙特卡洛模拟(非标准分布)且随窗口设定变化;对'漂移强但不爆炸'的慢牛会保持沉默——它检验的是自回归系数不是涨幅。AFML 用法:BSADF 序列不做择时开关,做元标注特征喂给二级模型(高阶)
15 min Chinese
返回