- 词嵌入金融文本:用向量空间把公告语义变成可计算因子
情感词典(利好词 +1、利空词 −1)有个致命短板:它只认得你手工列进去的词。市场天天造新词——『超预期』你收录了,明天出现『扩产』『中标』你没收录,词典对它们视而不见,直接算 0。词嵌入用 skip-gram 从公告语料里学出每个词的向量,语义相近的词自动挨在一起,于是词典外的新词也能被『情绪轴』投影出方向。合成实验:4000 条公告、三类语义(利好/利空/中性),纯 numpy 负采样 skip-gram 训练后同类词余弦 0.981 vs 异类 0.896;构造情绪因子做 IC 检验——在含词典内词的公告上嵌入因子 IC 0.607 与词典计数 0.574 基本打平,但在『全是词典外新词』的留出集上,词典计数 IC 直接归零(0.000),嵌入因子仍有 0.602。附向量可视化、维度敏感性与五类真实陷阱(中阶)。
15 min Chinese - FinBERT 新闻情绪:用金融预训练模型把公告变成 alpha
词典法只能抓字面褒贬词,读不懂「营收不及预期但指引超预期」这种反转。FinBERT 是在金融语料上继续预训练的 BERT,三分类(positive/negative/neutral)直接输出概率,对否定、语境、金融术语的还原力远超朴素词典法。本文用合成截面实跑:FinBERT 与「真实隐藏信号」的相关系数 0.92,碾压词典法的 0.45;按情绪分做多空组合净 Sharpe 约 2.8、年化 22%。附完整 Python 与六类真实陷阱(高阶)。
13 min Chinese - 大语言模型的嵌入作为文本因子:把新闻和公告变成可回测的截面信号
LLM 嵌入把新闻与公告等金融文本压成稠密向量,是连接文本与截面模型的桥。本文用可复现模拟讲清无监督 PCA 几乎挖不出信号、监督映射才能把收益方向对齐出来,并点明嵌入漂移、前视偏差与维度灾难三大真实陷阱,附落地 pipeline 与完整 Python。
13 min Chinese
返回