- 命名实体识别金融事件:从新闻里自动抽出公司-事件-时间
关键词正则抽事件有个死穴:它认得『回购』这个词,却认不出『拟以自有资金实施股份回购』里被拆开的实体,更分不清『茅台回购、格力增持』同一句里两家公司各自的动作。命名实体识别(NER)用 BIO 序列标注 + CRF 转移约束,把一条新闻切成『公司-事件-时间』三元组。本文从零讲清 BIO 标注、CRF 为什么能压掉非法标签路径,用合成金融语料对比正则法与序列标注的分类型 F1(公司 0.61 vs 0.90、事件 0.42 vs 0.83),并诚实指出中文分词、嵌套实体、事件归属三大真实陷阱,附完整 Python(中阶)。
17 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - FinBERT 新闻情绪:用金融预训练模型把公告变成 alpha
词典法只能抓字面褒贬词,读不懂「营收不及预期但指引超预期」这种反转。FinBERT 是在金融语料上继续预训练的 BERT,三分类(positive/negative/neutral)直接输出概率,对否定、语境、金融术语的还原力远超朴素词典法。本文用合成截面实跑:FinBERT 与「真实隐藏信号」的相关系数 0.92,碾压词典法的 0.45;按情绪分做多空组合净 Sharpe 约 2.8、年化 22%。附完整 Python 与六类真实陷阱(高阶)。
13 min Chinese
返回