- 命名实体识别金融事件:从新闻里自动抽出公司-事件-时间
关键词正则抽事件有个死穴:它认得『回购』这个词,却认不出『拟以自有资金实施股份回购』里被拆开的实体,更分不清『茅台回购、格力增持』同一句里两家公司各自的动作。命名实体识别(NER)用 BIO 序列标注 + CRF 转移约束,把一条新闻切成『公司-事件-时间』三元组。本文从零讲清 BIO 标注、CRF 为什么能压掉非法标签路径,用合成金融语料对比正则法与序列标注的分类型 F1(公司 0.61 vs 0.90、事件 0.42 vs 0.83),并诚实指出中文分词、嵌套实体、事件归属三大真实陷阱,附完整 Python(中阶)。
17 min Chinese - 词嵌入金融文本:用向量空间把公告语义变成可计算因子
情感词典(利好词 +1、利空词 −1)有个致命短板:它只认得你手工列进去的词。市场天天造新词——『超预期』你收录了,明天出现『扩产』『中标』你没收录,词典对它们视而不见,直接算 0。词嵌入用 skip-gram 从公告语料里学出每个词的向量,语义相近的词自动挨在一起,于是词典外的新词也能被『情绪轴』投影出方向。合成实验:4000 条公告、三类语义(利好/利空/中性),纯 numpy 负采样 skip-gram 训练后同类词余弦 0.981 vs 异类 0.896;构造情绪因子做 IC 检验——在含词典内词的公告上嵌入因子 IC 0.607 与词典计数 0.574 基本打平,但在『全是词典外新词』的留出集上,词典计数 IC 直接归零(0.000),嵌入因子仍有 0.602。附向量可视化、维度敏感性与五类真实陷阱(中阶)。
15 min Chinese - 谷歌趋势作为另类情绪信号:用搜索量预测短期波动
另类数据里,谷歌趋势是少数公开、免费、可日频获取的零售情绪代理。本文用自洽合成日度搜索量 + GARCH 波动,验证『恐慌搜索领先于波动』(Preis 2013 式水平信号):样本外 R²=0.073、高搜索量日后 5 日已实现波动 11.7% vs 低量日 7.5%;朴素『高搜索量降杠杆』把回撤从 −98.7% 改善到 −91.7%。诚实拆穿搜索量预测的是波动不是方向、代理偏差与可得性三类陷阱(中阶)。
10 min Chinese - 社交媒体情绪传播与价格发现:当叙事先于价格
社交媒体早已不只是情绪指标,而是价格发现的前置通道。本文用 SIR 传播模型与网络扩散视角,拆解情绪如何沿关系链传导并领先于价格,给出情绪传播力指标的构建方法与完整的 Python 实战代码,并指出机器人放大、回音室、前视偏差等真实陷阱。
14 min Chinese - 供应链数据在量化投资中的应用:用「供货关系」挖掘另类 Alpha
供应链关系(谁是你的供应商、谁是你的客户)是典型的另类数据,隐含着领先-滞后收益、冲击传染与网络中心度等可量化信号。本文拆解供应链数据的三大 alpha 来源,用 Python 构建供应链网络、模拟冲击传导、并计算上下游领先-滞后相关,给出从关系数据到交易信号的完整框架,同时指出披露滞后与可得性等真实陷阱。
13 min Chinese - 气象数据对大宗商品预测:当天气成为基本面
天气不是宏观叙事里的背景音,而是大宗商品最直接的基本面之一。本文拆解哪些商品被天气捏着命门、关键的气象指标(HDD/CDD、ENSO、干旱指数)如何传导到价格,并给出计算度日、构建 ENSO-商品关系、训练天气特征模型的完整 Python 实战,同时指出预报不确定性、季节性基差、仓储缓冲等真实陷阱。
13 min Chinese - 网页爬虫与文本挖掘:把非结构化网页变成可回测的量化信号
网页爬虫与文本挖掘把非结构化网页变成可回测信号。本文从合规红线讲起,用 Python 演示 requests+BeautifulSoup 采集、jieba 分词、情感打分构建日度情绪指数,再到 TF-IDF 与领先-滞后检验,并指出前视偏差等陷阱。
13 min Chinese
返回