引言:当华尔街遇上大模型#
2023 年以前,量化投资中的 NLP 应用还停留在”情感分析”阶段——用朴素贝叶斯或 LSTM 判别财经新闻是利好还是利空,然后打包成一条简单的因子。2024 年开始,以 GPT-4、Claude 和 Llama 为代表的大语言模型(LLM)彻底改变了这个游戏。
不仅是技术本身在变,思维方式也在变。传统量化研究员需要花数周手动设计特征,而 LLM 让研究员可以用自然语言描述想法,系统自动生成对应的处理流程。这种”LLM as Analyst”的范式转移,正在重新定义 quant 的工作内容。
本文系统梳理 LLM 在量化投资中的三条核心应用路径:NLP 因子构建、另类数据处理、以及端到端策略生成,并探讨其中的方法论细节。
一、从文本到因子:LLM 驱动的新型特征工程#
1.1 传统 NLP 因子的局限性#
传统量化中的 NLP 因子通常依赖预定义词典(如 Loughran-McDonald 词典)或简单模型。研究员手动筛选关键词列表,对新闻和财报文本打分,然后合成一条因子。这种方法有三个致命缺陷:
- 覆盖范围窄:词典是静态的,无法捕捉新出现的概念(如 2021 年的”meme stock”、2023 年的”AI 概念股”)
- 上下文丢失:单词级别的统计忽略了语义关系,“苹果减产”和”苹果增产”可能被错误地赋予相同的情感方向
- 更新成本高:每次词汇表需要扩展,都需要人工重新校准,响应速度慢
1.2 LLM 重构情感因子#
LLM 最大的优势在于对上下文的深度理解能力。以财报电话会(earnings call transcript)为例,传统方法可能只看”revenue”、“profit”等词汇的出现频率,而 LLM 能够:
- 理解管理层措辞的微妙变化,例如”we are cautiously optimistic”实际上暗示对前景的不确定性
- 捕捉多句话之间的逻辑关系,包括因果、转折和让步
- 跨语言处理,同时分析中文财报和英文研报
实践中,研究员通常采用 Few-shot Prompting 的方式,让 LLM 直接对一段文本输出结构化的情感打分:
你是一名专业的金融分析师。请分析以下财报电话会记录,
从以下五个维度各给出-1到1的打分(保留两位小数):
1. 管理层信心指数
2. 业绩指引倾向(正向=上调指引)
3. 风险暴露程度
4. 竞争格局评价
5. 宏观敏感性
输出格式:
{"维度1": 0.XX, "维度2": -0.XX, ...}plaintext这种结构化输出的设计非常关键——它确保每次调用输出格式一致,方便后续批量处理成时间序列因子。
1.3 另类数据的 LLM 提取#
LLM 在量化领域真正爆发的场景,是处理此前无法量化的另类数据(Alternative Data)。典型例子包括:
卫星图像解读:量化基金早已采购卫星图,但传统方法只能识别预设目标(如停车场的汽车数量)。LLM 现在可以理解更复杂的视觉模式:“识别图中建筑工地的新建进度,判断该区域未来 6 个月的建材需求变化”。
电话会音频分析:Beyond Verbal 等公司曾尝试用传统方法从语音中提取情感,但 LLM 结合 Whisper 等语音识别模型,可以直接从音频转录文本中分析管理层语速变化、犹豫停顿等非语言信号。
供应链关系图谱:通过分析上市公司的 10-K、10-Q 披露文件,LLM 自动提取供应商和客户关系,构建供应链依赖图谱。这个图谱在供应链危机事件(如2021年的全球芯片短缺)来临时极具价值。

二、方法论:LLM 因子构建的工程实践#
2.1 批量化推理的工程挑战#
在生产环境中用 LLM 生成因子,最大的挑战不是模型效果,而是吞吐量和成本。一条因子需要覆盖数千只股票、数年的历史数据,如果每次 API 调用耗时 2 秒,成本 $0.01,光是历史回测就要烧掉数千美元。
主流解决方案有三条路:
其一,蒸馏压缩。用大模型(如 GPT-4)为小模型(如 Llama-7B)生成训练数据,进行知识蒸馏。这种方法在情感分析任务上已经被验证有效——蒸馏后的模型在金融文本分类上的准确率与 GPT-4 差距小于 5%,但推理成本下降 90%。
其二,向量数据库索引。将历史文本预处理为向量存储,查询时用语义相似度检索,而非每次都调用 LLM 推理。典型方案是用 Pinecone 或 Weaviate 存储文本向量,每次查询先做向量检索,再用 LLM 做最终判断。
其三,结构化蒸馏。不直接蒸馏整个模型,而是提取 LLM 在特定任务上的判断规则,以 if-then 规则或小型决策树的形式固化。这种方法适合因子解释性要求高的场景(如监管审查),但会牺牲部分泛化能力。
2.2 因子正交化与组合#
LLM 生成的因子与传统因子(如 PB、PE、动量)之间往往存在相关性。实践中需要做施密特正交化(Gram-Schmidt Orthogonalization),把 LLM 因子中与传统因子共线的部分剔除,剩下的才是”纯增量信息”。
组合时需要考虑因子之间的非线性叠加效应。简单的等权线性组合在因子相关性较高时效果不佳,业界更倾向于用遗传规划(Genetic Programming)或贝叶斯优化搜索最优非线性组合权重。

三、端到端 LLM 策略:研究员的新工具还是替代者?#
3.1 LLM 作为策略 idea 生成器#
最直接的应用是让 LLM 扮演”策略头脑风暴助手”。研究员用自然语言描述宏观环境和市场观察,LLM 输出潜在的策略方向:
背景:2026年二季度,美联储维持高利率环境,
科技股估值承压,但AI算力需求持续增长。
请提出3个量化策略方向,要求:
1. 有明确的逻辑支撑
2. 可用公开数据验证
3. 避免已知过拟合陷阱plaintext这类交互的价值不在于 LLM 能直接给出可行策略,而在于帮研究员拓展思路盲区——人类研究员往往受限于自己的投资风格和历史经验,LLM 能带来跨风格、跨资产类别的思维跳跃。
3.2 端到端策略生成的现实与局限#
更进一步的问题是:LLM 能否直接生成可执行的交易策略?
目前最前沿的探索来自两方向。一是”LLM + 代码生成”模式:研究员描述策略思路,LLM 生成 Python/NumPy 代码,包括数据获取、因子计算、信号生成和回测框架,然后研究员审查修改后运行。DeepMind 的 AlphaCodium 论文展示的 Code-contest 工作流与此类似。
二是完全端到端的多 agent 系统。不同 agent 分别负责数据收集、因子设计、回测评估和风险管理,通过结构化通信协议协作。这个方向目前更多停留在学术研究阶段,实际效果良莠不齐。
核心的局限在于:LLM 缺乏真正的金融直觉和对尾部风险的感知。它可以学会”动量因子在趋势市中有效”这个统计规律,但很难真正理解”当流动性突然枯竭时,动量因子可能发生踩踏式崩塌”这种需要真实市场经验积累的认知。

四、未来展望:从工具到生态#
LLM 在量化领域的下一个爆发点,我认为在金融知识图谱的自动化构建。
当前的知识图谱依赖人工定义实体(公司、产品、人物)和关系(供应、竞争、投资)。LLM 可以从非结构化文本中自动抽取实体关系,将这个过程的成本降低一个数量级。一旦金融知识图谱的构建成本大幅下降,以图神经网络(GNN)为基础的因子挖掘方法将迎来新的黄金期。
此外,多模态金融分析是另一个值得关注的赛道。整合文本、图像(财报图表、K线形态)、音频(电话会)等多种模态的信息,用统一的 LLM backbone 做联合推理,是一条尚未被充分探索的方法论路径。Anthropic 的 Claude 3 已经展示了强大的多模态能力,将其应用于金融分析只是时间问题。
但有一点需要清醒认识:LLM 是 quant 研究员的放大器,而不是替代者。它让优秀研究员的生产力翻倍,但也可能让低质量研究的数量翻倍。最终,市场的超额收益来源不会因为 LLM 的出现而消失,只会被重新定价。真正稀缺的,永远是对市场本质的深刻理解。
本文不构成任何投资建议。