halo 的技术博客

返回

Alpha是什么#

在量化交易的世界里,Alpha是最神圣的概念。简单来说,Alpha就是你的策略在剥离了市场Beta之后的超额收益。如果你买了沪深300ETF,赚的是Beta——市场整体的上涨;如果你通过选股赚了比指数更多的钱,多出来的那部分就是Alpha。

本质上,量化研究员的工作就是一件事:持续地发现和捕捉Alpha信号

而这个过程中,特征工程是最关键也最耗时的环节。桥水基金创始人Ray Dalio说过一句经典的话:“投资的圣杯是找到15个以上互不相关的良好回报流。“翻译成量化语言:找到足够多、足够独立的Alpha因子。

量化研究员的因子研究流程

量化特征工程的三个层次#

L1:基础因子层(70%研究员停留于此)#

基础因子是直接可从数据中计算得到的最原始变量。包括:

量价因子:均线偏离、RSI、MACD、布林带宽度、成交量比率、换手率、波动率……这类因子数量众多,但同质化严重。问题在于,任何一个学过量化入门课的人都会用这些因子,你很难在公开因子上获得超额收益。

基本面因子:PE、PB、ROE、毛利率、营收增速、资产负债率、现金流比率……基本面因子的好处是经济含义清晰、不容易过拟合,缺点是更新频率低(财报季度才更新),对短期交易贡献有限。

L2:衍生因子层(20%研究员在此)#

衍生因子是对基础因子的二次加工,也是Alpha真正开始产生的地方。

时间序列变换:不只看ROE的绝对值,而是看ROE的环比变化、同比变化、加速度(二阶导)。一个ROE持续提升的公司,比一个ROE绝对值很高但已经开始下滑的公司更有投资价值。

截面标准化:把单个股票的因子值放在行业或全市场中进行比较。PE=30在高成长行业中可能是”便宜”,在传统行业中可能是”贵”。截面排名(rank)往往比原始值更稳定。

因子正交化与合成:单个因子噪音大,多个低相关因子的组合信号更可靠。通过PCA、ICA等降维方法可以合成”复合因子”。关键原则是——合成因子内部的子因子要尽可能低相关,不同合成因子之间也要低相关。桥水提到的”15个互不相关的良好回报流”就是这个意思。

L3:另类因子层(8%的领先者)#

这是Alpha最丰厚的层次,也是门槛最高的层次。

文本因子:从财报MD&A、电话会纪要、分析师报告中提取情感信号。前面那篇讲LLM在量化中的应用,核心就是在文本因子上做文章。

关系图谱因子:利用供应链、股权关系、专利引用关系构建知识图谱,挖掘”概念股”之间的联动效应。当某只龙头股出现异动时,其供应链上下游的股票可能在T+1日出现跟随效应。

高频微观结构因子:利用tick级别的订单簿数据,构建买卖压力、大单流向、流动性深度等因子。这对数据基础设施要求极高,但Alpha衰减速度也最慢。

特征工程的完整Pipeline#

一个工业级的特征工程流程大致是这样的:

这当然只是一个骨架。真实生产环境中,Pipeline需要处理更多的问题:缺失值处理(财报数据经常缺字段)、异常值截断(MAD法或分位数法)、数据对齐(财报的发布日期不等于报告期)、幸存者偏差(只用了现在还活着的股票)。每一点细节处理不当,都可能让你在回测中获得漂亮的曲线,但在实盘中遭遇”回测即巅峰”的尴尬。

特征工程自动化Pipeline流程

如何评估一个因子好不好#

光会构造因子没用,你得知道这颗因子值不值得放入实盘。以下是量化研究员日常的因子评估流程:

IC(Information Coefficient)分析:因子值和未来收益之间的秩相关系数。一般来说,|IC| > 0.02就算有信息量,|IC| > 0.05属于强因子。但IC的稳定性比绝对值更重要——一个IC=0.03但月度IC为正概率90%的因子,比一个IC=0.08但忽正忽负的因子更有实战价值。IC的IR(IC均值/IC标准差)是最核心的指标。

分层回测:将股票按因子值分为5-10组,看各组在未来一段时间的收益表现。第一要检查的是单调性——随着因子值从低到高,各组收益是否呈现单调递增或递减。不单调的因子往往存在非线性关系,直接用线性多空可能有坑。

换手率与容量:好的因子换手率不能太高。一个日频换手30%的因子,哪怕IC很高,在扣掉交易成本后的净收益可能所剩无几。同时要考虑市场容量——小市值股票上的Alpha容易做,但因为流动性差,大规模资金没法上。

从特征到策略的最后一公里#

一个IC=0.05、IR=0.8的优秀因子,距离一个赚钱的策略还有很长的路。这”最后一公里”包括:

多因子合成:你不会只用一个因子做交易。如何把10-50个因子合成为一个综合信号?等权是最简单的方法,但通常不是最优的。IC加权、滚动窗口IC加权、基于机器学习的非线性合成(GBDT、XGBoost、LightGBM都是常见选择)——这些才是Alpha工程师的日常。

风险控制:你的因子可能在某一类股票上集中暴露——比如无形中多配了小市值或高Beta的股票。因子中性化和行业中性化是基本功,不做好这一步,你以为的Alpha其实就是偷偷加了杠杆的Smart Beta。

交易成本建模:回测时不能假设成交价就是收盘价。冲击成本、滑点、佣金、印花税、涨跌停限制——每一条都会吃掉你的Alpha。专业的量化团队会把交易成本模型也做成一个独立的模块,与策略模型一起参与优化。

给想入行的人的建议#

如果你对量化研究感兴趣,以下路径可以参考:

  1. 先把Python搞熟。pandas、NumPy、scikit-learn是基本功,XGBoost/LightGBM是进阶必修课。不需要成为软件工程师,但要能独立完成数据清洗到模型训练的完整流程。

  2. 读论文,大量读。AQR、WorldQuant、Two Sigma公开发布的研究报告,SSRN上的量化金融论文,国内中信建投、华泰的量化研报——这些都是免费的”教材”。

  3. 动手做,不要只看。搭一个自己的回测架子(哪怕很简单),从最简单的均线金叉策略做起,逐步加入因子、风险控制、组合优化。实践中学到的东西,一百篇文章也替代不了。

  4. 理解市场,而不是只理解模型。量化不是数学竞赛。A股有A股的游戏规则——涨停板制度、T+1交收、融资融券限制、政策驱动——这些制度特征对策略的影响,比模型的选择要大得多。

最后记住一句话:好的特征工程是对市场的深刻理解的数据化表达。如果你不理解一个因子为什么能赚钱,那它大概率只是过拟合的产物。


封面图说明:量化因子研究从数据获取到实盘上线的完整工作流示意,以及特征工程从数据清洗到模型部署的自动化流水线。

量化研究员的核心武器:从特征工程到Alpha因子的实战方法论
https://blog.halo26812.eu.org/blog/quant-feature-engineering-alpha
Author halo
Published at 2026年7月27日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨