量化因子中心手册 / 因子分析怎么读

量化因子中心手册

因子分析怎么读

因子分析看板的完整读法:核心指标、分组收益表,以及 IC 序列、衰减、累计、自相关、分布与分组收益 3D 图各自说明什么问题。

在因子卡片或表格行上点【因子分析】,打开的是这个因子的图表看板。它把因子有效性拆成四个维度——预测能力、时间稳定性、分布形态、分层区分度——用一组指标和图表呈现。这一页讲每一块怎么读。

判断一个因子是否可用,要四个维度交叉验证,任何单一指标都不足以下结论。

一、看板由什么组成

区块 内容
因子收益率大图 各分组的收益曲线
核心指标卡 因子收益、夏普比率、年化收益、最大回撤,以及 IC 类指标
最新数据 最近一期各股票的日期、代码、名称与因子值
分组收益 分组明细表:年化收益率、超额年化、最大回撤、超额最大回撤、年化波动、超额年化波动、换手率、月度胜率等
图表矩阵 IC 与 Rank IC 各四张(序列 / 衰减 / 分布 / 自相关),以及因子分组收益 3D 图

面板可以拖拽缩放与最大化。因子如果还没有分析数据,会提示「该因子暂无分析数据」。

二、IC 与 Rank_IC:一切的起点

信息系数(IC) 是因子值与未来收益的皮尔逊相关系数,取值 [-1, 1]:

  • 正值:因子值越高、未来收益越高,正向预测能力;
  • 负值:因子值越高、未来收益越低,反向预测能力;
  • 绝对值越接近 1,线性预测能力越强;越接近 0 越弱。

一般参考:|IC| ≥ 0.02 表明因子在历史回测中呈现一定相关性,|IC| ≥ 0.05 为较强相关性。

Rank_IC 是横截面上因子值排名与未来收益排名的斯皮尔曼秩相关,比 IC 更稳健,原因有两点:一是不要求因子与收益满足线性关系,只关注排序一致性;二是对收益分布的极端值与非正态不敏感,更贴合真实市场。实务中通常以 Rank_IC 为主指标。

指标类型 指标 判断标准 说明
预测能力 IC 均值 绝对值 ≥ 0.02 因子值与下期收益率的相关性
预测能力 ICIR 绝对值 ≥ 0.5 IC 均值 / IC 标准差,稳定性指标
收益表现 年化收益 ≥ 15%(历史回测数据,不代表未来收益) 最优分组的年化收益率
风险控制 最大回撤 ≤ 20% 历史最大亏损幅度
风险调整 夏普比率 ≥ 1.2(历史回测指标,不构成收益承诺) 风险调整后收益
统计显著 P 值 < 0.05 表明历史统计显著性较高(统计显著不等于预测有效) 排除运气成分

三、序列图与累计 IC

序列图把每一期的 IC 画成柱子,图例里的 Cum_IC 打开后叠加累计曲线。

IC 序列图(上)与 Rank_IC 序列图(下):逐期柱状与累计曲线

累计 IC 是把每期 IC 逐个累加得到的序列,用来判断预测能力的持续性

  • 正向因子(IC 均值 > 0):累计 IC 持续上升,说明预测能力稳定有效;
  • 反向因子(IC 均值 < 0):累计 IC 持续下降,同样说明稳定有效;
  • 累计 IC 走平或剧烈波动:预测能力不稳定,存在阶段性失效。

上图这个示例因子 IC = 0.073、IC_IR = 0.5869,Rank_IC = 0.136、IC_IR = 0.6837;两张图的累计曲线在观测期内都稳步上行,下面那张(Rank_IC)更陡,说明它的排序预测能力比线性相关更清晰。注意两张图量纲不同,不能直接比柱子的高低来论证谁更稳定,要比的是 IC_IR。

四、衰减图:这个因子能预测多远

因子预测能力随时间衰减是普遍现象。衰减分析计算因子在不同滞后期的 IC / Rank_IC:滞后 0 期是对下一期收益的预测能力,作为基准;滞后 N 期是对 N 期之后收益的预测能力。

IC 衰减图(上)与 Rank_IC 衰减图(下)

  • IC 值快速下降:因子时效性强,只适合短周期策略;
  • IC 值缓慢下降:具备中长期预测能力,适合周度、月度这类低频策略。

上图的形态是:正向预测效应在近端维持较高水平,随预测期限拉长逐步衰减,远期窗口出现小幅负向波动,整体仍以正向预测为主。衰减曲线直接决定调仓周期该设多长——预测能力在第 5 期就归零的因子,配月度调仓是浪费。

五、自相关图:信号是不是在重复自己

自相关衡量相邻期 IC / Rank_IC 之间的相关性,反映预测能力的时间稳定性与信息独立性。

IC 自相关图(上)与 Rank_IC 自相关图(下),虚线为置信区间

情形 含义
自相关过高(如 > 0.8) IC 序列强序列相关,信号高度依赖前一期,信息冗余严重。需警惕因子构建中混入未来信息、滚动窗口重叠或过度拟合,样本外容易快速衰减
自相关过低(如 < 0.2) IC 序列接近白噪声,信号独立性强。若同时 IC 均值稳定、IR 较高,反而说明因子样本外更稳健;若 IC 均值低、波动大,则是预测能力不稳定
合理区间 日频 / 周频量价因子 0.20.6 较常见;月频基本面因子可略高,0.40.7,因为基本面信息更新慢、信号天然更平滑

低自相关未必是坏事,关键是与 ICIR、样本外表现结合判断,而不是只盯一个区间。上图中滞后 1 期显著为正、滞后 2 期后快速回落并在零值附近小幅波动,说明短期预测有一定延续性,但没有长期记忆性,各周期的预测相对独立。

六、分布图:偏度与峰度

通过偏度与峰度看 IC 的分布形态,判断收益的极端性与对称性。

IC 分布直方图(上)与 Rank_IC 分布直方图(下),含核密度曲线

偏度(Skewness) 衡量不对称程度:

  • 正偏(> 0):右侧长尾,容易出现高正向 IC 的极端情况,收益有「厚尾」特征;
  • 负偏(< 0):左侧长尾,容易出现极端负向 IC,风险较高;
  • 无偏(≈ 0):对称分布,预测能力稳定,没有极端收益或风险。

峰度(Kurtosis) 衡量陡峭程度:

  • 高峰(> 0):IC 集中在均值附近,极端值少,稳定性强;
  • 低峰(< 0):离散度高,极端值多,预测能力波动大;
  • 正态峰(≈ 0):符合正态分布,是理想形态。

上图的示例中,IC 分布强正偏(skew = 1.659)且高峰态(kurt = 1.869)——存在获得极端高收益的可能,但分布集中、极端值特征明显,高收益潜力伴随较高的不稳定性;Rank_IC 的偏度降到 1.068、峰度转为 -0.020,对称性更好、对异常值更不敏感,作为评价指标更稳。

七、分层收益:区分度的最终检验

分层验证把股票按因子值从低到高分成 N 组(通常 5 组),分组 5 为因子值最高组。理想状态下,分组 1 到分组 5 的收益呈单调递增(正向因子)或递减(反向因子),说明因子值高低与收益强弱严格对应。

下面是一个示例因子的分组收益明细:

分组 年化收益率 超额年化 最大回撤 超额最大回撤 年化波动 换手率 月度胜率
分组1 18.45% −40.23% 3.98% 13.87% 9.79% 100.00% 75.00%
分组2 35.11% −23.57% 4.48% 7.92% 10.92% 100.00% 75.00%
分组3 56.18% −2.51% 3.46% 3.15% 13.26% 100.00% 100.00%
分组4 72.05% 13.35% 4.46% 0.96% 15.49% 100.00% 100.00%
分组5 110.66% 51.96% 6.90% 3.34% 21.86% 100.00% 100.00%
多空组合(组5−组1) 92.21% 92.21% 6.45% 6.45% 20.46% 100.00% 100.00%
多空组合2(组4−组2) 36.93% 36.93% 1.69% 1.69% 10.09% 100.00% 75.00%

怎么读这张表:

  • 单调性良好:年化收益从分组 1 的 18.45% 阶梯式上升到分组 5 的 110.66%,符合「高因子值 → 高收益」的正向选股逻辑。
  • 超额收益稳定:分组 5 超额年化 51.96%,多空组合超额 92.21%,说明因子能持续创造超越基准的超额收益。
  • 风险可控:分组 5 最大回撤 6.90%(超额最大回撤 3.34%,两者是不同的列,别看串),多空组合最大回撤 6.45%。
  • 换手率 100%:各组调仓频率很高,落地时必须把交易成本算进去,否则账面收益会被大幅侵蚀。

3D 图把同一份数据换个角度看:横轴是分组、纵轴是时间、高度是收益,哪一组长期领跑一眼就能看出来;下面那张累计超额曲线则看分组之间的分化是否随时间稳定扩大——曲线自始至终纠缠在一起,说明这个因子在该区间没有真正的区分度。

分组收益 3D 曲面(上)与各组累计超额曲线(下)

八、指标体系总结

层次 看什么 验证什么
基础层 IC / Rank_IC 均值为正、正占比高 核心预测能力
时间层 衰减曲线符合逻辑、累计 IC 持续上升、自相关合理 稳定性
分布层 偏度 / 峰度接近正态 无极端风险
分层层 分组收益单调递增或递减 区分度

一个各维度都达标的因子,大致长这样:

  • IC 均值绝对值 ≥ 0.02,方向符合预期;
  • ICIR 绝对值 ≥ 0.5,稳定性好;
  • IC 衰减缓慢,预测周期长;
  • 累计 IC 持续上升,长期有效;
  • IC 自相关适度,预测能力有延续性但不冗余;
  • IC 分布对称(偏度接近 0),峰度适中;
  • 分层收益单调,区分能力强。
注意

以上全部是历史回测口径的判断标准。统计显著不等于未来有效,达标也不构成收益承诺;因子只是研究信号,实际用不用、怎么用由你自行判断。

九、AI 分析报告

【AI分析】按钮走的是另一条路:模型会读取这个因子在当前筛选口径下的指标,流式生成一份结构化的文字报告,覆盖预测能力、稳定性、适用范围与局限。它消耗算力,余额不足时会先提示。

报告适合两种场景:一是快速理解一个陌生因子的定位,二是把看板里的一堆数字翻译成能写进研究记录的结论。但结论仍应以看板数据为准——模型解释的是这些指标,不会产生新的证据。

十、下一步