Jikipedia
Jikipedia量化聚宽量化课堂(低频量化策略 43 篇)熵与信息增益(衡量特征/因子带来多少信息)
概念笔记

熵与信息增益(衡量特征/因子带来多少信息)

熵 = 一个变量的「不确定程度」;条件熵 = 知道某个特征后还剩多少不确定;信息增益(= 互信息)= 知道特征前后不确定性的减少量。减少得越多,这个特征(在量化里就是因子)越值得用。它是机器学习里「怎么比较特征谁更有用」的理论尺子,量化课堂用它开机器学习八篇的头。

量化条件熵信息增益互信息特征选择因子

一句话

「涨跌越像抛硬币越难猜。」熵把「难不难猜」量化;信息增益告诉我们:引入某个特征(因子)后,猜涨跌的不确定性被压掉了多少——压掉越多,这特征越重要。

当前理解

  • 熵 H(Y) = −Σ pᵢ·log₂(pᵢ)(Y 取 n 个值、概率 pᵢ):单值分布熵为 0;概率越均匀熵越大。二值变量在 50/50 时熵最大(=1 bit),最难预测。
  • 条件熵 H(Y|X) = Σₓ P(X=x)·H(Y|X=x):按特征 X 的取值把样本分组,组内算 Y 的熵,再按各组大小加权平均。它是「看完 X 之后 Y 的平均剩余不确定」。注意 H(Y|X=x) 是把 (Y|X=x) 整个当一个变量算熵,别和 H(Y|X) 混。
  • 信息增益 g(Y,X) = H(Y) − H(Y|X),也叫互信息:知道 X 让 Y 的不确定性少了多少。
  • 手算小例(量化课堂 36 篇):6 个样本 3 涨 3 跌 → H(Y)=1。X=涨 时 2 个样本全涨 → 组内熵 0;X=跌 时 4 个样本 3 跌 1 涨 → 熵 0.8113。P(X=涨)=1/3、P(X=跌)=2/3 → 条件熵 = ⅓×0+⅔×0.8113=0.5409。增益 = 1−0.5409 = 0.4591
  • 在量化/ML 里的定位:衡量「因子/特征是否有效」的一种标尺(因子有效性也可以看成「这个因子把次日涨跌的不确定性压掉多少」);也是决策树/随机森林分裂选特征的依据。本库 36–43 各篇都用特征预测涨跌,本篇给了比较特征的理论尺子。

来源

常见混淆

  • 熵 ≠ 日常「混乱」:这里的「不确定」指「难预测」,不是说状态乱糟糟。掷硬币 50/50 熵最高,但硬币本身很「干净」。
  • 信息增益 ≠ 相关系数:增益衡量「知道 X 后 Y 不确定性减少」,不需要线性假设,对非线性关系也敏感;相关系数只量线性同步。
  • 条件熵 H(Y|X) ≠ H(Y|X=x):前者是所有 x 加权的总剩余不确定;后者只算 X 取某个固定值那组的熵——36 篇专门提醒记号陷阱。
  • 信息增益大 ≠ 特征间无冗余:增益只量「X 单独能解释多少」;两个高度相关的特征各自增益都可能大,但信息重叠。选特征时不能只看单变量增益,36 篇未展开这一点。
  • 增益衡量「单独预测力」 ≠ 因子排序直接可交易:它只是特征有效性的一种度量,不涉及可交易性/成本/容量。

开放问题

  • 连续型特征怎么算增益(要分箱离散化,分箱方式影响结果)——36 篇没讲;43 篇给的技术指标离散化(±1)是一种工程近似。
  • 增益多大算「够有效」、多个特征怎么联合比较取舍,原文没给阈值与流程。
  • 特征冗余时(A、B 各自增益高但高度相关)怎么惩罚/去冗余,信息增益单变量框架不直接回答。
  • log 底数取 2(bit);若换自然对数只差常数倍数,不改变特征排序——36 篇没写底数口径。

更新 2026-09-06

检索知识库

按标题、类型或正文检索