概念笔记
朴素贝叶斯(贝叶斯定理 + 条件独立 + 后验最大化的分类器)
朴素贝叶斯 = 用贝叶斯定理把「某类出现的先验概率」和「该类下看到这些特征的概率(似然)」合起来,算出「看到特征后属于各类的概率(后验)」,再挑后验最大的类作答。它加了一条「朴素」假设——给定类别时特征相互独立——让概率能相乘、计算可行。量化课堂 37 篇用「年轻人检查阳性」的例子把整套讲透,43 篇把它列为预测次日涨跌的三算法之一。
一句话
「阳性 ≠ 确诊。」检测再准(阳性率 99%),只要「得病的人本来就极少」(先验低),阳性样本里多数仍是误诊——朴素贝叶斯把先验和似然正确合成后验,再挑最可能的类。基础率(先验)常常主导结果,这是它最反直觉也最有用的地方。
当前理解
- 公式:P(Y=c_k|X=x) = P(X=x|Y=c_k)·P(Y=c_k) / Σ_k P(X=x|Y=c_k)·P(Y=c_k)。分子 = 该类下看到 x 的概率 × 类先验;分母 = 把所有类加起来的归一化。
- 医学例(37 篇):20000 人里没病 18000、有病 2000。有病者中年轻人 5%、阳性率 99%;没病者中年轻人 95%、误诊阳性率 1%。「年轻且阳性且真病」=2000×5%×99%=99 人;「年轻且阳性且没病」=18000×95%×1%=171 人。所以 P(真病 | 年轻+阳性)=99/(99+171)=36.7% < 没病 63.3%——阳性 ≠ 确诊,医生让复诊。
- 反直觉点(基础率错觉):确诊率 99% 很高,但「年轻人得病」的先验极低(5%),于是阳性样本里误诊占多数。先验主导后验。
- 条件独立假设:P(年轻且阳性 | 某类) = P(年轻|某类)×P(阳性|某类)。不独立就不能乘:有云 0.5 × 下雨 0.33 ≠ 同现概率(云和雨相关)。
- 「朴素」的代价与回报:特征真相关时(云雨)估计失真;但独立假设让每个特征只需单独估计,样本需求与计算量骤降,实战里往往够用、常作基准。
- 后验最大化:给定特征时把各类后验都算出选最大者——在模型假设正确时让分类错误率最小。
- 量化里的用法(37/43 篇):技术指标(SMA/WMA/MOM 等 13 个,43 篇离散化成 ±1)当特征、次日涨跌当标签,训练朴素贝叶斯分类器预测涨跌;43 篇把它和 SVM、随机森林并列。两篇都明说:只演示用法,不对准确性/收益担保。
来源
- 朴素贝叶斯入门 — 原理 + 医学例 + sklearn 演示(postId=1727)
- 手把手教你如何应用机器学习 — 应用篇(postId=1900,朴素贝叶斯为三算法之一)
- 关联概念:把机器学习用到股票预测(落地流程与坑)(43 篇的落地流程,含特征离散化与滚动重训)、熵与信息增益(衡量特征/因子带来多少信息)(同为 ML 组理论起点)
常见混淆
- 朴素贝叶斯 ≠ 贝叶斯推断整体:它只是「贝叶斯定理 + 条件独立假设」组装出的一种分类器;37 篇讲的「贝叶斯定理」是其中的公式件,不是贝叶斯学派统计。
- 「阳性率 99%」≠「阳性者 99% 有病」:前者是 P(阳性|有病)(似然),后者是 P(有病|阳性)(后验),方向不能倒——这是全文最重要的反直觉点。
- 条件独立 ≠ 无条件独立:云和雨无条件不独立;但「给定类别后」某两个特征可能条件独立。朴素贝叶斯要的是给定类别后的独立。
- 后验最大化 ≠ 保证对:它只在「模型假设正确」时最优;特征强相关、分布假设错,估计就错。
- 分类器预测对 ≠ 策略赚钱:37/43 篇都明确只演示用法;预测对错到真金白银之间还差仓位、调仓、成本整套逻辑。
- 先验从哪来:本文用历史频率估计先验;先验口径不同(人群 vs 样本)结论会变——别把 toy 例子的比例当普适。
开放问题
- 连续特征在 sklearn 里具体怎么建模(高斯朴素贝叶斯等分布假设)——37/43 篇未给出具体类与参数 [需要验证]。
- 特征强相关时(13 个技术指标同源冗余)朴素贝叶斯偏差多大、怎么改进,原库没讨论。
- 次日涨跌分类正确率即使 >50%,扣完交易成本是否仍有超额——本库 ML 批次没走到那一步(低频验证方法论属 W9 QuantStart 批次)。
来源
更新 2026-09-06