Jikipedia
Jikipedia量化聚宽量化课堂(低频量化策略 43 篇)指标效果的历史频率统计(赢平输频次与最佳区间)
概念笔记

指标效果的历史频率统计(赢平输频次与最佳区间)

别拍脑袋定「指标到多少才买」。把历史上每个指标值出现后的涨跌记成赢/平/输频次,再设「区间宽度 + 最小数据比」扫出赢输比最高、样本又够的区间当信号——让历史数据投票,而不是凭感觉划线。

量化指标检验赢平输统计最佳区间数据比未来函数

一句话

一个指标(如 RSI、5 日收益率)的每个取值,都能统计出「出现它之后未来是涨是跌」的次数分布。光看单点不可靠(样本少、相邻值不稳),于是把指标轴切成一段段区间:每段里样本量达到总样本的一定比例(最小数据比 θ)才保留,比各段赢输比,取最高的一段当触发信号。它回答「为什么阈值取 20 不取 18」——因为 20 所在的区间历史赢面最高。

当前理解

方法与对象(量化课堂 17)

  • 指标 = 函数 Ind(T),输入时间及之前的数据,输出数值。结果按「预测的事件」三分:赢 / 平 / 输(判定标准可自定,作者承认有拍脑袋成分)。
  • 统计流程:去掉停牌日(skip_paused)→ 逐日记 (指标值, 赢/平/输) → pandas 统计每个值的频次 → matplotlib 叠加条形图(红输/黄平/绿赢)。
  • 两个坑:
    • 单点不可靠:恰好等于 1.17 的概率很小、可能几年不出现,且邻值 1.18 胜率不高,1.175 无法判断。
    • 样本太少不可信:某段只有赢没有输,但总共没几个样本。
  • 解法 = 扫区间:find_best_region(statistics, tick_width, least_percentage, band_width),赢输比 = 赢数/(输数+1)(防除零),区间样本 ≥ 总样本 × θ 才保留,取赢输比最高者。
  • 更彻底:find_absolute_best_region(..., least_width, most_width) 遍历所有宽度,取全体最佳。
  • 示例(002200,2006–2016,5 日收益率):θ=0.03、w=4 → [1.12,1.16],赢输比 1.43;θ=0.05、宽度 2~30 → 宽度 19 的 [1.12,1.31],赢输比 1.72。
  • 嵌入策略三纪律:不同股票分开统计(个性不同,区间不可跨股搬);每日更新统计与最佳区间(否则过时,且用现算区间回测历史 = 未来数据,收益虚高);可接凯利公式优化仓位(17 篇留作业)。

已被本系列用过(量化课堂 10)

  • 均值回归进阶把同一套方法用在「偏离倍数 ρ」上:只统计 ρ<−1 的深跌,赢输判定用「T 天内先涨 σ·u=赢 / 先跌 σ·d=输」,扫出最佳偏离区间(如 ρ∈[−3.1,−2.6],赢 27:输 12)再进场。10 篇正文注明方法引自 post 2086(即 17 篇)。

与其它「调参/选参」路线的区别

  • 13 篇(TD 指标)靠试参数找 T/N/M;17 篇把「阈值怎么选」升级成「先统计分布、再扫最优区间」——两者都是让数据说话,但 17 篇给了显式的样本量与宽度纪律。
  • 18 篇(多回测框架)在策略层面对整组参数跑回测;17 篇在信号层面对单个指标值做频次检验。一个验「信号阈值」,一个验「策略参数」。

来源

常见混淆

  • 赢输比 ≠ 胜率:比值的分母是「输数+1」(防除零),平局不计入分子分母;别把它当简单胜率读。
  • 区间赢输比最高 ≠ 一定赚钱:它是样本内最优,可能过拟合;1.72 只表示长期频次占优,不保证单次。
  • 频率统计 ≠ 统计推断:本篇是描述性频次,没有 p 值/置信区间;它不等于严谨的假设检验。
  • 统计有效 ≠ 策略能执行:还要过 T+1、涨跌停、流动性与成本(交易成本(佣金、规费、过户费与印花税))这几关。
  • 跨股搬区间是错的:每支股票要分开统计;一只股票的最佳区间用在另一只可能效果截然不同。
  • 「每日更新」不是可选优化:不每日重算,用「现在才知道的最佳区间」回测历史就是未来函数,结果虚高。

开放问题

  • θ(最小数据比)与宽度范围怎么定才不过拟合——17 篇只给了示例参数,没有权衡理论 [需要验证]。
  • 赢平输的判定标准很主观(作者自认);判定一变结论就变,没有「怎么选判定才稳」的准则。
  • 赢输比区间跨时段/跨市场是否稳定(10 篇的 ρ 区间同样有此疑问)。
  • 与更严格的显著性检验(bootstrap、样本外验证)及 QuantStart 的回测偏差方法论(W9)如何衔接。

更新 2026-09-06

检索知识库

按标题、类型或正文检索