规则挖掘不止决策树:五族方法怎么选?

📅 2026/8/26 16:46:10
规则挖掘不止决策树:五族方法怎么选?
决策树是主力,但不是唯一。实战挖规则有五族方法,按场景选:树基类:单棵全树抽规则、序列覆盖、级联树——适合从数据自动找切割;评分卡 WOE 基:WOE 逻辑回归,把变量转 WOE 后做回归,得到可解释的评分卡——适合需要稳定分数的场景;专家修正类:专家硬规则 拒绝推断——适合强监管、必须有明确规则的领域;分群交互类:聚类分群、交互探测——适合某两类变量组合才坏的隐藏风险;黑箱提取类:RuleFit、SkopeRules、关联规则——从复杂模型里提取可读规则,兼顾区分度和可解释。树基类实战DecisionTreeClassifier 抽取规则下面用 sklearn 的 DecisionTreeClassifier 训练一棵浅树并导出可读规则。关键步骤切分数据、训练模型、用 export_text 输出规则。import pandas as pd from sklearn.tree import DecisionTreeClassifier, export_text from sklearn.model_selection import train_test_split 1. 构造示例数据两个特征目标为 0/1 df pd.DataFrame({ income: [3, 8, 5, 12, 6, 15, 4, 9], age: [25, 45, 30, 50, 28, 55, 22, 40], bad: [0, 1, 0, 1, 0, 1, 0, 1] }) X df[[income, age]] y df[bad] 2. 切分训练集和测试集 X_train, X_test, y_train, y_test train_test_split( X, y, test_size0.25, random_state42 ) 3. 训练浅树限制深度便于抽规则 clf DecisionTreeClassifier(max_depth2, random_state42) clf.fit(X_train, y_train) 4. 输出可读规则 print(export_text(clf, feature_names[income, age])) 输出示例 |--- income 6.50 | |--- class: 0 |--- income 6.50 | |--- age 47.50 | | |--- class: 1 | |--- age 47.50 | | |--- class: 1运行后可以看到模型自动找到 income 和 age 的切割点形成“收入低 → 好客户收入高且年龄适中 → 坏客户”的规则适合直接用于业务解释。评分卡 WOE 基实战scorecardpy 构建评分卡下面用 scorecardpy 完成变量分箱、WOE 转换和逻辑回归得到可解释的评分卡。关键步骤数据切分、变量筛选、分箱与 WOE、训练评分卡。import scorecardpy as sc import pandas as pd 1. 构造示例数据 df pd.DataFrame({ income: [3, 8, 5, 12, 6, 15, 4, 9, 7, 11], age: [25, 45, 30, 50, 28, 55, 22, 40, 35, 48], bad: [0, 1, 0, 1, 0, 1, 0, 1, 0, 1] }) 2. 切分训练集和测试集 train, test sc.split_df(df, bad, seed42) 3. 变量筛选这里直接指定可用变量 train train[[income, age, bad]] test test[[income, age, bad]] 4. 分箱并转换为 WOE bins sc.woebin(train, ybad) train_woe sc.woebin_ply(train, bins) test_woe sc.woebin_ply(test, bins) 5. 训练评分卡 card sc.scorecard(bins, train, ybad) score sc.scorecard_ply(train, card) print(score.head()) 输出示例每行给出一个综合评分分数越高代表风险越低运行后可以看到每个变量先被自动分箱再映射为 WOE 值最后通过逻辑回归得到每个分箱的分数。最终输出是一张可直接落地的评分卡适合需要稳定分数和强解释性的场景。怎么选?基本原则:能解释优先用树基/评分卡;强合规用专家硬规则兜底;怀疑有交叉风险用分群交互;已有复杂模型想提取规则用黑箱提取。一张速查表:追求快和可解释 → 树基;追求稳定分数 → WOE 评分卡;监管要求硬规则 → 专家修正;隐藏交叉 → 分群交互;复杂模型复用 → 黑箱提取。