历经做风控的这一些年份, 我碰到过数目众多的团队于变量筛选这个方面遭遇挫折。存在有些人盲目地堆积起几十个变量, 然而模型却反倒呈现出不稳定的状况。存在有些人凭借经验随意决断, 从而忽略了确实具备预测能力的特征。信用评分模型变量筛选并非是一项简易的技术工作, 而是一项需要于业务理解、统计方法以及模型性能之间寻觅到平衡点的系统工程。
信用评分模型变量筛选看哪些维度
搞清楚啥是好变量, 乃是变量筛选的第一步。一个好变量, 需具备稳定的区分能力, 不能今儿有效明儿就失效。许多初学者易犯的错误是, 只瞅变量的KS值或IV值, 却忽略了变量自身的经济含义以及业务逻辑能不能说得通。
在变量方面, 其数据质量同样具备相当重要程度, 存在缺失率过高、异常值过多情况的变量, 哪怕它在样本内部表现得以展现出再好的状态走向, 然而等到上线之后, 却极易出现后续问题。我曾经有过这样的经历, 目睹了一个团队选取了一个IV值呈现很高态势的变量, 可是最终的结果却是, 这个变量在数据源进行更新活动之后, 几乎达到了全部缺失的情况, 进而导致模型直接陷入瘫痪状态。所以说,在变量筛选这个行为过程当中, 必须要将数据质量、稳定性放置到与预测能力保持同等重要层面状态的时候。
除此以外, 还得去考量变量相互之间的相关性, 要是十几个变量呈现出高度相关的状况, 那么模型不但会出现冗余的情况, 而且还存在着可能会放大某一个单一风险因素偏差的可能性, 一般而言, 我们会借助于相关性矩阵或者方差膨胀因子来对多重共线性进行检测, 进而把那些重复信息过多的变量予以剔除。
信用评分模型变量筛选用什么方法
在方法层面, 单变量分析乃是适合于初筛的一种方式, 它借着IV值、信息值等指标能够迅速地找出具备价值的候选变量, 而单变量分析与多变量分析是能够结合起来加以运用的, 多变量分析指的是在回归模型当中去观察变量的系数显著性以及方向的这一行为, 其目的在于确保变量在控制其余变量以后仍旧拥有效力呢。
一种较为经典的方法是逐步回归, 正向逐步法先是从空模型起始, 接着逐步去加入显著变量;反向逐步法则是从全模型开始, 随后逐步把不显著变量给剔除掉。然而这种方法是有着一个缺点的, 这个缺点便是较易于遭受变量顺序的影响, 不同的起始点很可能会得出不一样的结果。
近些年来, 源于树模型的特征重要性排序愈发流行起来, 用于随机处理时的森林、XGBoost算法其等等能够自主有效捕捉变量之间的非线性关系以及交互效应, 从而给出拥有较为可靠性质的重要性评分, 然而需要着重意及、留意一番的是树模型给出的此项重要性有时候会倾向于偏向高基数变量那个方面, 所以需要结合其他的方法进行验证一番。
变量筛选, 绝非做完一回便宣告终结之事, 伴随业务发生变化以及数据得以积累, 定期去回顾并更新变量清单, 如此方可使信用评分模型维持长久的生命力。

