多年从事风控建模工作, 见识过好多人在这方面遭遇挫折。变量筛选看似容易办到,实则直接左右着模型的走向。若选得恰当信用评分模型变量筛选, 模型稳固、业务易于推广;倘若选错, 后续即便努力调整参数也是徒劳无功。变量筛选本质而言, 就是于众多特征当中寻觅那几条最能够预测违约风险的线索, 既要考量统计层面的显著性, 又要兼顾业务的可解释性。不少新人容易陷入一种错误认知, 觉得变量数量越多越好, 事实并非如此。变量过多反倒会使模型陷入困境, 增添过拟合的风险, 还会让业务方难以弄明白。
信用评分模型变量筛选有哪些常用方法
对于行业内最为主要流行的做法而言, 乃是运用IV值去实施初步筛选, 此一指标于国内的使用极为频繁,IV值能够直观地展现出一个变量的区分能力信用评分模型变量筛选, 通常情况下, IV大于0.02的变量才有得以进入后续建模的价值, 然而仅仅依靠IV值又并不充分, 存在某些变量IV值颇高, 可是却与业务逻辑不相契合, 若强行将其放入模型中, 反而会引发问题。
这一绕不开步骤是相关性分析, 变量间若存在高度相关, 那模型稳定性会大幅降低, 像两个变量收入水平与负债比率, 要是相关系数在0.8以上, 选留其中一个即可, 另一个可考虑剔除。
在理论层面上, 逐步回归法属于那些经典范畴内的理念层面的方法, 然而, 在实际操作过程里, 它却存在着诸多的问题。它每一次仅仅去考量单个变量所产生的贡献, 却将变量彼此之间存在的交互作用给忽略掉了, 最终筛选出来的变量组合, 不一定就是最为优化的那种。在实际工作期间, 我更加趋向于把IV筛选、相关性分析以及业务理解这三者结合共同运用, 而不是一味地迷信某一种单一的方法。每一个业务场景所具有的变量特征都是不一样的, 消费贷以及供应链金融的筛选逻辑是全然不同的, 绝对不可以原封不动地照搬某一套模板来应对所有情况。
信用评分模型变量筛选需要注意什么
在变量筛选里头, 最为常见的那种坑, 便是过度去追求统计显著性了 , 有些变量的 p 值特别低, 然而把它们放到实际业务当中, 根本就没办法解释。还记得以前做过的一个项目呀, 筛选出来了一个变量, 在统计方面非常显著, 可是业务方完全讲不出这个变量和违约之间存在着怎样的逻辑关联, 最终只能将其舍弃掉。变量筛选的最终极标准是业务可解释性, 而并非纯粹的统计指标。
还有一个极易被忽略的问题在于, 变量稳定性以及时间跨度, 今日筛选出的优质变量, 过了半年也许就失效了, 尤其是在经济下行阶段, 某些变量的区分能力会明显降低, 故而筛选时要尽可能延长观察周期, 运用足够长的历史数据去检验变量的稳定性。
存在一个细节, 那便是变量之间的交叉验证, 有时单独看某个变量, 其效果还行, 然而两个变量组合在一起, 预测能力却会出现倍增的情况, 这种情形在信用评分模型里并非少见, 适度保留一些看似边缘的变量组合, 或许会给模型带来惊喜, 总之变量筛选没有标准作答, 需要于数据规律及业务直觉之间寻得那个微妙的平衡点。
