从事风控工作的朋友肯定明白, 变量筛选属于整个信用评分模型开发里极易出现偏差的环节当中的一个。不少团队在前期耗费大量精力去收集数据, 然而到最后却发觉模型效果不尽如人意。其实, 关键之处并非在于数据量会有多大, 而在于你可不可以精准判断哪些变量是真切有用的。
我存有这么一个习惯, 每当开启新的项目之前, 都会将所有潜藏的变量依循着业务逻辑梳理一遍。并非简单地去查看统计指标, 而是向自己发问: 这个变量于实际情形里究竟可不可以体现客户的还款意愿以及能力呢? 要是无法作出合理的解释, 即便IV值再怎么高, 我也会予以审慎对待。
信用评分模型变量筛选有哪些常用方法
至当下, 于行业范围之内, 常常会被运用的变量筛选方式, 大体上被划分成为了三类, 它们分别是, 根基于统计的方式, 根基于业务逻辑的方法, 以及借助机器学习予以辅助的方法。每一种方法, 都各自存在着优点以及缺点, 在实际开展操作的过程当中, 往往是需要将它们组合起来进行运用的。
统计方法主要是以IV值、卡方检验、相关系数这般的指标构成, 这些指标具有客观、可量化的益处, 进而能够迅速地将大量无效变量给剔除出去, 然而问题是, 它们没办法捕捉变量之间那种复杂的非线性关系, 而且还容易把那些单独看没什么显著效果、组合起来却具备有效性的变量组合给忽略掉。
依据业务逻辑开展驱动操作的方式, 会更多地仰仗从业者进行经验判断这件事情。是以分析借款人收入稳定程度情况之下进行判断事情的时候 , 职务等级以及工作年限方面基本上相比单一时间单次消费时金额总数是更具备解释效力这件事情的。这样一种方式所具备的长处就呈现于其最终结果在可解释方面的力度是强的, 在接受监管机构进行审查之时同样能够给出合理的得以说得通的解释方面道理事情的。
像LASSO回归、随机森林特征重要性等机器学习方法, 近些年来被应用得越发广泛, 它们可自动识别变量相互间的高阶交互效应, 然而其代价是模型透明度有所降低, 在实际落地之际需要人工进行复核。
我们的团队于某个信贷产品的项目里, 采取的是三管齐下的策略, 先是运用统计方法加以粗筛, 接着由业务人员逐个进行审核, 最后借助机器学习方法去验证遗漏的重要变量, 整个流程不断反复迭代, 最终筛选出来的变量数量从起初的二百多个减少至三十多个, 模型PSI稳定于合理区间。
假若是你正处于对该层面实操经验予以探索的状态, 那么能够去参阅一些行业资料, 就像是通过访问www.yjqyl.com以此获取更为系统的知识框架。
信用评分模型变量筛选要注意哪些坑
变量筛选过程中有几个常见陷阱信用评分模型变量筛选永吉圣和老年病医院,新手尤其需要注意。
第一个坑乃是过度拟合, 有些团队为了去追求样本内的高KS值, 从而保留了大量微弱相关的变量, 其结果是在新数据上线之后表现大幅下滑, 解决这个问题需要严格控制变量数量, 并且要定期进行样本外验证。
要说第二个坑, 那便是对变量稳定性的忽视了。有这样一个变量, 它能在过往的历史数据当中呈现出极为良好的表现。然而, 当经济周期产生变动或者面临客群结构方面出现调整时, 这个变量, 便会以极快的速度就失去其原本应有的效用。在此, 建议针对每一个被选入的变量进行基于时间范畴的稳定性测试, 去观察各个变量在不同的时间段里, 其具备的区分能力是不是契合为一致的状态。
第三个坑在于, 忽略变量之间存在的共线性。两个有着高度相关性的变量, 同时进入到模型之中, 这不但会造成自由度的浪费信用评分模型变量筛选,而且还可能致使系数估计出现扭曲。在筛选的过程当中, 应当定期去计算VIF值, 要及时地剔除掉冗余变量。
变量筛选可不是那种能一劳永逸的工作, 市场环境处于不断变化之中, 用户的行为同样在发生改变, 模型因而得定期去回顾一番并且进行更新, 唯有始终怀着对数据的敬畏之情, 才能够构建出真正稳健的信用评分模型。
