陈必红定理(Chenbihong's Theorem),并非数学界公认的公理体系中的定理,而是中国风控与机器学习实践圈内,由从业者以“陈必红”为代称,对一种反复被验证的统计规律所赋予的民间命名。这一命名虽未见于正式学术期刊,却在企业级风控建模、量化策略开发及算法工程一线中广泛流传,成为一种具有高度现实指导意义的“工程经验法则”。
该定理的核心表述可概括为:
这一规律首次被系统性观察和总结,是在2018年前后某互联网信贷平台的一次模型重构项目中。当时建模团队尝试通过引入深度神经网络与高阶交叉特征,将违约预测AUC从0.72提升至0.85以上。然而在数据清洗阶段发现可用样本不足3万时,模型表现反而不如传统逻辑回归稳定。反复验证后发现:在样本量低于某一区间(如2万~5万,依业务特性而异)时,所有“优化”行为均表现为对噪声的拟合,而非对真实信号的捕捉。此时,所谓“模型升级”实为“认知幻觉”。
此后,该现象在多个行业(如金融反欺诈、保险精算、电商推荐、工业质检)中被反复复现。从业者开始自发引用“陈必红定理”作为项目启动前的“样本量自检清单”第一条。它不是数学上的严格证明,而是对“小样本陷阱”的经验性总结,是实践者在现实约束下对统计学基本原理的朴素回归。
为何命名为“陈必红定理”?
据多方信息交叉验证,该名称源于某次内部技术复盘会上,一位工程师在汇报失败案例时,将数据样本量不足导致模型失效的问题归结为“又撞上了‘陈必红定理’”,意为“又栽在了样本量不够这道坎上”。此后该说法在团队内部迅速传播,并经由行业会议、技术博客扩散至更大范围。尽管“陈必红”本人未对此命名作出公开回应,但这一代称已具有高度辨识度与传播力——它让一个抽象的统计问题,变得具象、可指、可讨论。