Binary classification in imbalanced tabular datasets remains a significant challenge in machine learning, as conventional risk-stratification models exhibit limited discriminative performance and fail to capture nonlinear interactions among heterogeneous features. Existing approaches often suffer from three critical limitations: model-selection uncertainty across heterogeneous data distributions, systematic bias toward majority classes when training on imbalanced datasets, and insufficient interpretability for high-stakes decision-making applications. This work proposes a heterogeneous stacking ensemble framework that integrates five complementary base learners—Random Forest, XGBoost, LightGBM, CatBoost, and a Multi-Layer Perceptron—through an L2-regularized logistic regression meta-learner trained on out-of-fold predictions. To address class imbalance, we incorporate an adaptive Borderline-SMOTE oversampling strategy within a leakage-free cross-validation pipeline that concentrates synthetic sample generation in high-difficulty borderline regions. The framework is developed on a multi-institutional dataset of 4,127 instances with 28 features and externally validated on two independent cohorts (n=612, n=489). The proposed approach achieves an AUC of 0.892 (95
更多
查看译文
关键词
Ensemble learning,Stacked generalization,Class imbalance,Borderline-SMOTE,Interpretable AI,SHAP,Heterogeneous base learners,Out-of-fold prediction,Tabular data classification,Multi-institutional validation