)
翻當時的學習筆記的時候看到這么一頁寫得很潦草數據清洗、標準化、特征工程、編碼、過采樣欠采樣、6:2:2、網格搜索、貝葉斯優化、泛化能力……每個詞單獨拎出來我都能說出個大概但當時有個問題一直沒想通這些東西到底誰先誰后我記得最清楚的畫面是第一次做課程項目我把SMOTE過采樣跑完了才想起來劃分訓練集導師看了一眼說你這是把答案提前告訴模型了。后來自己動手跑了幾個項目才算把這頁筆記串成一條線。它其實是一條流水線前后順序有明確的道理亂了就出事。這篇文章就是把這條線從頭到尾捋一遍配一份復制就能跑的完整代碼。如果你是剛上完課、準備動手做第一個項目的階段應該能少踩幾個坑。一、先把全貌看清楚整個流程就三件事但三件事花的時間完全不成比例數據預處理吃掉整個項目 6~7 成的工作量。一個反直覺的事實是換算法帶來的提升通常遠不如把數據弄好帶來的提升。同樣的數據邏輯回歸和 XGBoost 的差距可能是三五個點但把特征工程做對可能是二十個點。所以第一階段別偷懶。一個反直覺的事實換算法帶來的提升通常遠不如把數據弄好帶來的提升。同樣的數據邏輯回歸和 XGBoost 的差距可能是三五個點但把特征工程做對可能是二十個點。所以第一階段別偷懶。二、數據預處理最臟最累但最值錢2.1 數據清洗原始數據基本都是臟的。常見四類問題問題類型典型表現常見處理缺失值NaN、空字符串、-999、0刪行 / 填中位數眾數 / 填業務默認值異常值年齡 250、月消費 999999業務規則修正 / 當缺失處理 / 保留重復值完全重復、主鍵重復去重類型錯誤數字存成字符串、日期格式不統一轉類型缺失值這里有個容易忽略的細節空字符串不是 NaN。pandas讀進來的空單元格才是 NaN業務系統里導出的空字符串往往原樣保留df.isna().sum()查不出來。處理前先統一一下df[contract_type] df[contract_type].replace(, np.nan)異常值我想多說一句因為這是我踩過的坑。我第一次處理一張電商用戶表用 3σ 把月消費字段的離群點全刪了結果把那批消費五萬以上的 VIP 全干掉了——模型是變干凈了但業務上最值錢的那群人沒了。所以判斷異常值統計方法3σ、IQR 箱線圖只是給你一個候選名單刪不刪要回到業務里問。我的習慣是明顯是錄入錯誤的年齡 250改成缺失值交給填充器處理數值雖然極端但真實的高消費用戶保留或者用分位數截斷Winsorize而不是刪掉。還有個工程上的建議清洗邏輯寫成函數別在 Excel 里手動改。手動改過一次下個月數據刷新你還得手動改一遍而且改的還不一定是同一套規則。2.2 數據轉換筆記上我在這條旁邊寫了個類似蒸餾當時沒聽清老師具體指的啥。后來理解了大概意思是把量綱千差萬別的原始值蒸餾到同一把尺子上。具體來說就兩種標準化Standardization / Z-scorex (x - 均值) / 標準差結果均值 0、方差 1。歸一化Normalization / Min-Maxx (x - min) / (max - min)結果壓到 [0, 1]。區別在于歸一化對異常值很敏感一個極端值就能把其他所有樣本擠到很窄的區間里標準化因為用的是均值和標準差抗干擾能力強一些而且不要求數據服從正態分布這點經常被人誤解。沒有特殊需求的話默認用標準化。哪些算法必須做轉換判斷標準其實很簡單你只需要看這個算法會不會算距離或者用梯度。必須做KNN、SVM、神經網絡、帶正則化的線性模型、PCA、K-Means不用做決策樹、隨機森林、XGBoost、LightGBM樹模型只看分裂閾值跟量綱無關不做會怎樣舉個直觀的例子特征里同時有年齡18-75和年收入0-1000000KNN 算歐氏距離的時候收入那一項的差值會完全主導結果年齡這個特征等于沒用。2.3 特征工程這是我認為最見功力的地方。筆記里寫的構建特征字典一開始我以為是某種數據結構后來發現是工程習慣——給每個特征建一份檔案。做項目的時候我都會先列這么一張表字段名類型業務含義取值范圍缺失率處理方式來源age數值用戶年齡18-756%中位數填充 標準化user_profilecontract_type類別合約類型月付/年付/兩年付3%眾數填充 獨熱order_infotenure_months數值已使用月數0-720%標準化user_profile看著像形式主義實際上有幾個很實在的用處一是強迫你想清楚每個字段到底是干嘛的經常填著填著就發現這個字段模型不該看后面會說的泄露問題二是別人接手你的代碼時不至于抓瞎三是上線的時候這張表就是特征服務的接口文檔。至于怎么造特征幾個我常用的套路# 1. 比值 / 人均絕對值往往不如相對值有區分度 df[tickets_per_month] df[support_tickets] / (df[tenure_months] 1) # 工單總數 10 單對用了 3 個月和用了 3 年的用戶含義天差地別 # 2. 時間差注冊到現在多久、上次登錄距今天數 df[days_since_last_login] (pd.Timestamp.now() - df[last_login]).dt.days # 3. 分箱把連續值離散化能捕捉非線性關系 df[age_bin] pd.cut(df[age], bins[18, 25, 35, 50, 100], labelsFalse) # 4. 交叉組合兩個特征單獨看沒用組合起來有用 df[high_value_new_user] ((df[monthly_charges] 200) (df[tenure_months] 3)).astype(int) # 5. 聚合統計從明細表造出用戶粒度的行為特征 # 近 30 天登錄次數、近 7 天平均停留時長 這類表格數據里收益最高的一類特征第 5 類聚合統計在真實業務里收益最高但有個前提只能用預測時點之前的數據算。你要預測用戶下個月會不會流失那近 30 天登錄次數必須是截止到預測時點的 30 天不能把未來數據算進去。這是時序特征最容易犯的錯。2.4 編碼模型只認數字類別特征得先翻譯一下。三種情況有序類別—— 用標簽編碼順序本身攜帶信息# 學歷高中 本科 碩士 博士 edu_map {高中: 0, 本科: 1, 碩士: 2, 博士: 3} df[education] df[education].map(edu_map)無序類別—— 用獨熱編碼One-Hot。注意別用標簽編碼瞎編順序微信0、支付寶1、銀行卡2會讓模型誤以為微信和支付寶的距離比微信和銀行卡近這純屬無中生有。from sklearn.preprocessing import OneHotEncoder # handle_unknownignore 一定要加 enc OneHotEncoder(handle_unknownignore, sparse_outputFalse)handle_unknownignore這個參數值得單獨提。不加的話訓練集沒見過、測試集出現的類別會直接報錯。真實業務里新類別太常見了新上線的支付方式、新開的城市不加就是給自己埋雷。加了以后未知類別會編碼成全 0模型不會因為一個沒見過的取值直接崩掉。高基數類別—— 取值特別多比如城市、商品 SKU、用戶 ID獨熱編碼會把維度撐爆。這時候用目標編碼Target Encoding用該類別對應的目標變量均值來替代。但目標編碼有嚴重的泄露風險它用到了標簽信息必須在交叉驗證的每一折內部單獨計算不能先算好再劃分數據集。sklearn 里對應的是TargetEncoder1.3 版本或者用category_encoders這個庫。2.5 類別不平衡這個坑我印象最深。第一次做二分類任務跑出來準確率 95%我還挺高興結果一看混淆矩陣——正樣本一個都沒預測對。因為正樣本只占 5%模型只要無腦預測全是負樣本準確率就是 95%。所以遇到不平衡數據第一件事是把準確率這個指標拉黑。三種應對方式過采樣復制或者合成少數類樣本。SMOTE 是經典方法它不只是復制而是在少數類樣本之間插值合成新樣本from imblearn.over_sampling import SMOTE from imblearn.pipeline import Pipeline as ImbPipeline # 注意用 imblearn 的 Pipeline不是 sklearn 的 pipe ImbPipeline([ (prep, preprocessor), (smote, SMOTE(random_state42)), (clf, RandomForestClassifier()), ])欠采樣刪掉一部分多數類樣本。數據量大的時候挺好用缺點是丟信息。改權重最省事不動數據直接告訴模型少數類更重要。sklearn 里大部分分類器都支持RandomForestClassifier(class_weightbalanced) LogisticRegression(class_weightbalanced) XGBClassifier(scale_pos_weight負樣本數/正樣本數)我個人習慣先試class_weightbalanced一行代碼幾乎零成本還不用擔心過擬合。這不是偷懶我在同一份數據上對比過一行class_weightbalanced能拿到測試集 ROC-AUC 0.8395 / PR-AUC 0.5577換成 SMOTE 反而只有 0.8198 / 0.4751。不是說 SMOTE 沒用而是它合成的樣本會引入噪聲在類別邊界重疊嚴重的表格數據上容易幫倒忙。所以我的順序永遠是先試零成本的權重法效果不夠再考慮采樣。這里有個必須記住的順序問題采樣只能在訓練集上做。先劃分數據集再對訓練集過采樣。如果先過采樣再劃分同一個樣本的合成兄弟會同時出現在訓練集和測試集里測試成績會虛高這就是為什么我第一次做項目被導師說的那個點。三、模型訓練3.1 數據集劃分為什么非要分三份因為三件事需要三份不同的數據訓練集喂給模型學習參數驗證集用來選模型、調超參數測試集只在最后評估一次模擬真實上線后遇到的新數據比例用 6:2:2 還是 8:1:1看數據量數據量小幾千條6:2:2驗證集和測試集都需要足夠樣本指標才穩定數據量大十萬以上8:1:1 甚至 98:1:11% 也夠用了多留點給訓練數據特別小幾百條別硬分三份直接用 K 折交叉驗證劃分的時候記得加stratify保持各集合里類別比例一致X_train, X_temp, y_train, y_temp train_test_split( X, y, test_size0.2, stratifyy, random_state42 ) X_val, X_test, y_val, y_test train_test_split( X_temp, y_temp, test_size0.5, stratifyy_temp, random_state42 )不加stratify運氣不好會出現某一折里正樣本特別少的情況訓練出來的模型指標會飄得厲害。還有一種情況要特別注意時間序列數據不能隨機劃分。你要用 1-6 月的數據預測 7 月那就嚴格按時間切訓練集是 1-4 月驗證集 5 月測試集 6 月。隨機打亂會讓模型看到未來線下指標好看得離譜上線一塌糊涂。3.2 算法選擇我的順序是先跑基線再上復雜模型。基線不是走過場它有兩個作用一是告訴你這個問題至少能做到什么程度二是如果復雜模型打不過基線說明你的數據或特征有問題。表格數據也就是大多數業務場景里的結構化數據的一個經驗結論梯度提升樹基本是天花板。多說一句很多剛入門的同學包括當時的我覺得深度學習一定比隨機森林強。在圖像、文本這些非結構化數據上確實如此但在幾千到幾十萬行的表格數據上LightGBM 通常又快又好深度網絡大概率打不過它還更難調。選算法之前先認清數據類型。3.3 超參數調優先分清兩個概念參數是模型自己學出來的比如線性回歸的系數超參數是你提前指定的比如樹的最大深度。調參調的是后者。網格搜索把所有候選值排列組合窮舉一遍。param_grid { clf__max_depth: [6, 10, None], clf__min_samples_leaf: [1, 5, 20], clf__n_estimators: [300], } # 3 × 3 × 1 9 種組合配合 5 折交叉驗證 45 次訓練問題在于組合爆炸3 個參數各 3 個候選值是 27 次5 個參數各 5 個候選值就是 3125 次配上交叉驗證直接跑到天荒地老。隨機搜索在候選范圍內隨機采樣 N 組。Bergstra 和 Bengio 2012 年那篇論文的核心結論是——通常只有少數幾個超參數真正重要隨機搜索因為采樣更分散在同樣的計算預算下反而更容易找到好的組合。from sklearn.model_selection import RandomizedSearchCV from scipy.stats import randint, uniform param_dist { clf__max_depth: randint(3, 20), clf__min_samples_leaf: randint(1, 30), clf__subsample: uniform(0.6, 0.4), } search RandomizedSearchCV(pipe, param_dist, n_iter50, scoringaverage_precision, cv5, n_jobs-1)我的實際做法先用隨機搜索大范圍掃一遍鎖定大致區間再用網格搜索在小區間里精調。貝葉斯優化它會根據歷史試驗結果推測下一組最值得試的參數而不是瞎試。適合單次訓練很貴的情況深度學習、大數據集。常用庫是 Optuna代碼量比 GridSearchCV 多一點點但省時間import optuna def objective(trial): params { n_estimators: trial.suggest_int(n_estimators, 100, 500), max_depth: trial.suggest_int(max_depth, 3, 15), learning_rate: trial.suggest_float(learning_rate, 0.01, 0.3, logTrue), } model LGBMClassifier(**params) score cross_val_score(model, X, y, cv5, scoringaverage_precision).mean() return score study optuna.create_study(directionmaximize) study.optimize(objective, n_trials50)不管用哪種都記得配合交叉驗證。用單次的訓練集-驗證集劃分來調參結果會受這一次劃分的運氣影響交叉驗證取平均才穩。四、模型評估4.1 先把混淆矩陣背下來所有分類指標都是從這四個數推出來的精確率 Precision TP / (TP FP)你報出來的正例里有多少是真的召回率 Recall TP / (TP FN)真正的正例里你抓住了多少F1上面兩個的調和平均想要一個綜合數字的時候用怎么選取決于業務代價癌癥篩查、金融風控、故障預警——寧可錯殺不可放過要召回率。漏掉一個早期癌癥患者的代價遠大于讓一個健康人多做一次檢查。垃圾郵件過濾、推薦系統——誤殺代價高要精確率。把老板的重要郵件扔進垃圾箱比收一封廣告嚴重多了。4.2 ROC-AUC 和 PR-AUC這兩個都是評估排序能力的指標不受閾值選擇影響。ROC-AUC0.5 是隨機瞎猜1.0 是完美。但它有個毛病——類別嚴重不平衡時會虛高。正樣本只占 1% 的時候模型只要不給正樣本排太低AUC 就能輕松上 0.9看著很漂亮實際抓正樣本的能力一塌糊涂。PR-AUCaverage precision只看正樣本的表現在不平衡場景下比 ROC-AUC 誠實得多。所以我的習慣不平衡數據上主看 PR-AUCROC-AUC 當輔助。回歸任務就三個常用指標MAE平均絕對誤差好解釋、RMSE對大誤差更敏感、R2擬合優度越接近 1 越好。4.3 泛化能力到底在看什么泛化能力說白了就是模型在沒見過的數據上還能不能打。判斷方法很直接——比訓練集和測試集的分數訓練集分數測試集分數診斷怎么辦很高很低過擬合加數據、簡化模型、加正則、減特征很低很低欠擬合換復雜模型、加特征、減少正則高高差距小正常挺好可以上線了比訓練集還高—有泄露檢查數據劃分和特征構造最后一行我加了條有泄露的情況看著違反直覺但真遇到的時候特別有提示性測試集分數比訓練集還高八成是哪里出了問題最常見的是先做采樣/標準化再劃分數據或者特征里混進了未來信息。順便說下學習曲線。橫軸是訓練樣本數縱軸是分數如果兩條線訓練集分數、驗證集分數之間有一條明顯的鴻溝且不收斂就是過擬合如果兩條線都低且貼在一起就是欠擬合。比看單個數字直觀。五、串起來一份完整可運行的代碼場景是某 SaaS 產品的用戶流失預測二分類且類別不平衡。數據是我用代碼模擬的會故意塞入缺失值、異常值和重復行這樣你復制過去直接就能跑不用下載任何數據集。依賴pip install pandas scikit-learn# -*- coding: utf-8 -*- 機器學習標準工作流程 —— 完整可運行示例 場景用戶流失預測二分類類別不平衡 依賴pip install pandas scikit-learn import numpy as np import pandas as pd from sklearn.model_selection import train_test_split, GridSearchCV, StratifiedKFold from sklearn.pipeline import Pipeline from sklearn.compose import ColumnTransformer from sklearn.impute import SimpleImputer from sklearn.preprocessing import StandardScaler, OneHotEncoder from sklearn.linear_model import LogisticRegression from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import ( classification_report, confusion_matrix, roc_auc_score, average_precision_score, ) RANDOM_STATE 42 rng np.random.default_rng(RANDOM_STATE) # ---------------------------------------------------------------------- # 0. 造一份臟數據這樣你復制過去就能跑不用下載任何數據集 # ---------------------------------------------------------------------- def make_dirty_churn_data(n8000): age rng.normal(38, 12, n).clip(18, 75) tenure rng.exponential(20, n).clip(0, 72) monthly rng.normal(120, 45, n).clip(20, 400) tickets rng.poisson(1.6, n) contract rng.choice([月付, 年付, 兩年付], n, p[0.55, 0.28, 0.17]) payment rng.choice([微信, 支付寶, 銀行卡, 對公轉賬], n, p[0.4, 0.35, 0.2, 0.05]) # 讓標簽和特征之間有真實的因果關系否則模型學不到東西 contract_risk np.select( [contract 月付, contract 年付, contract 兩年付], [1.3, -0.5, -1.1] ) logit ( -2.6 0.070 * (age - 38) - 0.070 * tenure 0.015 * (monthly - 120) 0.60 * tickets contract_risk rng.normal(0, 0.5, n) ) churn rng.binomial(1, 1 / (1 np.exp(-logit))) df pd.DataFrame( { age: age, tenure_months: tenure, monthly_charges: monthly, support_tickets: tickets, contract_type: contract, payment_method: payment, churn: churn, } ) # --- 動手把數據弄臟模擬真實業務表的樣子 --- # (1) 數值列隨機缺失 for col, ratio in [(age, 0.06), (monthly_charges, 0.04)]: df.loc[rng.choice(n, int(n * ratio), replaceFalse), col] np.nan # (2) 類別列缺失業務系統里經常是空字符串而不是 NaN df.loc[rng.choice(n, int(n * 0.03), replaceFalse), contract_type] np.nan # (3) 異常值年齡錄成了 3 歲和 250 歲 idx rng.choice(n, 12, replaceFalse) df.loc[idx[:6], age] 3 df.loc[idx[6:], age] 250 # (4) 重復行 df pd.concat([df, df.sample(30, random_stateRANDOM_STATE)], ignore_indexTrue) return df raw make_dirty_churn_data() print(原始數據:, raw.shape) print(缺失值統計:\n, raw.isna().sum()) print(流失占比: %.2f%%\n % (raw[churn].mean() * 100)) # ---------------------------------------------------------------------- # 1. 數據清洗 # ---------------------------------------------------------------------- def clean(df): df df.drop_duplicates() # 用業務規則修異常年齡合理區間 [18, 100]超出的一律置為缺失交給后面的填充 器 df.loc[(df[age] 18) | (df[age] 100), age] np.nan # 空字符串也當成缺失 df[contract_type] df[contract_type].replace(, np.nan) # 月費不可能超過 1000 df.loc[df[monthly_charges] 1000, monthly_charges] np.nan return df df clean(raw) print(清洗后:, df.shape) # ---------------------------------------------------------------------- # 2. 特征工程這里只做兩件最典型的事比值 分層 # ---------------------------------------------------------------------- def build_features(df): df df.copy() # 每月工單數 工單總數 / 使用時長比單獨的工單數更能反映暴躁程度 df[tickets_per_month] df[support_tickets] / (df[tenure_months] 1) # 是否高價值客戶 df[is_high_value] (df[monthly_charges] df[monthly_charges].median()).astype(int) return df df build_features(df) TARGET churn NUM_FEATURES [ age, tenure_months, monthly_charges, support_tickets, tickets_per_month, is_high_value, ] CAT_FEATURES [contract_type, payment_method] X df[NUM_FEATURES CAT_FEATURES] y df[TARGET] # ---------------------------------------------------------------------- # 3. 數據集劃分 —— 必須在任何學習數據分布的操作之前做 # ---------------------------------------------------------------------- X_train, X_temp, y_train, y_temp train_test_split( X, y, test_size0.2, stratifyy, random_stateRANDOM_STATE ) X_val, X_test, y_val, y_test train_test_split( X_temp, y_temp, test_size0.5, stratifyy_temp, random_stateRANDOM_STATE ) print(\n 訓練集 %d / 驗證集 %d / 測試集 %d (8:1:1) % (len(X_train), len(X_val), len(X_test))) print( 各 集 流 失 占 比 : %.3f / %.3f / %.3f\n % (y_train.mean(), y_val.mean(), y_test.mean())) # ---------------------------------------------------------------------- # 4. 預處理流水線缺失填充 - 標準化 / 獨熱編碼 # ---------------------------------------------------------------------- numeric_pipe Pipeline([ (imputer, SimpleImputer(strategymedian)), (scaler, StandardScaler()), ]) categorical_pipe Pipeline([ (imputer, SimpleImputer(strategymost_frequent)), (onehot, OneHotEncoder(handle_unknownignore, sparse_outputFalse)), ]) preprocessor ColumnTransformer([ (num, numeric_pipe, NUM_FEATURES), (cat, categorical_pipe, CAT_FEATURES), ]) # ---------------------------------------------------------------------- # 5. 建模邏輯回歸當基線隨機森林當主力 # ---------------------------------------------------------------------- def make_model(clf): return Pipeline([(prep, preprocessor), (clf, clf)]) lr make_model( LogisticRegression(max_iter1000, class_weightbalanced, random_stateRANDOM_STATE) ) lr.fit(X_train, y_train) val_prob_lr lr.predict_proba(X_val)[:, 1] print([基線] 邏輯回歸 驗證集 AUC %.4f PR-AUC %.4f % (roc_auc_score(y_val, val_prob_lr), average_precision_score(y_val, val_prob_lr))) rf make_model( RandomForestClassifier(n_estimators300, class_weightbalanced_subsample, random_stateRANDOM_STATE, n_jobs-1) ) rf.fit(X_train, y_train) val_prob_rf rf.predict_proba(X_val)[:, 1] print([主力] 隨機森林 驗證集 AUC %.4f PR-AUC %.4f % (roc_auc_score(y_val, val_prob_rf), average_precision_score(y_val, val_prob_rf))) # ---------------------------------------------------------------------- # 6. 超參數調優網格搜索 分層 K 折交叉驗證只用訓練集 驗證集 # ---------------------------------------------------------------------- X_tv pd.concat([X_train, X_val]) y_tv pd.concat([y_train, y_val]) param_grid { clf__max_depth: [6, 10, None], clf__min_samples_leaf: [1, 5, 20], clf__n_estimators: [300], } cv StratifiedKFold(n_splits5, shuffleTrue, random_stateRANDOM_STATE) search GridSearchCV( make_model(RandomForestClassifier(class_weightbalanced_subsample, random_stateRANDOM_STATE, n_jobs-1)), param_grid, scoringaverage_precision, cvcv, n_jobs-1, ) search.fit(X_tv, y_tv) print(\n 調參最佳組合:, search.best_params_) print(交叉驗證最佳 PR-AUC %.4f % search.best_score_) best_model search.best_estimator_ # ---------------------------------------------------------------------- # 7. 最終評估 —— 測試集到此只用這一次 # ---------------------------------------------------------------------- test_prob best_model.predict_proba(X_test)[:, 1] test_pred (test_prob 0.5).astype(int) print(\n 測試集最終表現 ) print(ROC-AUC %.4f PR-AUC %.4f % ( roc_auc_score(y_test, test_prob), average_precision_score(y_test, test_prob))) print(\n 混淆矩陣 (行真實, 列預測):) print(confusion_matrix(y_test, test_pred)) print() print(classification_report(y_test, test_pred, target_names[未 流 失 , 流 失 ], digits3)) # ---------------------------------------------------------------------- # 8. 看看泛化能力訓練集 vs 測試集的差距 # ---------------------------------------------------------------------- train_prob best_model.predict_proba(X_tv)[:, 1] print(訓練集 PR-AUC %.4f % average_precision_score(y_tv, train_prob)) print(測試集 PR-AUC %.4f % average_precision_score(y_test, test_prob)) # ---------------------------------------------------------------------- # 9. 特征重要性 # ---------------------------------------------------------------------- feat_names best_model.named_steps[prep].get_feature_names_out() importances best_model.named_steps[clf].feature_importances_ order np.argsort(importances)[::-1] print(\nTop 8 特征重要性:) for i in order[:8]: print( %-28s %.4f % (feat_names[i], importances[i]))我在 Python 3.13 scikit-learn 1.9.0 pandas 3.0.5 上跑出來的結果有節選原始數據: (8030, 7) 缺失值統計: age 480 monthly_charges 321 contract_type 242 流失占比: 17.57% 清洗后: (8000, 7) 訓練集 6400 / 驗證集 800 / 測試集 800 (8:1:1) 各集流失占比: 0.176 / 0.176 / 0.175 [基線] 邏輯回歸 驗證集 AUC 0.8681 PR-AUC 0.5941 [主力] 隨機森林 驗證集 AUC 0.8306 PR-AUC 0.5111 調 參 最 佳 組 合 : {clf__max_depth: None, clf__min_samples_leaf: 20, clf__n_estimators: 300} 交叉驗證最佳 PR-AUC 0.5458 測試集最終表現 ROC-AUC 0.8395 PR-AUC 0.5577 混淆矩陣 (行真實, 列預測): [[520 140] [ 37 103]] precision recall f1-score support 未流失 0.934 0.788 0.855 660 流失 0.424 0.736 0.538 140 accuracy 0.779 800 訓練集 PR-AUC 0.6586 測試集 PR-AUC 0.5577 差距 0.1009 Top 8 特征重要性: num__tickets_per_month 0.2347 num__age 0.1755 num__tenure_months 0.1749 cat__contract_type_月付 0.1322 num__monthly_charges 0.1032 num__support_tickets 0.0663 cat__contract_type_年付 0.0371 num__is_high_value 0.0307幾個值得盯著看的數字第一邏輯回歸AUC 0.8681打贏了隨機森林0.8306。這不是代碼寫錯了——這份數據的因果關系是我拿線性 logit 函數生成的邏輯回歸天生就適合擬合它。真實業務里很少有這么講道理的數據但這正好說明基線模型不能跳過它幫你判斷數據長什么樣也幫你在復雜模型翻車時有個參照。第二ROC-AUC 0.8395 看著挺體面PR-AUC 只有 0.5577。同一個模型、同一份數據兩個指標差了快 0.3差出來的這部分就是類別不平衡的照妖鏡。只報 ROC-AUC很容易讓人以為這是個能用的模型。第三最反直覺的一條模型準確率 0.779比全部預測為不流失還低。測試集里流失只占 17.5%無腦猜都不流失的準確率是 82.5%模型反倒只有 77.9%——是不是覺得白訓了不是。看混淆矩陣那兩行140 個真正會流失的用戶模型抓出了 103 個召回率 73.6%代價是 140 個正常用戶被誤判成流失。這就是class_weightbalanced在起作用——它告訴模型漏掉一個流失用戶比誤判一個正常用戶更貴模型照做了于是拿準確率去換召回率。準確率低不代表模型差只代表你的目標和猜多數類不是一回事。業務要的是提前把可能流失的人撈出來去挽回那 73.6% 的召回率就是值錢的。這也是為什么在不平衡場景下準確率基本沒有參考價值。你要是真把class_weightbalanced去掉再跑一遍會看到這個配置準確率召回率精確率ROC-AUCPR-AUC加權balanced0.7790.7360.4240.8400.558不加權默認0.8500.2710.6790.8320.554全猜不流失0.8250———去掉權重準確率從 0.779 漲到 0.850比全猜不流失的 0.825 還高看著是不是順眼多了但召回率從 0.736 掉到 0.271——140 個會流失的用戶只抓出了 38 個。如果你要拿這個模型去做挽回推送等于四分之三的流失用戶你連招呼都沒打。更值得琢磨的是最后兩列ROC-AUC 和 PR-AUC 幾乎沒動。因為class_weight本質上只是在移動決策閾值就是概率大于 0.5 判為正那條線并沒有改變模型把正負樣本排序的能力。模型的底子沒變變的只是你在哪個位置切一刀。所以結論是準確率、召回率這些指標會跟著閾值劇烈擺動AUC 類的指標才是穩的那個。調閾值或者調權重屬于最后的業務決策我愿意用多少誤判換多少召回不該拿來評判模型本身的好壞。第四tickets_per_month在特征重要性里排第一0.2347而它的兩個原材料support_tickets只有 0.0663、tenure_months0.1749排第三。一個除法算出來的新特征比原始字段更能打這就是特征工程的實際收益。最后訓練集 PR-AUC 0.6586、測試集 0.5577差 0.1屬于正常范圍。要是哪天你看到測試集分數反而比訓練集高先回去查數據泄露別高興得太早。再看代碼本身有幾個地方是刻意這么寫的一是整個預處理和模型都塞進了Pipeline。這不是為了好看而是為了防止數據泄露——SimpleImputer的中位數、StandardScaler的均值方差全都是在訓練集上算出來的然后原樣應用到驗證集和測試集。如果你手動先fit_transform整個數據集再劃分測試集的統計信息就混進訓練過程了指標會虛高。二是class_weightbalanced處理不平衡一行搞定沒引入任何新樣本。三是調參階段用的是訓練集驗證集合并后做 5 折交叉驗證測試集從頭到尾只在最后被碰了一次。這個習慣一定要養成每用測試集做一個決策它就臟一分。用測試集反復調參選模型等于把測試集變成了驗證集最后那個漂亮的數字沒有意義。四是最后那段特征重要性輸出tickets_per_month這個我自己造的特征直接排在了第一比它的兩個原材料support_tickets和tenure_months單獨用都強。這就是特征工程的價值——你自己改改build_features函數加幾個新特征進去看看能不能把 PR-AUC 再推高一點。六、幾個容易翻車的地方按我踩坑的頻率排個序先采樣/先標準化后劃分數據—— 最經典的泄露。train_test_split必須是全流程的第一道工序。用整個數據集的均值填充缺失值—— 同上屬于泄露。放進 Pipeline 里就不會犯。類別不平衡還盯著準確率看—— 95% 的準確率可能一個正樣本都沒抓到先看混淆矩陣和 PR-AUC。One-Hot 忘了加handle_unknownignore—— 訓練沒問題上線遇到新類別直接報錯。測試集被反復使用—— 調一次參看一次測試集最后報告的數字其實是過擬合到測試集上的。特征里混入了未來信息—— 比如用訂單總金額預測用戶是否下單這種特征線下 AUC 能到 0.99上線就廢。特征字典里來源那一列就是用來排查這個的。忽略業務規則—— 模型說這個用戶會流失但你去看數據發現他的賬號三天前就被封了。這種樣本應該提前剔除。寫在最后回頭看那頁筆記它其實給了正確的順序只是我當時不知道每一步為什么在那里。真正讓我理解這個流程的不是背下來清洗→轉換→特征→編碼→采樣這個順序而是想明白了一件事凡是從數據里學出來的東西均值、方差、類別映射、采樣策略、超參數都只能在訓練集上學習然后應用到其他集合上。理解了這一條整個流程的順序就能自己推出來了——標準化為什么在劃分之后SMOTE 為什么只能在訓練集上做Pipeline 為什么非寫不可全是同一個道理的不同表現。代碼在上面我是跑通了的。建議你動手改幾個地方試試把class_weightbalanced去掉看準確率是不是會漲回 0.82 以上、召回率又會掉到多少或者把build_features里的tickets_per_month刪掉看 PR-AUC 掉幾個點。動手改一遍比看十遍記得牢。如果這篇文章對你有幫助歡迎點贊收藏。有說錯的地方也歡迎評論區指出我改。