机器学习知识框架

按回归、分类、集成算法和特征工程,整理一份便于复习的经典机器学习提纲。

本文目录

这是一份经典机器学习的复习提纲,按问题类型、算法与数据处理整理。原笔记没有标注写作日期,页面日期为本站整理日期。

回归问题

  • 线性回归(Linear Regression):MSE 损失、梯度下降。
  • 正则化:L1(Lasso)、L2(Ridge),用于控制过拟合。

分类问题

  • 逻辑回归(Logistic Regression):Sigmoid 函数、交叉熵。
  • 决策树(Decision Tree):信息增益、基尼系数,Gini = 1 - ∑pₖ²
  • 过拟合与剪枝:例如使用 max_depth 限制树深度。

集成算法

  • Bagging:并行训练、组合预测。随机森林(Random Forest)使用样本与特征随机抽样。
  • Boosting:串行纠错。GBDT、XGBoost 通过逐步添加学习器、拟合损失函数的负梯度来改进预测。

特征工程

  • 数据切分train_test_split,注意防止数据泄漏。
  • 特征缩放MinMaxScaler,训练集使用 fit_transform,测试集使用 transform
  • 缺失值填充:例如用中位数填充;中位数对离群值相对不敏感。
  • 类别编码pd.get_dummies,One-Hot 独热编码;按模型需要处理冗余列。

这份提纲用于定位知识点,具体公式、适用条件和代码实践可以沿着这些分支继续补充。