机器学习知识框架
按回归、分类、集成算法和特征工程,整理一份便于复习的经典机器学习提纲。
博客本文目录
这是一份经典机器学习的复习提纲,按问题类型、算法与数据处理整理。原笔记没有标注写作日期,页面日期为本站整理日期。
回归问题
- 线性回归(Linear Regression):MSE 损失、梯度下降。
- 正则化:L1(Lasso)、L2(Ridge),用于控制过拟合。
分类问题
- 逻辑回归(Logistic Regression):Sigmoid 函数、交叉熵。
- 决策树(Decision Tree):信息增益、基尼系数,
Gini = 1 - ∑pₖ²。 - 过拟合与剪枝:例如使用
max_depth限制树深度。
集成算法
- Bagging:并行训练、组合预测。随机森林(Random Forest)使用样本与特征随机抽样。
- Boosting:串行纠错。GBDT、XGBoost 通过逐步添加学习器、拟合损失函数的负梯度来改进预测。
特征工程
- 数据切分:
train_test_split,注意防止数据泄漏。 - 特征缩放:
MinMaxScaler,训练集使用fit_transform,测试集使用transform。 - 缺失值填充:例如用中位数填充;中位数对离群值相对不敏感。
- 类别编码:
pd.get_dummies,One-Hot 独热编码;按模型需要处理冗余列。
这份提纲用于定位知识点,具体公式、适用条件和代码实践可以沿着这些分支继续补充。