机器学习学习笔记(一):总览篇——一张导图看懂我要学什么
大模型应用开发方向中机器学习基础是绕不开的一环。这一系列是我学习机器学习的输出笔记目标就是 把学过的东西讲清楚同时把面试高频考点提前备好。本篇是整个系列的目录页和学习路线。前言为什么大模型应用开发岗要学机器学习说实话我一开始也觉得做 RAG、Agent 这类应用开发机器学习基础用不上多少。但翻了一圈面经之后发现不是让你现场推导公式而是会围绕几个固定的问题反复考察——过拟合怎么办、L1 和 L2 区别、梯度下降为什么能用、精确率和召回率怎么选。这些问题的答案全部藏在机器学习的经典算法里而且它们的思想一路延续到了深度学习和大模型比如梯度下降训练 LLM 和训练线性回归在原理上是同一件事。所以我给自己的要求是理解经典机器学习算法这样再回看大模型时很多东西会自然打通。系列目录本系列共 7 篇按学习顺序排列篇目内容01 总览篇学习路线与知识地图02 机器学习概述术语、算法分类、建模流程、特征工程、拟合情况03 线性回归损失函数、正规方程、梯度下降、正则化04 KNN 算法距离度量、K 值选择、特征预处理、交叉验证、分类评估05 决策树CART、特征选择、剪枝06 集成学习Bagging 与 Boosting、随机森林07 聚类算法KMeans、SSE 肘部法、轮廓系数发布后此处会替换为各篇的跳转链接一张知识地图先上整体结构。整个机器学习基础可以拆成一条主线和六个算法模块机器学习基础概述线性回归KNN决策树集成学习聚类术语与数据集划分算法分类: 有监督/无监督/半监督/强化建模流程六步特征工程欠拟合与过拟合损失函数 MSE/RMSE/MAE正规方程法梯度下降正则化 L1/L2欧氏距离与投票K值选择归一化与标准化交叉验证网格搜索混淆矩阵/精确率/召回率/F1CART 二分递归预剪枝与后剪枝Bagging: 随机森林Boosting: AdaBoostKMeans 质心迭代SSE肘部法与轮廓系数看这张图会发现一个规律六个模块不是孤立的。线性回归引出损失函数和梯度下降这俩贯穿整个机器学习KNN 引出特征预处理和评估体系后面所有分类问题都要用决策树是集成学习的地基聚类则是无监督学习的代表。所以我的学习顺序就按概念铺垫 → 回归 → 分类 → 模型融合 → 无监督来走。各篇面试可能考点面试考察机器学习基础的方式很集中提前把问题列出来学的时候带着问题学概述篇要回答的机器学习的建模流程是什么归一化和标准化的区别什么是欠拟合、过拟合分别怎么解决线性回归篇要回答的梯度下降的原理学习率大了小了会怎样正规方程和梯度下降怎么选L1 正则化和 L2 正则化的区别MSE、RMSE、MAE 哪个对异常值更敏感为什么KNN 篇要回答的K 值过大或过小分别会怎样精确率和召回率的区别什么场景优先保召回率F1-score 为什么用调和平均而不是算术平均决策树篇要回答的预剪枝和后剪枝的优缺点决策树为什么容易过拟合集成学习篇要回答的Bagging 和 Boosting 的区别随机森林随机在哪里聚类篇要回答的KMeans 的原理K 值怎么选肘部法为什么拐点就是最优 K这些问题每一篇都会正面回答面试前直接把六篇文章的问答节当题库复习。环境准备整个系列只需要一个 scikit-learn加上老三样pip install scikit-learn numpy pandas matplotlib我的版本环境Python 3.13 scikit-learn 1.x。有一点提前说网上大量教程包括课件用的波士顿房价数据集load_boston在 sklearn 1.2 之后已经被官方移除了线性回归那篇我会改用加州房价数据集fetch_california_housing实现同样的流程细节到那篇再展开。写在最后这一篇是坑位费。路线就是上面这些接下来按顺序更新每篇都遵循同一个结构是什么 → 原理与公式 → 跑通的案例代码 → 易错点 → 面试问答。如果这篇对你有用欢迎收藏追更评论区见到同样在准备大模型方向秋招的朋友。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →