通过 7 个 Jupyter Notebook,学习监督回归如何从带标签数据生成数值预测。课程从监督学习的含义出发,依次进入最小二乘线性模型、多项式特征扩展、基于误差的模型比较,以及 Ridge 与 LASSO 正则化。
课程把数学推导与 Python、scikit-learn 结合起来。住房、疫苗、比特币和合成矩阵示例帮助你练习曲线拟合、预测评估、识别过高模型复杂度的影响,并理解正则化如何改变系数。
你将学到什么
- 区分监督学习、回归和分类任务
- 推导普通最小二乘法,并使用 NumPy 实现线性回归
- 在波士顿与北京住房数据上拟合 scikit-learn 线性模型
- 评估住房预测并检查模型系数
- 创建多项式特征,比较线性与多项式拟合,并依据误差选择次数
- 使用三次及更高次多项式回归拟合历史比特币数据
- 解释病态最小二乘问题,并比较 Ridge 与 LASSO 正则化路径
- 直接计算 Ridge 系数并与 scikit-learn 结果比较
本课程适合谁
本课程适合希望理解回归机制、而不是把估计器当作黑盒的 Python 学习者,也适合准备把公式、矩阵、图表和模型 API 联系起来的监督学习初学者。数学章节和代码补全任务要求你具备超过第一天入门水平的 Python 能力。
前置要求: 建议掌握 Python、NumPy、Pandas、绘图、代数和简单矩阵运算。熟悉训练/测试数据和函数会有帮助;无需已有回归经验。
学习环境: 7 个活动均在课程提供的 Ubuntu 22.04 Jupyter 环境中运行。预置 Notebook 包含讲解、可视化、配套数据文件、可执行示例和需要补全的实现部分。
常见问题
课程会推导回归公式,还是只使用 scikit-learn?
两者都有。你会推导最小二乘与 Ridge 系数,用 NumPy 和 SciPy 实现部分步骤,再与 scikit-learn 模型的结果比较。
包含哪些预测示例?
示例包括波士顿与北京住房价格、用于多项式拟合的疫苗相关数据、历史比特币数据,以及揭示普通最小二乘不稳定性的 Hilbert 矩阵。
如何评估模型?
Notebook 使用留出数据、可视化比较、平均绝对误差和均方误差。多项式练习会比较多个次数,展示复杂度如何影响预测误差。
比特币实验会预测当前价格或提供金融建议吗?
不会。它只是把多项式曲线拟合到 2010–2018 年历史数据上,用于练习回归;它不是实时预测系统,也不应作为投资决策依据。





