内容详情
数据加载与预处理
加载 50_Startups.csv 数据集。
重命名列以便于后续引用。
初步模型拟合
使用所有自变量(RD_Spend, Administration, Marketing_Spend)构建初始多元线性回归模型。
打印模型参数和详细摘要,评估整体模型性能。
可视化探索
绘制散点图,分别展示 Administration、Marketing_Spend 和 RD_Spend 与 Profit 的关系,不显示拟合曲线。
绘制带有拟合线的图表,直观展示 RD_Spend 和 Profit 之间的关系。
简化模型
构建一个仅包含 RD_Spend 的简化模型,评估其对利润的影响,并打印参数和详细摘要。
异常值检测
计算高杠杆值、DFFITS、学生化残差和 Cook 距离等统计量,识别潜在的异常值。
计算学生化残差绝对值大于2的比例,评估异常值的存在情况。
去除异常值后重新建模
筛选出无异常值的数据集,并基于此数据集重新拟合简化模型。
打印新模型的参数和详细摘要,评估去除异常值后的模型性能。
预测与比较
使用新模型对原始数据进行预测,生成实际值与预测值的对比表。
计算并展示预测误差,评估模型的预测准确性。
相关性分析
计算选定连续