主成分分析赋能区域高质量发展
作者信息
段班祥、康海刚、桂改花、聂葳
广东科学技术职业学院
简介
本案例为科学计算与系统建模仿真方向的教学案例,以2007年全国31个省市自治区农村居民家庭生活消费支出真实数据为载体,围绕8维消费指标综合排名核心问题,完整呈现主成分分析(PCA)从数学原理到工程落地的全流程。
案例基于国产科学计算平台MWORKS实现,将线性代数中特征值分解、协方差矩阵等抽象理论与数据降维、综合评价实践深度结合,配套完整代码、可视化脚本与教学课件,兼顾知识传授、能力培养与思政育人,适用于高职及应用型本科的数学与数据科学类课程教学。
教学目标
1. 知识理解层面
- 理解PCA数学本质:通过协方差矩阵特征值分解实现高维数据降维
- 掌握方差最大化原则与累计贡献率的物理含义
- 理清特征值、特征向量与主成分方向、方差解释力的对应关系
2. 方法掌握层面
- 掌握数据预处理全流程:清洗、Max-Min归一化、相关系数矩阵计算
- 掌握PCA标准计算步骤与MWORKS内置
pca()函数调用方法 - 能够通过陡坡图、帕累托图科学选择主成分个数
3. 工程应用层面
- 独立完成“多指标数据→PCA建模→综合评价排名”完整分析链路
- 结合业务场景解读主成分实际含义(消费水平、消费结构差异等)
- 完成结果可视化与区域发展特征分析
技术与环境
- 核心平台:MWORKS 科学计算平台
- 编程语言:Julia
- 核心依赖:TyStatistics、TyMachineLearning、DataFrames、可视化工具库
- 先修知识:矩阵运算、特征值与特征向量、基础统计概念
案例核心内容
1. 问题引入与认知冲突
以“8项消费指标如何科学排名”为切入点,对比“直接相加排名”的失真结果,分析量纲差异、指标相关性带来的信息冗余问题,引出PCA降维的必要性。
2. 数据预处理
- 读取31个样本、8项消费指标的真实统计数据
- 采用Max-Min归一化消除量纲差异,适配非正态分布数据特征
- 计算相关系数矩阵并绘制热力图,量化指标间相关性
3. PCA数学原理
围绕协方差矩阵的特征值分解展开核心推导:
- 构建归一化数据的协方差矩阵
- 特征值分解得到主成分方向与对应方差
- 按方差贡献率排序,通过累计贡献率筛选主成分
- 计算主成分得分,完成高维数据到低维空间的映射
4. MWORKS编程全流程
- 调用
pca()函数一键完成特征值分解,输出系数矩阵、得分矩阵、特征值、方差贡献率等结果 - 绘制陡坡图(Scree Plot)与帕累托图,完成主成分个数选择
- 基于主成分贡献率加权计算综合得分,输出31个省市自治区排名
- 绘制主成分得分散点图,可视化区域消费特征差异
5. 对比与验证
设置MWORKS与Python实现的对比实验,分析国产平台在统计函数完备性、教学友好性上的优势;设计多组课堂验证活动,通过修改指标、更换标准化方法深化理解。
目录结构
PcaEmpowerRegionalQualityDevelopment/
├── data/ # 数据集
│ ├── Exam.xlsx # 2007年各地区农村居民消费支出原始数据
│ └── 2018省会城市主要指标.xlsx # 拓展实验数据集
├── scripts/ # MWORKS 源代码
│ ├── Exam.jl # 课堂教学完整演示代码(含详细注释)
│ ├── Test1.jl # 实验1:主成分解释与排名对比
│ └── Test2.jl # 实验2:拓展数据集分析
├── docs/ # 教学文档
│ ├── 主成分分析教学PPT.pptx
│ ├── 实验指导书.pdf
│ └── 案例说明书.pdf
├── results/ # 结果样例
│ ├── 相关系数热力图.png
│ ├── 陡坡图与帕累托图.png
│ └── 区域主成分得分散点图.png
└── README.md
快速上手
- 将仓库克隆至MWORKS工作空间
- 打开
scripts/Exam.jl,直接运行即可复现完整PCA分析流程 - 替换
data/目录下的Excel文件,可适配其他多指标综合评价场景 - 参考
docs/内实验指导书完成配套练习与拓展任务
适用场景
- 高职/应用型本科《应用数学》《线性代数》课程教学
- 《数据科学基础》《统计分析方法》课程上机实践
- 国产科学计算软件教学推广与课程思政建设
- 区域经济分析、综合评价方法的入门实训
版权说明
本案例版权归属广东科学技术职业学院段班祥老师,仅供非商业教学学习,请勿直接用于各类赛事及项目等内容的申报。
登录账号即可下载资源、参与讨论。