1. 研究背景
区域经济规模的长期演进既反映全国增长的空间承载方式,也揭示产业转移、要素集聚和区域政策作用下的结构变化。单纯观察某一年度GDP排名,只能识别静态规模,难以回答哪些地区保持长期增长、哪些地区贡献更多新增规模、区域差距是扩大还是收敛,以及外部冲击是否改变原有增长路径。基于连续省级GDP序列构建一套可复现的描述性分析框架,可以把“规模—速度—结构—稳定性”放在同一逻辑中观察。
本报告使用公开的中国省级GDP数据,对1992—2020年31个省级地区进行纵向追踪。研究先呈现省级GDP合计、排名、复合增速和增量贡献,再计算前五省份份额与HHI并按四大区域汇总,随后以PCA和K-Means形成省域发展类型画像,最后以岭回归和随机森林构建简单预测基线,检验历史规模惯性在2018—2020年测试期内的稳定性。
2. 研究意义
分析意义|通过同时使用规模、增速、份额和波动性指标,避免把“增长快”直接等同于“经济强”,也避免只依据大体量地区判断区域活力。
管理意义|增量贡献和区域份额能够帮助识别全国新增经济规模的主要来源;聚类画像则适合用于同类地区对标、指标分层和差异化政策讨论。
方法意义|案例使用常见的Pandas、Matplotlib、Seaborn和Scikit-learn工具,方法复杂度适中,既适合展示完整数据分析流程,也便于后续接入人口、产业、就业、财政等指标扩展。
3. 数据说明与研究设计
项目 | 内容 |
时间与对象 | 1992—2020年,31个省级地区,29×31=899个观测 |
指标单位 | GDP为亿元,属于名义规模指标;未进行价格平减和人口标准化 |
质量检查 | 年份与省份字段完整,无缺失值;按年份升序整理并转成长表用于建模 |
区域口径 | 东部10省级地区、中部6个、西部12个、东北3个,仅用于结构汇总 |
核心方法 | 趋势/排名/热图、复合增速、增量贡献、份额与HHI、PCA、K-Means、岭回归与随机森林 |
说明:省级GDP合计与国家统计口径的全国GDP可能因核算范围、修订时点和地区加总差异而不完全一致。因此,报告只把省级合计作为同一数据集内部的比较基准,不将其解释为官方全国GDP。复合增速为名义增速,既包含实际产出变化,也包含价格因素。
4. 实证分析:规模、速度与新增贡献
totals = wide.sum(axis=1) growth = totals.pct_change() * 100 fig, ax1 = plt.subplots(figsize=(9.2, 4.8)) ax1.plot(totals.index, totals / 10000, lw=2.8) ax2 = ax1.twinx() ax2.plot(growth.index, growth, color='#F4A261') plt.show()31个省级地区GDP合计从1992年的2.60万亿元上升至2020年的101.24万亿元,28年名义复合增速约13.98%。规模曲线持续向上,但增速曲线从早期较高水平逐步下降,2008—2009年、2015年前后以及2020年均出现明显下探,说明中国区域经济已由高速度扩张转向更低增速、更强调结构与质量的阶段。由于图中使用名义GDP,早期高增速中包含价格变化,不能直接等同于真实产出增长。
cagr = ((wide.loc[2020] / wide.loc[2000])**(1/20)-1)*100 benchmark = ((totals.loc[2020] / totals.loc[2000])**(1/20)-1)*100 s = cagr.sort_values() plt.barh(s.index, s.values, color=np.where(s >= benchmark, '#2A9D8F', '#607D8B')) plt.axvline(benchmark, color='#E76F51', ls='--') plt.show()2000—2020年省级GDP合计复合增速为12.38%。贵州、西藏、陕西、重庆和宁夏位居长期增速前列,分别约为15.32%、14.92%、14.31%、13.99%和13.81%,体现西部开发、基础设施改善、产业承接和低基数共同作用下的追赶特征。辽宁、黑龙江等东北地区增速偏低,与其在区域份额中的下降相互印证。高增速地区部分源于较低起点,评价时仍需同时观察当前体量和增长稳定性。
5. 实证分析:集中度与区域再平衡
东部长期占据一半以上的省级GDP合计,2020年份额为51.93%,较2010年下降1.94个百分点;同期中部由20.74%升至21.95%,西部由18.49%升至21.07%,两者合计提升3.79个百分点。东北份额则从2010年的6.90%降至2020年的5.05%,区域再平衡主要表现为中西部抬升与东北相对收缩,而非东部主导地位的根本改变。
6. 实证分析:增速降档与冲击差异
growth = wide.pct_change() * 100 heat = growth.loc[2011:2020].T fig, ax = plt.subplots(figsize=(9.5, 8.6)) sns.heatmap(heat, cmap='RdYlGn', center=8, vmin=-5, vmax=20, linewidths=.25, ax=ax) plt.show()热图显示2011年前后多数地区仍保持两位数名义增速,随后绿色区域逐渐减少,体现各省普遍进入增速降档阶段;资源型地区和东北地区在部分年份出现更明显的低增速。
7. 省域发展类型画像
聚类选择五项指标:2020年GDP对数、2000—2020年复合增速、2010—2020年复合增速、2011—2020年增速波动、2010—2020年全国份额变化。指标标准化后使用K-Means聚类,并以PCA二维投影展示组间关系。聚类仅用于描述相似性,不代表行政等级或发展优劣。
标准化画像进一步说明,成熟规模型的规模与稳定性优势最明显,但长期增速并非最高;份额提升型在长期增速、近期增速和份额变化上均高于平均,是追赶扩张的主体;增长承压型在增速和份额变化上显著低于平均,同时波动偏高;小体量成长型规模远低于平均,却保持较快增速。对标分析应优先在同一类型内部进行,避免让小体量高增长地区与成熟大省直接比较总量。
8. 简易预测模型与稳健性检验
模型将2017年及以前的样本作为训练集,将2018—2020年93个省年观测作为测试集。解释变量包括上一年GDP对数、上一年增速、年份、省份类别和四大区域,目标为当年GDP对数。岭回归用于刻画稳定线性惯性,随机森林作为非线性对照;所有误差指标均转换回亿元后计算。
模型 | R² | RMSE(亿元) | MAE(亿元) | MAPE |
岭回归 | 0.9916 | 2303.5 | 1591.1 | 5.14% |
随机森林 | 0.9556 | 5309.6 | 2423.8 | 5.70% |
岭回归MAPE由2018年的2.70%上升至2019年的4.68%,2020年进一步升至8.05%。误差随预测期向前推进而累积,同时2020年受到突发冲击和省际恢复差异影响,历史趋势难以充分解释实际变化。由此可见,该模型适合作为常态情景基线,但不能直接用于重大冲击年份的精确预测;正式预测需要加入产业结构、投资、消费、就业、价格与政策变量。
9. 主要结论
第一,规模持续扩张但增速换挡。1992—2020年省级GDP合计增长近39倍,名义复合增速约13.98%,但2011年后多数地区的年度增速中枢明显下移。
第二,头部省份稳定,新增动力更趋多元。广东、江苏保持规模领先并贡献最大增量,同时安徽、福建、湖北、湖南、四川等省份在增量贡献和份额提升中表现突出。
第三,区域再平衡是渐进过程。东部仍占省级GDP合计的一半以上,中西部份额稳步提高,东北相对份额继续下降;现有变化更接近缓慢重构,而非短期逆转。
第四,省域发展具有多维差异。成熟规模型、份额提升型、增长承压型和小体量成长型说明规模、增速、稳定性和份额变化并不同步,地区评价需要组合指标。
第五,历史惯性强但冲击年份误差扩大。岭回归具有较高总体拟合度,但2020年误差显著上升,说明宏观预测必须显式考虑外生冲击、产业暴露和恢复节奏。
具体细节见原文,可私
创造不易,谢谢各位多多点赞收藏!