19、经合组织国家包容性绿色增长的机器学习洞察
经合组织国家包容性绿色增长的机器学习洞察
1. 引言
政策制定者正积极响应联合国可持续发展目标(SDGs),努力实现多维度的可持续发展。欧洲领导人也推出了“欧洲绿色协议”,旨在提升欧盟的绿色增长能力、改善环境质量,并在2050年实现碳中和。在过去二十年里,经合组织(OECD)国家的政策重点从单纯的经济增长和公平,转向了包含环境可持续性的新模式,这催生了包容性绿色增长(IGG)的概念。
IGG意味着实现一种社会和环境可持续的增长路径,确保自然资源为后代所用,并保护生命依赖的生态系统。2022年气候变化报告和2021年SDGs报告都凸显了在OECD国家推动IGG的必要性,因为气候变化正加剧这些国家在粮食安全、热浪、洪水、生物多样性丧失和污染相关死亡等方面的脆弱性。
为了帮助政策制定者确定促进IGG的关键因素,本文采用机器学习正则化和推理技术,分析了OECD国家过去二十年的增长轨迹。具体目标包括:
- 识别哪些OECD国家正在实现“绿色”和“包容性”增长。
- 运用机器学习正则化技术确定IGG的关键驱动因素。
- 提供一个可靠的模型来预测OECD国家的IGG。
- 运用机器学习推理技术估计所选协变量对IGG进展的影响。
2. 实证文献回顾
2.1 基于传统估计技术的可持续发展决定因素
- 有研究发现,良好的治理与能源效率相互作用,能促进非洲的IGG。
- 对于新兴国家,能源效率在长期内推动了经济可持续发展,且与可再生能源对经济增长存在单向因果关系。
- 在中国,空气污染、能源节约和绿色技术对IGG至关重要,数字经济集聚、能源消费等因素也驱动着IGG。
- 在老挝,包容性增长、社会发展和环境保护是可持续发展的关键决定因素。
- 亚洲发展中经济体的研究表明,贫困和收入不平等会增加生态足迹,而可再生能源消费可减少贫困。
- 撒哈拉以南非洲国家的研究显示,改善治理质量和电力供应可减少贫困和碳排放,缺乏清洁技术和外国直接投资流入会增加碳足迹。
- 亚洲国家的研究发现,人均收入和金融发展促进可持续发展,而通货膨胀率和自然资源租金则有相反影响。
- 肯尼亚的研究表明,家庭消费、失业、资源生产率等因素决定可持续发展。
- 金砖国家的研究显示,自然资源租金、可再生能源开发和城市化有助于环境改善。
2.2 基于机器学习技术的可持续发展决定因素
- 在土耳其,研发支出和技术相关投资是经济进步的重要决定因素。
- 在中国,金融发展、收入增长和工业化是可持续经济增长的主要驱动因素,不同类型的出行和汽车拥有量是碳排放的主要驱动因素,人力资本和创新是IGG的重要驱动因素。
- 在非洲,贫困率、经济增长、全球化等13个因素是包容性增长的关键决定因素。
- 在中国,经济增长、人均能源消费等是碳排放的相关决定因素。
- 对美国、日本、中国和印度等国家的研究表明,收入、人口增长、能源和化石燃料消费是二氧化碳排放的主要影响因素。
- 对东北亚6个国家的研究显示,二氧化碳排放和能源结构决定经济发展。
3. 数据与方法
3.1 数据
本文使用了包含32个OECD国家的宏观面板数据集,涵盖了2000 - 2020年的55个潜在IGG决定因素,包括制度和政策有效性得分、收入分配、经济增长、绿色创新和资本流动等。
outcome变量是一个综合的IGG指数,通过主成分分析(PCA)生成。55个潜在驱动因素的数据来自多个数据库,如国际货币基金组织的全球金融发展指数、世界收入不平等数据库、KOF全球化指数、世界治理指标、世界发展指标和OECD绿色增长数据库等。
| 变量类型 | 变量名称 | 数据来源 |
|---|---|---|
| 金融发展 | 金融发展指数 | 国际货币基金组织全球金融发展指数 |
| 收入不平等 | 帕尔马比率 | 世界收入不平等数据库 |
| 全球化 | KOF全球化指数 | KOF全球化指数 |
| 制度/治理 | 世界治理指标 | 世界治理指标 |
| 宏观经济 | 汇率、贫困、通货膨胀、失业、经济增长等 | 世界发展指标 |
| 能源消费/排放 | 能源消费和排放数据 | OECD绿色增长数据库 |
3.2 估计策略
估计策略分为两部分:变量选择技术和推理模型。传统估计技术和机器学习技术在处理大型数据集时各有优劣。传统技术依赖理论选择协变量,而机器学习技术更依赖数据驱动的方法。由于传统技术在处理大量协变量时可能出现过拟合问题,本文采用机器学习算法来揭示数据集的潜在模式。
为了实现目标(ii)和(iii),采用了lasso家族的三种收缩模型(标准lasso、最小SBIC lasso和自适应lasso)和弹性网络(Elastic net)。为了实现目标(iv),运用了双选择lasso线性模型、偏出lasso线性回归和偏出lasso工具变量回归进行因果推理。分析使用了STATA(v17)和R(v3.6)软件。
graph LR
A[数据] --> B[变量选择技术]
B --> C[标准lasso]
B --> D[最小SBIC lasso]
B --> E[自适应lasso]
B --> F[弹性网络]
A --> G[推理模型]
G --> H[双选择lasso线性模型]
G --> I[偏出lasso线性回归]
G --> J[偏出lasso工具变量回归]
3.2.1 标准lasso和Schwarz贝叶斯lasso模型
标准lasso通过消除对结果变量不显著的变量,提高了模型的可解释性,并减少了模型方差,增强了推理的可靠性。通过调整参数λ对模型系数进行惩罚,当λ = 0时,为全模型;当λ → ∞时,为仅含截距的模型;变量选择在λ介于0和∞之间进行。
Schwarz贝叶斯信息准则lasso(SBIC lasso)与标准lasso具有相同的ℓ1 - 范数惩罚,但基于最小SBIC进行变量选择,提供了更深层次的正则化,但惩罚更高。
标准lasso的目标函数为:
[
Q_{Lasso} = \frac{1}{N} \sum_{i = 1}^{N} \omega_i f(y_{it}, \beta_0 + X_{it}\beta’) + \lambda \sum_{j = 1}^{\rho} |\beta_j|
]
lasso系数的估计为:
[
\hat{\beta}
{lasso} = \min(SSE + \lambda \sum
{j = 1}^{\rho} |\beta_j|)
]
其中,(SSE = \sum_{i = 1}^{N} (y_i - f(x_i))^2),(\lambda)为调整参数,(y_{it})为国家(i)在年份(t)的IGG,(N)为观测值数量,(\omega_i)为观测级权重,(X_{it})为55个潜在IGG驱动因素。
3.2.2 自适应lasso模型
自适应lasso解决了标准lasso和最小SBIC lasso在特征数量过多时正则化效果不佳的问题。通过引入“神谕属性”((z_j))到ℓ1 - 范数惩罚中,增强了变量选择能力。
自适应lasso的目标函数为:
[
Q_{Adaptive lasso} = \frac{1}{N} \sum_{i = 1}^{N} \omega_i f(y_{it}, \beta_0 + X_{it}\beta’) + \lambda \sum_{j = 1}^{\rho} |\beta_j|z_j
]
系数估计为:
[
\hat{\beta}
{Adaptive Lasso} = \min(SSE + \lambda \sum
{j = 1}^{\rho} |\beta_j|z_j)
]
3.2.3 弹性网络模型
弹性网络结合了标准lasso和岭回归技术,通过应用ℓ1和ℓ2惩罚规范,在处理高度相关的协变量时增强了稀疏性。
弹性网络的目标函数为:
[
Q_{Elasticnet} = \frac{1}{N} \sum_{i = 1}^{N} \omega_i f(y_{it}, \beta_0 + X_i\beta’) + \lambda \sum_{j = 1}^{p} k_j \left{\frac{1 - \alpha}{2} \beta_j^2 + |\beta_j|\right}
]
其中,(\alpha)为额外的弹性网络惩罚参数,取值范围为[0, 1]。当(0 < \alpha < 1)且(\lambda > 0)时,会出现稀疏性;当(\lambda = 0)时,退化为岭估计器;当(\lambda = 1)时,退化为标准lasso估计器。
3.3 调整参数的选择
调整参数(\lambda)控制着模型收缩的强度,影响着推理和预测结果。常用的选择方法包括贝叶斯信息准则(BIC)、赤池信息准则(AIC)和交叉验证(CV)。本文同时使用CV和BIC进行变量选择。
3.4 lasso推理模型
由于标准正则化技术不能直接提供所选预测变量的估计值和置信区间,本文应用lasso推理技术来实现目标(iv)。具体包括双选择lasso线性模型(DSL)、偏出lasso线性回归(PLR)和偏出lasso工具变量回归(PIVLR)。这些模型将目标(ii)中冗余/弱的IGG驱动因素作为控制变量,能够在不考虑数据维度、模型规格、空间依赖性和多重共线性的情况下,产生无偏且有效的估计。
-
双选择lasso线性模型 :
[
E[y | d, X] = d\alpha’ + X\beta’
]
其中,(y)为IGG,(d)为包含J个感兴趣协变量的向量(即lasso或Elasticnet选择的IGG主要驱动因素),(X)为包含p个控制变量的向量(即IGG的冗余决定因素)。DSL估计器估计(d)中J个协变量的参数(\alpha),而放松对(X)中控制变量的估计。 -
偏出lasso线性回归 :
[
E[Y | d, X] = d\alpha’ + X\beta’
]
与DSL类似,PLR对目标(ii)中选择的IGG主要决定因素进行估计。与DSL相比,PLR在模型变得复杂时,能提高推理的有效性。 -
偏出lasso工具变量回归 :
[
y = d\alpha_d’ + f\alpha_f’ + X\beta’ + \varepsilon
]
其中,(y)为IGG,(d)包含(J_d)个内生感兴趣协变量,(f)包含(J_f)个外生感兴趣协变量,(X)包含(p_x)个控制变量。PIVLR估计器在存在内生变量(d)的情况下,使用(p_z)个工具变量(z)(与(d)相关但与(\varepsilon)不相关)产生一致估计。工具变量(z)从(X)中自动选择并从方程中排除。
3.5 数据工程与划分
为了确保有效正则化,使用K - 最近邻(KNN)数据插补方法处理数据中的缺失值。KNN基于相似总体的变量具有相似值的原则,为每个缺失观测值选择附近的邻居,并使用邻居值的均值或中位数进行估计。本文使用均值规则和Minkowski距离来处理数值变量的缺失值:
[
d(i, j) = (\vert x_{i1} - x_{j1}\vert^q + \vert x_{i2} - x_{j2}\vert^q + \cdots + \vert x_{i\rho} - x_{j\rho}\vert^q)^{\frac{1}{q}}
]
然后,将数据集按70:30的比例划分为训练集和测试集,采用简单随机技术进行划分,并使用分类和回归训练(Caret)数据划分方法评估划分的合理性。Caret技术将数据划分为四分位数,并在每个四分位数内进行采样,具有数据预处理和计算变量重要性的优势。
3.6 包容性绿色增长指数的构建
根据可持续发展的定义,选择了22个与IGG的社会和环境可持续性相关的变量。对于社会经济可持续性,考虑社会公平和经济增长相关的协变量;对于环境可持续性,关注自然资本保护、环境生活质量、经济机会和政策干预以及环境和资源生产率等方面的变量。
使用主成分分析(PCA)计算IGG得分。为了评估指数的可靠性,进行了Kaiser - Meyer - Olkin(KMO)测试和Bartlett测试,分别评估样本的充分性和变量之间的相关性。
| 变量类别 | 变量名称 | 符号 | 数据来源 |
|---|---|---|---|
| 社会经济进步 - 社会背景 | 女性领导人比例 | WOMEN | 世界发展指标(WDI) |
| 社会经济进步 - 社会背景 | 卫生设施使用比例 | SANIT | WDI |
| 社会经济进步 - 社会背景 | 清洁饮用水使用比例 | POWAT | WDI |
| 社会经济进步 - 社会背景 | 儿童营养不良率 | UNDNOUR | WDI |
| 社会经济进步 - 社会背景 | 预期寿命 | LIFEXP | OECD统计 |
| 社会经济进步 - 社会背景 | 人口密度 | POPDEN | OECD统计 |
| 社会经济进步 - 经济背景 | 收入增长 | INCGRO | WDI |
| 社会经济进步 - 经济背景 | 收入不平等 | PALMA | 世界收入不平等数据库(WIID) |
| 社会经济进步 - 经济背景 | 汇率 | EXCH | OECD统计 |
| 社会经济进步 - 经济背景 | 失业率 | UNEMP | WDI |
| 环境进步 - 自然资产基础 | 耕地面积比例 | AGRIC | WDI |
| 环境进步 - 自然资产基础 | 森林覆盖率 | FOREST | WDI |
| 环境进步 - 自然资产基础 | 温度变化 | TEMP | OECD统计 |
| 环境进步 - 环境生活质量 | PM2.5暴露 | AMB | OECD统计 |
| 环境进步 - 环境生活质量 | PM2.5相关福利成本 | AMBCOST | OECD统计 |
| 环境进步 - 环境和资源生产率 | 生物质比例 | BIO | OECD统计 |
| 环境进步 - 环境和资源生产率 | 自然资源租金 | NATRES | WDI |
| 环境进步 - 环境和资源生产率 | 渔业产量 | FISH | OECD统计 |
| 环境进步 - 环境和资源生产率 | 碳强度 | CARINT | OECD统计 |
| 环境进步 - 环境和资源生产率 | 磷平衡 | PHOS | OECD统计 |
| 环境进步 - 经济机会和政策响应 | 环境相关研发预算 | RD | OECD统计 |
| 环境进步 - 经济机会和政策响应 | 环境友好技术发展 | ENVTECH | OECD统计 |
经合组织国家包容性绿色增长的机器学习洞察
4. 结果呈现与讨论
4.1 数据工程
数据插补任务基于KNN技术,旨在确保训练集和测试集中的观测值平衡。在KNN数据插补之前,90.7%的变量 - 观测值单元格非缺失,KNN技术用于填充剩余9.3%的缺失单元格。
4.2 描述性统计
55个潜在IGG决定因素的描述性统计结果显示,训练集和测试集在各变量的均值、标准差、最小值和最大值上存在一定差异。例如,训练集的平均IGG得分为 - 0.11,而测试集为0.02;训练集的平均金融发展得分为0.62,测试集为0.63。
| 变量 | 训练集观测数 | 训练集均值 | 测试集均值 | 训练集标准差 | 测试集标准差 | 训练集最小值 | 测试集最小值 | 训练集最大值 | 测试集最大值 |
|---|---|---|---|---|---|---|---|---|---|
| igg | 470 | - 0.011 | 0.027 | 1.012 | 0.975 | - 1.722 | - 1.772 | 4.456 | 4.034 |
| kofgidj | 470 | 85.583 | 84.134 | 5.276 | 8.196 | 68.219 | 0.000 | 93.741 | 93.585 |
| fd | 470 | 0.624 | 0.635 | 0.220 | 0.222 | 0.130 | 0.000 | 0.985 | 1.000 |
| … | … | … | … | … | … | … | … | … | … |
4.3 数据划分结果
IGG在训练集和测试集的分布结果表明,两者分布相似,这是进行有效正则化的必要条件。
graph LR
A[数据集] --> B[训练集70%]
A --> C[测试集30%]
B --> D[IGG分布]
C --> E[IGG分布]
D --> F[相似分布]
E --> F
4.4 经合组织国家的包容性绿色增长得分
通过PCA计算IGG得分,KMO测试统计值为0.539,满足样本充分性条件。Bartlett卡方统计值为7341.7,在1%的水平上显著,表明变量之间存在强相关性,支持PCA的应用。
结果显示,在32个经合组织国家中,只有15个国家的增长轨迹是绿色和包容性的,包括卢森堡、瑞士、挪威等。这些国家在采用环保技术、推动智能出行、提高能源效率和加强社会保护等方面表现出色。而拉脱维亚、波兰、斯洛伐克等国家的IGG得分较低。
4.5 经合组织国家包容性绿色增长主要驱动因素的正则化结果
不同的正则化方法(标准lasso、弹性网络、自适应lasso和最小SBIC lasso)对IGG的主要驱动因素选择有所不同:
-
标准lasso
:在55个可能的驱动因素中,选择了38个,其中贸易开放度、全球价值链参与度、天然气发电和官方发展援助是最相关的4个变量。
-
弹性网络
:选择了39个决定因素,除了上述4个变量外,水电生产也是重要的决定因素。
-
自适应lasso
:选择了31个变量,贸易开放度、全球价值链参与度等9个变量是促进IGG的最重要因素。
-
最小SBIC lasso
:选择了7个主要驱动因素,包括城市化、贸易开放度、政府准备度等,该方法在更高的惩罚成本下进行选择。
综合来看,经济全球化、可持续生产、移动性和智慧城市建设,以及新经济的改善、政府准备度和气候变化适应能力对经合组织国家的IGG至关重要。最小SBIC lasso模型在预测IGG方面表现最佳,其模型方程为:
[
igg_{it} = \alpha_0 + \delta_1 urbanization_{it} + \delta_2 trade_{it} + \delta_3 gov_ready_{it} + \delta_4 capacity_{it} + \delta_5 internet_{it} + \delta_6 noda_{it} + \delta_7 elect_natgas_{it} + \mu_i + \varepsilon_{it}
]
其中,(igg)为包容性绿色增长,(urbanization)为城市化,(trade)为贸易开放度,(capacity)为气候变化适应能力,(internet)为互联网接入,(noda)为官方发展援助净额,(gov_ready)为政府气候变化准备度,(elect_natgas)为天然气能源生产,(\mu_i)为国家特定固定效应,(\varepsilon_{it})为实体内部误差项。
4.6 经合组织国家包容性绿色增长主要驱动因素的结果
使用DSL、PLR和PIVLR估计技术对上述模型进行估计,结果显示除了电力生产外,其他变量的估计参数在10%的显著性水平或更高水平上显著。
-
城市化
:城市化是经合组织国家IGG的关键驱动因素,PLR和PIVLR系数估计表明,城市化每增加1%,IGG增加0.139%。城市化可以通过提高能源效率、减少自然资源开发和提供平等的社会基础设施来促进IGG,体现了智慧城市的优势。
-
经济全球化(贸易开放度)
:贸易开放度促进了经合组织国家的IGG,PLR和PIVLR系数估计显示,贸易每改善1%,IGG增加0.007%。贸易可以通过创造就业机会、减少收入不平等和促进环保技术的传播来推动IGG。
-
政府准备度
:政府准备度是IGG的积极决定因素,PLR和PIVLR系数估计表明,政府准备度每提高1%,IGG刺激0.48%。良好的经济治理有助于建立有效的公私伙伴关系,吸引投资,促进可持续生产和消费实践。
-
气候变化适应能力
:气候变化适应能力与IGG呈负相关。可能的原因是经合组织国家在应对特定部门的气候变化问题时,采取可持续适应措施的速度较慢,近期的极端天气事件和新冠疫情凸显了这些国家在适应能力方面的不足。
-
互联网使用
:互联网使用对IGG有负面影响,PLR和PIVLR系数估计表明,互联网使用每增加1%,IGG减少0.005%。这反映了数字经济在社会经济和环境方面的负面影响,如高碳足迹和对个人健康的影响。
-
外国援助(官方发展援助净额)
:外国援助对经合组织国家的IGG至关重要,PLR和PIVLR系数估计显示,外国援助每增加1%,IGG增加0.45%。外国援助可以通过增加投资、减少贫困和促进公平收入分配来促进IGG。
5. 结论与政策建议
本文使用机器学习技术分析了经合组织国家的IGG,结果表明,在32个经合组织国家中,只有15个国家的增长轨迹是绿色和包容性的,7个变量是IGG的关键预测因素,包括城市化、政府准备度、发展援助和气候变化适应解决方案。
基于这些结果,提出以下政策建议:
-
城市化方面
:进行可持续的地方发展规划,鼓励私营部门投资可持续发展项目、可持续住房、清洁技术和基础设施。
-
国际贸易方面
:经合组织成员国应在全球活动中纳入环境目标,通过可持续的横向供应链合作,提供环保商品和服务。
-
互联网使用方面
:推广绿色信息技术的有效应用,减少ICT设备的电力消耗,特别是数据中心的能源使用,以降低温室气体排放。
更多推荐



所有评论(0)