基于AI的边缘计算微电网优化
基于人工智能的算法在多接入边缘计算中用于基准微电网的性能优化控制
Tie Li, Junyou Yang, Dai Cui
摘要
在实际工程中,工业系统的通信网络十分复杂,且系统模型通常难以获得。为克服对数学模型的需求,本文引入了多种基于人工智能的算法应用于多接入边缘计算,以实现对基准微电网的性能优化控制。首先,提出一种基于神经网络的识别方案,并将其与在线自适应动态规划学习方法相结合,从而避免了对系统模型的需求。然而,该方法未考虑辨识误差。接着,为进一步实现无模型目的而不使用识别方案,提出了基于在线双网络的动作相关启发式动态规划方法和仅评论家Q学习方法。最后,将最优控制策略应用于基准微电网系统,以验证性能优化的有效性。
关键词 : 人工智能;边缘计算;神经网络;性能优化。
1. 引言
自适应动态规划(ADP)属于强化学习(RL)领域,是人工智能的一个重要分支。它可以被视为在最优控制领域的一种应用形式。策略迭代(PI)和值迭代(VI)是主流的基于模型的离线ADP方法。然而,在实际中,系统的数学模型通常无法获得,因此基于模型的方法在无模型环境中失效。无模型ADP控制方法主要依赖于数据驱动技术。数据驱动的ADP方法可分为两大类:第一类是利用系统数据通过通用逼近器[1, 2, 3],(如神经网络(NNs)[4, 5]和模糊模型)重构实际系统的模型,然后利用所得的辨识结果替代实际系统模型。实际上,该方法仍属于基于模型的方法,并会引入辨识逼近误差,可能影响控制性能。第二类是直接数据驱动方法,该方法直接通过系统数据学习最优控制,而无需事先进行辨识过程[6, 7, 8]。
本文首先提出一种基于辨识的在线ADP学习方案。随后,为了消除辨识误差的影响,详细描述了两种直接数据驱动方法,包括与动作相关的启发式动态规划(HDP)和基于值迭代的Q学习。此外,对这三种无模型方案进行了综合比较。
由于大多数实际系统模型是以连续时间(CT)形式建立的,迄今为止,已有大量关于连续时间系统最优控制的自适应动态规划(ADP)研究工作。在[9]中,提出了一种新颖的在线自适应执行‐评论家学习算法,用于连续时间系统的最优控制。受该研究启发,在线自适应动态规划学习方法被扩展到连续时间多参与者系统[10]和多智能体系统[11]。在[12]中,通过一种基于事件触发的分布式算法并结合独立计算,解决了多能源系统的实时协同能量管理问题。在[13]中,建立了多能源系统的一种新型双模式能量管理模型,并提供了一种分布式动态牛顿‐拉夫森算法来解决相关的能量管理问题。在[14]中,为了克服单个不确定轨迹实例数量高基数的问题,研究了不确定轨迹实例之间的相似性,并提出了参考表示还提供了相关说明。为了降低成本并节省通信资源,将基于事件触发的技术与自适应动态规划方法相结合来解决最优控制问题。为了解决无需系统模型要求的最优控制问题,采用了数据驱动的非策略(off‐policy)技术。随后,非策略学习方法[6, 7]被扩展用于求解 H∞控制[15]。然而,在实际应用中,大多数控制方案需要以离散时间(DT)方式实现。仅有文献[16]给出了针对连续时间系统的在线自适应动态规划学习算法的综合比较。尽管连续时间形式在现实中广泛存在,但计算机控制只能识别和使用离散时间(DT)形式。据我们所知,目前仍缺乏对离散时间(DT)情形的相关综合分析研究,这正是本文研究工作的动机所在。
(1) 本文中基于人工智能的多接入边缘计算算法集成了强化学习、神经网络和离散时间最优控制原理。
(2) 本文提出了一种结合在线自适应动态规划学习方法的基于神经网络的辨识方案,避免了对系统模型的要求。
(3) 为了在不使用辨识方案的情况下实现无模型目的,本文提出了一种基于在线双网络的动作相关启发式动态规划方法和一种仅评论家Q学习方法。
本文评审了用于基准微电网性能优化控制的基于人工智能的计算算法。图1显示了基准微电网边缘计算的示意图。传感器采集的系统数据通过通信线路传输至管理中心。随后,由边缘计算技术生成的控制命令被应用于调节涡轮机的运行。现有涉及边缘计算的研究[17, 18, 19]主要集中在利用输入输出大数据生成调度策略,以最终实现自动化。然而,通常忽略了经济性、能源成本或系统性能的最优性。为克服这一瓶颈,我们结合最优控制理论与基于人工智能的算法来寻找最优解,这将在数值仿真结果中得以展示。需要注意的是,本文强调理论推导而非应用。未来,若实际系统能够通过控制系统模型进行表述,则本文介绍的方法可被应用。
因此,本文的方法论在大规模工业系统中具有广阔的应用前景。
本文的其余部分安排如下。在第2节中,离散时间最优控制问题被表述为数学形式。为了实现无模型目的,分别在第3、4和5节中介绍了三种无需实际系统模型的数据驱动的ADP方案。为了测试性能优化的有效性,在第6节中将所提出的方案应用于一个基准微电网。最后,在第7节中给出了简要结论。
2. 问题陈述
让我们考虑以下非线性离散时间系统:
$$
x(k+ 1)= f(x(k))+ g(x(k))u(k) \tag{1}
$$
其中,$x(k) \in R^n$为系统状态;$f(x) \in R^n$为内部函数;$g(x) \in R^{n\times m}$为输入函数;$u(k) \in R^m$表示控制输入。对于基准微电网,$f(x)$和$g(x)$构成电力系统模型;$x(k)$为当前系统状态;$x(k+ 1)$表示未来系统状态;$u(k)$是控制策略,将通过边缘计算进行设计和获取。因此,$x(k)$和$u(k)$可视为系统输入数据,而$x(k+ 1)$是系统输出数据。
对于某个控制系统,我们主要关注两个因素,即系统状态和控制输入,它们决定了系统性能和控制成本。因此,我们提出如下相关的成本函数:
$$
J(x(0), u)= \sum_{p=0}^{\infty} r(x(p), u(p)) \tag{2}
$$
其中 $r(x, u)= x^T Qx+ u^T Ru$。$Q$和$R$是正定矩阵。可以轻松调节权重矩阵$Q$和$R$,以分别调节$x$和$u$。给定允许的状态反馈控制,值函数表示为
$$
V(x(k))= \sum_{p=k}^{\infty} r(x(p), u(p))= r(x(k), u(k))+ V(x(k+ 1)). \tag{3}
$$
由公式(1)和(2)可知,每一步的$x(k)$和$u(k)$决定了未来的状态$x(k+ 1)$。如果控制输入$u(k)$未被适当地给出,未来数据将受到影响。本文的主要思想是利用边缘计算技术来获得最优解。最优控制问题旨在找到一种控制策略以最小化值函数:
$$
V^
(x(k))= \min_{u(x)} {r(x(k), u(k))+ V^
(x(k+ 1))}. \tag{4}
$$
为了解决这个问题,我们结合了最优控制理论和基于人工智能的算法。
根据贝尔曼最优性原理[1, 20, 21],可以推导出如下最优控制策略
$$
u^
(x(k))=\arg \min_{u(x)} {r(x(k), u(k))+ V^
(f(x(k))+ g(x(k))u(k))} = - \frac{1}{2} R^{-1} g^T (x(k))\nabla V^* (x(k+ 1)). \tag{5}
$$
如何获得最优控制策略$u^* (x(k))$依赖于求解哈密顿‐雅可比‐贝尔曼(HJB)方程[20]。将(5)代入最优值函数(4)产生
$$
V^
(x(k))=\frac{1}{4}\nabla V^{
T}(x(k+ 1))g(x(k))R^{-1}g^T(x(k))\nabla V^
(x(k+ 1)) + x^T(k)Qx(k)+ V^
(x(k+ 1)). \tag{6}
$$
问题描述 :方程(6)被称为哈密顿‐雅可比‐贝尔曼方程,它是一个偏微分函数,其解析解难以获得甚至无法获得。求解非线性偏微分方程仍然是一个开放性问题。从(6)可以看出,求解哈密顿‐雅可比‐贝尔曼方程需要系统模型$f(x)$和$g(x)$的信息。然而,在实际中系统模型通常是不可获得的。因此,传统的基于模型的方法失效了,这也促成了本文的研究工作。本文尝试利用边缘计算技术,通过使用系统输入输出数据$x(k)$、$u(k)$和$x(k+ 1)$来获取最优解,而无需精确的系统模型$f(x)$和$g(x)$。在接下来的章节中,将详细评审三种无模型方法。
3. 基于神经网络的辨识方案
首先,我们提出了一种基于神经网络的辨识方案[1, 2, 21]。其中构建了评判网络和执行网络,分别用于逼近值函数和控制策略。
$$
\hat{V}(x(k))= \hat{W}^T_c(k)\phi_c(Y^T_c x(k)), \tag{7}
$$
$$
\hat{u}(k)= \hat{W}^T_a(k)\phi_a(Y^T_a x(k)), \tag{8}
$$
其中,$Y_c$和$Y_a$表示输入层与隐含层之间固定的神经网络权重;$\hat{W}_c(k)$和$\hat{W}_a(k)$表示隐含层与输出层之间经过调整的神经网络权重;$\phi_c(\cdot)$和$\phi_a(\cdot)$是相应的神经网络激活函数。回顾(3)可得
$$
0= r(x(k - 1), u(k - 1))+ V(x(k))- V(x(k - 1)). \tag{9}
$$
根据(9),使用评判网络和执行网络(7)及(8)将导致近似误差:
$$
e_c(k)= r(x(k - 1), \hat{u}(k - 1))+ \hat{V}(x(k))- \hat{V}(x(k - 1)). \tag{10}
$$
为了最小化误差性能$E_c(k)= \frac{1}{2} e^2_c(k)$,我们决定采用梯度下降法。因此,评论家网络的在线调节律设计为
$$
\hat{W}_c(k+ 1)= \hat{W}_c(k)- \beta_c \frac{\partial E_c(k)}{\partial \hat{W}_c(k)} = \hat{W}_c(k)- \beta_c \frac{\partial E_c(k)}{\partial e_c(k)} \frac{\partial e_c(k)}{\partial \hat{V}(x(k))} \frac{\partial \hat{V}(x(k))}{\partial \hat{W}_c(k)}. \tag{11}
$$
根据最优控制形式(5),执行网络的目标函数表示为
$$
\tilde{u}(k)= - \frac{1}{2}R^{-1}g^T(x(k)) \frac{\partial \hat{V}(x(k+ 1))}{\partial x(k+ 1)}. \tag{12}
$$
执行网络与目标函数之间会产生误差。因此,我们定义误差函数为
$$
e_a(k)= \tilde{u}(k - 1)- \hat{u}(k, k - 1) \tag{13}
$$
其中,$\hat{u}(k, k - 1)=\hat{W}^T_a(k)\phi_a(Y^T_a x(k - 1))$。与评论家网络相同的设计,为最小化误差性能$E_a(k)= \frac{1}{2} e^T_a(k)e_a(k)$,执行网络的调节律为
$$
\hat{W}_a(k+ 1)= \hat{W}_a(k)- \beta_a \frac{\partial E_a(k)}{\partial \hat{W}_a(k)} = \hat{W}_a(k)- \beta_a \frac{\partial E_a(k)}{\partial e_a(k)} \frac{\partial e_a(k)}{\partial \hat{u}(k, k - 1)} \frac{\partial \hat{u}(k, k - 1)}{\partial \hat{W}_a(k)}. \tag{14}
$$
然而,可以看出该在线学习算法仍然是基于模型的。如果系统动态$f(x)$和$g(x)$未知,则这种基于模型的在线方法将失效。为了实现无模型目的,我们采用一个额外的辨识器神经网络[1, 2, 21]来重构并替代原始系统(1)。
根据神经网络通用逼近性质,系统(1)在紧集上具有神经网络表示:
$$
x(k+ 1)= W^T_s \phi_s(Y^T_s z_s(k))+ \rho_s(k) \tag{15}
$$
其中神经网络输入为$z_s=[x^T, u^T]^T$。$W_s$和$Y_s$是理想神经网络权重;$\phi_s(\cdot)$表示神经网络激活函数;$\rho_s$代表神经网络逼近误差。构造一个辨识器神经网络来逼近系统(15):
$$
\hat{x}(k+ 1)= \hat{W}^T_s(k)\phi_s(Y^T_s z_s(k)) \tag{16}
$$
其中,$\hat{x}$和$\hat{W}_s(k)$分别是$x$和$W_s$的估计。
Let $\tilde{W}_s(k)= \hat{W}_s(k)- W_s$, $\tilde{x}(k+1)=\hat{x}(k+1)-x(k+1)$, $X(k+1)=\tilde{x}^T(k+1)\tilde{x}(k+1)/2$,辨识学习律为
$$
\hat{W}_s(k+ 1)= \hat{W}_s(k)- \beta_s \frac{\partial X(k+ 1)}{\partial \tilde{x}(k+ 1)} \frac{\partial \tilde{x}(k+ 1)}{\partial \hat{W}_s(k)} = \hat{W}_s(k)- \beta_s\phi_s(\bar{z}_s(k))\tilde{x}^T (k+ 1) \tag{17}
$$
其中$\bar{z}_s(k) = Y^T_s z_s(k)$,$\beta_s$是辨识器神经网络的学习率。基于神经网络的辨识方案的示意图如图2所示。
基于神经网络的辨识方案可以总结如下。我们将把该方法应用于一个基准微电网,并以此为例。
定理1. [1, 21] 设系统(1)由标识神经网络(16)进行重构。采用更新律(17),状态估计误差$\tilde{x}(k)$是渐近稳定的。
经过充分的学习过程后,辨识器神经网络的权重$\hat{W} s(k)$收敛到一个常数值$\hat{W} {sm}$。然后,该辨识器神经网络可表示为
$$
\hat{x}(k+ 1)= \hat{f}(x(k))+ \hat{g}(x(k))u(k)= \hat{W}^T_{sm}\phi_s(\bar{z}_s(k)) \tag{18}
$$
其中$\hat{f}(x)$和$\hat{g}(x)$分别表示对$f(x)$和$g(x)$的估计。
因此,人们有
$$
\hat{g}(x(k))= \frac{\partial(\hat{W}^T_{sm}\phi_s(\bar{z}
s(k)))}{\partial u(k)} = \frac{\partial(\hat{W}^T
{sm}\phi_s(\bar{z}
s(k)))}{\partial\phi_s(\bar{z}_s(k))} \frac{\partial\phi_s(\bar{z}_s(k))}{\partial\bar{z}_s(k)} \frac{\partial\bar{z}_s(k)}{\partial z_s(k)} \frac{\partial z_s(k)}{\partial u(k)} = \hat{W}^T
{sm} \frac{\partial\phi_s(\bar{z}_s(k))}{\partial\bar{z}_s(k)} Y^T_s C_s \tag{19}
$$
其中$C_s= \partial z_s(k)/\partial u(k)$。通过利用所获得的辨识结果,可以在无模型环境中实现在线学习方案。然而,辨识误差可能影响控制性能,但这一点很少被考虑。
4. 在线动作依赖HDP方法
对于微电网等复杂系统,辨识误差可能会影响控制性能和准确性。本节将给出一种无需事先进行辨识过程的在线动作依赖HDP方法[22, 23, 24]。
设执行网络$\hat{u}(k)$由式(8)给出。构造评论家网络如下
$$
\hat{V}(x(k))= \hat{W}^T_c(k)\phi_c(Y^T_c z_c(k)) \tag{20}
$$
其中神经网络输入为$z_c=[x^T,\hat{u}^T]^T$。注意,对于微电网,该方法的评判神经网络输入不仅包含系统状态$x$,还包含控制命令$\hat{u}$。定义评论家网络的误差函数:
$$
e_c(k)= r(x(k - 1), \hat{u}(k - 1))+ \hat{V}(Y^T_c z_c(k))- \hat{V}(Y^T_c z_c(k - 1)). \tag{21}
$$
为了最小化误差性能$E_c(k)= \frac{1}{2} e^2_c(k)$,评论家网络的更新律设计如下
$$
\hat{W}_c(k+ 1)= \hat{W}_c(k)- \beta_c \frac{\partial E_c(k)}{\partial \hat{W}_c(k)} = \hat{W}_c(k)- \beta_c \frac{\partial E_c(k)}{\partial e_c(k)} \frac{\partial e_c(k)}{\partial \hat{V}(k)} \frac{\partial \hat{V}(k)}{\partial \hat{W}_c(k)}. \tag{22}
$$
将执行网络的误差函数定义为$e_a(k)= \hat{V}(Y^T_c z_c(k))-\Psi$,其中$\Psi$通常设为零以表示“成功”[22, 23, 24]。基于最小化误差性能$E_a(k)= \frac{1}{2} e^T_a(k)e_a(k)$的目的,相应的更新律为
$$
\hat{W}_a(k+ 1)= \hat{W}_a(k)- \beta_a \frac{\partial E_a(k)}{\partial \hat{W}_a(k)} = \hat{W}_a(k)- \beta_a \frac{\partial E_a(k)}{\partial e_a(k)} \frac{\partial e_a(k)}{\partial \hat{V}(Y^T_c z_c(k))} \frac{\partial \hat{V}(Y^T_c z_c(k))}{\partial(Y^T_c z_c(k))} \frac{\partial z_c(k)}{\partial z_c(k)} \frac{\partial \hat{u}(k)}{\partial \hat{W}_a(k)}. \tag{23}
$$
在线动作依赖HDP方案的示意图如图3所示。该方法充分利用了当前和历史系统数据中隐藏的信息,并避免了对系统模型的需求。执行‐评价双网络框架保证了该方法能够从真实数据中充分学习模型信息并快速搜索最优解,这一点已在AlphaGo等许多信息系统中得到证实。
备注1. 可以看出,在线动作依赖HDP方法[22, 23, 24]不涉及系统模型的信息$f(x)$和$g(x)$,并避免了辨识过程。然而,该方法仍需要一个初始可容许控制策略。此外,在线学习算法通常耗时较长,且数据利用率较低,因为它仅使用当前数据而丢弃了历史信息。需要注意的是,“探索”信号(也称为持续激励(PE))在在线学习过程中是必要的。不幸的是,如何找到合适的PE条件很少被讨论,仍然是一个开放性问题。
5. 数据驱动的基于VI的Q学习方法
为了克服上述困难,下一节将给出一种新颖的基于VI的Q学习方法[25, 26, 27, 28]。它是一种数据驱动的无模型离线学习算法,能够避免对初始可容许控制的需求以及在线学习方法的缺点。首先,让我们构造如下 Q函数:
$$
Q(x(k), a)=r(x(k), a)+ \sum_{p=k+1}^{\infty} r(x(k), u(k)) =r(x(k), a)+ V(x(k+ 1)). \tag{24}
$$
给定最优控制策略$u^*(k)$,其对应的最优Q函数表示为
$$
Q^
(x(k), a)= r(x(k), a)+ V^
(x(k+ 1)). \tag{25}
$$
根据最优Q函数(25),可得
$$
u^
(x)= \arg \min_u V(x)= \arg \min_a Q^
(x, a). \tag{26}
$$
因此,通过上述Q函数和VI算法的经典框架,我们提出了如图4所示的基于值迭代的Q学习算法。
备注2. 与上述的演员-评论家方法不同,我们采用仅评论家结构来实现Q学习方法。相比与演员-评论家双网络方法相比,这种仅使用评论家神经网络的实现方案将计算负担减少了一半。此外,与在线动作依赖HDP方法[22, 23, 24]相比,Q学习算法[25, 26, 27, 28]具有以下几个优点:1)该方法结合了值迭代算法的优点,即不需要初始可容许控制的严格条件;2)该方法是一种迭代的离线学习算法,学习所需时间不多;3)神经网络的充足训练数据可以离线获取,从而避免了在线学习设计中的PE条件;4)数据利用率更高。
构建一个评论家网络来近似迭代的Q学习函数:
$$
\hat{Q}_l(x, a)= \phi^T_c(x, a)\hat{W}_l \tag{29}
$$
其中,$\hat{W}_l$和$\phi_c(x, a)$分别表示神经网络权重和激活函数。令$\hat{u}_l(x)= \arg \min \hat{Q}_l(x, a)$,其中$\hat{u}_l(x)$是$u_l(x)$的估计。采用如下梯度下降法
$$
\hat{u}
{l,q+1}(x)=\hat{u}
{l,q}(x)- \beta_a \frac{\partial \hat{Q}
l(x, a)}{\partial a} \bigg|
{a=\hat{u}
{l,q}(x)} =\hat{u}
{l,q}(x)- \beta_a \frac{\partial\phi^T_c(x, a)}{\partial a} \bigg|
{a=\hat{u}
{l,q}(x)} \hat{W}_l. \tag{30}
$$
评论家网络的误差函数由以下给出
$$
e^l_c(x(k), a)= \hat{Q}_{l+1}(x(k), a)- r(x(k), a)- \hat{Q}_l(x(k+ 1), \hat{u}_l(x(k+ 1))) =\phi^T_c(x(k), a)\hat{W}^{l+1}_c - r(x(k), a)- \phi^T_c(x(k+ 1),\hat{u}_l(x(k+ 1))\hat{W}^l_c. \tag{31}
$$
设$\eta= \phi^T_c(x(k), a)$和$\psi_l= r(x(k), a)+ \phi^T_c(x(k+ 1),\hat{u}_l(x(k+ 1))\hat{W}^l_c$。然后,可得
$$
e^l_c( x(k), a)= \eta \hat{W}^{l+1}_c - \psi_l. \tag{32}
$$
使用最小二乘法来最小化$|e^l_c( x(k), a)|^2$并更新评判神经网络权重。收集$M$个不同的训练数据集$(x_q(k), a_q, x_q(k+1))$。令$\Theta_l=[\psi^T_{l1}, \psi^T_{l2}, \cdots, \psi^T_{lM}]^T$和$\xi=[\eta^T_1, \eta^T_2, \cdots, \eta^T_M]^T$。然后得到$\hat{W}^{l+1}_c$。因此,最小二乘解形式下$\hat{W}^{l+1}_c$的更新律可描述为
$$
\hat{W}^{l+1}_c=[\xi^T\xi]^{-1}\xi^T\Theta_l. \tag{33}
$$
因此,我们可以将上述算法的实施步骤总结如下。
本文中三种方法的性能比较如表1所示。由于基于神经网络的辨识方法仍属于模型重构领域,因此其收敛速度较快。基于神经网络的辨识方法和动作依赖HDP方法均需要初始可容许控制,而基于VI的Q学习方法没有这种初始局限性。由于动作依赖HDP和基于VI的Q学习方法仅利用系统数据,因此不需要任何系统模型信息。由于存在辨识误差,基于神经网络的辨识方法的计算准确性较低。尽管动作依赖HDP方法没有辨识过程,但由于在线学习不足,无法达到较高的计算准确性。由于基于VI的Q学习方法使用系统数据并离线运行,因此具有较高的计算准确性。
| 方法 | 收敛速度 | 初始局限性 | 模型要求 | 计算准确性 |
|---|---|---|---|---|
| 基于神经网络的辨识 | High | High | 中 | Low |
| 与动作相关HDP | 中 | High | Low | 中 |
| 基于值迭代Q学习 | 中 | Low | Low | High |
| ## 6. 仿真结果 |
我们将提供三个小节来详细展示仿真过程。
6.1. 基准微电网的实际模型
考虑如下基准微电网系统[29]
$$
\begin{aligned}
\Delta \dot{f} &= -\frac{1}{T_p} \Delta f + \frac{k_p}{T_p} \Delta P_d \
\Delta \dot{P}_d &= -\frac{1}{T_t} \Delta P_d + \frac{1}{T_t} \Delta P_g \
\Delta \dot{P}_g &= -\frac{1}{k_s T_g} \Delta f - \frac{1}{T_g} \Delta P_g - \frac{1}{T_g} \Delta E + \frac{1}{T_g} u \
\Delta \dot{E} &= k_e \Delta f
\end{aligned}
\tag{34}
$$
其中,$\Delta f$为频率偏差;$\Delta P_d$为柴油发电机输出的增量变化;$\Delta P_g$为调速器阀门位置的增量变化;$\Delta E$为积分控制的增量变化;$T_p$、$T_t$和$T_g$分别表示电厂模型、涡轮机和调速器的时间常数;$k_p$、$k_s$和$k_e$分别表示电厂增益、速度调节和积分增益。
6.2. 数据处理
从图5中,我们可以清楚地看到仿真的过程。首先,可以从现实世界中获得数学系统模型,即方程(34)。其次,应设置所有系统参数$T_p$、$T_t$、$T_g$、$k_p$、$k_s$和$k_e$的值。为简便起见,我们令所有参数的值均为1,从而可得到系统矩阵$A$和$B$。令$x=[x_1, x_2, x_3, x_4]^T=[\Delta f, \Delta P_d, \Delta P_g, \Delta E]^T$。设初始值为$x(0)=[x_1(0), x_2(0), x_3(0), x_4(0)]^T=[0.6, -0.6, 0.3, -0.3]^T$。第三,连续时间系统(34)可被离散化为离散时间形式(1)。在本仿真中,我们设置不同的性能矩阵$Q=0.1I_4$、$Q=I_4$、$Q=10I_4$和$R=0.1$、$R=1$、$R=10$以测试其有效性。通过使用所引入的基于人工智能的算法,我们可以获得最优控制$u^*(x(k))$。
6.3. 结果
在将$u^*(x(k))$应用于基准微电网后,我们最终可以通过MATLAB获得图6和图7中的仿真结果。
在图6中,我们可以看到使用不同矩阵$Q$的三维和二维图,这表明通过增强参数矩阵$Q$,可以显著提高收敛速度和控制性能。当设置为$Q=0.1I_4$时,系统状态在15个时间步后达到收敛;当设置为$Q=I_4$时,系统状态在10个时间步内变得稳定;当设置为$Q=10I_4$时,系统状态在第8个时间步即实现收敛。因此,采用更大的$Q$,最优控制策略将找到更优的收敛轨迹。
为了测试性能优化的有效性,我们进行了两组仿真。首先,我们设置相同的矩阵$R=1$,并提供不同的矩阵$Q=0.1I_4$、$Q=I_4$和$Q=10I_4$。从图7可以看出,如果调节矩阵$Q$,状态收敛的性能优化得到改善。系统状态实现了更快收敛和更小的幅值。其次,我们设置相同的矩阵$Q=I_4$,并提供不同的矩阵$R=0.1$、$R=1$和$R=10$。可以观察到,如果调节矩阵$R$,控制输入的性能优化得到改善。控制输入消耗更少能量。因此,可以证明矩阵$Q$和$R$分别决定了系统状态和控制输入的性能优化。
7. 结论
本文综述了若干种用于基准微电网性能优化控制的基于人工智能的计算算法。提出了一种基于在线自适应动态规划学习方法的识别方案,该方法无需系统模型。为了消除辨识误差的影响,引入了两种数据驱动无模型方案,包括双网络动作依赖HDP方法和仅评论者VI‐based Q学习算法。该Q学习方法不仅避免了可容许控制的严格条件,而且与执行‐评论结构工作相比,降低了计算负担并简化了算法设计复杂性。所提出的最优控制方案已在基准微电网中进行了测试,以验证性能优化的有效性。
更多推荐



所有评论(0)