面向基础设施辅助无人机系统的最优边缘计算

摘要

无人机(UAV)自主运行的能力受限于其机载资源的严重约束。这些设备有限的处理能力和能量存储不可避免地使得对复杂信号进行实时分析——实现自主性的关键——变得具有挑战性。在城市环境中,无人机可以利用周边广域物联网基础设施的通信和计算资源来增强其能力。例如,无人机可以与边缘计算资源互联,并将计算任务卸载,以改善对传感器输入的响应时间并降低能耗。然而,城市拓扑结构的复杂性以及大量设备和数据流对相同网络和计算资源的竞争,导致环境高度动态,信道条件差和边缘服务器拥塞可能会严重影响任务卸载的性能。本文提出一个框架,能够根据网络和计算负载参数以及当前状态做出最优卸载决策。该优化问题被建模为半马尔可夫过程上的最优停止时间问题。我们在不同层次的抽象和对系统底层随机过程的先验知识条件下,采用动态规划和深度强化学习求解该优化问题。我们在一个真实场景中验证了结果,其中一架无人机在连接至边缘服务器的同时执行建筑检测任务。

索引词 —边缘计算,城市物联网,无人机,自主系统。

一、引言

无人机(UAV)的使用正被越来越多地应用于各种场景,包括监视与监控、灾害管理、农业以及网络覆盖扩展[1]–[5]。它们的自主运行需要从周围环境中获取并实时分析信息。然而,处理富含信息的信号(如视频和音频输入)以支持导航及一般的自主决策,对于这些资源受限的平台而言是一项极为艰巨的任务。事实上,由于机载计算资源有限,分析过程可能需要大量时间,从而降低无人机对刺激的响应能力。

此外,持续运行高强度的分析算法会给这些由电池供电的设备带来显著的能耗负担。总之,无人机的自主性程度可能受到限制,并且可能以缩短运行寿命为代价。

在城市环境中,无人机可以利用周围城市物联网(IoT)基础设施的资源来克服自身的一些局限性并增强其能力。例如,无人机可以利用通信基础设施连接到边缘服务器——即位于网络边缘的具备计算能力的设备——以卸载数据处理任务[6]。通过将计算任务卸载到更强大的设备上,无人机有可能缩短捕获到决策时间,从而改善对传感器输入的响应时间。此外,将数据处理任务卸载到边缘服务器还可以减少完成任务所需的能量。

然而,城市物联网是一个高度动态的系统,其中大量设备和数据流竞争有限的通信和计算资源。因此,连接无人机与边缘服务器的网络可能出现拥塞,导致数据传输到边缘服务器所需时间较长。此外,由于路径损耗和阴影效应,城市区域拓扑可能降低信道容量。最后,边缘服务器可能已存在来自其他设备和服务的计算任务队列,需要在处理无人机数据之前完成。因此,在某些条件和位置下,将数据传输到边缘服务器并接收分析结果所需的时间可能超过无人机本地处理的时间。

在本文中,我们提出了一种优化的决策过程,通过该过程无人机决定是本地处理还是将计算任务卸载至边缘服务器。该决策基于无人机与物联网系统之间的一系列交互,在此过程中无人机接收有关网络和边缘服务器状态的反馈,从而能够估计任务完成剩余时间。基于这些信息,无人机求解一个优化问题,旨在最小化延迟与能耗的加权和。从形式上讲,该问题被建模为半马尔可夫过程上的最优停止时间问题。

基于从系统实际实现中提取的参数所得出的数值结果显示,所提出的智能顺序探测技术能够有效地将处理策略适应于网络‐边缘服务器系统的瞬时状态。其结果是降低了处理延迟和能耗,这两者在所考虑的应用中是重要的指标。我们在上述城市场景中对结果进行了评估,特别关注可能在整个任务过程中降低无人机性能的各个组成部分。除了进行理论分析外,我们还对所提出的自适应卸载方案在时域和平均性能方面进行了表征,该场景中无人机任务需要围绕建筑物飞行一圈,同时分析图像。

在上述设定中,我们训练了一种深度强化学习(DRL)智能体,使其能够学习环境的时空特性,以掌握有效的卸载策略。结果表明,位置和近期卸载结果等特征对于提升控制器在不同任务中优化其决策能力具有重要意义。

本文的其余部分组织如下。第二节介绍了本文所考虑系统的概述。第三节详细描述了无人机‐边缘服务器系统的参数和操作。第四节引入了系统动态的马尔可夫描述,并建立并求解了卸载决策优化问题。第五节给出了数值结果,展示了所提出的自适应卸载策略的性能,并将其与替代方案进行了比较。第六节讨论了相关研究,第七节对全文进行了总结。

II. 系统与问题概述

我们考虑一种无人机在城市环境中自主导航的场景。该无人机被指派在城市内预定义的位置获取并处理复杂数据,而处理结果可能会影响其感知和导航行为。一个相关的案例研究应用是城市监控,在此应用中,无人机在每个位置拍摄全景图片序列,并使用分类算法对这些图像进行处理,以检测感兴趣的对象或情况。如果检测到目标,无人机可能会停留在该位置,以对其视野中的特定区域拍摄更详细或更高分辨率的图片。

直观上,对于无人机等固有资源受限的平台而言,使用计算密集型算法处理信息丰富的信号是一项具有挑战性的任务。事实上,机载计算资源的处理能力有限,导致算法的采集到输出的时间较长,从而降低了对刺激的响应能力,并延长了任务时间。此外,与飞行运动和导航相比,机载处理本身消耗大量能量,进一步缩短了这些电池供电系统的寿命。需要注意的是,在上述场景中,无人机在等待分类算法完成时处于悬停状态,因为算法结果将决定其后续动作。因此,较长的处理时间还会因飞行时间延长而带来额外的能耗代价。

无人机可以利用周围城市物联网基础设施的资源来提升其性能。在当前场景中,部署在网络边缘的边缘服务器可以接管无人机采集数据的处理任务。直观来看,与无人机相比,边缘服务器具备更强的处理能力,能够显著加快处理任务的完成速度。从而实现更快的决策制定,缩短从图像捕获到分析结果可用之间的时间。此外,无人机无需承担处理带来的能耗负担,只需付出与数据传输相关的能耗代价。我们指出,接收分类算法输出所需时间越短,与悬停相关的能耗也越小。

然而,正如引言中所述,城市物联网是一个高度动态的环境,其中大量数据流和服务共存并竞争相同的通信资源。在所考虑的场景中,连接无人机与无线接入点的无线信道可能由于信号传播的物理特性,以及部分时频信道资源被干扰通信占用,而导致容量较低。此外,边缘服务器可能正在为其他卸载其计算任务的设备提供服务,从而导致无人机任务遭受排队延迟或处理速度降低。因此,在某些情况下,通过容量较差的通信信道将计算任务卸载到过载的边缘服务器,可能导致更长的捕获到决策时间。这不仅对应着较低效的任务操作,还可能因在等待响应期间悬停而产生较大的能耗。

为了充分利用城市物联网基础设施提供的可用资源所带来的潜在性能增益,无人机需要就是否卸载图像分析的执行做出明智的决策。为此,我们使无人机具备与周围网络和边缘设备交互的能力,并获取有关通信和处理流水线状态的信息。这些信息用于评估任务的进展,并预测在本地与边缘辅助计算之间进行二元决策的未来成本。

我们指出,该优化框架可用于具有多个基站和边缘服务器的场景。由于顺序决策是基于任务逐个做出的,因此网络基础设施可以管理切换和连接性,而不会对决策制定产生重大影响。然而,我们注意到,在考虑智能体学习时空相关性特性(如第V‐C节所示)时,智能体需要隐式地融入与空间特征相关的连接性信息。事实上,切换可能导致时间相关性的突然损失——例如,当连接到新的基站时若切换至不同的边缘服务器,则服务器负载可能会出现此类情况。

III. 系统模型

在本节中,我们对由无人机、网络接入点和边缘服务器组成的系统抽象进行形式化讨论。我们将描述分为若干模块,重点关注系统的通信、计算和能耗方面。

A. 通信

无人机通过具有有限容量的无线信道连接到网络接入点。需要传输的数据用于卸载的任务大小为 L比特。无人机以固定的功率 P和速率 R进行传输,速率来自有限的 K+ 1个传输速率集合 {R0, R1, R2,…, RK},其中 R0= 0对应于与网络断开连接,因此不进行数据传输。无人机与接入点之间的链路是受路径损耗、衰落和噪声影响的无线链路。接收端的信噪比为

$$ SNR= \frac{gP}{\sigma^2}, $$

其中 $\sigma^2$是噪声功率, $g$是包含路径损耗和衰落的信道衰减系数。我们假设存在指数路径损耗和瑞利平坦衰落。因此, $g$的分布为

$$ \Theta_g(x)= Pr(g \leq x)= 1−e^{−\frac{x}{\gamma}}, $$

其中 $\gamma$是路径损耗。

假设已知信道状态信息并采用容量实现方案,无人机的选定传输速率为Ri比特/秒,当且仅当 $g∈(g_i, g_{i+1}]$时。

$$ g_i= g: R_i= C(gSNR), i= 1,…, K, $$

and

$$ C(x)= \log(1+ x). $$

得到的传输时间为L/Ri秒。在本文中,我们使用容量模型来抽象通信层,其中信道增益与最大可达数据速率相匹配。若在模型中集成更真实的通信模型,例如捕捉物理层、信道接入层和传输层之间的相互作用,将导致更加复杂的分析。我们建议感兴趣的读者参考我们的工作[7],以了解针对无人机动态卸载的真实边缘计算的评估与分析。

B. 计算

无人机和边缘服务器上完成计算任务所需的时间分别用随机变量X′和 X表示。我们假设 X′和 X分别服从速率为 μ′和 μ任务/秒的指数分布。边缘服务器将传入的计算任务累积在一个大小为 B任务的有限缓冲区中。除无人机生成的任务外,其他任务以 λ任务/秒的速率根据泊松过程到达,其中 λ< μ。

C. 能源

如前一节所述,无人机在每个预设位置采集数据,然后在悬停并保持位置的同时完成计算任务——任务可在本地或边缘服务器上处理。我们针对受卸载决策影响的两个基本操作模块定义能耗速率:处理和悬停。具体而言,我们定义 $P_P$和 $P_H$分别为用于数据处理和悬停的瓦特数。如前所述,传输功率等于 P瓦特。

IV. 最优卸载决策

在所考虑的场景中,两个最关键的性能指标是每个位置的能耗 $E$ 和时间 $T$。此处,我们假设系统在每个位置的状态是相互独立的。重要的是,成本 $E$和 $T$是卸载决策的函数,即计算任务是在无人机上还是在边缘服务器上完成。

在已知系统参数的情况下,无人机可以计算出两种选择对应的平均成本 $E$和时间 $T$,其中平均值是针对与系统动态相关的随机过程的实现进行的。然而,在该平均值中,存在一些实现情况使得卸载是有利的(高信道容量和低处理拥塞)或不利的(低信道容量和高处理拥塞)。为了在面对物联网系统的动态性时充分挖掘边缘计算所能带来的性能增益,我们开发了一种顺序探测与决策框架。在每一阶段,无人机观察当前的实现情况,估计完成任务所需的剩余成本,并决定是否启动本地处理。该建模对应于半马尔可夫过程上的最优停止时间问题。

根据上一节列出的假设,系统的时域演化可以表示为一个半马尔可夫过程。定义 $t_j^+$ 、 $j= 0, 1, 2,…$为事件发生后立即出现的时间点,这些事件定义为建立网络连接、将数据传输至边缘服务器,或在无人机或边缘服务器上完成计算任务。我们将时间 $t_j^+$时系统的状态表示为随机变量 $S(t_j^+)$。$S(t_j^+)$的状态空间 $S$包含一个初始状态 $s_0$、两个终止状态 $s_{UAV}$和 $s_{ES}$,以及若干描述数据传输和任务排队过程的状态。终止状态对应于计算任务在无人机本地完成($s_{UAV}$)和卸载到边缘服务器($s_{ES}$)。具体而言,我们包括:(i)一组与传输速率相关联的 K+1个状态 $R_0, R_1,…, R_K$,即前一节中定义范围内的信道状态;以及(ii)一组与无人机任务在边缘服务器任务缓冲区中的位置相关的 $C+1$个状态 $B_1,…, B_{C+1}$。注意, $B_{C+1}$对应到达时缓冲区已满的情况,即无人机任务被拒绝。可以证明,过程 $S=(S(t_j^+))_{j=0,1,…}$是一个马尔可夫过程。

在每个时间点$t_j^+$,无人机收到网络接入点或边缘服务器通知的状态$S(t_j^+)$,并做出二元决策$u∈{0, 1}$,其中 0和1分别对应本地计算和继续在边缘辅助流水线中执行——即进一步延迟本地计算。

A. 转移概率

我们现在描述控制随机过程S动态的转移概率。为了符号清晰起见,我们将时间 $t_j^+$ 用其索引 $j$表示。然后我们定义

$$ P(s’ | s, u)= Pr(S(j+1)= s’ | S(j)= s, U(j)= u). $$

如果决策等于0,则从任意状态 $s$的转移概率为

$$ P(s’ | s, 0)=\begin{cases} 1 & \text{if } s’ = s_{UAV}; \ 0 & \text{otherwise}. \end{cases} $$

也就是说,如果决策是本地计算,则该过程将从任意状态确定性地转移到状态 $s_{UAV}$。

然后,我们分析当决策为1时的转移概率,即无人机进一步推迟本地计算的启动。在这种情况下,从初始状态 $s_0$开始,对信道分布进行采样,状态以相应区间概率的大小转移到某个传输前状态 $R_i$。因此,

$$ P(s’|s_0, 1)=\begin{cases} \pi_i & \text{if } s’= R_i, i= 0, 1,…, K; \ 0 & \text{otherwise}, \end{cases} $$

其中$\pi(i) =\Theta_g(g_{i+1}) −\Theta_g(g_i)$。

在任意状态$R_i$下,无人机从无线接入点获得报告的传输速率,即索引$i$。如果决策为延迟本地处理,则转移概率来自$R_i$,$i = 1,…,K$

$$ P(s’|R_i, 1)=\begin{cases} \sigma_{c−1} & \text{if } s’= B_c \ 0 & \text{otherwise}. \end{cases} $$

$\sigma_c$是无人机任务到达时在边缘服务器缓冲区中发现有 $c$个任务存储的概率。已知

$$ \sigma_c= \frac{(1 − \lambda/\mu)(\lambda/\mu)^c}{1 −(\lambda/\mu)^{C+1}}. $$

状态$R_0$(对应于与网络断开连接)将确定性地导致 $s_{UAV}$。

在任何状态$B_c$开始时,无人机都会收到关于索引$c$的通知。对于状态$B_c, c= 2,…, C$,其转移概率为

$$ P(s’|B_c, 1)=\begin{cases} 1 & \text{if } s’= B_{c−1} \ 0 & \text{otherwise}. \end{cases} $$

状态$B_{C+1}$对应任务队列已满,因此会拒绝无人机任务。因此,系统将从$B_{C+1}$确定性地转移到$s_{UAV}$。状态$B_1$对应无人机任务位于队列首位,并确定性地导致$s_{ES}$。

B. 成本函数与最优策略

在状态和动作条件下的转移概率基础上,现在我们可以构建优化过程。我们考虑一种无人机目标是最小化$E(V)$的表述形式,其中

$$ V= \omega E+(1−\omega)T, $$

其中 $\omega$是$[0, 1]$中的一个正权重。

为此,定义在状态$s∈S$下执行动作 $u$所花费的时间和能量分别为 $\Phi(s, u)$和 $\Psi(s, u)$。注意,前者和后者均为随机变量。将其平均值记为 $\varphi(s, u) =E(\Phi(s, u))$和 $\psi(s, u) = E(\Psi(s, u))$。进一步定义$C(s, u) = \omega\Phi(s, u)+(1−\omega)\Psi(s, u)$,其平均值为 $c(s, u)$。

初始状态的平均时间与能耗成本均为0。在终止状态$s_{UAV}$和$s_{ES}$中,我们有

$$ \varphi(s_{UAV})= 1/\mu’, $$

示意图0

$$ \psi(s_{UAV})=(P_P+ P_H)/\mu’, $$

and

$$ \varphi(s_{ES})= 1/\mu, $$

$$ \psi(s_{ES})= P_H/\mu. $$

在此,基于通过实验评估获得的实际值,我们假设传输能耗$PL/R_i$与处理和悬停能耗相比可以忽略不计。注意,在终止状态中,动作是预先确定的,无需正式计入成本。

从任何传输与排队状态$R_0,…, R_K$和$B_1,…, B_{C+1}$,如果决策是在无人机上启动本地处理($u= 0$),则过程立即转移到 $s_{UAV}$,且能耗和时间成本均为0。注意,此类决策在状态 $R_0$和 $B_{C+1}$中是强制执行的。

如果决策是延迟本地处理($u= 1$),则成本为

$$ \varphi(R_i, 1)= L/R_i, $$

$$ \psi(R_i, 1)=(P_H+ P)L/R_i. $$

与 $i=, 1,…, K$,以及

$$ \varphi(B_i , 1)= 1/\mu, $$

$$ \psi(B_i , 1)= P_H/\mu. $$

在此,基于通过实验评估获得的测量结果,我们假设传输能耗$PL/R_i$与计算和悬停能耗相比可以忽略不计。

最小化预期总成本的问题可以重新表述为有限时间范围内的马尔可夫决策过程。我们的目标是找到(确定性的)最优决策策略 $u^*(s)$,其中

$$ u^*(s)= \arg \min_{u={0,1}} E(V_{res}(s, u)), $$

其中$E(V_{res}(s, u))$表示在选择决策$u$的情况下,从状态 $s$到终止状态 $s^\dagger$的期望最小累积剩余成本,即

$$ \min_{U_{j^\dagger}^1} E \left( \sum_{j=0}^{j^\dagger} c(S(j), U(j)|U(0)= u, S(0)= s) \right), $$

其中

$$ j^\dagger= \min(j: S(j)\in{s_{UAV}, s_{ES}}), $$

和$U_{j^\dagger}^1=(U(0) … , U(j^\dagger))$。

我们使用值迭代方法[8], 计算最优策略,该方法专注于通过迭代生成性能逐渐接近最优点的策略。在本例中,从起始状态出发的最优值分别给出每幅图像在$\omega= 0$或$\omega= 1$情况下的经历的延迟和能耗。在收敛时,其他状态的值表示使用最优策略从该状态出发的预期未来成本。

令$V_t$为一个向量,其元素为状态空间中每个状态的值函数,其中$t$为递归过程中执行的步数。则$V_t \in\mathbb{R}^{5+K+C}$,该向量的大小直接由图2中的状态定义决定。任意初始化的向量$V_0$随后通过贝尔曼方程进行更新,如下所示:

$$ Q_{k+1}(s, a)=\sum_{s’} P(s’ | s, a)(R(s, a, s’)+ \gamma V_k(s’)) $$

$$ V_k(s)= \min_a Q_k(s, a), $$

其中 $Q_t( s, a)$表示采取动作 $a$的预期成本。注意,为了减少收敛时间,通常从末端节点(在本例中为$s_{ES}, s_{UAV}$)向输入节点 $s_0$反向计算更新。

示意图1

V. 数值结果

本节展示并讨论了本文所提出的模型和优化技术获得的结果。首先,我们分析了性能指标和卸载概率,探讨了描述信道质量和服务器负载的参数。然后,我们在真实环境中表征了所提方案的性能,其中信道参数(即信噪比)是基于无人机轨迹获取的。需要注意的是,在结果的后半部分,我们可以分析系统在任务期间的时序行为。

为了使我们的观察更具意义,我们利用实际实验中获得的参数,在不同的信道和负载条件下推导出最优策略。除非另有说明,否则均使用这些值。具体而言,我们使用了一架 3DR Solo无人机,搭载运行ArduCopter的Pixhawk飞控,并连接树莓派3B型号作为伴航计算机。边缘服务器采用一台配备16 GB内存、Intel Core i7‐6700HQ处理器和Nvidia GM204 M GPU的笔记本电脑。我们将每个位置采集的图像数量设为1,每张图像的分辨率为 720 × 480。编码后每张图像的平均大小为80 kB。图像处理采用基于多尺度Haar级联的人脸识别算法,在无人机端平均耗时 $1/\mu’= 0.56$s,在边缘服务器端平均耗时 $1/\mu= 0.046$ s。我们考虑的信噪比值范围为[−10, 20] dB,传输速率范围为1 Mbps至11 Mbps(对应采用Wi‐Fi IEEE 802.11的系统)。功耗率基于同一实验设置中的电池电量读数:具体地,我们设定 $P_h = 0.1$ levels/s,$P_p = 10\% \cdot P_h$ levels/s。给定参数下的最优确定性策略$U_{j^\dagger}^1$通过公式(21)计算得出。需要指出的是,由于在可用速率和位置集合上选择的分辨率存在误差,我们的性能分析将受到影响。受位置误差的影响,预期信噪比会发生变化,从而导致速率上的概率分布不同。这些误差将在多次运行中被平均化,因此我们的结果仍然成立。我们考虑在

示意图2

图3中,我们展示了卸载到边缘服务器的概率随信噪比和服务器负载 $\rho= \lambda/\mu$的变化情况。该概率对应于在给定控制策略条件下,从 $S_0$被 $S_{ES}$吸收的概率,定义为

$$ P_\infty^{S_0}(Y)= \lim_{t\to\infty} P(S(t)= S_Y |S(0)= S_0, U= U_{j^\dagger}^1) $$

其中$Y \in{S_{UAV}, S_{ES}}$,且 $P_\infty^{S_0}(S_{UAV}) + P_\infty^{S_0}(S_{ES}) = 1$。

在图3中,我们绘制了 $P_\infty^{S_0}(S_{ES})$,概率越高则像素颜色越浅。正如预期,当 $\rho$取值较低且信噪比高时,卸载概率几乎等于1,即当系统条件有利时,无人机将卸载计算任务。当信噪比较低时,无人机很可能断开连接,或者由于将数据传输到边缘服务器所需时间较长,导致卸载成本超过本地计算成本。类似地,如果负载参数 $\rho$较大,即边缘服务器缓冲区频繁有任务到达或计算任务需要较长时间才能完成,无人机将选择本地计算。

示意图3

在图4中,我们展示了 $\omega$的影响,该参数控制目标函数中能量与延迟之间的权衡,进而影响最优策略和卸载概率。图中每条曲线对应不同的 $\omega \in[0, 1]$值,其中 $\omega$越大,能量成本的权重越大。将能量纳入优化的影响是明显的:$\omega$越大,卸载概率也越大,即使在信噪比较低的情况下,此时通过信道传输可能

示意图4

导致总体延迟增加。事实上,虽然较大的延迟会导致更长的悬停时间,从而增加悬停能耗,但卸载消除了与本地处理相关的能量消耗。我们观察到一个有趣的阈值效应,即当信噪比值为 $\omega$的函数时,策略从完全本地计算转变为部分卸载。

在图5中,我们固定信噪比,并将 $P_\infty^{S_0}(S_{ES})$表示为 $\rho$的函数。随着信噪比的降低,卸载到边缘服务器的概率也随之下降。直观来看,信噪比会影响概率曲线的形状。有趣的是,高信噪比值表现出从卸载到本地计算的急剧转变,而低信噪比值则呈现出更为渐进的过渡,这很可能与通信时间的分布有关。

最后,我们展示了探测相较于基于参数先验知识预先计算的平均延迟所做出的简单决策的价值。图6显示了在不同阶段做出本地处理决策或选择卸载的概率。具体而言,决策阶段为:

  • 阶段0:初始阶段 $S_0$,此时无人机已知参数,但未知信道和队列状态;
  • 阶段1: $R_i$,此时无人机已连接网络并知晓最大传输速率;
  • 阶段2: $B_j$,此时无人机已到达边缘服务器,即在传输完成后,被告知其在处理队列中的位置。

对于较小的 $\rho$值,卸载占主导地位,只有在信道条件极差时才会以较小的概率被迫进行本地计算决策。随着 $\rho$的增加,对应于本地计算决策的速率集合也随之增大。事实上,由于在边缘服务器缓冲区中花费的平均时间增加,数据传输的延迟要求变得更加严格。在卸载与本地计算之间的过渡阶段,当无人机到达边缘服务器后选择本地计算的概率会出现激增,这是因为在某一区域之前,缓冲区中的任务数量足够多、使得卸载不再有利的概率增加,导致探测甚至不再尝试执行。我们所采用的系统抽象得出的策略具有简单的结构。在决策制定的各个阶段中,智能体将在马尔可夫过程的各层内识别出对应于二元决策的阈值。尽管该结构简单,但这些阈值是信道质量分布和服务器到达负载分布在函数。

B. 任务轨迹

我们现在分析无人机在城市场景中的任务轨迹,该场景受到城市监控和建筑检测等应用的启发。我们考虑如图 8所示的轨迹,其中无人机以固定高度和恒定距离沿建筑物外表面飞行,从左下角开始,按顺时针方向循环飞行。所示地图划定一个 50 × 50米的区域,接入点和无人机均位于15米高度,建筑物的宽度、长度和高度分别为20米、30米和30米。

在该场景中,我们考虑一个接入点和一座建筑物的设置,并计算信噪比——待插入

示意图5 0% 和(b) 70%.)

示意图6

我们的模型,见公式(3)——使用建筑物遮蔽模型[9](添加到自由空间传播引起的衰减中)

$$ L= \alpha n+ \beta d_0, $$

其中 $\alpha$是每堵墙的衰减(dB), $n$是穿透的墙数, $\beta$是每米衰减(dB),$d_0$是穿过障碍物的距离(米)。我们使用经过实验验证的系数[9] $\alpha= 9$ dBm和$\beta= 0.9$ dB/m 使用与之前结果相同的一组参数,我们找到了在所考虑的地图中每个位置的最优策略。在图7中,我们展示了卸载到边缘服务器的概率沿轨迹的变化情况。在图7(a)中,边缘服务器专用于无人机。建筑物附加衰减效应对策略的影响显而易见:在受附加衰减影响较大的区域,卸载概率降低。总体而言,低服务器负载使得卸载成为主要策略。

图7(b)显示了在同一地图中我们将服务器负载增加至70%的情况,可以看出自适应方案作出响应,在较少的部分实现中选择边缘计算作为最佳策略。这种效应是由于更高的可能性导致

示意图7

示意图8

由无人机生成的任务将在服务器的缓冲区中找到其他几个任务。

我们现在考虑在整个轨迹上的延迟性能,并说明策略如何演变。在图9中,我们绘制了最优策略实现的平均捕获到输出延迟。可以观察到,对于不同的信噪比值,低性能区域会扩大。这是由于信道支持的数据速率较低,导致选择本地计算的概率更高所致。有趣的是,随着噪声增加,我们可以观察到新的激增和低性能区域出现,同时在某些区域策略切换到不同的模式。

服务器负载 $\rho$的影响大不相同,如图10所示。平均延迟沿着轨迹均匀增加,直至达到由始终选择本地分析策略所决定的上限。此外,我们观察到中等程度的服务器负载影响相对较小(e.g.,25% 对比 50%)。

考虑到完整轨迹上的平均情况,我们现在探讨一些参数如何影响性能和策略。在图11和图12中,我们展示了在不同噪声水平和边缘服务器负载下,轨迹平均的平均延迟(蓝色)和卸载概率(橙色)。有趣的是,在改变平均信噪比时,延迟与卸载概率之间呈现出明显的反比关系;而在改变边缘服务器负载时,平均延迟与卸载概率之间的关系则不那么明显。

在前一张图(图11)中,我们在 ≈ 10dB处观察到一个急剧的变化,此时卸载概率发生了显著变化

示意图9

示意图10

示意图11 平均信噪比为16 dB。(b) 平均信噪比为6 dB。)

成功卸载急剧减少,且由于更频繁地选择本地处理,导致延迟增加。在后一张图(12)中,我们观察到延迟的敏感性较低,在低至中等负载区域,平均延迟增加,但卸载策略变化较小。当高负载区域的卸载概率急剧下降时,延迟出现急剧上升。这是由于负载增加所引起的性能逐渐恶化,相较于信噪比恶化的影响更为平缓所致。

我们现在表征设备计算能力(以其服务速率表示)的影响。我们探讨了

示意图12 ρ= 0%。(b) ρ= 70%)

示意图13 延迟和 (b) 在平均信噪比为16 dB且无服务器负载的情况下,不同硬件配置下轨迹的延迟标准差。处理速度参考为服务速率 μ。)

$\mu \in[1, 40]$ 对于边缘服务器和 $\mu’ \in[1, 8]$ 对于无人机的取值范围,以评估不同设计选择和操作设置的影响。我们通过展示采用固定卸载策略时延迟增加的百分比,突出自适应方法的优势。需要说明的是,我们仍在考虑整个轨迹上的平均值。

增益如图14所示,其中我们将负载设置为0(a)和 70%(b)。注意在两个图中,较高的增益(较暗的区域)集中在本地服务速率较高而边缘服务器服务速率相对较低的区域。这表明只有当策略非平凡且适应性能带来好处时,适应才能改善性能。当本地服务速率较小时(图的左侧部分),我们确实观察到卸载策略,有趣的是,我们发现当负载较高时,自适应策略带来的增益更大,这是由于在该过程的特定实现中,当缓冲区繁忙时,我们的策略能够有效地回退到本地计算。

在图15(a)中,我们可以看到使用自适应策略时的平均延迟对本地处理能力非常敏感,但对边缘服务器处理能力的依赖较弱。然而,如图15(b)所示,我们发现延迟的方差在增益较小的区域更高。事实上,自适应技术的优势在于,只要本地处理看起来更有利,就会选择本地处理,这一点体现在较低变异性对应于本地处理为最优策略的区域。

C. 时间相关环境中状态的表征

我们在这些结果的基础上构建了一个基于事件的仿真器,该仿真器能够捕捉轨迹上后续位置之间的时间相关性。我们使用此工具来研究不同状态表示对决策代理性能的影响。

在状态表示中 we include:

  • 阶段:卸载前,在边缘服务器或本地处理
  • 位置:地图上的(x, y)坐标
  • E[SNR]:当前位置的平均信噪比
  • 任务数量:队列中的任务数量
  • 过去(动作,延迟)元组:我们包含最近3个动作和延迟

尽管在协作系统中,我们期望收集上述所有信息,但如果使用第三方基础设施或不同的网络协议,可能难以甚至无法收集到部分动态信息。因此,我们使用三种不同的观测状态来研究同一系统: 1) 完整状态 2) 阶段、位置、过去动作‐延迟 3) 阶段、过去动作‐延迟 由于该状态的特性是部分元素为离散型,另一部分为连续型,因此我们采用函数逼近器(如深度神经网络( DNN))来学习Q函数。为了在此新环境下实现从经验中学习,我们采用了深度强化学习(DRL)中研究的一些技术。深度强化学习(DRL)已在Atari游戏[10],、围棋游戏[11]以及许多其他环境[12]中取得了成功。正如这些研究工作所示,存在许多细节有助于DRL对Q函数实现稳定逼近。事实上,简单方法通常无法奏效,这是由于深度神经网络(DNN)的学习方式与表格法存在本质差异。例如,深度神经网络(DNN)容易出现灾难性遗忘[13],,即倾向于遗忘训练过程中早期见过的样本。为解决此问题, Schaul et al.引入了回放缓冲区[14],,用于在观察后存储样本。我们从该缓冲区中随机提取样本,并以批次形式输入到深度神经网络(DNN)中。模型将计算函数 Q(·),并返回一个包含各个动作对应Q值的向量。然而,由于我们只能执行一个动作,因此只会观察到一个奖励,从而仅针对一个输出进行更新,即计算损失并应用反向传播。我们使用基于单步时序差分的贝尔曼方程来计算下一步的估计Q值:

$$ Q(s, a)=(1 - \alpha)Q(s, a)+ \alpha(R(s, a)+ \gamma\arg\max_{a’} \hat Q(s’, a’)) $$

其中 $\alpha$是学习率, $\gamma$是折扣因子, $\hat Q$是DNN的旧版本。我们使用两个不同的网络 Q, $\hat Q$,以使Q值估计不会变化过快,从而避免发散行为。我们周期性地更新 $\hat Q= Q$以改进我们的Q函数逼近。

如前所述,我们保持设置与之前相同,其中智能体需要决策是否继续

示意图14

示意图15 ρ= 70%。(b) ρ= 90%。)

在两个阶段决定是否卸载:到达某个位置时以及进入边缘服务器队列时。从智能体的角度来看,所有状态转移都是概率性的,因为传输速率可能为0,队列也可能已满。为了抑制仅采用固定策略进行卸载的行为,当传输失败时,会在延迟中增加一个较小的网络探测项。

我们使用前述的状态表示训练了不同的智能体,并深入了解了在每个位置预测最优策略时哪些信息具有实用性。在图16中,我们展示了各个智能体在轨迹行进过程中的平均延迟。可以观察到,使用所有可用信息使智能体获得了与之前类似的优点,因为它能够针对每种特定的信道状况选择正确的策略。有趣的是,在负载低于70%的情况下,移除平均信噪比和队列位置对性能没有明显影响。在此情况下,我们看到两条曲线(蓝色代表完整状态,橙色代表仅有位置和延迟)开始分离,其中信息较少的状态导致更高的平均延迟。这两种策略相较于仅基于延迟的策略和固定策略的关键优势可在图17中观察到:我们注意到,在轨迹的中心部分,由于建筑物遮挡了视距,卸载策略导致了非常高的延迟。在高负载状态下,我们还可以看到边缘服务器处的队列位置如何改变用户仅在有利时机进行卸载的能力:在图17中可以看出,只有能够获取服务器缓冲区中队列位置的智能体,才能在高负载状态下成功地在位置0– 50实现有效的卸载。

本研究揭示了轨迹上的位置可作为平均信噪比的有效代理,而另一方面,先前延迟对服务器队列中的进程数量的预测能力较弱。此外,这为深入研究能够嵌入此类信息并实现持续学习环境中动态适应的时空图提供了机会。

VI. 相关工作

近年来,针对无人机任务卸载已有多项研究贡献。所提出的框架建立在大量关于移动设备卸载的研究基础之上。然而,如[15]及其他文献所述,移动应用通常假设计算任务为稀疏且非均匀生成。而在任务导向型和机器人应用中,通常假设应用程序会产生同质计算任务的连续流。此外,如[16],所示,无人机系统中的截止时间与移动应用不同,属于硬截止时间。我们所提出的框架将这些特性作为核心要素,以改善延迟性能。序列决策可在细粒度上控制延迟,以满足严格约束。我们提出的强化学习框架利用任务的连续流,学习最优卸载的时空特性,并通过系统中的时空相关性提升预测能力。该领域内的许多研究,例如 [17]和[18],,聚焦于寻找在长期性能中能量、延迟和吞吐量指标最优的边缘服务器。

其他贡献,例如[19],关注的是与通信相关的货币度量,以指导优化过程。在[19]中提出了一种博弈论方法,作者通过该方法能够降低通信成本,不仅考虑了多服务器的情况,还考虑了其中部分服务器进一步卸载计算的可能性。我们的工作集中在短期度量上,这使得在优化卸载过程时能够实现更精细的控制。我们指出,这与大多数现有文献有显著不同。

最近的一些研究,例如[20],,专注于特定场景的优化,假设已知信道状态的预测模型,从而导致采用复杂的决策算法来确定任务部分的卸载。这类有趣的方法对分析任务的类型施加了更强的限制。[21]提出了一种基于模糊逻辑的方法,以应对这些应用引起的高不确定性。

在[22], B. Liu 等提出将无人机的计算密集型任务卸载到边缘和云服务器。他们通过定义一个三层计算模型,构建了一个联合计算与路由优化问题,并在此基础上设计了一种多项式近似最优算法。作者采用了[23],中描述的马尔可夫逼近技术,该技术在求解网络组合优化问题时非常有效。然而,他们未考虑能耗相关度量与控制。

在Zhu et al.[24],的研究中考虑了能耗,其中提出了一种面向无人机的协同计算卸载方法,提出了一种旨在改善简单本地计算方案低效问题的方法。作者探索了无人机在城市环境中的运行,并采用模拟退火算法在满足延迟约束的同时最小化能耗。我们的方案对能量与延迟进行联合优化,为应用提供了更大的灵活性。

我们的工作还可以与实际贡献相结合,其中采用不同的启发式方法来控制任务卸载,而非严格的最优决策制定。在[7],中,使用了一种基于参数阈值的算法来决策是否进行卸载有益,同时还涉及与合适服务器的匹配以及自适应地探测可用的远程计算选项。

VII. 结论

本文提出了一种用于控制无人机系统中向边缘服务器卸载处理任务的框架。该框架依次探测网络状态和边缘服务器缓冲区状态,以在本地与边缘辅助计算之间做出最优决策。数值结果表明,与非自适应策略相比,所提出的技术基于马尔可夫决策过程建模并求解最优停止时间问题,能够显著降低延迟。最后,我们在网络模拟器3上通过建筑检测等实际任务验证了我们的结果。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐