【计算机科学与应用】基于深度学习模型的鸟类保护研究
作者信息:
魏倩楠, 张志华, 纪雨欣, 李佳硕, 刘洪源, 全 尧:辽宁科技大学电子与信息工程院,辽宁 鞍山
导读:
为了保护鸟类,维持森林生态系统的稳定,针对声音识别技术在鸟类保护系统中的重要性,本文旨在运用深度学习模型实现鸟类声音,伐木,枪声,电锯声的识别,首先通过对采集到的声音运用麦克风阵列法进行声源定位等预处理;其次对声音进行识别,运用梅尔倒谱系数(MFCC)进行特征提取是识别声音的关键步骤,模型测试结果表明,鸟声的识别率为90.2%,电锯和枪声的识别率为96.6%。
正文
本文将利用深度学习模型(Deep learning models)设计一种准确率较高的鸟类保护系统。声音定位识别的流程主要包括以下4个部分:数据收集与处理、特征提取、声源识别、声源定位。
数据收集
选定xeno-canto世界野生鸟类声音公开数据(https://xeno-canto.org/)作为鸟类音频文件数据源。同时从Freesound.org收集枪声和电锯声的数据。
特征提取
本研究运用梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients, MFCC)融合特征参数,来提取信号的时频域特征,其突出特点是把信号从线性频域转换到梅尔域。实现对鸟声信号的分类,相关提取流程如图1所示。

声音识别
采用ResNetSE (带注意力机制的残差网络)作为核心模型架构,在完成语音信号预处理后,基于注意力机制深度学习完成语音特征信息的提取。
声源定位
聚焦森林鸟类保护及生态监测的实际需求,搭建基于到达时间差(Time Difference of Arrival, TDOA)的麦克风阵列声源定位体系,用于对森林鸟类和环境声音开展精准化定位工作。
1. 基于广义互相关(GCC)计算时延
依据测量环境条件以及信号自身特性,可对时延估计方法进行分类,涵盖相位法、双谱法、相关法、自适应滤波器参数模型法等。在这些方法中,相关法属于最为经典且应用最广泛时延估计方法。
2. 麦克风阵列选型与布局
采用三维阵列心型指向性动圈式麦克风,心型指向性可增强目标方向声音采集、抑制环境噪声。
近场模型的构建至少需要三个麦克风参与,这里以基础的三麦克风模型(如图y1,y2,y3所示)展开分析,如图3所示。

针对仅配置两个麦克风的情形,由于其自身特性限制,仅能够求解方位角,而无法确定方位距离,如图4所示。

本文充分梅尔倒谱系数模块实现对音频进行处理,实现对提取信号的时频域特征,实现对鸟声信号,电锯声信号,枪声信号的识别搭建卷积神经网络模型,模型识别准确率较高。在整个声音识别流程中发现,对数运算和离散余弦运算非常重要,会严重影响到声音识别的效果。此外,本文对声音信号搭建了神经网络模型,测试结果表明鸟声的识别率为90.2%,电锯和枪声的识别率为96.6%,显示鸟声的识别率比较低。在后期的研究中会对神经网络结构进行调整,并进一步优化。
基金项目:
辽宁科技大学大学生创新创业训练计划项目(X202510146100)。
更多推荐



所有评论(0)