作者信息:

魏倩楠张志华纪雨欣李佳硕刘洪源全 尧:辽宁科技大学电子与信息工程院,辽宁 鞍山

导读:

为了保护鸟类,维持森林生态系统的稳定,针对声音识别技术在鸟类保护系统中的重要性,本文旨在运用深度学习模型实现鸟类声音,伐木,枪声,电锯声的识别,首先通过对采集到的声音运用麦克风阵列法进行声源定位等预处理;其次对声音进行识别,运用梅尔倒谱系数(MFCC)进行特征提取是识别声音的关键步骤,模型测试结果表明,鸟声的识别率为90.2%,电锯和枪声的识别率为96.6%。

正文

本文将利用深度学习模型(Deep learning models)设计一种准确率较高的鸟类保护系统。声音定位识别的流程主要包括以下4个部分:数据收集与处理、特征提取、声源识别、声源定位。

数据收集

选定xeno-canto世界野生鸟类声音公开数据(https://xeno-canto.org/)作为鸟类音频文件数据源。同时从Freesound.org收集枪声和电锯声的数据。

特征提取

本研究运用梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients, MFCC)融合特征参数,来提取信号的时频域特征,其突出特点是把信号从线性频域转换到梅尔域。实现对鸟声信号的分类,相关提取流程如图1所示。

声音识别

采用ResNetSE (带注意力机制的残差网络)作为核心模型架构,在完成语音信号预处理后,基于注意力机制深度学习完成语音特征信息的提取。

声源定位

聚焦森林鸟类保护及生态监测的实际需求,搭建基于到达时间差(Time Difference of Arrival, TDOA)的麦克风阵列声源定位体系,用于对森林鸟类和环境声音开展精准化定位工作。

1. 基于广义互相关(GCC)计算时延

依据测量环境条件以及信号自身特性,可对时延估计方法进行分类,涵盖相位法、双谱法、相关法、自适应滤波器参数模型法等。在这些方法中,相关法属于最为经典且应用最广泛时延估计方法。

2. 麦克风阵列选型与布局

采用三维阵列心型指向性动圈式麦克风,心型指向性可增强目标方向声音采集、抑制环境噪声。

近场模型的构建至少需要三个麦克风参与,这里以基础的三麦克风模型(如图y1,y2,y3所示)展开分析,如图3所示。

针对仅配置两个麦克风的情形,由于其自身特性限制,仅能够求解方位角,而无法确定方位距离,如图4所示。

本文充分梅尔倒谱系数模块实现对音频进行处理,实现对提取信号的时频域特征,实现对鸟声信号,电锯声信号,枪声信号的识别搭建卷积神经网络模型,模型识别准确率较高。在整个声音识别流程中发现,对数运算和离散余弦运算非常重要,会严重影响到声音识别的效果。此外,本文对声音信号搭建了神经网络模型,测试结果表明鸟声的识别率为90.2%,电锯和枪声的识别率为96.6%,显示鸟声的识别率比较低。在后期的研究中会对神经网络结构进行调整,并进一步优化。

基金项目:

辽宁科技大学大学生创新创业训练计划项目(X202510146100)。

原文链接:https://doi.org/10.12677/csa.2025.159229

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐