王妍玮教授:基于SegFormer-CG的煤矸石识别技术

创新点

(1)提出一种轻量级煤矸石识别模型——SegFormer-CG。通过对原模型解码器进行改进,引入ODConvBottleneck、DSASPP和CCA注意力机制,显著增强模型对煤矸石目标的特征提取与识别能力。

(2)引入深度可分离卷积技术,有效降低模块的参数量与计算量。所提模型不仅能够快速准确地识别煤矸石,还能同时获取其清晰的边界轮廓,实现了识别与分割的集成。

(3)在加噪、运动模糊和低光照等复杂工况下,模型依然保持良好的识别稳定性,并对新疆、陕西矿区样本表现出良好的泛化能力。该研究为选矸机器人实现高效、可靠的煤矸石识别提供了有力的技术支撑。

基于SegFormer-CG的煤矸石识别技术
作者:王妍玮1,2, 陶文彬1,2, 陈凯云1,2, 孟祥林1,2, 张玉1,2
单位:1. 黑龙江科技大学 机械工程学院; 2. 黑龙江省光学三维测量与检测重点实验室

研究背景

煤矸石是煤矿开采和加工过程中排放的固体废弃物,其主要成分包括岩石、矿物及少量煤炭。煤矸石在堆积和运输过程中不仅占用大量土地资源,还会对环境造成污染。因此,对煤矸石的高效识别和分离在煤矿开采领域具有重要意义。传统的煤矸石识别技术通常依赖于人工选矸、跳汰选矸和重介质选矸,这些方法效率低下,准确性不足且浪费资源,难以满足现代工业的需求。

近年来,越来越多的专家和学者投身于煤矸石分选智能化研究,煤矸石识别技术发展十分迅速。常见的煤矸石识别方法有射线法、声波振动法和图像识别法。射线法是通过分析射线(如X射线、γ射线等)穿透物质后的衰减特性,来推断物质的内部结构或成分,精度较高,但设备成本高,占地面积较大,且存在一定安全隐患。声波振动法利用煤和矸石在声波或振动下的响应差异进行识别,受环境噪声影响较大,实际应用仍有难度。

随着计算机视觉和深度学习技术的发展,基于图像识别的方法逐渐成为研究热点。在煤矸石分选领域,深度学习的图像识别算法主要包括卷积神经网络(Convolutional Neural Network, CNN)和基于Transformer架构的算法。CNN作为早期主流的图像识别技术,因其局部感受野的特点,能够有效捕捉图像中的局部特征,广泛应用于目标检测和语义分割。然而,煤矸石分选场景中通常存在复杂背景和小目标分布的问题,传统CNN模型在提取全局特征和处理多尺度信息方面存在一定局限性。目前也有很多研究人员使用CNN模型进行煤矸石识别任务。沈科等通过引入自校正卷积(Self-Calibrated Convolutions, SCConv)和精简YOLOv5s模型的Neck区域,有效提升了煤矸石目标检测的速度,采用K-means算法优化锚框尺寸,进一步提高了检测精度。张释如等通过引入空洞卷积和残差块改进了YOLOv5模型,有效增强了模型对煤矸石特征的提取能力。同时,采用AdaBelief优化算法提高了模型的收敛速度和识别精度。李德永等针对煤矿高噪声、低照度、运动模糊和大批量煤和矸石混杂等复杂工况环境,通过改进YOLOv5s模型采用ConvNeXt V2特征提取模块,使模型获得较高识别精度。滕文想等提出了一种针对煤矿井下复杂环境的煤矸石识别算法,通过HGNetv2网络替换YOLOv8n主干网络并嵌入三重注意力机制,显著提高了煤矸石识别的精度。燕碧娟等将YOLOv5s模型的主干网络C3模块替换为FasterNet Block结构,在颈部引入SimAM注意力机制,提高了检测精度和实时性。WANG等提出了一种基于PSPNet的改进语义分割网络SSNet_CG,用于快速识别多尺度、粘连和半遮挡条件下的煤矸石。刘敬敬等提出基于YOLOv8的轻量化煤屑颗粒群分割方法,引入动态蛇形卷积与自适应特征融合,提升精度同时降低参数量与运算量。程德强等改进UNet模型,引入了压缩激励空洞空间金字塔池化模块和基于Transformer的多路迭代编码器,解决了煤粒漏分割和过分割问题。袁永等提出了一种结合特征金字塔网络和空洞空间金字塔池化的改进UNet煤矸石分割模型,显著提高了煤矸石图像的识别精度。近年来,基于Transformer算法,凭借其强大的全局建模能力,在计算机视觉任务中展现了优异的性能。通过自注意力机制,Transformer能够捕捉图像中不同位置之间的长距离依赖关系,为复杂场景中的目标识别提供了新的解决方案。

在煤矿选矸场景中,常常存在低照度、快速运动以及粉尘干扰等多种工况,这对传统图像识别算法构成了极大挑战。基于卷积神经网络(CNN)的模型在本地特征提取方面具有优势,但在长距离依赖建模、尺度变化适应方面存在天然劣势。例如,目标尺寸较小或被遮挡时,CNN难以获取全局信息,易造成特征丢失。近年来,基于Transformer的图像识别模型,如ViT、Swin Transformer因其强大的全局建模能力,在复杂场景下显示出更强的表现力。然而此类模型参数量大、计算复杂度高,不易在煤矿边缘设备或嵌入式平台中实时运行。因此,笔者在采用轻量级Vision Transformer架构的SegFormer基础上引入多模块融合策略,提出SegFormer-CG模型,重点解决在煤矿复杂工况下的精度、实时性之间的平衡问题。

摘要

煤矸石分选机器人对煤矿智能化发展意义重大,煤矸石识别是煤矸石分选机器人的核心技术,针对传统识别技术在面对高噪声、运动模糊等复杂工况时,存在识别效率低、准确性不足的问题,提出一种基于SegFormer-CG的煤矸石识别技术,以提升识别的实时性和准确率。该模型的编码器采用 SegFormer 的Transformer架构提取多尺度特征,并以轻量级的MiT-B0作为编码器,解码器设计融合模块以增强语义分割性能。在解码器的C1、C2、C3特征图后引入瓶颈模块(Bottleneck)增强模型特征提取能力,并采用深度可分离卷积(Depthwise Separable Convolution, DSConv)与全维度动态卷积(Omni-Dimensional Dynamic Convolution, ODConv)改进瓶颈模块,降低参数量与计算量;同时在C4特征图引入空洞空间金字塔池化(Atrous Spatial Pyramid Pooling, ASPP)模块,并采用深度可分离卷积和5×5卷积对ASPP改进,提升模型多尺度融合能力;在C3、C4特征图后加入交叉注意力机制(Criss-Cross Attention, CCA)使模型聚焦于关键信息,增强模型关键特征提取能力。训练采用2阶段迁移学习策略,先冻结主干网络进行50轮特征适配训练,再解冻全局参数进行优化,有效增强模型对煤矸石图像的泛化能力。结果表明:SegFormer-CG模型的精确率达到96.39%,召回率达到96.29%,平均交并比达到93.03%,相较原模型精确率提升1.32%,召回率提升0.59%,平均交并比提升1.73%。参数量为5.14×106,浮点计算量为5.90×109,帧率为50.92 帧/s。与其他常见模型如PSPNet、DeepLabV3+和UNet对比,SegFormer-CG模型均取得更优秀的识别效果,且在参数量、浮点计算量上都有明显优势,在加噪、运动模糊和低光照的复杂工况下仍保持稳定识别效果,且对新疆、陕西矿区样本具有泛化能力,为选矸机器人高效识别提供了可靠技术支持。

CCA结构

 SegFormer-CG结构

数据集图片

损失函数对比

SegFormer-CG模型泛化性测试

 

相关推荐

暂无评论

发表评论

您的电子邮件地址不会被公开,必填项已用*标注。