国内刊号:11-1964/S
国际刊号:1000-1298
发布日期:
作者:于美玲,周云成,侯玉涵,刘峻渟
单位:沈阳农业大学,沈阳农业大学,沈阳农业大学,沈阳农业大学,
关键词:日光温室;场景识别;特征聚合;视觉 Transformer;图像处理
基金:国家重点研发计划项目(2021YFD1500204、2023YFD1501303)
场景识别可作为温室环境空间定位的替代方案,也是智能农机装备视觉系统的重要功能之一。针对以特征聚类为基础的场景识别范式无法适应高动态变化且高度相似的温室场景识别的问题,提出一种基于深度特征聚合的温室场景识别方法,以预训练的视觉Transformer网络为基础,提取场景图像局部特征,应用多层感知机全局感受野特性,考虑局部特征空间关系,融合图像局部特征,生成场景图像全局描述子,以多重相似性损失最小化为优化目标,构建温室场景识别模型。试验结果表明,模型场景识别R@1(top-1召回率)、R@5和R@10分别达到78.43%、89.21%和92.47%,具有较高的场景识别精度。所提出的基于多层感知机的特征混合方法是有效的,与采用池化操作进行特征聚合相比,R@1提高8.01个百分点。模型对光照条件变化具有一定的鲁棒性,与正常的中等光照条件相比,强光及弱光条件下,R@1下降未超过4.00个百分点。相机视角及采样距离的变化也会影响模型识别性能,20°以内的视角变化,R@1下降6.61个百分点,2倍以内的距离变化,R@1下降17.87个百分点。与现有场景识别基准方法NetVLAD、GeM、Patch-NetVLAD、MultiRes-NetVLAD和MixVPR相比,R@1分别提高7.82、6.59、3.56、4.14、1.88个百分点,在温室场景识别任务上模型性能有较大提升。该研究构建的基于多层感知机的图像全局特征聚合方法,能够生成可靠的全局描述子,用于温室场景识别,且具有一定的光照、视角、距离及时间变化的鲁棒性,研究结果可为智能农机视觉系统设计提供技术参考。
来源:2025年第2期
《农业机械学报》期刊编辑部