国内刊号:11-1964/S
国际刊号:1000-1298
发布日期:
作者:崔晓晖,师栋瑜,陈志泊,许福
单位:北京林业大学,北京林业大学,北京林业大学,北京林业大学,
关键词:林业文本;文本分类;大数据分析;Spark;XGBoost
基金:国家自然科学基金项目(61772078)和北京林业大学热点追踪项目(2018BLRD18)
针对当前“互联网+”技术与林业的交叉融合,涌现出海量待挖掘的涉林文本,而林业文本分类的相关研究尚不成熟的问题,使用网络爬虫技术面向互联网采集涉林文本,基于丰富的语料重新构建分类标签,提出基于Spark计算框架的XGBoost并行化方法,对林业文本进行分类。经由交叉验证,构建的XGBoost并行分类算法准确率为0.9234,在各类别中最低F?1为0.8604,最高为0.9984;其在2.1万条、4.2万条、8.4万条数据集上的训练加速比分别为2.13、3.47、3.82。结果表明,基于该标签设定的分类模型对现存互联网中涉林文本的适应性较好;Spark环境下实现的XGBoost并行化算法的准确率显著优于其他4种机器学习(朴素贝叶斯、GBDT决策树、BP神经网络和ELM神经网络算法)的并行化算法,算法执行效率远高于单机版本,且数据量越大,其加速比越高,能有效应对海量林业文本的实时、准确分类。
来源:2019年第6期
《农业机械学报》期刊编辑部