首页 期刊 计算机与数字工程 基于Spark Streaming的在线KMeans聚类模型研究 【正文】

基于Spark Streaming的在线KMeans聚类模型研究

作者:侯敬儒; 吴晟; 李英娜 昆明理工大学信息工程与自动化学院; 昆明650500
mapreduce   spark   streaming   在线计算   低延迟  

摘要:针对基于MapReduce框架处理海量数据实时响应能力较差的问题,设计并实现了基于Spark Streaming的在线计算模型进行大规模的KMeans聚类分析。该模型将整个过程分为数据接入、在线训练等模块,各模块通过数据流连通形成任务实体,提交到Spark分布式集群运行完成。通过比对分析实验和性能检测,验证了该在线KMeans聚类模型具有高吞吐、低延迟的优势,且集群运行状况良好。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

学术咨询 免费咨询 杂志订阅