【免费】Spark内存管理及缓存策略研究-发表之家

Spark内存管理及缓存策略研究

作者：孟红涛; 余松平; 刘芳; 肖侬国防科学技术大学计算机学院

大数据 spark内存管理 rdd缓存缓存策略

摘要：Spark系统是基于Map-Reduce模型的大数据处理框架。Spark能够充分利用集群的内存,从而加快数据的处理速度。Spark按照功能把内存分成不同的区域:Shuffle Memory和Storage Memory,Unroll Memory,不同的区域有不同的使用特点。首先,测试并分析了Shuffle Memory和Storage Memory的使用特点。RDD是Spark系统最重要的抽象,能够缓存在集群的内存中;在内存不足时,需要淘汰部分RDD分区。接着,提出了一种新的RDD分布式权值缓存策略,通过RDD分区的存储时间、大小、使用次数等来分析RDD分区的权值,并根据RDD的分布式特征对需要淘汰的RDD分区进行选择。最后,测试和分析了多种缓存策略的性能。

注：因版权方要求，不能公开全文，如需全文，请咨询杂志社

学术咨询免费咨询杂志订阅

热门期刊服务

Journal of Systems Science and Complexity Chinese Optics Letters 中国ESP研究 Advances in Atmospheric Sciences Pedosphere Research in Astronomy and Astrophysics Chinese Physics C Plasma Science and Technology Chinese Physics B Applied Geophysics Journal of Geographical Sciences Petroleum Science

计算机科学

影响因子：0.94

期刊级别：北大期刊

发行周期：月刊

服务介绍

Spark内存管理及缓存策略研究

计算机科学

期刊咨询

订阅杂志

期刊推荐