This paper presents a benchmark of stream processing throughput comparing Apache Spark Streaming (under file-, socket- and Kafka-based stream integration), with a prototype P2P stream processing framework, HarmonicIO. Maximum throughput for broad range of stream processing loads are measured, in particular, those with large message sizes (up to 10MB), and heavy CPU load -- loads more typical of scientific computing use cases (such as microscopy), than enterprise contexts. A detailed exploration of the performance characteristics of these integrations under varying loads reveals a complex interplay of performance trade-offs, uncovering the boundaries of good performance for each framework and integration. Based on these results, we suggest which frameworks and integrations are likely to offer good performance for a given load. Broadly, the advantages of Spark's rich feature set comes at a cost of sensitivity to message size in particular, whereas the simplicity of HarmonicIO offers more robust performance, especially for raw CPU utilization.


翻译:本文介绍了将Apache Spark Streaming(在文件、套接和基于Kafka的流流集成下)与原型P2P流处理框架 " 和谐组织 " 比较的溪流处理输送量基准。测量了广泛的溪流处理负荷的最大输送量,特别是信息大小大(高达10MB)和重的CPU负荷 -- -- 科学计算使用案例(如显微镜)比企业环境更典型的负荷。详细探讨不同负荷下这些集成的性能特点,揭示了业绩权衡的复杂相互作用,揭示了每个框架和集成的良好性能界限。基于这些结果,我们建议哪些框架和集成有可能为特定负荷提供良好的性能。广而言,Spark的丰富功能组合的优势是以对信息大小特别敏感为代价的,而HarmonicIO的简单化提供了更强有力的性能,特别是用于原始CPU的利用。

0
下载
关闭预览

相关内容

专知会员服务
59+阅读 · 2020年3月19日
【新书】Java企业微服务,Enterprise Java Microservices,272页pdf
专知会员服务
158+阅读 · 2020年1月16日
开源书:PyTorch深度学习起步
专知会员服务
49+阅读 · 2019年10月11日
Transferring Knowledge across Learning Processes
CreateAMind
26+阅读 · 2019年5月18日
Call for Participation: Shared Tasks in NLPCC 2019
中国计算机学会
5+阅读 · 2019年3月22日
【TED】生命中的每一年的智慧
英语演讲视频每日一推
9+阅读 · 2019年1月29日
人工智能 | SCI期刊专刊信息3条
Call4Papers
5+阅读 · 2019年1月10日
大数据 | 顶级SCI期刊专刊/国际会议信息7条
Call4Papers
10+阅读 · 2018年12月29日
医学 | 顶级SCI期刊专刊/国际会议信息4条
Call4Papers
5+阅读 · 2018年12月28日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
16+阅读 · 2018年12月24日
disentangled-representation-papers
CreateAMind
26+阅读 · 2018年9月12日
人工智能类 | 国际会议/SCI期刊专刊信息9条
Call4Papers
4+阅读 · 2018年7月10日
人工智能 | 国际会议/SCI期刊约稿信息9条
Call4Papers
3+阅读 · 2018年1月12日
TResNet: High Performance GPU-Dedicated Architecture
Arxiv
7+阅读 · 2020年3月30日
Arxiv
3+阅读 · 2018年3月2日
Arxiv
5+阅读 · 2015年9月14日
VIP会员
相关资讯
Transferring Knowledge across Learning Processes
CreateAMind
26+阅读 · 2019年5月18日
Call for Participation: Shared Tasks in NLPCC 2019
中国计算机学会
5+阅读 · 2019年3月22日
【TED】生命中的每一年的智慧
英语演讲视频每日一推
9+阅读 · 2019年1月29日
人工智能 | SCI期刊专刊信息3条
Call4Papers
5+阅读 · 2019年1月10日
大数据 | 顶级SCI期刊专刊/国际会议信息7条
Call4Papers
10+阅读 · 2018年12月29日
医学 | 顶级SCI期刊专刊/国际会议信息4条
Call4Papers
5+阅读 · 2018年12月28日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
16+阅读 · 2018年12月24日
disentangled-representation-papers
CreateAMind
26+阅读 · 2018年9月12日
人工智能类 | 国际会议/SCI期刊专刊信息9条
Call4Papers
4+阅读 · 2018年7月10日
人工智能 | 国际会议/SCI期刊约稿信息9条
Call4Papers
3+阅读 · 2018年1月12日
Top
微信扫码咨询专知VIP会员