spark实时流处理 spark 流

转载

云端筑梦师 2023-08-08 07:49:31

文章标签 spark实时流处理 spark 大数据 hadoop Streaming 文章分类 Spark 大数据

一、Spark Streaming 是什么 ?

spark实时流处理 spark 流_Streaming

Spark 流使得构建可扩展的容错流应用程序变得更加容易。

Spark Streaming 用于流式数据的处理。Spark Streaming 支持的数据输入源很多，例如：Kafka、Flume、Twitter、ZeroMQ 和简单的 TCP 套接字等等。数据输入后可以用 Spark 的高度抽象原语，如：map、reduce、join、window 等进行运算。而结果也能保存在很多地方，如 HDFS，数据库等。

spark实时流处理 spark 流_Streaming_02

和 Spark 基于 RDD 的概念很相似，Spark Streaming 使用离散化流 (discretized stream)作为抽象表示，叫作 DStream。DStream 是随时间推移而收到的数据的序列。在内部，每个时间区间收到的数据都作为 RDD 存在，而 DStream 是由这些RDD 所组成的序列(因此得名“离散化”)。所以简单来将，DStream 就是对 RDD 在实时数据处理场景的一种封装。

二、Spark Streaming 的特点

➢ 易用

spark实时流处理 spark 流_spark_03

➢ 容错

spark实时流处理 spark 流_Streaming_04

➢ 易整合到 Spark 体系

spark实时流处理 spark 流_spark_05

二、Spark Streaming 架构

1. 架构图

➢ 整体架构图

spark实时流处理 spark 流_Streaming_06

➢ SparkStreaming 架构图

spark实时流处理 spark 流_spark_07

2. 背压机制

Spark 1.5 以前版本，用户如果要限制 Receiver 的数据接收速率，可以通过设置静态配制参数“spark.streaming.receiver.maxRate”的值来实现，此举虽然可以通过限制接收速率，来适配当前的处理能力，防止内存溢出，但也会引入其它问题。比如：producer 数据生产高于 maxRate，当前集群处理能力也高于 maxRate，这就会造成资源利用率下降等问题。

为了更好的协调数据接收速率与资源处理能力，1.5 版本开始 Spark Streaming 可以动态控制数据接收速率来适配集群数据处理能力。背压机制（即 Spark Streaming Backpressure）: 根据 JobScheduler 反馈作业的执行信息来动态调整 Receiver 数据接收率。

通过属性“spark.streaming.backpressure.enabled”来控制是否启用 backpressure 机制，默认值false，即不启用。

本文章为转载内容，我们尊重原作者对文章享有的著作权。如有内容错误或侵权问题，欢迎原作者联系我们进行内容更正或删除文章。