在流处理之前,数据通常存储在数据库,文件系统或其他形式的存储系统中。应用程序根据需要查询数据或计算数据。这就是传统的静态数据处理架构。Hadoop 采用 HDFS 进行数据存储,采用 MapReduce 进行数据查询或分析,这就是典
阅读全文
弹性式数据集RDDs
RDD 全称为 Resilient Distributed Datasets,是 Spark 最基本的数据抽象,它是只读的、分区记录的集合,支持并行操作,可以由外部数据集或其他 RDD 转换而来,它具有以下特性:
阅读全文
Spark SQL JOIN
本文主要介绍 Spark SQL 的多表连接,需要预先准备测试数据。分别创建员工和部门的 Datafame,并注册为临时视图,代码如下:
阅读全文
聚合函数Aggregations
注:emp.json 可以从本仓库的resources 目录下载。
阅读全文
Spark SQL 外部数据源
Spark 支持以下六个核心数据源,同时 Spark 社区还提供了多达上百种数据源的读取方式,能够满足绝大部分使用场景。
阅读全文
DataFrame和Dataset简介
Spark SQL 是 Spark 中的一个子模块,主要用于操作结构化数据。它具有以下特点:
阅读全文
集合
Scala 中拥有多种集合类型,主要分为可变的和不可变的集合两大类:
阅读全文
隐式转换和隐式参数
隐式转换指的是以 implicit 关键字声明带有单个参数的转换函数,它将值从一种类型转换为另一种类型,以便使用之前类型所没有的功能。示例如下:
阅读全文
继承和特质
Scala 中继承关系如下图:
阅读全文
类型参数
Scala 支持类型参数化,使得我们能够编写泛型程序。
阅读全文