Scala 语言基础 和 Spark SQL 的基本操作
1. Scala 基础数据结构
-
元组(Tuple):
-
使用
val a = (1, "hello", true, 3.5)创建了一个包含不同类型元素的元组。
通过a._1、a._2等方式访问元组中的元素。
-
数组(Array):
-
使用
Array(1, 2, 3, 4, 5)创建整型数组。
注意:数组末尾不能有多余的逗号(否则会报错)。
通过下标访问数组元素,如array(2)返回3。
-
列表(List):
-
使用
List存储多个元组,每个元组表示一个人的信息(姓名、性别、年龄)。
2. Spark DataFrame 的创建与展示
-
从列表创建 DataFrame:
使用spark.createDataFrame(list)将列表转换为 DataFrame。
使用.toDF("name", "gender", "age")为列命名。
-
展示 DataFrame:
使用df.show()默认显示所有数据。
使用df.show(2)或df.show(1)控制显示的行数。
3. 从 JSON 文件读取数据
-
使用
spark.read.json("file:///opt/data/student.json")读取本地 JSON 文件。 -
读取后自动推断结构,生成包含
age、college、name等字段的 DataFrame。 -
使用
student.show展示数据内容。 -

4. 从 CSV 文件读取数据:
· 使用 `spark.read_csv("file:///opt/data/book.csv")` 读取本地 CSV 文件
· 读取后生成包含 _c0、_c1 等默认字段的 DataFrame
· 使用 `book.show` 展示数据内容,显示图书的 id、name、rating、price、publish、url 等信息

· 通过 `book.show(2)` 只显示前 2 行数据
· 最后使用 `spark.read.option("header","true").csv(p2)` 正确指定表头重新读取文件

更多推荐


所有评论(0)