AWSGlue中没有选择XML作为数据源的选项 _编程开发

AWSGlue中没有选择XML作为数据源的选项

创始人

2024-09-25 18:02:16

0次

AWS Glue 默认不支持使用 XML 字符串或 XML 文件作为数据源。但是可以使用 Spark SQL 的 XML 数据源库来读取 XML 数据。以下是使用 Spark SQL 读取 XML 文件的步骤。

首先需要将 XML 文件上传到 S3 存储桶中。
在 AWS Glue 的“Crawlers”页面创建一个新的爬虫，并配置数据源为 S3 存储桶中的 XML 文件。运行该爬虫，让 AWS Glue 自动推断出 XML 文件的模式和架构。
在 AWS Glue 的“Jobs”页面创建一个新的作业，选择使用 Spark 开发的“Scala”或“Python”语言。
在作业代码中，可以使用以下代码示例中的 PySpark 代码来读取 XML 文件并将其转换为 DataFrame。

from pyspark.sql.functions import from_xml
from pyspark.sql.types import StructType, StructField, StringType

inputPath = "s3://my-bucket/path/to/xml/file.xml"
outputPath = "s3://my-bucket/path/to/output/folder/"

customSchema = StructType([
    StructField("_id", StringType(), True),
    StructField("title", StringType(), True),
    StructField("author", StringType(), True),
    StructField("description, StringType(), True),
    StructField("price", StringType(), True)
])

df = spark.read.format("xml") \
    .schema(customSchema) \
    .option("rootTag", "books") \
    .option("rowTag", "book") \
    .load(inputPath)

df.write.mode("overwrite").format("parquet").save(outputPath)

运行作业并等待作业完成。
生成的 Parquet 文件将保存到 S3 存储桶中的指定路径。

使用以上方法，即可在 AWS Glue 中读取 XML 文件并将其转换为 Parquet 文件。

上一篇：AWSGlue中long类型存在时创建struct的问题

下一篇：AWSGlue中使用NLTK的方法是什么？

AWSGlue中没有选择XML作为数据源的选项

相关内容

热门资讯