SparkSQL 之 Spark On Hive 原理分析及配置

📅 2026/8/21 10:18:32
SparkSQL 之 Spark On Hive 原理分析及配置
摘要Spark on Hive 与 Hive on Spark 常被混淆——前者 Spark 是主角访问 Hive 元数据后者 Hive 用 Spark 作执行引擎。本文从 enableHiveSupport() 启动流程、HiveExternalCatalog、Metastore 集成、SerDe/UDF、Thrift Server 多用户方案、以及两者对比六个维度全面解析。关键词Spark on Hive, enableHiveSupport, Hive Metastore, HiveExternalCatalog, Thrift Server一、开篇Spark on Hive ≠ Hive on SparkSpark on Hive: Spark 是主角 → enableHiveSupport() 访问 Metastore 获取表结构 → Spark 引擎读写 Hive 表 Hive on Spark: Hive 是主角 → set enginespark HiveServer2 接收 HQL → RSC → Spark Executor二、架构全景enableHiveSupport() 做了什么valsparkSparkSession.builder().config(spark.sql.warehouse.dir,hdfs://...).enableHiveSupport()// ← 核心入口.getOrCreate()// ① 加载 hive-site.xml// ② 创建 HiveSessionStateBuilder// ③ 实例化 HiveExternalCatalog → 连接 Metastore// ④ 加载 Hive UDF · Hive SerDe// ⑤ spark.sql(show tables) 直接查询 Hive 表Metastore 集成spark.sql(SELECT * FROM hive_db.hive_table)// 直接查 Hive 表spark.table(hive_db.hive_table)// DataFrame API// 与 Hive 共享同一套元数据数据写入 HDFS Warehouse三、核心对比Spark on HiveHive on Spark主角SparkHive入口enableHiveSupport()set enginesparkSQL接口spark.sql()Beeline→HiveServer2优化器Catalyst(更强)Hive OptimizerJDBC服务Thrift Server(10016)HiveServer2(10000)四、Thrift Server$SPARK_HOME/sbin/start-thriftserver.sh\--masteryarn--executor-memory 4g# Beeline: jdbc:hive2://host:10016五、完整配置!-- hive-site.xml --hive.metastore.uristhrift://host:9083// spark-defaults.confspark.sql.warehouse.dirhdfs://...spark.sql.catalogImplementationhive spark.sql.hive.convertMetastoreParquettrue作者starzy博客blog.starzy.cnGitHubstarzy1990.github.io专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践