SparkSQL对查询的SQL,需要扫描全部的数据,然后获取满足查询条件的记录。如果在海量的数据中,命中的记录个数比较小,查询的时间主要在读取数据。 为了加速响应时间,我们对存储在hdfs上的海量数据的指定字段,建立索引,存储在Elasticsearch中;对于每一个SQL查询,提取出索引字段的查询条件,然后通过Elasticsearch得到满足条件的记录的路径,Spark直接读取记录,实现了海量数据的查询,秒级响应。
浏览1551次
浏览10277次
浏览8839次
浏览7753次
浏览7586次
浏览11572次
2025-04-25 深圳
2025-04-25 上海
2025-08-22 深圳
2025-04-11 广州
打开微信扫一扫,分享到朋友圈
Text