目前在很多企业的数据分析任务中,常见几百上千列的宽表数据。这些宽表通常数据量巨大、存储在HDFS等分布式文件系统中。HDFS上宽表存储优化重要且具有挑战。宽表在数据分析中的可以避免一些频繁的连接操作,在用户画像、数据挖掘负载中,宽表也是一种高效的数据存取方式。对于宽表上的分析型负载,列存储可以有效减少不必要的I/O、提高数据压缩效果。HDFS上也已经有RC File、ORC、Parquet等成熟的列存储格式,但这些存储格式的设计只考虑了传统的数据分析负载,并没有针对宽表做深入的研究和优化。本工作介绍了HDFS上宽表列存储的特征和优化方法。该工作已在微软Bing日志分析产品中应用,并发表在SIGMOD 17上。
浏览1628次
浏览1427次
浏览5218次
浏览10778次
浏览4209次
浏览6872次
2025-01-08 昆明
2025-04-19 南京
2024-12-27 上海
2025-10-23 上海
打开微信扫一扫,分享到朋友圈