字节跳动日前宣布开源其云原生数据湖引擎DLF(Data Lake Formation),该引擎旨在简化数据湖的构建与管理,支持多种计算引擎如Spark、Presto等,并提供统一的元数据管理、数据入湖、数据探索等功能。DLF已在字节跳动内部大规模应用,管理着EB级数据。
DLF的核心特性包括:基于Apache Hive Metastore的元数据服务,支持多集群共享;提供自动化数据入湖工具,支持全量及增量同步;集成数据权限与审计功能,保障数据安全。开源版本遵循Apache 2.0协议,已在GitHub上发布。
此次开源有望降低企业构建数据湖的技术门槛,推动云原生数据湖生态发展。字节跳动表示将持续投入社区建设,与开发者共同完善DLF。