跳到主要内容
项目详情

Apache Drill 是 Apache 软件基金会提供的无模式 SQL 查询引擎,面向 Hadoop、NoSQL 数据库和云存储中的多结构数据。它的主要特点是可以在不预先加载数据、创建和维护模式或执行转换的情况下,直接查询原始数据;用户可以在 SQL 中写入 Hadoop 目录、MongoDB 集合或 S3 存储桶的路径。与只面向传统关系型表的查询工具不同,Drill 使用 JSON 数据模型处理复杂和嵌套结构,同时保留标准 SQL、BI 工具连接能力,以及从单台笔记本扩展到大型服务器集群的部署方式。\n\n### 核心功能\n\n#### 多数据源联合查询\nDrill 支持 HBase、MongoDB、MapR-DB、HDFS、MapR-FS、Amazon S3、Azure Blob Storage、Google Cloud Storage、Swift、NAS 和本地文件等数据源。单条查询可以连接多个数据存储,例如把 MongoDB 中的用户资料集合与 Hadoop 中的事件日志目录进行关联。其面向数据存储的优化器会根据数据源能力重新组织查询计划,并支持数据本地性;官网建议将 Drill 与数据存储部署在相同节点上。\n\n#### 无模式原地查询\n传统查询引擎通常需要先加载数据、创建并维护模式,再进行转换处理;Drill 可以直接对原始数据进行查询。查询时只需在 SQL 中包含 Hadoop 目录、MongoDB 集合或 S3 存储桶的路径,不要求预先掌握模式。Drill 还使用查询编译和重新编译技术,在执行过程中根据数据情况工作,从而不依赖前置模式知识。\n\n#### JSON 与复杂嵌套数据处理\nDrill 的 JSON 数据模型用于查询复杂数据、嵌套数据,以及现代应用和非关系型数据存储中常见的快速变化结构。它提供面向复杂数据的 SQL 扩展,使这类数据能够通过查询表达式进行处理。官网还介绍了面向复杂数据的内存分片列式表示,用于结合列式执行速度与 JSON 文档模型的灵活性。\n\n#### 标准 SQL、BI 工具与应用连接\nDrill 支持标准 SQL,业务用户、分析师和数据科学家可以通过 JDBC 与 ODBC 驱动,把 Tableau、Qlik、MicroStrategy、Spotfire、SAS、Excel 等工具连接到非关系型数据存储。虚拟数据集能够把复杂的非关系型数据映射为适合 BI 工具使用的结构,供用户探索和可视化。开发者还可以使用 Drill 的 REST API,在自定义应用中创建可视化。\n\n#### 分布式执行与性能架构\nDrill 既可以在笔记本上运行,也可以部署到由普通服务器组成的集群,并从单机扩展到数千台服务器。其对称架构让所有节点采用相同形态,官网将简单安装和运维作为大型集群部署特点。执行引擎包含支持复杂数据的列式执行、执行时数据驱动的编译与重新编译、用于降低内存占用并消除垃圾回收的内存管理、减少网络流量的本地性感知执行,以及能够在可能时将处理下推到数据存储中的代价优化器。\n\n### 使用方式\n\nDrill 提供下载入口,支持在 Mac、Windows 和 Linux 上运行。官网给出的命令行示例是下载并解压发行包,进入 apache-drill-<version> 目录后执行 bin/drill-embedded,用于在本地启动嵌入式 Drill。生产环境可以将其部署到服务器集群。查询可以通过标准 SQL 完成,也可以通过 JDBC、ODBC 连接 BI 工具,或使用 REST API 接入自定义应用。正文没有提到注册要求、自备模型 Key 或独立客户端。\n\n### 适用人群与场景\n\n需要直接分析非关系型数据的业务用户和数据分析师,可以使用标准 SQL 以及 Tableau、Qlik、MicroStrategy、Spotfire、SAS、Excel 等 BI 工具探索数据。数据科学家可以通过 JDBC 或 ODBC 访问多种数据存储,并使用虚拟数据集整理复杂数据结构。开发者可以使用 REST API 将 Drill 接入自定义应用和可视化项目。需要从笔记本开始验证数据、再扩展到服务器集群的团队,则可以利用 Drill 的本地运行和分布式部署方式。\n\n### 定价\n\n官网正文没有列出价格档位、订阅方案或免费额度。页面提供 Drill 下载,并在版权信息中注明软件采用 Apache License 2.0 授权;具体商业服务或收费方案未在给定正文中说明。\n\n### 注意事项\n\nDrill 面向 Hadoop、NoSQL 和云存储等非关系型数据源,官网列出的连接方式和工具支持以正文内容为准。页面建议在 Drill 与数据存储位于相同节点时利用数据本地性;如果数据存储和 Drill 分离,查询执行的网络流量可能受到部署位置影响。官网同时说明,Drill 的查询示例和能力围绕 JSON、Parquet、MongoDB、HBase、文件系统及云存储等数据展开。

多数据源联合查询支持连接 HBase、MongoDB、HDFS、Amazon S3、Azure Blob Storage、Google Cloud Storage 及本地文件等数据源,并在单条查询中关联多个存储。
无模式原地查询无需预先加载数据、创建维护模式或转换数据,即可在 SQL 中直接指定 Hadoop、MongoDB 或 S3 数据路径进行查询。
复杂 JSON 数据模型使用 JSON 数据模型处理复杂、嵌套和快速变化的数据结构,并提供面向复杂数据的 SQL 扩展。
BI 工具连接通过标准 SQL、JDBC 和 ODBC 连接 Tableau、Qlik、MicroStrategy、Spotfire、SAS、Excel 等 BI 工具。
REST API开发者可以使用简单的 REST API 将 Drill 接入自定义应用并创建可视化。
从单机扩展到集群支持在 Mac、Windows 和 Linux 笔记本上运行,也可以部署到由普通服务器组成的大型集群。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

Apache Drill 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500