优化您的数据湖仓以满足 AI 需求:深入了解 RisingWave 与 MinIO

RisingWave 是一个开源流式数据库,位于现代数据湖仓的处理层,旨在提供高性能和可扩展性。RisingWave 的设计初衷是允许开发人员对流式数据运行 SQL 查询。鉴于 SQL 是数据工程的通用语言,此功能至关重要。它拥有一个强大的架构,包括计算节点、元数据节点和压缩节点,所有这些都针对 AI 的基础高吞吐量和低延迟操作进行了优化,例如数据质量、数据探索和预处理。请记住,您的 AI 计划的成效取决于您的数据质量。
RisingWave 将自己定位为 Apache Flink 和 ksqlDB 的替代方案,并且与该领域的其他 Kubernetes 原生技术配合良好;特别是那些也为 速度 和 规模 而构建的技术。本博文展示了使用 Docker Compose 在 RisingWave 和 MinIO 之间进行实现。
先决条件
您需要在系统上安装 Docker Desktop。下载并安装适合您操作系统的版本,然后通过打开终端并运行以下命令来检查您是否已正确安装
docker-compose --version
您还需要一个 PostgreSQL 客户端,即 psql
。请根据您的操作系统按照 这些 指示进行操作。
接下来,在终端窗口中克隆 RisingWave 存储库并导航到包含 docker-compose 文件的文件夹
git clone https://github.com/risingwavelabs/risingwave.git
cd risingwave/docker
启动服务
使用以下命令启动 RisingWave 和 MinIO 服务
docker-compose up -d
当您使用此 Docker Compose 文件执行 docker-compose up 时,Docker Compose 会协调多个互连服务的部署,包括 risingwave-standalone
、etcd-0
、minio-0
、prometheus-0
、grafana-0
和 message_queue
。它根据指定的设置(如镜像源、环境变量、卷映射和端口绑定)配置每个服务。服务之间的依赖关系得到管理,以确保正确的启动顺序。网络设置允许内部通信,而健康检查则监控服务的稳定性。资源限制和重启策略用于维持性能和可靠性。从本质上讲,此命令设置了一个复杂的、多服务应用程序环境,该环境针对定义的配置量身定制。
访问 RisingWave、Grafana 和 MinIO
成功启动服务后,您可以访问 http://127.0.0.1:5691 上的 RisingWave 仪表板以查看集群状态并管理流式源、接收器和查询。
访问 http://127.0.0.1:9400 上的 MinIO Web 界面。使用默认凭据(用户名:hummockadmin
,密码:hummockadmin
)登录。您会看到已创建了一个名为 hummock001
的存储桶。
访问 http://127.0.0.1:3001/ 上的 Grafana,导航到左侧的“仪表板”菜单。找到 risingwave_dashboard
。在此仪表板中,您可以访问多个内部指标,包括节点数、内存使用情况、吞吐量和延迟。这些指标对于诊断和提高集群性能非常有价值。
执行 SQL
通过在终端窗口中运行以下命令,使用 psql
连接到 RisingWave
psql -h localhost -p 4566 -d dev -U root
现在,您可以开始使用此集成。以下示例查询将帮助您开始在 Rising Wave 上执行 SQL。运行以下命令以创建一个名为 purchase records
的表
CREATE TABLE purchase_records (
purchase_id int,
product_id int,
customer_id int,
amount_spent real,
purchase_date date
);
运行此命令以将数据插入到您刚刚创建的表中
INSERT INTO purchase_records (purchase_id, product_id, customer_id, amount_spent, purchase_date)
VALUES
(1, 301, 3001, 120.5, '2023-05-10'),
(2, 301, 3002, 150.0, '2023-05-10'),
(3, 301, 3003, 80.0, '2023-05-10'),
(4, 302, 3001, 220.2, '2023-06-15'),
(5, 302, 3003, 110.0, '2023-06-15');
从该表创建一个物化视图,并进行一些聚合以进一步探索数据
CREATE MATERIALIZED VIEW product_spending_summary AS
SELECT
product_id,
AVG(amount_spent) AS average_spent,
COUNT(amount_spent) AS total_purchases
FROM
purchase_records
GROUP BY
product_id;
通过运行以下 SQL 查询以从物化视图中选择所有内容来查看您已编译的数据:
SELECT * FROM product_spending_summary;
您可以返回到 http://127.0.0.1:9400 上的 MinIO 以查看您创建的物化视图和表中的对象是否已填充您的对象存储。
扩展本教程
将 RisingWave 与 MinIO 集成,为开发人员构建和扩展实时分析应用程序提供了强大的解决方案。这种组合提供了处理大量数据流所需的可靠性和可扩展性。通过按照上述步骤,您可以设置一个利用 RisingWave 和 MinIO 优势的环境。与所有 Kubernetes 原生软件一样,如果您愿意,也可以使用 Kubernetes 部署此集成。无论您是在运行复杂的查询还是管理庞大的数据集,这种服务的组合都能确保您具备应对现代数据处理挑战的能力,并确保您的组织为 AI 计划做好准备。