跳到主要内容
项目详情

Apache SystemDS 是一个面向端到端数据科学生命周期的开源机器学习系统。它覆盖从数据集成、数据清洗和特征工程,到机器学习模型训练、部署与服务的完整流程。与只聚焦单一建模环节的工具不同,SystemDS 通过一组采用类似 R 语法的声明式语言,面向数据科学生命周期中的不同任务,也面向具有不同专业经验的用户。用户编写的高级脚本会被编译为混合执行计划,在本地内存中的 CPU 与 GPU 操作、以及基于 Apache Spark 的分布式操作之间进行组织。

核心功能

数据集成、清洗与特征工程

SystemDS 将数据集成、数据清洗和特征工程纳入同一个数据科学生命周期中。官网将这些步骤列为模型训练之前的处理环节,说明它并非只提供单独的模型计算能力,而是覆盖从数据准备开始的连续工作流。

机器学习模型训练

系统支持机器学习模型训练,并将训练作为端到端流程中的核心阶段。训练可以通过高级声明式脚本表达,脚本随后会转换为适合执行的计划。

本地 CPU 与 GPU 执行

SystemDS 的执行计划可以包含本地、内存中的 CPU 和 GPU 操作。由此,脚本中的任务能够使用本地计算资源完成相应处理;官网将 CPU 与 GPU 都列为其混合执行计划支持的操作类型。

基于 Apache Spark 的分布式执行

除本地执行外,SystemDS 也支持在 Apache Spark 上进行分布式操作。官网将本地内存计算与 Spark 分布式操作放在同一套混合执行计划中,体现了系统对不同执行方式的组织能力。

声明式语言与 R-like 语法

SystemDS 提供采用 R-like syntax 的声明式语言栈。语言栈面向数据科学生命周期中的不同任务,也面向不同专业程度的用户;用户通过高级脚本描述任务,再由系统编译为执行计划,而不是直接编写底层执行操作。

部署与服务

部署和服务是 SystemDS 所覆盖的生命周期后续阶段。官网将模型训练之后的 deployment and serving 纳入系统定位,因此其产品范围从数据处理和训练延伸到模型的部署与提供服务。

使用方式

官网提供 SystemDS 下载入口,并为新用户提供快速安装指南,用于设置环境并开始使用系统;同时提供文档入口。使用形态上,官网明确说明用户通过高级脚本使用声明式语言,脚本可编译为本地 CPU、GPU 或 Apache Spark 分布式操作组成的执行计划。正文未说明是否需要注册、是否需要自备模型 Key,也未列出额外导入导出方式。

适用人群与场景

SystemDS 面向参与端到端数据科学生命周期的用户。需要处理数据集成、清洗和特征工程,并继续进行机器学习模型训练的用户,可以使用它组织这些阶段;需要在本地 CPU、GPU 与 Apache Spark 分布式环境之间执行数据科学任务的用户,可以使用其混合执行计划;具有不同专业程度的数据科学用户,则可以通过 R-like 声明式语言编写高级脚本。对希望参与项目开发的人,官网提供开发者邮件列表、社区信息和路线图入口。

注意事项

官网正文说明 SystemML 已更名为 SystemDS,原因是产品关注点转向端到端数据科学生命周期。正文未提供具体价格、免费额度、用户规模或性能数字,也未说明注册要求、模型 Key 要求和数据处理限制。

端到端数据科学流程覆盖数据集成、清洗、特征工程、模型训练、部署与服务。
声明式语言提供采用 R-like 语法的声明式语言栈,面向不同任务和不同专业程度的用户。
混合执行计划将高级脚本编译为本地 CPU、GPU 及 Apache Spark 分布式操作组成的执行计划。
本地与分布式计算支持本地内存中的 CPU 和 GPU 操作,也支持基于 Apache Spark 的分布式操作。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

Apache SystemDS 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500