开源大数据流水线系统 PiFlow V0.9 发布

PiFlow是一个基于分布式计算框架Spark开发的大数据流水线系统。该系统将数据的采集、清洗、计算、存储等各个环节封装成组件,以所见即所得方式进行流水线配置。简单易用,功能强大。本次版本更新如下特性:

  1. 增加可视化分析功能,包括线性图、柱状图、饼状图、散点图;
  2. 增加可编程特性,无缝衔接上下游组件,按需在线开发和调试;
  3. 增加多语言特性,支持Scala、Python、Shell等多种语言的编程;
  4. 增加Spark依赖jar包管理

Gitee地址: https://gitee.com/opensci/piflow
GitHub地址: https://github.com/cas-bigdatalab/piflow

1)可视化分析

2)可编程+多语言

扫描二维码关注公众号,回复: 12112975 查看本文章

3)Spark jar包管理

猜你喜欢

转载自www.oschina.net/news/122092/piflow-0-9-released