国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:朱小杰, 赵子豪, 杜一
单位:1.中国科学院 计算机网络信息中心,北京 100190;2.中国科学院大学,北京 100049
关键词:大数据,流水线,流水线调度,模型驱动的开发方法,数据处理
基金:国家重点研发计划云计算与大数据重点专项(2018YFB1004001);国家自然科学基金重点项目(61836013);中国烟草总公司科技重大专项(110201801019(SJ-01))。
复杂流程的大数据处理多依托于流水线系统,但大数据处理的流水线系统在易用性、功能复用性、扩展性以及处理性能等方面存在不足。针对上述问题,为提高大数据处理环境的构建与开发效率,优化处理流程,提出了一种模型驱动的大数据流水线框架PiFlow。首先,将大数据处理过程抽象为有向无环图;然后,开发一系列组件用于构建数据处理流水线,并设计了流水线任务执行机制。同时,为规范和简化流水线框架的描述,设计了基于模型驱动的大数据流水线描述语言——PiFlowDL,该语言以模块化、层次化的方式对大数据处理任务进行描述。PiFlow以所见即所得(WYSIWYG)的方式配置流水线,集成了状态监控、模板配置、组件集成等功能,与Apache NiFi相比有2~7倍的性能提升。
来源:2020年第6期
《计算机应用》期刊编辑部