跳到主要内容

数据流节点

概述

数据流节点用于通过算子完成数据读取、处理和输出。本文说明如何创建数据流节点、分析字段血缘,并列出各类算子文档。

创建数据流节点

进入离线开发任务编辑页面后,从左侧面板将「数据流」节点拖入画布。选中节点后,点击「编辑」进入算子编辑页面。

分析字段血缘

在任一算子上点击血缘图标,选择要分析的字段,即可查看该字段的上游算子。

运行引擎

8.3 及以上版本默认使用 Gluten 引擎(Spark 升级版)运行数据流,以提升运行性能。

具体说明

数据流节点包括以下具体算子,请按需参阅具体文档。

数据集算子

算子说明文档
输入数据集输入数据集
输出数据集输出数据集
数据库输入(高级版)数据库输入(高级版)
数据库输出(高级版)数据库输出(高级版)

列编辑算子

算子说明文档
添加计算列添加计算列
合并列合并列
分组聚合分组聚合
选择列选择列
行转列行转列
列转行列转行

数据编辑算子

算子说明文档
筛选数据行筛选数据行
去重去重
值替换值替换
Null 值替换Null值替换

数据集组合

算子说明文档
行拼接行拼接
关联数据关联数据

高级计算

SQL 算子:SQL输入