数据流节点
概述
数据流节点用于通过算子完成数据读取、处理和输出。本文说明如何创建数据流节点、分析字段血缘,并列出各类算子文档。
创建数据流节点
进入离线开发任务编辑页面后,从左侧面板将「数据流」节点拖入画布。选中节点后,点击「编辑」进入算子编辑页面。

分析字段血缘
在任一算子上点击血缘图标,选择要分析的字段,即可查看该字段的上游算子。


运行引擎
8.3 及以上版本默认使用 Gluten 引擎(Spark 升级版)运行数据流,以提升运行性能。
具体说明
数据流节点包括以下具体算子,请按需参阅具体文档。
数据集算子
| 算子 | 说明文档 |
|---|---|
| 输入数据集 | 输入数据集 |
| 输出数据集 | 输出数据集 |
| 数据库输入(高级版) | 数据库输入(高级版) |
| 数据库输出(高级版) | 数据库输出(高级版) |
列编辑算子
| 算子 | 说明文档 |
|---|---|
| 添加计算列 | 添加计算列 |
| 合并列 | 合并列 |
| 分组聚合 | 分组聚合 |
| 选择列 | 选择列 |
| 行转列 | 行转列 |
| 列转行 | 列转行 |
数据编辑算子
| 算子 | 说明文档 |
|---|---|
| 筛选数据行 | 筛选数据行 |
| 去重 | 去重 |
| 值替换 | 值替换 |
| Null 值替换 | Null值替换 |
数据集组合
| 算子 | 说明文档 |
|---|---|
| 行拼接 | 行拼接 |
| 关联数据 | 关联数据 |
高级计算
SQL 算子:SQL输入