Skip to main content

Dataflow Node

Overview

Create a Dataflow Node

In the Offline Dev task editor, drag a Dataflow node from the left panel to the canvas. Select the node, then click Edit to open the operator editor.

Operator Lineage Analysis

Click the lineage icon on any operator, then select a field to view its upstream operator.

Execution Engine

Version 8.3 and later use the Gluten engine, an enhanced Spark engine, to run Dataflow by default and improve performance.

Detailed Description

Dataflow Node includes the following operators. Refer to the corresponding documents as needed.

Dataset Operators

OperatorReference
Input DatasetInput Dataset
Output DatasetOutput Dataset
Database Input (Advanced)Database Input (Advanced)
Database Output (Advanced)Database Output (Advanced)

Column Editing Operators

OperatorReference
Add Calculated ColumnAdd Calculated Column
Merge ColumnsMerge Columns
Group AggregateGroup Aggregate
Select ColumnsSelect Columns
Pivot Rows to ColumnsPivot Rows to Columns
Unpivot Columns to RowsUnpivot Columns to Rows

Data Editing Operators

OperatorReference
Filter Data RowsFilter Data Rows
DeduplicateDeduplicate
Replace ValuesReplace Values
Replace Null ValuesReplace Null Values

Dataset Combination

OperatorReference
Append RowsAppend Rows
Join DataJoin Data

Advanced Calculation

SQL operator: SQL Input