数据编排的核心不是“几点执行”,而是数据区间、任务依赖、回填、资产质量和重新物化。本文只比较数据 DAG、数据资产和数据平台调度,不讨论普通应用后台队列或 Kubernetes 容器工作流。
| 项目 | 类型 | 适合场景 | 主要代价 |
|---|---|---|---|
| Airflow | 数据 DAG | ETL、数据仓库、离线报表和依赖编排 | 组件多,部署和维护成本高 |
| DolphinScheduler | 可视化数据调度 | 多人管理数据任务、依赖和运行记录 | 面向数据平台,普通任务会显得重 |
| Prefect | Python 工作流 | 动态分支、缓存、重试和事件自动化 | 需要理解 Flow、Task、Server / Worker |
| Dagster | 数据资产编排 | 数据质量、依赖、血缘和重新物化 | 需要围绕资产建模 |
| Kestra | 声明式多语言工作流 | 用 YAML 编排数据、AI 和基础设施 | 平台和插件体系较重 |
传统数据仓库和成熟 DAG 看 Airflow;平台化可视化调度看 DolphinScheduler;Python 动态流程看 Prefect;资产、质量和血缘看 Dagster;想用 YAML 统一编排多种运行环境看 Kestra。