问题:ETL 脚本是维护噩梦
你正在构建一个数据流水线。每天需要:
- 从 CSV 加载原始数据
- 清洗和转换
- 插入目标表
- 导出汇总报表
传统做法?一个 20+ 行的 Python 脚本,或者一个串联多个 SQL 命令的 shell 脚本:
# Python 方案——6 个步骤,40 行代码
import duckdb
con = duckdb.ATTACH ("pipeline.duckdb")
# 步骤 1:加载原始数据
con.execute("CREATE TABLE raw AS SELECT * FROM read_csv('data.csv')")
# 步骤 2:清洗数据
con.execute("""