实战项目 · 已通过自测
实战项目:DataFlow ETL
从 CSV、JSON 目录和 HTTP API 同步数据,完成清洗、过滤、并发补全、分组汇总及 JSON/CSV 双输出。
完整的数据同步管道
DataFlow ETL 是完全由 HHY v1.0 编写并通过端到端自测的数据同步应用。它读取客户 CSV 和事件 JSON 目录,规范化姓名与邮箱,过滤停用和低消费客户,并发请求本地画像 API,按部门 group_by 汇总,最后原子写入 JSON 报告和 CSV 明细。
| 阶段 | 实现 |
|---|---|
| 采集 | read_lines + parse_csv;files + parse_json |
| 清洗 | trim、lower、to_int 与结构化 Map |
| 补全 | parallel(4) + http.get + timeout + retry |
| 汇总 | where、sort_by、group_by、sum |
| 输出 | encode_json/save_text 与 encode_csv/save_lines |
真实目录与数据流

customers.csv + events/*.json + HTTP profiles
↓
parse / trim / lower
↓
active + minimum spend filter
↓
parallel HTTP enrichment
↓
group_by department + sum
↓
report.json + customers.csv实际自测结果
cd hhy-vm
sh dataflow-etl/self-test.sh
运行自己的同步任务
复制 config/test.json,替换项目名、API 地址和最低消费阈值,再准备 customers.csv 与 events/*.json。HTTP 单项失败会变成结构化 error,报告 ok=false 并返回退出码 1。
hhy run dataflow-etl/etl.hhy \
./input \
./config.json \
./output/report.json \
./output/customers.csv