Dewei Zhai

/cv

让你的数据不再让你头疼 — 无论规模多大。

8+ 年跨 AWSAzureGCPAlibaba Cloud 的 500TB–1PB 数据湖经验 — 大概率踩过、并修过你即将要踩的大多数坑。

我交付给你的是确定性: 来自没人写进文档的那些坑、第一性原理与奥卡姆剃刀长期打磨出的技术判断,以及多次担任救火队长沉淀下来的救火与防火直觉。

履历

  1. 2026 — now

    Platform Architect (Azure + Alibaba Cloud) Enyquant

    一家能源交易方向的 AI-first 创业公司,作为唯一动手架构师负责双区域 Lakehouse(Azure EU + Alibaba Cloud 中国)。100% IaC (CDKTF + Terraform),事件驱动 serverless 管道,跨团队 IAM。搭建了 AI 增强工程实践(交付吞吐 ~3×)。

  2. 2024 — 2025

    Lead Data Engineer (AWS Datalake) PVH Corp · 2nd engagement

    500+TB AWS 数据湖,90+ 数据源,1000+ 数据集。负责 ETL、平台架构、CI/CD、数据质量。实时 GDPR (反)匿名化服务: 延迟从 2h 降到实时,成本下降 10×。

  3. 2022 — 2024

    Data Engineer & Infra Admin VodafoneZiggo

    1PB+ 数据湖。从 Oracle DWH 迁移到 Snowflake,CDC 摄取(DMS),AWS IaC (CDK + Terraform)。引入新 CI/CD 流程,为团队节省 60+ 小时。

  4. 2020 — 2022

    Lead Data Engineer (AWS Datalake) PVH Corp · 1st engagement

    把数据湖从 Hadoop 迁到 AWS。设计了对接 Adobe、Salesforce、SAP 的外部集成。搭建自助式分析平台,TTM 从两周缩到 10 分钟。

  5. 2018 — 2020

    Data DevOps Engineer FedEx Digital

    AWSGCP 上的 ETL 管道,数据科学模型产品化,Kinesis 流处理。

  6. 2018

    Data Engineer ABN AMRO

    Hive/Spark ETL,参与企业数据湖搭建。

  7. 2016 — 2018

    Data Engineer / Hadoop Admin KPN

    Hadoop 运维,Hive/Spark ETL,基于 AnsibleJenkins 的自动化。

精选案例

下列案例都是公开信息;如需带姓名的 reference,可以单独提供。

↳ 悬停或聚焦一个技能,即可查看它在整份 CV 中的使用场景;点击可保持高亮。

  • 2026 — present

    Enyquant 平台架构师 & 端到端数据工程师 — raw → modeled (Azure + Alibaba Cloud) — 全职

    独立负责双区域能源数据平台的架构设计与工程落地。我把稳定的业务契约——时间、就绪度、血缘与故障边界——和可替换的运行时分开;当证据表明技术不再匹配时,就替换技术。

    • — 定义与运行时无关的摄取、时间与就绪契约,让计算引擎变化而业务含义不变
    • — 把日常运行时从 Databricks + ADF 迁到 Airflow + DuckDB/Polars + DuckLake → 月成本降低约 95%
    • — 建立受治理的 DuckLake 访问,明确区分人员、团队与写入者边界
    • — 100% IaC (CDKTF + Terraform),零 click-ops 偏差
    • — 可复用的多云架构层,实现 EU ↔ 中国一致的部署体验

    Azure (ADLS Gen2, Databricks, ADF, Functions, Key Vault, Entra ID) · Alibaba Cloud (OSS, Function Compute, EMR Spark) · Airflow, DuckDB/Polars, DuckLake, Docker Compose · Terraform + CDKTF (TypeScript) · GitHub Actions + OIDC · Python, SQL

  • 2022 — 2024

    VodafoneZiggo 数据工程师 & 基础设施管理员 — 自由职业

    在 1PB+ 企业级数据湖上,把遗留 DWH 工作负载从 Oracle 迁到 Snowflake。负责 CDC 摄取、IaC,以及整个团队赖以构建的 CI/CD 基础。

    • — 支持从遗留 Oracle DWH 到 Snowflake 的迁移
    • — 设计并维护基于 CDC 的摄取管道(DMS 实现)
    • — 以代码方式管理 AWS 基础设施(CDK + Terraform)
    • — 引入 CI/CD 改进,为团队节省 60+ 小时手工操作
    • — 在 1PB+ 数据湖上交付 ETL 管道与内部数据工程框架
    • — 为数据科学与分析团队提供可靠的数据集支持

    Snowflake · AWS · Terraform, AWS CDK (TypeScript) · Python, SQL, Spark · AWS DMS for CDC · GitLab CI/CD

  • 2020 — 2022 & 2023 — 2025 (returned engagement)

    PVH Corp (Tommy Hilfiger, Calvin Klein) 主导数据工程师 — 自由职业

    500+TB AWS 数据湖,90+ 数据源,1000+ 数据集的主导工程师。两次合作分别覆盖 HadoopAWS 迁移,以及后期平台现代化阶段。

    • — 把数据湖从 Hadoop 迁移到 AWS
    • — 设计并交付外部集成:Adobe、Salesforce、SAP 等
    • — 重构 ETL 层为幂等、配置驱动
    • — 修复数据与调度跨时区的长期遗留问题
    • — 60+ dashboard 的自助分析平台,CRM 与 C-suite 在用 — TTM 从 2 周降到 10 分钟
    • — 实时 GDPR (去)匿名化服务:延迟从 2h 降到实时,成本下降 10×
    • — 把负载迁到 Azure Databricks;接入 GCP BigQueryGoogle Analytics 数据源
    • — 以高级平台工程师身份,为 DataOps、IaC 与生产就绪标准提供咨询

    AWS (S3, Glue, EMR, ECS, Lambda, API Gateway, Athena, Step Functions) · Spark, Kafka, dbt, Airflow · Terraform, AWS CDK · GitLab CI/CD · PyDeequ for data quality · Azure Databricks, GCP BigQuery (cross-cloud sources)

  • 2018 — 2020

    FedEx 数据工程师 — 自由职业

    AWS 数据平台的 DE — 用 IaC 管理基础设施、交付 ETL;同时擅长把 DS 写的 Spark 代码工程化,变成可维护的 DE 管道。

    • — 用 IaC (Terraform) 管理 AWS 数据基础设施
    • — 开发新的数据源集成与 ETL 管道
    • — 把 DS 写的 Spark 代码工程化、调度化,变成可维护的 DE 管道
    • — 把一个 DS 的 Spark job 从 3 小时 OOM (跑不到 50%) 优化到 5 分钟以内 — 175× 提速,做法是把原本对 175 个独立 case 的串行 for-loop 改成 cross-join

    AWS · Terraform · Spark · PySpark · Python

  • 2018

    ABN AMRO 数据工程师 — 全职

    参与 DIAL 数据平台建设 — 把各部门散落的 ETL 整合到共享平台上,并把负载从 Hive 迁到 PySpark

    • — 把各部门散落的 ETL 整合到共享的 DIAL 平台上
    • — 把负载从 Hive 迁到 PySpark
    • — 把同事每周花 3 天的手工 Excel 流程,替换为一个 3 分钟跑完的脚本

    Hive · PySpark · Spark · Python

  • 2016 — 2018

    KPN 大数据顾问 — 全职 (B2B 部门)

    在 KPN 的 B2B 部门做 Hadoop 集群运维 — 在 bare-metal 上为外部企业客户安装和运维 Hortonworks HDP 集群。同时搭建了团队的自动化系统健康检查框架。

    • — 在 bare-metal 硬件上为外部 B2B 客户运维 Hortonworks HDP Hadoop 集群
    • — 用 Robot Framework 搭建了端到端的自动化系统健康检查套件,替代原本的手工安装验证流程
    • — 每周为团队节省 8+ 小时的重复手工验证工作

    Hortonworks HDP · Hadoop · Bare-metal · Robot Framework · Python

  • 2009 — 2012

    Huawei 软件测试工程师 — 电信核心网数据库 (HLR / HSS) — 全职

    电信核心网数据库 — 为移动运营商做的 HLR / HSS。担任 KPN 荷兰核心数据库切换项目的测试与交付负责人(覆盖 1600 万用户,成功迁移 1200 万,零事故)。

    • — 担任 KPN 荷兰核心网数据库切换项目的测试与交付负责人 — 覆盖 1600 万用户,是他们核心网最关键的一套数据库
    • — 约 7 个月的切换前密集测试,识别出数百个不同严重等级的 bug
    • — 主导迁移方案的设计与执行,包括分阶段灰度与回滚预案
    • — 数月切换运行期间零事故,1200 万用户成功迁移

    HLR · HSS · Telecom core network · Test engineering · Migration planning

技术栈

Cloud
AWS (deepest), Azure, Alibaba Cloud, GCP
Lakehouse
Databricks, Snowflake, Unity Catalog, Iceberg, DuckDB
ETL
Spark, dbt, Glue, Kafka, AWS DMS (CDC)
Languages
Python, SQL, TypeScript, Scala, Shell, Solidity, Cython
Orchestration
Airflow, ADF, Step Functions, Oozie
IaC
Terraform, AWS CDK, CDKTF, Ansible
CICD
GitHub Actions, GitLab CI/CD, Jenkins
Quality
PyDeequ, Great Expectations

出版论文

认证

  • AWS Certified Solutions Architect — Associate
  • Databricks Certified Associate Developer for Apache Spark
  • Databricks Certified Data Engineer Associate
  • — Certified Associate in Python Programming

教育背景

通信与信息系统硕士 — 西安电子科技大学,中国(2025 软科世界一流学科排名:通信工程全球第 4)。IDW 学历评估: 等同于荷兰 MSc Computing Science。