Dewei Zhai

/cv

De pijn uit je data halen — op elke schaal.

8+ jaar ervaring met 500TB–1PB datalakes op AWS, Azure, GCP en Alibaba Cloud — lang genoeg om de meeste fouten die jij nog gaat maken al gemaakt én opgelost te hebben.

Wat ik verkoop is zekerheid — uit valkuilen die niemand documenteert, jaren trouw aan first principles en Occam's razor, en vele beurten als brandweercommandant van dienst: branden blussen én voorkomen dat de volgende ontstaat.

Track record

  1. 2026 — now

    Platform Architect (Azure + Alibaba Cloud) Enyquant

    Enige hands-on architect voor een dual-region Lakehouse (Azure EU + Alibaba Cloud China) bij een AI-first startup in energy trading. 100% IaC (CDKTF + Terraform), event-driven serverless pipelines, multi-team IAM. AI-augmented engineering practice opgezet (~3× delivery throughput).

  2. 2024 — 2025

    Lead Data Engineer (AWS Datalake) PVH Corp · 2nd engagement

    500+TB AWS data lake, 90+ bronnen, 1000+ datasets. Lead op ETL, platformarchitectuur, CI/CD, datakwaliteit. Real-time GDPR (de)anonimisatie-service: latency 2u → real-time, kosten 10× lager.

  3. 2022 — 2024

    Data Engineer & Infra Admin VodafoneZiggo

    1PB+ datalake. Snowflake-migratie vanaf Oracle DWH, CDC-ingestie (DMS), AWS IaC (CDK + Terraform). Nieuwe CI/CD ingevoerd die het team 60+ uur scheelde.

  4. 2020 — 2022

    Lead Data Engineer (AWS Datalake) PVH Corp · 1st engagement

    Data lake gemigreerd van Hadoop naar AWS. Externe integraties ontworpen (Adobe, Salesforce, SAP). Self-service analytics gebouwd: TTM van 2 weken naar 10 minuten.

  5. 2018 — 2020

    Data DevOps Engineer FedEx Digital

    ETL pipelines op AWS & GCP, data-science modellen geproductiseerd, Kinesis-based streaming.

  6. 2018

    Data Engineer ABN AMRO

    Hive/Spark ETL, meegebouwd aan enterprise datalake.

  7. 2016 — 2018

    Data Engineer / Hadoop Admin KPN

    Hadoop-beheer, Hive/Spark ETL, automatisering met Ansible & Jenkins.

Geselecteerd werk

De cases hieronder zijn openbaar; referenties met namen erbij op aanvraag.

↳ Beweeg over of focus op een skill om die door het hele CV te volgen. Klik om de markering vast te zetten.

  • 2026 — present

    Enyquant Platform-architect & end-to-end Data Engineer — raw → modeled (Azure + Alibaba Cloud) — FTE

    Verantwoordelijk voor de architectuur en hands-on realisatie van een dual-region energie-dataplatform. Ik scheidde stabiele bedrijfscontracten — tijd, readiness, lineage en failure boundaries — van vervangbare runtimes en veranderde de runtime toen het bewijs liet zien dat die niet meer paste.

    • — Runtime-onafhankelijke ingestion-, temporal- en readiness-contracten, zodat compute kan veranderen zonder de bedrijfsbetekenis te wijzigen
    • — Dagelijkse runtime van Databricks + ADF naar Airflow + DuckDB/Polars + DuckLake gebracht → circa 95% lagere maandkosten
    • — Governed DuckLake-toegang gebouwd met expliciete grenzen voor mensen, teams en writers
    • — 100% IaC (CDKTF + Terraform); geen click-ops-drift
    • — Herbruikbare multi-cloud architectuurlaag voor consistente EU ↔ China-deployment

    Azure (ADLS Gen2, Databricks, ADF, Functions, Key Vault, Entra ID) · Alibaba Cloud (OSS, Function Compute, EMR Spark) · Airflow, DuckDB/Polars, DuckLake, Docker Compose · Terraform + CDKTF (TypeScript) · GitHub Actions + OIDC · Python, SQL

  • 2022 — 2024

    VodafoneZiggo Data Engineer & Infra Admin — Freelance

    Legacy DWH-workloads van Oracle naar Snowflake gemigreerd op een 1PB+ enterprise datalake. Eigenaar van CDC-ingestie, IaC en het CI/CD-fundament waar het bredere team op bouwt.

    • Snowflake-migratie vanaf legacy Oracle DWH ondersteund
    • CDC-based ingestion pipelines ontworpen en onderhouden (DMS-based)
    • AWS infrastructure as code beheerd (CDK + Terraform)
    • CI/CD-verbeteringen ingevoerd die het bredere team 60+ uur handwerk scheelden
    • ETL pipelines en intern data-engineering framework opgeleverd op een 1PB+ datalake
    • — Data scientists en analytics teams ondersteund met betrouwbare datasets

    Snowflake · AWS · Terraform, AWS CDK (TypeScript) · Python, SQL, Spark · AWS DMS for CDC · GitLab CI/CD

  • 2020 — 2022 & 2023 — 2025 (returned engagement)

    PVH Corp (Tommy Hilfiger, Calvin Klein) Lead Data Engineer — Freelance

    Lead engineer voor een 500+TB AWS data lake met 90+ bronnen en 1000+ datasets. Twee engagements: de HadoopAWS migratie en een latere platform-modernisatiefase.

    • Data lake gemigreerd van Hadoop naar AWS
    • — Externe integraties ontworpen en opgeleverd: Adobe, Salesforce, SAP, e.a.
    • ETL-laag herbouwd: idempotent en config-driven
    • — Langlopende tijdzoneproblemen opgelost in data en scheduling
    • — Self-service analytics-platform met 60+ dashboards in gebruik bij CRM & C-suite — TTM van 2 weken naar 10 minuten
    • — Real-time GDPR (de)anonimisatie-service: latency 2u → real-time, kosten 10× lager
    • — Workloads naar Azure Databricks gemigreerd; GCP BigQuery & Google Analytics bronnen geïntegreerd
    • — Senior platform engineer in adviesrol voor DataOps, IaC en production readiness

    AWS (S3, Glue, EMR, ECS, Lambda, API Gateway, Athena, Step Functions) · Spark, Kafka, dbt, Airflow · Terraform, AWS CDK · GitLab CI/CD · PyDeequ for data quality · Azure Databricks, GCP BigQuery (cross-cloud sources)

  • 2018 — 2020

    FedEx Data Engineer — Freelance

    DE op het AWS data-platform — infrastructuur als code beheren, ETL uitrollen — met als nevenspecialisme het productioneel maken van data-science Spark-code tot onderhoudbare DE-pipelines.

    • AWS data-infrastructuur als code beheerd (Terraform)
    • — Nieuwe bron-integraties en ETL pipelines ontwikkeld
    • Spark-code van DS productioneel gemaakt: scheduled, getest, maintainable als DE-pipeline
    • — Een DS-Spark-job van 3u OOM (<50% voortgang) teruggebracht naar onder de 5 minuten — 175× versnelling, door een seriële for-loop over 175 onafhankelijke cases te vervangen door een cross-join

    AWS · Terraform · Spark · PySpark · Python

  • 2018

    ABN AMRO Data Engineer — FTE

    Bijgedragen aan de bouw van het DIAL data-platform — gefragmenteerde departementele ETL geconsolideerd op een gedeeld platform en workloads van Hive naar PySpark gemigreerd.

    • — Gefragmenteerde ETL per afdeling geconsolideerd op het gedeelde DIAL-platform
    • — Workloads van Hive naar PySpark gemigreerd
    • — Een handmatige Excel-workflow van een collega die 3 dagen per week kostte, vervangen door een script dat in 3 minuten draait

    Hive · PySpark · Spark · Python

  • 2016 — 2018

    KPN Big Data Consultant — FTE (B2B-divisie)

    Hadoop cluster-admin bij KPN's B2B-tak — Hortonworks HDP clusters op bare-metal installeren en beheren voor externe enterprise-klanten. Bouwde het automated system-health framework voor het team.

    • Hortonworks HDP Hadoop-clusters op bare-metal hardware beheerd voor externe B2B-klanten
    • — Een geautomatiseerde end-to-end system-health-check suite in Robot Framework gebouwd, ter vervanging van de handmatige install-verificatie
    • — Het team 8+ uur per week aan repetitieve handmatige verificatie bespaard

    Hortonworks HDP · Hadoop · Bare-metal · Robot Framework · Python

  • 2009 — 2012

    Huawei Software Test Engineer — Telecom core-database (HLR / HSS) — FTE

    Telecom core-network database werk — HLR / HSS voor mobiele operators. Test- & delivery-lead op een grote core-database cutover bij KPN Nederland (16M subscribers in scope, 12M gemigreerd, nul incidenten).

    • — Test- & delivery-lead op de core-network database cutover bij KPN NL — 16M subscribers in scope, de meest kritische database in hun core-network
    • — ~7 maanden intensief testen vooraf; honderden bugs gevonden op alle severity-niveaus
    • — Het migratieplan ontworpen en uitgevoerd, inclusief staged rollouts en rollback-procedures
    • — Nul incidenten over maanden van cutover-operaties; 12M subscribers succesvol gemigreerd

    HLR · HSS · Telecom core network · Test engineering · Migration planning

Tech stack

Cloud
AWS (deepest), Azure, Alibaba Cloud, GCP
Lakehouse
Databricks, Snowflake, Unity Catalog, Iceberg, DuckDB
ETL
Spark, dbt, Glue, Kafka, AWS DMS (CDC)
Languages
Python, SQL, TypeScript, Scala, Shell, Solidity, Cython
Orchestration
Airflow, ADF, Step Functions, Oozie
IaC
Terraform, AWS CDK, CDKTF, Ansible
CICD
GitHub Actions, GitLab CI/CD, Jenkins
Quality
PyDeequ, Great Expectations

Publicaties

Certificeringen

  • AWS Certified Solutions Architect — Associate
  • Databricks Certified Associate Developer for Apache Spark
  • Databricks Certified Data Engineer Associate
  • — Certified Associate in Python Programming

Opleiding

MSc, Communication & Information Systems — Xidian University, China (Telecommunication Engineering: wereldwijd #4 in ShanghaiRanking's Global Ranking of Academic Subjects 2025). IDW-evaluatie: gelijkwaardig aan MSc Computing Science (NL).