Dewei Zhai

Senior Data Engineer & Applied AI Engineer

Opgeloste problemen

Bekijk concrete teamuitdagingen, mijn bijdrage en de opgeleverde resultaten.

Een te zwaar en duur platform

Circa 95% lagere maandkosten voor vergelijkbare dagelijkse workloads.

Enyquant

Mijn aanpak

Architectuur kiezen op basis van workloads, teamgrootte en kosten. De cloud- en datafundering vanaf nul gebouwd en vergelijkbare dagelijkse workloads van Databricks + ADF naar DuckDB, Polars en DuckLake op één VM verplaatst, inclusief implementatie, deployment en beheer.

Resultaat

Circa 95% lagere maandkosten voor vergelijkbare dagelijkse workloads; binnen 60 dagen vijf jaar landelijke elektriciteits- en marktdata opgeleverd.

  • Azure
  • Alibaba Cloud
  • Airflow
  • DuckDB
  • Polars
  • DuckLake

Een job faalt. Kan hij veilig opnieuw draaien?

Configuratiegestuurde, idempotente ETL voorkomt dubbele writes bij herhaling.

PVH

Mijn aanpak

Configuratiegestuurde, idempotente ETL gebouwd op het 500+TB AWS-dataplatform van PVH, met veilig opnieuw draaien als ontwerpeis. Idempotentie betekent dat dezelfde invoer opnieuw verwerken consistente doeldata oplevert zonder duplicaten op te stapelen. Ook datakwaliteit, observability en planning over tijdzones verbeterd.

Resultaat

Veilig herhaalbare productie-ETL opgeleverd, met reproduceerbare verwerkingspaden voor herstel en dagelijks beheer. Configuratiehergebruik verminderde dubbele implementatie en ondersteunde het beheer en de verdere ontwikkeling van het grote platform.

  • Python
  • SQL
  • Spark
  • Airflow
  • AWS
  • Idempotent ETL

Een dashboard kost 4–6 weken

Een representatief oplevertraject verkort tot 1–2 uur.

PVH

Mijn aanpak

Notebooks van analisten werden door data engineers herschreven in PySpark. SQL van analisten opgenomen in een beheerst opleverproces met YAML-contracten, validatie en een DAG-factory. Oude en nieuwe resultaten eerst parallel vergeleken.

Resultaat

Een representatief end-to-end traject ging van 4–6 weken naar circa 1–2 uur; het platform ondersteunde 60+ dashboards.

  • SQL
  • YAML
  • Airflow
  • Data contracts

Spark draait uren en loopt uit het geheugen

Alle 175 businesscases binnen vijf minuten afgerond.

FedEx

Mijn aanpak

Een Spark-job herbouwd die niet op de volledige dataset kon afronden. Analysecode omgezet naar een werkende productiejob en alle businesscases op volledige data gevalideerd.

Resultaat

De oude job liep na drie uur uit het geheugen. De nieuwe versie voltooide alle 175 businesscases binnen vijf minuten.

  • Spark
  • PySpark
  • EMR
  • GKE

Het bestand is binnen. De business wacht twee uur.

Typische doorlooptijd 5–10 minuten; circa 90% lagere gerelateerde resourcekosten.

PVH

Mijn aanpak

Een goedgekeurde PII-heridentificatieflow gebruikte polling per uur, permanente EMR en Aurora en handmatige overdracht. Vervangen door S3-events, Step Functions, goedkeuringscontrole in DynamoDB, EMR Serverless en automatische levering aan goedgekeurde bestemmingen, met statusmeldingen.

Resultaat

De typische doorlooptijd ging van circa twee uur naar 5–10 minuten. Identificeerbare AWS-resourcekosten voor deze flow daalden circa 90%.

  • AWS
  • Step Functions
  • DynamoDB
  • EMR Serverless
  • Terraform

ETL-feedback komt uren of dagen later

Feedback binnen minuten voor 40+ ontwikkelaars.

VodafoneZiggo

Mijn aanpak

PowerCenter-conversie en voorafgaande validatie geïntegreerd in GitLab CI/CD, zodat ontwikkelaars eerder resultaat kregen en minder handmatig werk hoefden te herhalen.

Resultaat

Voor 40+ ontwikkelaars ging feedback van uren of dagen naar minuten; conservatief geschat 40+ uur handmatig werk per week bespaard.

  • GitLab CI/CD
  • PowerCenter
  • ETL validation

Het platform moet verhuizen. De business draait door.

Full Load en CDC voor honderden TB van Oracle naar Snowflake.

VodafoneZiggo

Mijn aanpak

AWS DMS Full Load + CDC uitgevoerd om historische data en doorlopende wijzigingen te verbinden, met verdere ontwikkeling van Scala/Spark ETL en ondersteuning bij migratieproblemen.

Resultaat

Full Load en incrementele synchronisatie ondersteund voor honderden TB bij de Oracle-Snowflake-migratie. Mijn scope omvatte migratieondersteuning, pipelines en engineeringtools.

  • AWS DMS
  • CDC
  • Oracle
  • Snowflake
  • Scala
  • Spark

Analysecode heeft een route naar productie nodig

Data science-omgevingen, productiejobs en tijdsemantiek voor trainingsdata.

VodafoneZiggo · FedEx · Enyquant

Mijn aanpak

JupyterHub + MLflow gebouwd voor 4–5 data scientists bij VodafoneZiggo. JupyterHub beheerd en Spark-code productierijp gemaakt bij FedEx. Point-in-time zichtbaarheid gedefinieerd voor historische trainingsdata bij Enyquant.

Resultaat

Data science-diensten, productie-Spark-workloads en tijdsemantiek voor modeltrainingsdata opgeleverd.

  • JupyterHub
  • MLflow
  • Python
  • Spark
  • Point-in-time data

Meer agentregels, minder duidelijkheid

Duidelijk eigenaarschap; afgebakende Skill-inhoud 51,7% kleiner.

AI collaboration repository · agent-skills

Mijn aanpak

Een bedrijfsbrede AI-samenwerkingsrepo heringericht met aparte teamcontracten, gedeelde interfaces en optionele methoden. Een lifecycle voor ontdekken, toepassen, bijdragen en publiceren gedefinieerd, dubbele regels samengebracht en bevoegdheden, resourcecoördinatie en opleverbewijs verduidelijkt.

Resultaat

Afgebakende Skill-inhoud ging van 2.975 naar 1.437 regels; alle 18 behouden capabilities slaagden voor onafhankelijke validatie. Productiviteitswinst is nog niet gekwantificeerd.

  • AI Agents
  • Skills
  • Plugins
  • Context Design
  • Resource Coordination

Groene tests bewijzen niet dat de agent klaar is

Deterministische checks scheiden mechanismetests, kandidaatdekking en echte data.

Enyquant

Mijn aanpak

Een via Docker verspreide validatie-CLI gebouwd die ontwikkelcontracten, testselectie, bronsteekproefplannen en gestructureerde rapporten verbindt. Checks gekoppeld aan codeversies, contracten en databronnen, met afwijzing van verkeerde intervallen, eenheden, leden, oude contracten en ontbrekend bewijs. Dual-architecture checks en releasegates voor definitieve images ontworpen.

Resultaat

Samengevoegde tooling wijst samples met verkeerde intervallen, eenheden of leden af. Geslaagde mechanismetests overrulen geen falende datachecks; niet-uitgevoerde stappen en ontbrekende kandidaatdekking blijven zichtbaar. Echte dataoplevering gebruikt snapshot-readback en herhaalchecks, met aparte registratie van code, deployment, data en gebruikersacceptatie. Formele kandidaatvalidatie blijft een afzonderlijke uitvoerstap.

  • Python CLI
  • Docker
  • Contract Validation
  • Structured Reports
  • CI/CD

Persoonlijke agentworkflows zijn lastig te delen

Drie gedeelde Skills verbinden ontwikkelregels, versiegebonden tools en echte proeven.

Enyquant

Mijn aanpak

Dataontwikkeling en brononderzoek verpakt in drie gedeelde Skills met expliciete invoer, toolversies, bevoegdheden, bewijs en stopvoorwaarden. Deterministische implementatie blijft in de CLI van de bedrijfsrepository. Echte Windows/WSL-agentproeven van een ander teamlid gebruikt om omgevingsdetectie, UTF-8 en overdracht bij geblokkeerde uitvoering te verbeteren, met één onderhouden bron.

Resultaat

De broncode van alle drie gedeelde Skills is samengevoegd: persoonlijke workflows kregen onderhoudbare teamingangen. Proeffeedback leidde tot correcties; ontbrekende tools, omgevingsblokkades en falende bedrijfschecks worden apart behandeld. Bronacceptatie, formele release en installatie door teamleden worden apart vastgelegd.

  • AI Agents
  • Skills
  • Plugins
  • Workflow Engineering
  • Behavioral Validation