Senior Data Engineer & Applied AI Engineer
Opgeloste problemen
Bekijk concrete teamuitdagingen, mijn bijdrage en de opgeleverde resultaten.
Een te zwaar en duur platform
Circa 95% lagere maandkosten voor vergelijkbare dagelijkse workloads.
Enyquant
Mijn aanpak
Architectuur kiezen op basis van workloads, teamgrootte en kosten. De cloud- en datafundering vanaf nul gebouwd en vergelijkbare dagelijkse workloads van Databricks + ADF naar DuckDB, Polars en DuckLake op één VM verplaatst, inclusief implementatie, deployment en beheer.
Resultaat
Circa 95% lagere maandkosten voor vergelijkbare dagelijkse workloads; binnen 60 dagen vijf jaar landelijke elektriciteits- en marktdata opgeleverd.
- Azure
- Alibaba Cloud
- Airflow
- DuckDB
- Polars
- DuckLake
Een job faalt. Kan hij veilig opnieuw draaien?
Configuratiegestuurde, idempotente ETL voorkomt dubbele writes bij herhaling.
PVH
Mijn aanpak
Configuratiegestuurde, idempotente ETL gebouwd op het 500+TB AWS-dataplatform van PVH, met veilig opnieuw draaien als ontwerpeis. Idempotentie betekent dat dezelfde invoer opnieuw verwerken consistente doeldata oplevert zonder duplicaten op te stapelen. Ook datakwaliteit, observability en planning over tijdzones verbeterd.
Resultaat
Veilig herhaalbare productie-ETL opgeleverd, met reproduceerbare verwerkingspaden voor herstel en dagelijks beheer. Configuratiehergebruik verminderde dubbele implementatie en ondersteunde het beheer en de verdere ontwikkeling van het grote platform.
- Python
- SQL
- Spark
- Airflow
- AWS
- Idempotent ETL
Een dashboard kost 4–6 weken
Een representatief oplevertraject verkort tot 1–2 uur.
PVH
Mijn aanpak
Notebooks van analisten werden door data engineers herschreven in PySpark. SQL van analisten opgenomen in een beheerst opleverproces met YAML-contracten, validatie en een DAG-factory. Oude en nieuwe resultaten eerst parallel vergeleken.
Resultaat
Een representatief end-to-end traject ging van 4–6 weken naar circa 1–2 uur; het platform ondersteunde 60+ dashboards.
- SQL
- YAML
- Airflow
- Data contracts
Spark draait uren en loopt uit het geheugen
Alle 175 businesscases binnen vijf minuten afgerond.
FedEx
Mijn aanpak
Een Spark-job herbouwd die niet op de volledige dataset kon afronden. Analysecode omgezet naar een werkende productiejob en alle businesscases op volledige data gevalideerd.
Resultaat
De oude job liep na drie uur uit het geheugen. De nieuwe versie voltooide alle 175 businesscases binnen vijf minuten.
- Spark
- PySpark
- EMR
- GKE
Het bestand is binnen. De business wacht twee uur.
Typische doorlooptijd 5–10 minuten; circa 90% lagere gerelateerde resourcekosten.
PVH
Mijn aanpak
Een goedgekeurde PII-heridentificatieflow gebruikte polling per uur, permanente EMR en Aurora en handmatige overdracht. Vervangen door S3-events, Step Functions, goedkeuringscontrole in DynamoDB, EMR Serverless en automatische levering aan goedgekeurde bestemmingen, met statusmeldingen.
Resultaat
De typische doorlooptijd ging van circa twee uur naar 5–10 minuten. Identificeerbare AWS-resourcekosten voor deze flow daalden circa 90%.
- AWS
- Step Functions
- DynamoDB
- EMR Serverless
- Terraform
ETL-feedback komt uren of dagen later
Feedback binnen minuten voor 40+ ontwikkelaars.
VodafoneZiggo
Mijn aanpak
PowerCenter-conversie en voorafgaande validatie geïntegreerd in GitLab CI/CD, zodat ontwikkelaars eerder resultaat kregen en minder handmatig werk hoefden te herhalen.
Resultaat
Voor 40+ ontwikkelaars ging feedback van uren of dagen naar minuten; conservatief geschat 40+ uur handmatig werk per week bespaard.
- GitLab CI/CD
- PowerCenter
- ETL validation
Het platform moet verhuizen. De business draait door.
Full Load en CDC voor honderden TB van Oracle naar Snowflake.
VodafoneZiggo
Mijn aanpak
AWS DMS Full Load + CDC uitgevoerd om historische data en doorlopende wijzigingen te verbinden, met verdere ontwikkeling van Scala/Spark ETL en ondersteuning bij migratieproblemen.
Resultaat
Full Load en incrementele synchronisatie ondersteund voor honderden TB bij de Oracle-Snowflake-migratie. Mijn scope omvatte migratieondersteuning, pipelines en engineeringtools.
- AWS DMS
- CDC
- Oracle
- Snowflake
- Scala
- Spark
Analysecode heeft een route naar productie nodig
Data science-omgevingen, productiejobs en tijdsemantiek voor trainingsdata.
VodafoneZiggo · FedEx · Enyquant
Mijn aanpak
JupyterHub + MLflow gebouwd voor 4–5 data scientists bij VodafoneZiggo. JupyterHub beheerd en Spark-code productierijp gemaakt bij FedEx. Point-in-time zichtbaarheid gedefinieerd voor historische trainingsdata bij Enyquant.
Resultaat
Data science-diensten, productie-Spark-workloads en tijdsemantiek voor modeltrainingsdata opgeleverd.
- JupyterHub
- MLflow
- Python
- Spark
- Point-in-time data
Meer agentregels, minder duidelijkheid
Duidelijk eigenaarschap; afgebakende Skill-inhoud 51,7% kleiner.
AI collaboration repository · agent-skills
Mijn aanpak
Een bedrijfsbrede AI-samenwerkingsrepo heringericht met aparte teamcontracten, gedeelde interfaces en optionele methoden. Een lifecycle voor ontdekken, toepassen, bijdragen en publiceren gedefinieerd, dubbele regels samengebracht en bevoegdheden, resourcecoördinatie en opleverbewijs verduidelijkt.
Resultaat
Afgebakende Skill-inhoud ging van 2.975 naar 1.437 regels; alle 18 behouden capabilities slaagden voor onafhankelijke validatie. Productiviteitswinst is nog niet gekwantificeerd.
- AI Agents
- Skills
- Plugins
- Context Design
- Resource Coordination
Groene tests bewijzen niet dat de agent klaar is
Deterministische checks scheiden mechanismetests, kandidaatdekking en echte data.
Enyquant
Mijn aanpak
Een via Docker verspreide validatie-CLI gebouwd die ontwikkelcontracten, testselectie, bronsteekproefplannen en gestructureerde rapporten verbindt. Checks gekoppeld aan codeversies, contracten en databronnen, met afwijzing van verkeerde intervallen, eenheden, leden, oude contracten en ontbrekend bewijs. Dual-architecture checks en releasegates voor definitieve images ontworpen.
Resultaat
Samengevoegde tooling wijst samples met verkeerde intervallen, eenheden of leden af. Geslaagde mechanismetests overrulen geen falende datachecks; niet-uitgevoerde stappen en ontbrekende kandidaatdekking blijven zichtbaar. Echte dataoplevering gebruikt snapshot-readback en herhaalchecks, met aparte registratie van code, deployment, data en gebruikersacceptatie. Formele kandidaatvalidatie blijft een afzonderlijke uitvoerstap.
- Python CLI
- Docker
- Contract Validation
- Structured Reports
- CI/CD
Persoonlijke agentworkflows zijn lastig te delen
Drie gedeelde Skills verbinden ontwikkelregels, versiegebonden tools en echte proeven.
Enyquant
Mijn aanpak
Dataontwikkeling en brononderzoek verpakt in drie gedeelde Skills met expliciete invoer, toolversies, bevoegdheden, bewijs en stopvoorwaarden. Deterministische implementatie blijft in de CLI van de bedrijfsrepository. Echte Windows/WSL-agentproeven van een ander teamlid gebruikt om omgevingsdetectie, UTF-8 en overdracht bij geblokkeerde uitvoering te verbeteren, met één onderhouden bron.
Resultaat
De broncode van alle drie gedeelde Skills is samengevoegd: persoonlijke workflows kregen onderhoudbare teamingangen. Proeffeedback leidde tot correcties; ontbrekende tools, omgevingsblokkades en falende bedrijfschecks worden apart behandeld. Bronacceptatie, formele release en installatie door teamleden worden apart vastgelegd.
- AI Agents
- Skills
- Plugins
- Workflow Engineering
- Behavioral Validation