Een datalaag waar agents veilig op mogen werken
Elk datavraagstuk liep via één persoon die het vertaalde, begeleidde en valideerde. Die persoon was de bottleneck. De opdracht was om de datalaag zo in te richten dat agents er zelf op kunnen werken, met kosten, herkomst en goedkeuring zichtbaar.
Het vraagstuk
In een Databricks-omgeving die organisch was gegroeid bouwden verschillende mensen los van elkaar aan vergelijkbare oplossingen. Er was geen centraal overzicht van wat er al bestond, dus hergebruik gebeurde alleen als iemand het toevallig wist. Kennis vertrok met de medewerker.
Tegelijk was er een concrete wens om AI-agents in te zetten voor datavragen en pipeline-wijzigingen. Dat kan alleen als drie dingen geregeld zijn: de agent mag niet zomaar productie aanpassen, iemand moet kunnen zien wat het kost, en gevoelige data mag niet in een modelaanroep belanden.
Wat ik gebouwd heb
- 01Een datalaag waarin Shopify, fulfilment en e-mailplatform samenkomen, met de bestaande jobs als vertrekpunt in plaats van een nieuwe stack ernaast.
- 02Een productie-integratie met een taalmodel voor het verrijken van consumentinteracties, inclusief herstel van de quotalimieten waar die eerder op vastliep.
- 03Een afschermingsplan voor persoonsgegevens op de productieomgeving, zodat agenttoegang niet automatisch toegang tot klantdata betekent.
- 04Een ontwerp voor een MCP-gateway waarmee agents gecontroleerd bij data en tooling kunnen, met authenticatie en autorisatie per bron.
- 05Een uitsplitsing van het platformverbruik per gebruiker en per proces, zodat kosten toewijsbaar zijn in plaats van één maandbedrag.
- 06Een architectuur waarin een agent nooit rechtstreeks live patcht: output is altijd een pull request plus een begrijpelijk validatiebericht aan de aanvrager.
Hoe het werkt
Intake
Slack en mailVerzoek wordt vastgelegd
Triage
Klein modelType en risicoklasse
Bouw
Groot modelCatalog-check, dan PR
Akkoord
AanvragerMerge, job draait vanaf git
Wat het opleverde
Het gedeelte dat draait is de datalaag met de modelintegratie erop: die verrijkt consumentinteracties in productie. Het agentplatform daarboven is ontworpen en opgezet als scaffold, maar draait nog niet als geheel.
De belangrijkste ontwerpkeuze is dat een agent nooit direct in productie schrijft. Een verzoek eindigt altijd in een pull request en een validatiebericht in begrijpelijke taal, waar de aanvrager zelf ja of nee op zegt. Dat maakt het verschil tussen automatisering die je durft aan te zetten en een demo.
Eerlijk over de status: de datalaag en de modelintegratie draaien in productie. Het volledige agentplatform is ontwerp plus scaffold en is nog niet als geheel in gebruik.
Uitgangspunten
- Alles binnen de bestaande omgeving
- Agent levert een PR, nooit een live patch
- Elke modelaanroep gelogd met kosten
- Verplichte check op wat er al bestaat
- Persoonsgegevens afgeschermd van agenttoegang
Gebouwd met
Herkenbaar vraagstuk?
Stuur kort welke systemen meedoen en waar het vastloopt. Dan krijg je een eerlijk antwoord over de beste eerste stap, ook als dat is dat je mij niet nodig hebt.
