Expertise hub / Testen
Testen 9 min lezen

Model drift: waarom een AI-systeem dat vandaag goed werkt morgen faalt

Een model dat bij oplevering 92% nauwkeurig was, kan een jaar later 78% halen, zonder dat er ook maar één regel code veranderde. Het probleem zit niet in het model, maar in de wereld eromheen.

Geen bug, geen incident, geen deployment die iets brak. Een AI-model faalt zelden omdat het gisteren fout gebouwd werd. Het faalt omdat de wereld waarin het vandaag moet beslissen niet meer dezelfde is als die waarin het geleerd heeft.

Twee soorten drift

// Data drift versus concept drift
Data driftinvoer verandert van vorm
Concept driftde relatie invoer-uitkomst verandert

Data drift betekent dat het model nieuwe situaties ziet die afwijken van wat het geleerd heeft. De input verandert: andere klantgroepen, nieuwe producten, veranderend gedrag.

Concept drift betekent dat de betekenis van die input verandert. De signalen waarop het model vroeger kon vertrouwen, voorspellen de uitkomst niet meer op dezelfde manier.

Daarom verschuift AI-testing van een eenmalige kwaliteitscontrole naar continue kwaliteitsbewaking.

Hoe je drift opspoort

Statistische monitoring van de invoerdata

Vergelijk continu de verdeling van binnenkomende data met de trainingsdata. Een significante afwijking is een vroege waarschuwing, nog vóór de prestaties zichtbaar dalen.

Prestatiemonitoring met vertraging

Waar mogelijk, vergelijk voorspellingen achteraf met de werkelijke uitkomst. Dat geeft het meest directe signaal, maar komt vaak pas na een vertraging binnen.

Proxy-metrics wanneer echte labels ontbreken

Wanneer de werkelijke uitkomst pas veel later gekend is (bijvoorbeeld bij kredietrisico), gebruik je tussentijdse signalen om drift te vermoeden vóór het bevestigd wordt.

Een driftmeting is geen doel op zich. De vraag is niet "is onze data veranderd?", maar "is die verandering groot genoeg om vertrouwen in de voorspellingen te verminderen?"

Tools als Evidently AI en NannyML zijn hier specifiek voor gebouwd: ze houden de statistische afstand tussen productiedata en trainingsdata bij, en signaleren wanneer die een drempel overschrijdt.

Van eenmalige validatie naar continue assurance

Voor hoogrisicosystemen onder de EU AI Act is post-market monitoring geen aanbeveling maar een verplichting (artikel 72). Continue monitoring van modelgedrag en mogelijke drift is een belangrijke manier om aan die verplichting invulling te geven.

Een voorbeeld uit de praktijk

Een aanbevelingsmodel bij een e-commerceklant presteerde uitstekend tot het bedrijf een nieuwe productcategorie overnam via een overname. Binnen zes weken daalde de klikratio op aanbevelingen met bijna een derde, zonder dat er een release, een bug of een incident aan te wijzen was.

// Wat de monitoring liet zien
Statistische afwijking invoerdata (week 1-2)licht verhoogd
Statistische afwijking invoerdata (week 5-6)ruim boven drempel
Klikratio-daling-31%

De monitoring signaleerde de datadrift twee weken vóór de klikratio zichtbaar daalde. Zonder die vroege waarschuwing was het probleem pas via klantenklachten aan het licht gekomen, weken later.

Wat we praktisch instellen bij klanten

// Stilstand is geen stabiliteit

Weet je of jouw model vandaag nog presteert zoals bij oplevering?

We zetten drift-monitoring op en tonen je wanneer een model aan herziening toe is, vóór het klanten opvalt.

Plan een gesprek
// Lees ook