Nauwkeurigheid van 94% zegt niets over wie de overige 6% zijn. Bias-testing gaat over die vraag: niet hoe goed een model gemiddeld presteert, maar voor wie het faalt.
Een model kan uitstekend presteren op het geheel van een testset en tegelijk systematisch slechter presteren voor een specifieke groep. Dat is geen randgeval: het is precies waar bias-testing om draait.
De trainingsdata weerspiegelt historische ongelijkheid, of bevat bepaalde groepen onvoldoende.
De "juiste antwoorden" waarop het model trainde, zijn zelf al door menselijke vooroordelen gekleurd.
Een schijnbaar neutraal kenmerk (postcode, opleidingsnaam) correleert sterk met een beschermd kenmerk.
Dat laatste is het lastigste om op te sporen. Een model dat geslacht of etniciteit nooit als invoer krijgt, kan alsnog discriminerend gedrag vertonen omdat andere variabelen er sterk mee samenhangen. "We gebruiken dat kenmerk niet" is dus geen garantie.
Geen van beide metrics is universeel "de juiste". Demographic parity kan onwenselijk zijn wanneer groepen legitiem verschillen in de onderliggende situatie; equalized odds vraagt betrouwbare labels per groep, die niet altijd voorhanden zijn. De keuze hangt af van de context, en die keuze hoort een bewuste, gedocumenteerde beslissing te zijn, geen toevallige.
Een globale accuraatheidsscore verbergt exact het probleem dat bias-testing moet blootleggen. Test altijd uitgesplitst per relevante subgroep.
Een model dat vandaag fair scoort, kan dat na retraining op nieuwe data niet meer zijn. Bias-testing hoort bij elke modelversie, niet enkel bij lancering.
Voor AI-systemen in HR, kredietbeoordeling of andere Annex III-domeinen onder de EU AI Act is non-discriminatie geen vrijblijvend streven maar een wettelijke verplichting. Tools als Fairlearn en SHAP maken bias meetbaar en de bijdrage van individuele kenmerken traceerbaar: precies het soort bewijs dat een technisch dossier moet bevatten.
Bij een kredietbeoordelingsmodel dat we voor een klant valideerden, scoorde het model een globale nauwkeurigheid van 91%. Uitgesplitst per postcodegebied bleek de afwijzingsgraad voor twee wijken echter dubbel zo hoog als het gemiddelde, zonder dat inkomen of kredietgeschiedenis dat verschil verklaarde.
Postcode was geen invoer van het model. Maar een gecorreleerd kenmerk (het type onderpand, sterk verbonden met de buurt) fungeerde als proxy. Dat soort verband vind je nooit door enkel de invoervariabelen te inspecteren; je vindt het door de uitkomsten uit te splitsen naar groep en te vergelijken.
We voeren een bias-analyse uit op je model en tonen concreet waar de verschillen zitten.
Plan een gesprek