Expertise hub / Testen
Testen 10 min lezen

Bias & fairness testing uitgelegd

Nauwkeurigheid van 94% zegt niets over wie de overige 6% zijn. Bias-testing gaat over die vraag: niet hoe goed een model gemiddeld presteert, maar voor wie het faalt.

Een model kan uitstekend presteren op het geheel van een testset en tegelijk systematisch slechter presteren voor een specifieke groep. Dat is geen randgeval: het is precies waar bias-testing om draait.

Waar bias vandaan komt

01

Data-bias

De trainingsdata weerspiegelt historische ongelijkheid, of bevat bepaalde groepen onvoldoende.

02

Label-bias

De "juiste antwoorden" waarop het model trainde, zijn zelf al door menselijke vooroordelen gekleurd.

03

Proxy-bias

Een schijnbaar neutraal kenmerk (postcode, opleidingsnaam) correleert sterk met een beschermd kenmerk.

Dat laatste is het lastigste om op te sporen. Een model dat geslacht of etniciteit nooit als invoer krijgt, kan alsnog discriminerend gedrag vertonen omdat andere variabelen er sterk mee samenhangen. "We gebruiken dat kenmerk niet" is dus geen garantie.

Hoe je het meet

// Twee gangbare fairness-metrics
Demographic paritygelijke uitkomstkansen per groep
Equalized oddsgelijke fout- en trefkans per groep

Geen van beide metrics is universeel "de juiste". Demographic parity kan onwenselijk zijn wanneer groepen legitiem verschillen in de onderliggende situatie; equalized odds vraagt betrouwbare labels per groep, die niet altijd voorhanden zijn. De keuze hangt af van de context, en die keuze hoort een bewuste, gedocumenteerde beslissing te zijn, geen toevallige.

Veelgemaakte fout: enkel het gemiddelde testen

Een globale accuraatheidsscore verbergt exact het probleem dat bias-testing moet blootleggen. Test altijd uitgesplitst per relevante subgroep.

Veelgemaakte fout: bias-testing als eenmalige check

Een model dat vandaag fair scoort, kan dat na retraining op nieuwe data niet meer zijn. Bias-testing hoort bij elke modelversie, niet enkel bij lancering.

Fairness is geen kenmerk dat een model heeft of niet heeft. Het is een meetbare eigenschap die per context, per metric en per subgroep verschilt, en die je expliciet moet nagaan, niet veronderstellen.

Waarom dit meer is dan een ethische kwestie

Voor AI-systemen in HR, kredietbeoordeling of andere Annex III-domeinen onder de EU AI Act is non-discriminatie geen vrijblijvend streven maar een wettelijke verplichting. Tools als Fairlearn en SHAP maken bias meetbaar en de bijdrage van individuele kenmerken traceerbaar: precies het soort bewijs dat een technisch dossier moet bevatten.

Een voorbeeld uit de praktijk

Bij een kredietbeoordelingsmodel dat we voor een klant valideerden, scoorde het model een globale nauwkeurigheid van 91%. Uitgesplitst per postcodegebied bleek de afwijzingsgraad voor twee wijken echter dubbel zo hoog als het gemiddelde, zonder dat inkomen of kredietgeschiedenis dat verschil verklaarde.

// Wat de uitsplitsing blootlegde
Globale nauwkeurigheid91%
Afwijzingsgraad, gemiddeld14%
Afwijzingsgraad, twee specifieke postcodes27–29%

Postcode was geen invoer van het model. Maar een gecorreleerd kenmerk (het type onderpand, sterk verbonden met de buurt) fungeerde als proxy. Dat soort verband vind je nooit door enkel de invoervariabelen te inspecteren; je vindt het door de uitkomsten uit te splitsen naar groep en te vergelijken.

Hoe je dit praktisch aanpakt

// Weet voor wie je model niet werkt

Benieuwd of jouw model systematisch een groep benadeelt?

We voeren een bias-analyse uit op je model en tonen concreet waar de verschillen zitten.

Plan een gesprek
// Lees ook