Expertise hub / Generatieve AI
Generatieve AI 9 min lezen

Hallucinaties bij LLM's: hoe meet je dat

Het lastige aan een hallucinatie is dat ze er zelden onzeker uitziet. Het model twijfelt niet, het antwoordt gewoon fout. Hoe maak je dat testbaar?

Een taalmodel dat iets verzint (een niet-bestaand rapport, een verkeerd jaartal, een citaat dat nooit is uitgesproken) presenteert dat met exact dezelfde stelligheid als een correct antwoord. Er is geen foutmelding, geen laag-vertrouwenswaarschuwing. Gewoon een zelfverzekerd fout antwoord.

Voor een experiment is dat misschien nog aanvaardbaar. Zodra een LLM klantvragen beantwoordt, medewerkers adviseert of beslissingen ondersteunt, wordt elke onbeheerde hallucinatie een kwaliteits- en vertrouwensrisico.

Twee soorten hallucinatie

// Intrinsiek versus extrinsiek
Intrinsiektegenspreekt de gegeven bron
Extrinsiekniet te verifiëren aan de bron

Intrinsieke hallucinatie is het makkelijkst op te sporen: het model beweert iets dat rechtstreeks ingaat tegen de brontekst die het kreeg.

Extrinsieke hallucinaties zijn lastiger. Het model voegt informatie toe die niet uit de bron komt. Die informatie kan toevallig correct zijn, maar ze is niet onderbouwd door de context waarop het antwoord zou moeten steunen. In domeinen waar juistheid telt, zijn beide vormen een probleem.

Hoe je het meetbaar maakt

Groundedness-scoring

Elke bewering in de output wordt afgezet tegen de brondocumenten: is dit letterlijk of logisch afgeleid uit wat werd meegegeven, of niet?

Automatische fact-checking tegen een kennisbank

Voor gesloten domeinen (een productcatalogus, interne documentatie) kan je beweringen automatisch aftoetsen aan een betrouwbare bron.

Menselijke beoordeling met steekproeven

Voor open, generatieve taken blijft menselijke evaluatie nodig: geautomatiseerde metrics missen nuance en context.

Bij RAG-systemen (retrieval-augmented generation) komt daar een extra laag bovenop: een hallucinatie kan ontstaan omdat het model foutief redeneert, maar evengoed omdat de opgehaalde brondocumenten zelf niet relevant of niet correct waren. Wie enkel de output test en niet de retrieval-stap, mist de helft van het probleem.

Een hallucinatiepercentage van 2% klinkt beheersbaar, tot je beseft dat het om 2% van elk antwoord gaat dat een gebruiker voor waar aanneemt.

Wat je in de praktijk opbouwt

Hallucinatie volledig elimineren is met de huidige generatie modellen niet realistisch. Het meetbaar en beheersbaar maken, wel, en dat is precies het verschil tussen een demo en een productiesysteem.

Een voorbeeld uit de praktijk

Bij een klantenservice-bot die antwoordt op basis van interne productdocumentatie (een RAG-opzet) testten we honderd vragen tegen een vaste kennisbank. Het antwoordpercentage met een correct onderbouwd antwoord lag aanvankelijk op 82%.

// Waar de overige 18% misging
Verkeerd brondocument opgehaald11%
Correct document, foutieve interpretatie7%

Het grootste deel van de hallucinaties kwam dus niet uit het model zelf, maar uit de retrieval-stap: de zoekfunctie haalde het verkeerde productblad op, waarna het model plichtsgetrouw, en verkeerd, een antwoord bouwde op basis van die foute bron. Een test die enkel de output beoordeelde, had de oorzaak gemist.

Wat we in dit soort trajecten meten

// Van gevoel naar cijfer

Weet je hoe vaak jouw LLM-toepassing hallucineert?

We bouwen een testset en meetmethode op maat van jouw domein, en tonen je het werkelijke cijfer.

Plan een gesprek
// Lees ook