Het lastige aan een hallucinatie is dat ze er zelden onzeker uitziet. Het model twijfelt niet, het antwoordt gewoon fout. Hoe maak je dat testbaar?
Een taalmodel dat iets verzint (een niet-bestaand rapport, een verkeerd jaartal, een citaat dat nooit is uitgesproken) presenteert dat met exact dezelfde stelligheid als een correct antwoord. Er is geen foutmelding, geen laag-vertrouwenswaarschuwing. Gewoon een zelfverzekerd fout antwoord.
Voor een experiment is dat misschien nog aanvaardbaar. Zodra een LLM klantvragen beantwoordt, medewerkers adviseert of beslissingen ondersteunt, wordt elke onbeheerde hallucinatie een kwaliteits- en vertrouwensrisico.
Intrinsieke hallucinatie is het makkelijkst op te sporen: het model beweert iets dat rechtstreeks ingaat tegen de brontekst die het kreeg.
Extrinsieke hallucinaties zijn lastiger. Het model voegt informatie toe die niet uit de bron komt. Die informatie kan toevallig correct zijn, maar ze is niet onderbouwd door de context waarop het antwoord zou moeten steunen. In domeinen waar juistheid telt, zijn beide vormen een probleem.
Elke bewering in de output wordt afgezet tegen de brondocumenten: is dit letterlijk of logisch afgeleid uit wat werd meegegeven, of niet?
Voor gesloten domeinen (een productcatalogus, interne documentatie) kan je beweringen automatisch aftoetsen aan een betrouwbare bron.
Voor open, generatieve taken blijft menselijke evaluatie nodig: geautomatiseerde metrics missen nuance en context.
Bij RAG-systemen (retrieval-augmented generation) komt daar een extra laag bovenop: een hallucinatie kan ontstaan omdat het model foutief redeneert, maar evengoed omdat de opgehaalde brondocumenten zelf niet relevant of niet correct waren. Wie enkel de output test en niet de retrieval-stap, mist de helft van het probleem.
Hallucinatie volledig elimineren is met de huidige generatie modellen niet realistisch. Het meetbaar en beheersbaar maken, wel, en dat is precies het verschil tussen een demo en een productiesysteem.
Bij een klantenservice-bot die antwoordt op basis van interne productdocumentatie (een RAG-opzet) testten we honderd vragen tegen een vaste kennisbank. Het antwoordpercentage met een correct onderbouwd antwoord lag aanvankelijk op 82%.
Het grootste deel van de hallucinaties kwam dus niet uit het model zelf, maar uit de retrieval-stap: de zoekfunctie haalde het verkeerde productblad op, waarna het model plichtsgetrouw, en verkeerd, een antwoord bouwde op basis van die foute bron. Een test die enkel de output beoordeelde, had de oorzaak gemist.
We bouwen een testset en meetmethode op maat van jouw domein, en tonen je het werkelijke cijfer.
Plan een gesprek