Een chatbot antwoordt. Een AI-agent handelt: het roept tools aan, doorzoekt systemen en onderneemt zelfstandig meerdere stappen om een taak af te werken. Dat verschil in autonomie vraagt een andere testaanpak.
Waar een taalmodel voorheen enkel tekst genereerde, kan een agent vandaag een ticket aanmaken, een betaling initiëren of een e-mail versturen zonder tussenkomst van een gebruiker. Die stap van antwoorden naar handelen is precies waar de meeste bestaande testaanpakken tekortschieten.
Een chatbot die een fout antwoord geeft, is vervelend. Een agent die een fout uitvoert, heeft al iets veranderd voor er iemand kon ingrijpen: een verkeerde API-aanroep, een dubbele bestelling, een e-mail naar de verkeerde ontvanger. Dat verschil in gevolgen is de kern van waarom agenten een eigen testaanpak vragen.
Een agent kan de juiste tool met verkeerde parameters aanroepen, of een tool inzetten die voor de taak niet nodig was. Elke aanroep is een kans op een fout die verderop in de keten pas zichtbaar wordt.
Een agent die op een onverwacht resultaat stuit, kan blijven proberen: dezelfde tool herhaaldelijk aanroepen in de hoop op een ander resultaat. Zonder een harde grens op stappen of kosten loopt dat ongemerkt op.
Een agent met toegang tot een systeem gebruikt die toegang soms breder dan bedoeld: een leesrecht dat ook schrijfacties toelaat, of een taak die verder gaat dan de oorspronkelijke opdracht.
Agentic AI-systemen valideren is voor ons een uitbreiding van dezelfde discipline die we al toepassen op klassieke AI-systemen: niet enkel controleren of de output klopt, maar of het systeem binnen zijn grenzen blijft handelen, stap voor stap.
Bij een klant met een agent die klantendossiers bijwerkt en bevestigingsmails verstuurt, liep een test met een opzettelijk trage database vast: de agent kreeg geen bevestiging van de schrijfactie, interpreteerde dat als een fout, en probeerde de update drie keer opnieuw. Resultaat: drie identieke bevestigingsmails naar dezelfde klant.
Er verscheen geen foutmelding en geen falende test in de klassieke zin. De agent deed precies wat hem gezegd was: probeer opnieuw bij een fout. Het probleem zat in de afwezigheid van een grens op het aantal pogingen én een controle of de vorige poging misschien wél was gelukt.
De oplossing was tweeledig: een harde limiet van één herhaling, en een idempotentiecontrole die eerst nagaat of de actie al werd uitgevoerd voor ze opnieuw wordt geprobeerd.
We testen de volledige keten: van individuele tool-aanroepen tot de grenzen die een agent nooit mag overschrijden.
Plan een gesprek