De meeste “AI testing tools” zijn een GPT-wrapper met een mooie interface. Een nuttig filter om te scheiden wat écht werkt van conference-demo-magie.
Na 25 jaar QA-podcasts en honderden interviews met testleiders blijft, ondanks een stortvloed aan "agentic QA"-marketing, één observatie overeind. Dat is geen cynisme: het is een nuttig uitgangspunt om te bepalen wat een tool écht oplost.
Teams bij grote technologiebedrijven die AI in productie gebruiken voor testen, zijn opvallend selectief: ze zetten AI in op specifieke, afgebakende problemen (flaky-test-detectie, selector-herstel, testgeneratie voor Playwright), niet als vervanging van hun volledige testaanpak.
Dit soort claims overleeft zelden een eigen proof-of-concept. Vraag altijd naar een demo op jouw eigen applicatie, niet op de gepolijste showcase van de vendor.
"90% minder onderhoud" zegt niets zonder te weten op welke applicatie, onder welke omstandigheden, en vergeleken met wat. Self-healing-benchmarks zijn zelden vergelijkbaar tussen vendoren.
Een tool die wijzigingen doorvoert zonder logboek of reviewmogelijkheid, bouwt technische schuld op die je pas later ontdekt.
Start bij de pijn, niet bij de hype. Verlies je tijd aan flaky tests door CI/CD? Kost testonderhoud een dag per sprint? Ontbreekt de dekking om vol vertrouwen te releasen? Zoek dan het tool dat dát specifieke probleem oplost, niet het platform dat belooft alles tegelijk te doen. Een gerichte oplossing die één probleem écht oplost, levert meer op dan een compleet platform dat overal een beetje bijdraagt.
Wij evalueren AI-testtools op precies die manier: niet op basis van de marketingclaim, maar op basis van wat ze op jouw eigen suite daadwerkelijk oplossen.
Een vendor demonstreerde een "volledig autonome AI-tester" die zonder menselijke tussenkomst een volledige regressiesuite zou opbouwen en onderhouden. Op de eigen demo-applicatie van de vendor werkte dat vlekkeloos. Op de suite van een klant, met een iets complexere multi-stap checkout, faalde de tool op stap drie van vijf: hij kon geen betrouwbaar onderscheid maken tussen een tussentijds laadscherm en een daadwerkelijke fout.
Dat is geen uitzondering, het is de regel: een tool die op een gecontroleerde demo perfect werkt, zegt weinig over hoe hij presteert op een applicatie met eigen eigenaardigheden. De enige manier om dat verschil te zien, is testen op je eigen suite, niet op die van de vendor.
We evalueren tools op jouw eigen suite, niet op de showcase van de vendor.
Plan een gesprek