Close-up van een code-editor met een menu AI Actions, met opties als Find Problems en Suggest Refactoring

AI testen: testen met AI, en AI-toepassingen zelf testen

In het kort: AI testen kan twee dingen betekenen. Je kunt AI inzetten om te testen, bijvoorbeeld om testgevallen op te stellen of kapotte scripts te repareren. En je kunt software testen waar AI in zit, zoals een chatbot. Het eerste scheelt tijd. Het tweede vraagt een andere manier van testen, omdat AI niet altijd twee keer hetzelfde antwoord geeft.

Vraag tien mensen wat ze onder “AI testen” verstaan en je krijgt twee soorten antwoorden. Testers denken aan tools die testscripts schrijven en repareren. Producteigenaren denken aan de chatbot die net live is gegaan, en aan de vraag hoe je weet of die de juiste antwoorden geeft. Ze hebben allebei gelijk. En de meeste teams krijgen binnenkort met allebei te maken: ze gaan AI gebruiken bij het testen, en ze bouwen zelf functies met AI erin.

Wat betekent AI testen?

AI testen heeft twee betekenissen die makkelijk door elkaar lopen. De eerste is testen met AI: AI-tools die je testwerk ondersteunen. Ze stellen testgevallen op uit een user story en bedenken testdata. Ze repareren een script als een knop een andere naam krijgt, of vatten samen waarom een testrun faalde. De tweede is het testen van AI: software controleren waar AI in zit. Denk aan een klantenservice-chatbot, een tool die documenten samenvat of een model dat aanvragen beoordeelt. Dan is de vraag of de AI juiste, veilige en eerlijke antwoorden geeft. De testwereld ziet dit inmiddels als twee aparte vakgebieden. De ISTQB-certificering AI Testing (CT-AI) gaat in de huidige versie 2.0 over het testen van AI-systemen. Voor het gebruik van generatieve AI in je testwerk is er een aparte certificering, CT-GenAI. Voor een teamleider is de nuttige vraag eenvoudig: welke van de twee hebben we nu nodig, en welke straks?

Hoe helpt AI je vandaag bij het testen?

AI is sterk in het herhaalwerk van testen: werk dat veel tijd kost en weinig oordeel vraagt. Bij Nekst zetten we AI in waar het onze testers helpt. Op deze plekken levert het het meest op:

  • Testgevallen opstellen. Geef een user story met acceptatiecriteria, en AI stelt testgevallen voor, ook randgevallen die je anders zou overslaan. Een tester controleert en schrapt daarna.
  • Testdata maken. Realistische namen, adressen en orders in het juiste formaat, zonder productiedata te kopiëren.
  • Scripts repareren. Veel automatiseringstools stellen nu zelf een oplossing voor als een element op het scherm verandert. Dat heet ook wel self-healing.
  • Fouten lezen. Lange logs samenvatten en fouten met dezelfde oorzaak groeperen, zodat je weet waar je eerst moet kijken.
  • Sneller testcode schrijven. Een programmeerassistent maakt van een beschreven test een eerste versie van het script.

De rode draad: AI maakt de eerste versie sneller. Een mens beslist nog steeds of die versie klopt.

Wat kan AI niet voor je testen?

AI schrijft testscripts sneller, maar bepaalt niet wat ertoe doet. Dat deel van testen blijft mensenwerk, en het wordt belangrijker nu ontwikkelen met AI sneller gaat. Als ontwikkelaars sneller code opleveren, moet testen dat bijhouden. Meer tests is dan nog geen betere dekking. Vijf dingen lossen AI-tools niet voor je op:

  • Kiezen wat je test. Welk bedrijfsproces mag nooit breken? Welk risico kost het meest? Dat haal je uit kennis van de business, niet uit de code.
  • Eigenaar zijn van de testset. Iemand moet de tests elke nacht draaien, repareren wat stukgaat en weghalen wat niet meer nodig is. Een testset vol gegenereerde tests waar niemand naar omkijkt, veroudert net zo snel als een handgeschreven set.
  • Testdata beheren. Gegenereerde data helpt, maar tests falen nog steeds als de data in een gedeelde omgeving onder ze verandert.
  • Een uitslag beoordelen. Is dit een echte bug, een probleem in de test of een gewijzigde eis? Daar is context voor nodig.
  • Testen als een gebruiker. AI kan van een user story testcases maken. Maar het kan je niet vertellen of een echt mens het scherm begrijpt, de knop vindt of de uitkomst vertrouwt. Daar zijn mensen voor nodig: testers die exploratief testen en zelf blijven nadenken. En gebruikers uit de business die er elke dag mee werken en de acceptatietest doen.

Hoe test je software waar AI in zit?

Software met AI erin vraagt een andere aanpak, omdat de antwoorden niet altijd hetzelfde zijn. Stel een chatbot twee keer dezelfde vraag en de formulering verschilt. Soms verschilt de inhoud ook. Een simpele geslaagd of gezakt op één exact antwoord werkt dan niet. Je toetst in plaats daarvan aan criteria. Klopt het antwoord? Is het volledig? Blijft het binnen wat het bedrijf echt aanbiedt? Weigert het wat het hoort te weigeren? Zo test je AI in de praktijk, en de stappen zijn voor de meeste toepassingen vergelijkbaar:

  1. Stel een set referentievragen op. Begin met 30 tot 50 echte vragen van klanten of gebruikers, ook de lastige. Schrijf per vraag op wat een goed antwoord moet bevatten en wat er nooit in mag staan.
  2. Beoordeel de antwoorden, vergelijk ze niet alleen. Toets elk antwoord aan de criteria. Een deel kun je automatiseren, zoals of een prijs of datum klopt. Voor de rest heb je een menselijke beoordelaar nodig, of een tweede model dat het antwoord beoordeelt. Dat heet ook wel LLM-evaluatie.
  3. Test misbruik. Probeer de AI iets te laten doen wat niet mag: gegevens delen, zijn instructies negeren of iets beloven wat het bedrijf niet kan waarmaken. Pogingen om een model met slimme invoer om de tuin te leiden, heten prompt injection.
  4. Draai de set opnieuw na elke wijziging. Een nieuwe modelversie, een aangepaste prompt of nieuwe brondocumenten kunnen de antwoorden veranderen. Dit is regressietesten voor AI.
  5. Blijf monitoren, en zorg dat je het kunt aantonen. Neem steekproeven uit echte gesprekken en toets die aan dezelfde criteria, ook als er niets is veranderd. Antwoorden kunnen verschuiven als data en gebruik veranderen. Leg vast wat je hebt gecontroleerd en wat je vond. Voor AI-systemen met een hoog risico eist de AI-verordening precies dit: vastgelegde monitoring na de livegang, zolang het systeem draait.

Raamwerken helpen je om de risico’s af te dekken. De OWASP AI Testing Guide beschrijft hoe je AI-systemen test op veiligheid en betrouwbaarheid. Veel bedrijven zijn al zover. In het onderzoek van Applause uit 2026 zei 54,5% van de 1.636 deelnemers dat hun organisatie al AI-functies heeft uitgebracht.

Welke AI-testtools zijn de moeite waard?

Er is geen beste AI-testtool, omdat de tools heel verschillende dingen doen. Het helpt om in drie groepen te denken. Eerst de AI-functies in testautomatiseringstools die je misschien al gebruikt, zoals voorgestelde reparaties voor kapotte scripts. Daarmee begin je het makkelijkst, met het minste risico. Dan de platforms die vanaf het begin op AI draaien en tests schrijven en uitvoeren op basis van gewone taal. Daarmee ben je snel op weg. Kijk wel hoe je de regie houdt over wat er getest wordt, en wat er gebeurt als je ooit wilt overstappen. Tot slot zijn er evaluatietools voor toepassingen met AI erin, die je referentievragen draaien en de antwoorden scoren. Kies eerst de groep die bij je vraag past, en vergelijk pas daarna tools.

Wat betekent dit voor je team?

Begin bij de vraag die je nu hebt. Wil je AI gebruiken bij het testen? Kies dan één taak die je testers de meeste tijd kost, zoals het opstellen van testgevallen. Probeer AI daar een maand en meet wat het oplevert. Houd het denkwerk bij je testers: zij beoordelen wat AI opstelt, en blijven de toepassing zelf verkennen. Bouw je een functie met AI erin? Begin dan voor de livegang met 30 tot 50 echte vragen en duidelijke criteria, en spreek af wie de antwoorden beoordeelt.

Het tweede pad houdt bij de livegang niet op. Een AI-functie verandert onder je handen: een nieuwe modelversie, nieuwe brondocumenten, nieuwe manieren waarop mensen hem gebruiken. Je blijft de antwoorden dus testen in productie. En je moet kunnen laten zien wat je hebt getest, aan je management en bij systemen met een hoog risico ook aan toezichthouders. Met een spreadsheet vol vragen en antwoorden houd je dat geen paar maanden vol.

Daarom bouwden we VeritasAI, onze eigen tool voor het testen van AI-toepassingen. Daarmee testen we je AI-toepassing als dienst: de tool draait de testvragen doorlopend en rapporteert over de uitkomsten. Een managementdashboard laat zien hoe je AI-toepassing het over tijd doet. Een operationeel dashboard laat zien op welke vragen hij faalt en aan welke wet, regelgeving of welk raamwerk elke fout gekoppeld is. Bij elke bevinding zie je de prompt, het antwoord en een prioriteitsscore, zodat je team weet wat eerst moet. Hoe dat werkt, lees je op onze pagina over AI Compliance Testing.

Vind de foute antwoorden van je AI voordat je klanten dat doen.

AI Compliance TestingPraat met ons team

Veelgestelde vragen

Vervangt AI de softwaretester?

Niet het deel van het werk dat het meest telt. AI versnelt herhaalwerk, zoals testgevallen opstellen en scripts repareren. Bepalen wat je test, uitslagen beoordelen en verantwoordelijk zijn voor de kwaliteit van een release blijft werk voor mensen die de business kennen. Net als exploratief testen en acceptatietesten door echte gebruikers. Het werk verschuift, het verdwijnt niet.

Wat is het verschil tussen AI testen en testen met AI?

Testen met AI betekent dat je AI-tools inzet bij je testwerk. AI testen betekent meestal dat je AI-systemen zelf test, maar de term wordt ook voor de eerste betekenis gebruikt. Vraag bij twijfel welke van de twee iemand bedoelt.

Hoe test je een chatbot?

Stel een set echte vragen op en bepaal wat een goed antwoord wel en niet mag bevatten. Beoordeel de antwoorden aan de hand van die criteria. Voeg vragen toe die de chatbot proberen te misbruiken. Draai de set opnieuw na elke wijziging aan het model, de prompt of de brondocumenten.

Bestaat er een certificering voor AI testen?

Ja. ISTQB heeft Certified Tester AI Testing (CT-AI) voor het testen van AI-systemen. Voor het gebruik van generatieve AI in je testwerk is er Certified Tester Testing with Generative AI (CT-GenAI).