Computable - Polteq: AI testen vraagt om een nieuwe kijk op softwarekwaliteit

ADVERTORIAL

POLTEQ > MARC VAN ‘T VEER

AI testen vraagt om een nieuwe kijk op softwarekwaliteit

AI voegt een nieuw soort risico toe aan IT-landschappen. Waar traditionele software voorspelbaar reageert op dezelfde input, kan een AI-systeem telkens een ander antwoord geven. “Bestaande test- en kwaliteitsprocessen moeten worden aangevuld met een aanpak die ook onvoorspelbaar gedrag zichtbaar maakt”, zegt Marc van ‘t Veer, Test Architect bij Polteq.

AI-systemen gaan zelden ‘stuk’. Ze blijven antwoorden geven, ook wanneer die antwoorden onjuist, ongewenst of zelfs gevaarlijk zijn. Juist dat maakt AI lastig te testen, weet Van ‘t Veer. “De klassieke risicoanalyse gaat uit van de vergelijking ‘kans maal impact’. Dus hoe groot is de impact als het fout gaat en hoe groot is de kans dat het fout gaat? Met het AI-element in het IT-landschap is nu niet meer voldoende. Een derde factor wordt belangrijk: de mate waarin een fout zichtbaar is. Dus is de vergelijking nu: ‘kans maal impact, maal zichtbaarheid’. Of eigenlijk onzichtbaarheid, want de output van AI kan overtuigend klinken, terwijl niemand direct merkt dat het niet klopt.”

Dat vraagt om een andere manier van testen. Niet alleen moet worden vastgesteld óf een AI-toepassing fouten maakt, maar vooral hoe ernstig die fouten zijn en hoe vaak ze voorkomen. “Onze experts kunnen daarbij helpen door te bepalen wat het juiste antwoord zou moeten zijn”, zegt Van ‘t Veer. “De werkelijke AI-output wordt vervolgens met die referentie vergeleken. Naarmate de afwijking groter of structureler wordt, neemt het risico toe.”

Daarbij moet niet alleen naar het AI-model zelf worden gekeken, benadrukt Van ‘t Veer. “AI is onderdeel van een bredere IT-keten en moet bijvoorbeeld kunnen voldoen aan beleidsregels, wetgeving en contractuele voorwaarden. Een virtuele verzekeringsassistent mag klanten geen dekking beloven die niet in de polis staat. Toch kan een gebruiker het systeem bewust uitdagen om zo’n belofte te doen. Testen moet daarom ook aantonen hoe een AI-systeem zich onder dergelijke druk gedraagt.

“Onze aanpak telt tien stappen. We beginnen bij wat het systeem belooft en wie beslist: adviseert het model, of beslist het? Daarna volgt de risicoanalyse over de hele keten, met het model als één component, en scheiden we het deterministische deel van het niet-deterministische. Voor dat laatste kiezen we een testorakel: wat is het juiste antwoord, en wat kost elk type fout? Eerlijk twijfelen is goedkoop, plausibel gokken is duur. De steekproef trekken we langs risicoklassen, niet langs functionaliteit. Normen en beslisregels leggen we vooraf vast, we meten hoe zeker het model over zijn eigen antwoord is en we vergelijken trainingscondities met de productiepraktijk. Tot slot zetten we triggers die aangeven wanneer hertesten nodig is.”

Om dat proces te automatiseren ontwikkelde Polteq een testframework voor AI- en ML-systemen, Polteq iQ genaamd. Het vergelijkt verschillende versies van een model en maakt zichtbaar welke impact wijzigingen hebben voor een nieuwe versie live gaat.

De uitdaging voor bedrijven is uiteindelijk een balans te vinden tussen snelheid en kwaliteit. Van ‘t Veer : “AI is weliswaar nieuw voor veel bedrijven, maar testen en nadenken over software kwaliteit doen we al als Polteq al 25 jaar.”

‘De uitdaging voor bedrijven is uiteindelijk een balans te vinden tussen snelheid en kwaliteit’