Grip op AI
Blog
AI-governance 9 min leestijd

Hoe beoordeel je het risico van een AI-tool?

Er is geen magische score. Wel negen dimensies die er echt toe doen, van wat er met je invoer gebeurt tot welke persoonsgegevens er waarschijnlijk in komen. En de reden dat dezelfde tool laag én hoog risico kan zijn.

Abstracte dubbele golven in teal en zand
Snel antwoord

Het risico van een AI-tool beoordeel je niet met één score, maar langs een vaste reeks dimensies: wat gebeurt er met de invoer, wordt die gebruikt voor training, waar vindt de verwerking plaats en onder welk recht, is er een verwerkersovereenkomst, welke certificeringen zijn relevant, welke koppelingen krijgt de tool, welke incidenten zijn bekend, welke gebruiksvorm wordt beoogd en welke persoonsgegevens komen er waarschijnlijk in. De eerste zeven gaan over de tool en de leverancier; de laatste twee over jouw organisatie. Daarom kan dezelfde tool bij het ene gebruik laag risico zijn en bij het andere hoog. De score is advies. Het besluit blijft van de organisatie.

01

Eén score verbergt precies de afweging die je moet maken

02

Zeven dimensies gaan over de tool en de leverancier, twee over jouw gebruik

03

Het accounttype weegt vaak zwaarder dan de naam van de tool

04

Een certificering zegt iets over de leverancier, niet over wat jouw mensen invoeren

05

Een risicoscore is advies, het besluit legt de organisatie zelf vast

Een team bij een zorgorganisatie wil een tool gebruiken die vergaderingen opneemt en samenvat. De privacyfunctionaris opent de website van de leverancier en leest: ISO 27001, hosting in de EU, "AVG-conform". Drie vinkjes. Ze weet dat dat geen antwoord is, maar ze weet ook niet meteen wat dan wél de vragen zijn.

Het risico van een AI-tool zit niet in één score. Het zit in een reeks dimensies die je stuk voor stuk kunt bevragen, en waarvan er twee niet over de tool gaan maar over jouw organisatie. Dat is de reden waarom dezelfde tool bij de ene afdeling laag risico is en bij de andere hoog.

Waarom werkt één score niet?

Een score is handig als je honderden tools op volgorde wilt zetten. Maar het moment waarop je een besluit neemt over één tool, is precies het moment waarop je wilt weten waar het getal vandaan komt. Een tool met een gemiddelde score kan op alle dimensies middelmatig zijn, of uitstekend op zes en onaanvaardbaar op één. Dat verschil bepaalt het besluit, en het getal verbergt het.

Er is een tweede reden. Een score over de tool kan alleen iets zeggen over de tool. Of een team er klantgegevens in gaat zetten, staat er niet in. Een beoordeling die alleen naar de leverancier kijkt, is dus een halve beoordeling, hoe grondig ook.

Welke dimensies doen ertoe?

Negen, in de volgorde waarin ze het meest opleveren. Bij elke dimensie hoort één vraag. Wie die negen vragen kan beantwoorden, heeft genoeg om een besluit op te bouwen; wie er drie niet kan beantwoorden, weet in elk geval waar het onderzoek nog ligt.

DimensieDe vraag die je stelt
InvoerWat gebeurt er met wat iemand invoert: wordt het opgeslagen, hoe lang, en wie kan erbij?
TrainingWordt invoer gebruikt om het model te verbeteren, en verschilt dat per accounttype?
Verwerking en rechtWaar vindt de verwerking plaats, en onder welk recht valt de leverancier en zijn moederbedrijf?
VerwerkersovereenkomstIs er een verwerkersovereenkomst beschikbaar, en op welk abonnement?
CertificeringenWelke certificeringen heeft de leverancier, en welke zijn relevant voor deze verwerking?
KoppelingenBij welke andere systemen mag de tool: agenda, mail, documenten, broncode?
IncidentenWelke incidenten zijn bekend, hoe is erop gereageerd, en is de bron controleerbaar?
GebruiksvormWaarvoor gaat de organisatie de tool inzetten: samenvatten, schrijven, transcriberen, code?
PersoonsgegevensWelke persoonsgegevens komen er bij dat gebruik waarschijnlijk in, en hoe gevoelig zijn die?

De eerste zeven vragen stel je aan de leverancier, of zoek je op in diens documentatie. De laatste twee stel je aan het team dat de tool wil gebruiken. Ze zijn even belangrijk, en ze worden het vaakst overgeslagen.

Wat gebeurt er met de invoer?

Dit is de dimensie die het zwaarst weegt, en de vraag die het meest wordt ingekort tot "wordt erop getraind?". Training is één ding dat met je invoer kan gebeuren. Opslag, bewaartermijn, menselijke beoordeling bij vermoeden van misbruik en technische logging zijn vier andere, en die gebeuren ook bij een leverancier die niet traint. Wat de trainingsbelofte precies wel en niet dekt, staat in wat "we trainen niet op jouw data" precies betekent.

Vraag daarom per categorie: gespreksinhoud, bijlagen, technische logs. Vraag naar de termijn en of die instelbaar is. En vraag of het antwoord verschilt tussen het gratis account, het zakelijke account en de API, want bij vrijwel elke leverancier is dat zo.

Waar staat het, en van wie is het?

Twee vragen die als één worden gesteld. Een leverancier die in Frankfurt draait, kan een Amerikaans bedrijf zijn, en dan is de locatie van het datacentrum niet het antwoord op de vraag welke overheid gegevens kan vorderen. Wat er in dat geval speelt, en waarom de bewaartermijn vaak zwaarder weegt dan de regio, staat in waar je data blijft.

Voor de beoordeling noteer je drie dingen: de verwerkingsregio, de vestigingsplaats van de contractpartij, en of er een moederbedrijf is met een andere rechtsmacht. "Wij hosten in de EU" is één van de drie.

Is er een verwerkersovereenkomst, en voor wie?

Verwerkt de tool persoonsgegevens namens jouw organisatie, dan is de leverancier verwerker en hoort daar een verwerkersovereenkomst bij. De grote leveranciers bieden die aan, maar alleen op hun zakelijke abonnementen. Het gratis account werkt onder consumentenvoorwaarden, zonder. Wanneer je er een nodig hebt en wat erin moet staan, is uitgewerkt in heb je een verwerkersovereenkomst nodig voor een AI-tool.

Voor de beoordeling is het antwoord dus nooit "ja" of "nee", maar "ja, op abonnement X". Dat bepaalt meteen welk account de organisatie moet aanschaffen als ze de tool wil toestaan.

Wat zegt een certificering wel en niet?

Een ISO 27001-certificaat zegt dat de leverancier zijn informatiebeveiliging volgens een norm heeft ingericht en dat een externe partij dat heeft getoetst. Dat is waardevol. Het zegt niets over training, over rechtsmacht, over de bewaartermijn van je prompts, of over wat jouw mensen invoeren.

Kijk daarom niet naar het aantal logo's, maar naar de relevantie. Voor een zorgorganisatie is NEN 7510 relevant, voor een onderwijsinstelling FERPA in de Verenigde Staten of de Nederlandse afspraken over leerlinggegevens. Een certificering die niet bij de verwerking past, telt niet mee. En let op het verschil tussen "onze hosting is gecertificeerd" en "wij zijn gecertificeerd". Beide kunnen waar zijn, en ze betekenen iets anders.

Welke koppelingen krijgt de tool?

Een chatbot waarin je tekst plakt, ziet wat je plakt. Een assistent die bij je agenda, je mail en je documenten mag, ziet alles waar hij bij mag, ook wat je niet had bedoeld. De reikwijdte van een tool verandert dus met elke koppeling, en een tool die bij aanschaf laag risico was, kan dat een functie later niet meer zijn.

Vraag per koppeling: met wiens rechten, met welke reikwijdte, en kan die worden beperkt. Een tool die "alles in SharePoint" mag doorzoeken, erft elke te ruime machtiging die daar in de loop der jaren is gezet.

Welke incidenten zijn bekend?

Elke grote leverancier heeft incidenten gehad. Dat is op zichzelf geen reden om een tool af te wijzen. Wat telt is het patroon: hoe snel was het gemeld, hoe is het opgelost, en is de bron controleerbaar. Een incident zonder controleerbare bron is een gerucht, en een gerucht hoort niet in een beoordeling.

Leg per incident de bron vast. Een beoordeling die een jaar later wordt herlezen, moet nog steeds kunnen laten zien waar een oordeel vandaan kwam.

Welke gebruiksvorm, en welke gegevens?

Hier verandert de beoordeling van een leveranciersonderzoek in een besluit. Dezelfde tool voor het bedenken van slogans en dezelfde tool voor het samenvatten van functioneringsgesprekken zijn twee verschillende verwerkingen. Bij de eerste komen waarschijnlijk geen persoonsgegevens binnen; bij de tweede komen ze zeker binnen, en dan van de gevoelige soort.

Vraag het team wat het gaat doen, en leid daaruit af welke gegevens er waarschijnlijk in komen. Niet "welke gegevens mogen erin", want dat staat in het beleid, maar welke er in de praktijk in zullen komen. Dat antwoord bepaalt of een verwerkersovereenkomst nodig is, of een DPIA aan de orde is, en welke voorwaarde er bij het besluit hoort.

Waarom kan dezelfde tool laag én hoog risico zijn?

Omdat de dimensies niet allemaal over de tool gaan. Twee ervan, gebruiksvorm en persoonsgegevens, gaan over jouw organisatie. En van de andere zeven verandert er een aantal met het account: training, verwerkersovereenkomst, bewaartermijn en beheerinstellingen zijn bij het zakelijke account van een tool anders dan bij het gratis account. Dat verschil is groot genoeg om er twee aparte beoordelingen van te maken, wat in gratis versus zakelijk AI-account wordt uitgelegd.

Een accountantskantoor beoordeelde een chatbot voor twee teams. Het marketingteam wilde er teksten mee herschrijven, via de zakelijke licentie met verwerkersovereenkomst: op elke dimensie in orde, laag risico, toegestaan. Het controleteam wilde er jaarrekeningen mee samenvatten, en bleek dat al te doen via gratis accounts van een paar medewerkers: geen verwerkersovereenkomst, training niet uitgezet, klantgegevens in de invoer. Dezelfde tool, twee besluiten. Voor het controleteam werd het: niet toegestaan via een gratis account, wel via de licentie, met als voorwaarde dat klantnamen vooraf worden vervangen.

De vragen die je de leverancier stelt om de eerste zeven dimensies te vullen, staan uitgeschreven in een AI-tool goedkeuren: welke vragen stel je de leverancier, met per vraag wat een bruikbaar en wat een ontwijkend antwoord is.

Hoe wordt dit een besluit?

Een beoordeling is pas iets waard als er een besluit uit volgt dat is vastgelegd en dat mensen op het werkmoment tegenkomen. Anders is het een archiefstuk. Het besluit heeft één van vier statussen, en bij "beperkt toegestaan" hoort de voorwaarde die uit de beoordeling volgt.

BeeSensible houdt een catalogus bij van 865 AI-tools, met per tool de leverancier, het land, certificeringen, het trainingsbeleid, of een verwerkersovereenkomst beschikbaar is, en gedocumenteerde incidenten met bron. Elke tool krijgt een risicoscore over zes gewogen dimensies: data-governance (gewicht 6), jurisdictie (4), compliance (3), incidenten (3), integratie (2) en leveranciersvertrouwen (2), met een maximum van 100. De banden zijn Laag onder 40, Middel van 40 tot 59, Hoog van 60 tot 79 en Kritiek vanaf 80. Gratis en zakelijke versies van dezelfde tool staan er als aparte regels in, met een eigen score.

Zoek tool of categorie…
865 tools
ChatGPT🇺🇸
HoogToegestaan
Claude🇺🇸
MiddelToegestaan
DeepSeek🇨🇳nieuw
KritiekNiet toegestaan
Perplexity🇺🇸nieuw
MiddelNog geen besluit
Mistral🇫🇷
LaagNog geen besluit
Midjourney🇺🇸
MiddelNog geen besluit

Elke tool, beoordeeld op risico

865 AI-tools, elk beoordeeld van Laag tot Kritiek, zonder dat er iets vooraf is goedgekeurd of geblokkeerd totdat iemand een besluit neemt.

Meer over AI Tools

Die score is advies. De twee dimensies die over jouw organisatie gaan, gebruiksvorm en persoonsgegevens, kan een catalogus niet invullen, en daarom beslist de catalogus nooit. Elke tool begint op "nog geen besluit" en de organisatie legt zelf de status vast, ook als de score laag is. Wat het product daarin precies doet, staat op de productpagina over AI-tools; de andere stukken over dit onderwerp staan op de themapagina AI-governance.

Nog één kanttekening voor wie de beoordeling grondig doet: de Europese privacytoezichthouders concludeerden in hun opinie over AI-modellen dat een model dat op persoonsgegevens is getraind niet zonder meer als anoniem kan worden beschouwd. De trainingsvraag heeft dus twee kanten: wat de leverancier met jouw invoer doet, en wat er al in het model zit. De tweede kant is voor de meeste beoordelingen minder urgent, maar hij hoort in het dossier.

De volgende beoordeling begint niet bij de website van de leverancier, maar bij twee vragen aan het team: wat ga je ermee doen, en welke gegevens komen daarbij langs. De zeven vragen aan de leverancier volgen daarna, en het besluit dat eruit komt heeft een status en een voorwaarde, geen cijfer.

FAQ

Veelgestelde vragen

Wat is het belangrijkste risico van een AI-tool?

Meestal wat er met je invoer gebeurt: wordt die opgeslagen, hoe lang, wordt erop getraind, en wie kan erbij. Dat weegt zwaarder dan de locatie van de server of een certificering. Maar het hangt af van het gebruik: een tool die alleen openbare tekst vertaalt, heeft een ander risico dan dezelfde tool die klantdossiers samenvat.

Is een AI-tool met ISO 27001-certificering veilig?

Een certificering zegt dat de leverancier zijn informatiebeveiliging op een bepaalde manier heeft ingericht en daar op is getoetst. Het zegt niets over of de leverancier op je invoer traint, onder welk recht hij valt, of over wat jouw medewerkers in de tool zetten. Het is één dimensie van de beoordeling, niet het antwoord.

Waarom scoort dezelfde tool bij de ene organisatie hoger dan bij de andere?

Omdat het risico niet alleen van de tool afhangt. Een gratis account en een zakelijk account van dezelfde tool verwerken je invoer onder andere voorwaarden. En het beoogde gebruik verschilt: een marketingteam dat slogans bedenkt, brengt andere gegevens in dan een HR-afdeling die verslagen samenvat. De tool is dezelfde, de situatie niet.

Heb je voor elke AI-tool een DPIA nodig?

Nee. Een DPIA is verplicht als de verwerking waarschijnlijk een hoog risico oplevert voor betrokkenen, en dat hangt af van wat je met de tool doet en welke gegevens erin komen. De beoordeling in dit artikel helpt om te bepalen of dat het geval is. Het is een voorbereiding op die vraag, geen vervanging ervan.

Hoe vaak moet je de beoordeling van een AI-tool herhalen?

Bij een gebeurtenis, niet op een vaste datum: een overname, gewijzigde voorwaarden, een incident, een nieuwe functie die de reikwijdte vergroot, of een verplaatsing van de hosting. AI-leveranciers veranderen sneller dan een jaarlijkse cyclus. Leg vast wat er op de datum van beoordeling is toegezegd, dan is een latere afwijking een controleerbaar feit.

Portret van Rens Timmermans van BeeSensible

Liever iemand die het laat zien?

Rens, BeeSensible

Ik geef je graag een rondleiding van twintig minuten. Laat je gegevens achter, dan zoek ik een moment dat jou uitkomt. Bellen of mailen mag natuurlijk ook.

Liever eerst iemand spreken? Plan een call.

Wil je een live demo, of een offerte voor 100+ gebruikers? Laat je gegevens achter en we nemen binnen één werkdag contact op.