Een team bij een zorgorganisatie wil een tool gebruiken die vergaderingen opneemt en samenvat. De privacyfunctionaris opent de website van de leverancier en leest: ISO 27001, hosting in de EU, "AVG-conform". Drie vinkjes. Ze weet dat dat geen antwoord is, maar ze weet ook niet meteen wat dan wél de vragen zijn.
Het risico van een AI-tool zit niet in één score. Het zit in een reeks dimensies die je stuk voor stuk kunt bevragen, en waarvan er twee niet over de tool gaan maar over jouw organisatie. Dat is de reden waarom dezelfde tool bij de ene afdeling laag risico is en bij de andere hoog.
Waarom werkt één score niet?
Een score is handig als je honderden tools op volgorde wilt zetten. Maar het moment waarop je een besluit neemt over één tool, is precies het moment waarop je wilt weten waar het getal vandaan komt. Een tool met een gemiddelde score kan op alle dimensies middelmatig zijn, of uitstekend op zes en onaanvaardbaar op één. Dat verschil bepaalt het besluit, en het getal verbergt het.
Er is een tweede reden. Een score over de tool kan alleen iets zeggen over de tool. Of een team er klantgegevens in gaat zetten, staat er niet in. Een beoordeling die alleen naar de leverancier kijkt, is dus een halve beoordeling, hoe grondig ook.
Welke dimensies doen ertoe?
Negen, in de volgorde waarin ze het meest opleveren. Bij elke dimensie hoort één vraag. Wie die negen vragen kan beantwoorden, heeft genoeg om een besluit op te bouwen; wie er drie niet kan beantwoorden, weet in elk geval waar het onderzoek nog ligt.
| Dimensie | De vraag die je stelt |
|---|---|
| Invoer | Wat gebeurt er met wat iemand invoert: wordt het opgeslagen, hoe lang, en wie kan erbij? |
| Training | Wordt invoer gebruikt om het model te verbeteren, en verschilt dat per accounttype? |
| Verwerking en recht | Waar vindt de verwerking plaats, en onder welk recht valt de leverancier en zijn moederbedrijf? |
| Verwerkersovereenkomst | Is er een verwerkersovereenkomst beschikbaar, en op welk abonnement? |
| Certificeringen | Welke certificeringen heeft de leverancier, en welke zijn relevant voor deze verwerking? |
| Koppelingen | Bij welke andere systemen mag de tool: agenda, mail, documenten, broncode? |
| Incidenten | Welke incidenten zijn bekend, hoe is erop gereageerd, en is de bron controleerbaar? |
| Gebruiksvorm | Waarvoor gaat de organisatie de tool inzetten: samenvatten, schrijven, transcriberen, code? |
| Persoonsgegevens | Welke persoonsgegevens komen er bij dat gebruik waarschijnlijk in, en hoe gevoelig zijn die? |
De eerste zeven vragen stel je aan de leverancier, of zoek je op in diens documentatie. De laatste twee stel je aan het team dat de tool wil gebruiken. Ze zijn even belangrijk, en ze worden het vaakst overgeslagen.
Wat gebeurt er met de invoer?
Dit is de dimensie die het zwaarst weegt, en de vraag die het meest wordt ingekort tot "wordt erop getraind?". Training is één ding dat met je invoer kan gebeuren. Opslag, bewaartermijn, menselijke beoordeling bij vermoeden van misbruik en technische logging zijn vier andere, en die gebeuren ook bij een leverancier die niet traint. Wat de trainingsbelofte precies wel en niet dekt, staat in wat "we trainen niet op jouw data" precies betekent.
Vraag daarom per categorie: gespreksinhoud, bijlagen, technische logs. Vraag naar de termijn en of die instelbaar is. En vraag of het antwoord verschilt tussen het gratis account, het zakelijke account en de API, want bij vrijwel elke leverancier is dat zo.
Waar staat het, en van wie is het?
Twee vragen die als één worden gesteld. Een leverancier die in Frankfurt draait, kan een Amerikaans bedrijf zijn, en dan is de locatie van het datacentrum niet het antwoord op de vraag welke overheid gegevens kan vorderen. Wat er in dat geval speelt, en waarom de bewaartermijn vaak zwaarder weegt dan de regio, staat in waar je data blijft.
Voor de beoordeling noteer je drie dingen: de verwerkingsregio, de vestigingsplaats van de contractpartij, en of er een moederbedrijf is met een andere rechtsmacht. "Wij hosten in de EU" is één van de drie.
Is er een verwerkersovereenkomst, en voor wie?
Verwerkt de tool persoonsgegevens namens jouw organisatie, dan is de leverancier verwerker en hoort daar een verwerkersovereenkomst bij. De grote leveranciers bieden die aan, maar alleen op hun zakelijke abonnementen. Het gratis account werkt onder consumentenvoorwaarden, zonder. Wanneer je er een nodig hebt en wat erin moet staan, is uitgewerkt in heb je een verwerkersovereenkomst nodig voor een AI-tool.
Voor de beoordeling is het antwoord dus nooit "ja" of "nee", maar "ja, op abonnement X". Dat bepaalt meteen welk account de organisatie moet aanschaffen als ze de tool wil toestaan.
Wat zegt een certificering wel en niet?
Een ISO 27001-certificaat zegt dat de leverancier zijn informatiebeveiliging volgens een norm heeft ingericht en dat een externe partij dat heeft getoetst. Dat is waardevol. Het zegt niets over training, over rechtsmacht, over de bewaartermijn van je prompts, of over wat jouw mensen invoeren.
Kijk daarom niet naar het aantal logo's, maar naar de relevantie. Voor een zorgorganisatie is NEN 7510 relevant, voor een onderwijsinstelling FERPA in de Verenigde Staten of de Nederlandse afspraken over leerlinggegevens. Een certificering die niet bij de verwerking past, telt niet mee. En let op het verschil tussen "onze hosting is gecertificeerd" en "wij zijn gecertificeerd". Beide kunnen waar zijn, en ze betekenen iets anders.
Welke koppelingen krijgt de tool?
Een chatbot waarin je tekst plakt, ziet wat je plakt. Een assistent die bij je agenda, je mail en je documenten mag, ziet alles waar hij bij mag, ook wat je niet had bedoeld. De reikwijdte van een tool verandert dus met elke koppeling, en een tool die bij aanschaf laag risico was, kan dat een functie later niet meer zijn.
Vraag per koppeling: met wiens rechten, met welke reikwijdte, en kan die worden beperkt. Een tool die "alles in SharePoint" mag doorzoeken, erft elke te ruime machtiging die daar in de loop der jaren is gezet.
Welke incidenten zijn bekend?
Elke grote leverancier heeft incidenten gehad. Dat is op zichzelf geen reden om een tool af te wijzen. Wat telt is het patroon: hoe snel was het gemeld, hoe is het opgelost, en is de bron controleerbaar. Een incident zonder controleerbare bron is een gerucht, en een gerucht hoort niet in een beoordeling.
Leg per incident de bron vast. Een beoordeling die een jaar later wordt herlezen, moet nog steeds kunnen laten zien waar een oordeel vandaan kwam.
Welke gebruiksvorm, en welke gegevens?
Hier verandert de beoordeling van een leveranciersonderzoek in een besluit. Dezelfde tool voor het bedenken van slogans en dezelfde tool voor het samenvatten van functioneringsgesprekken zijn twee verschillende verwerkingen. Bij de eerste komen waarschijnlijk geen persoonsgegevens binnen; bij de tweede komen ze zeker binnen, en dan van de gevoelige soort.
Vraag het team wat het gaat doen, en leid daaruit af welke gegevens er waarschijnlijk in komen. Niet "welke gegevens mogen erin", want dat staat in het beleid, maar welke er in de praktijk in zullen komen. Dat antwoord bepaalt of een verwerkersovereenkomst nodig is, of een DPIA aan de orde is, en welke voorwaarde er bij het besluit hoort.
Waarom kan dezelfde tool laag én hoog risico zijn?
Omdat de dimensies niet allemaal over de tool gaan. Twee ervan, gebruiksvorm en persoonsgegevens, gaan over jouw organisatie. En van de andere zeven verandert er een aantal met het account: training, verwerkersovereenkomst, bewaartermijn en beheerinstellingen zijn bij het zakelijke account van een tool anders dan bij het gratis account. Dat verschil is groot genoeg om er twee aparte beoordelingen van te maken, wat in gratis versus zakelijk AI-account wordt uitgelegd.
Een accountantskantoor beoordeelde een chatbot voor twee teams. Het marketingteam wilde er teksten mee herschrijven, via de zakelijke licentie met verwerkersovereenkomst: op elke dimensie in orde, laag risico, toegestaan. Het controleteam wilde er jaarrekeningen mee samenvatten, en bleek dat al te doen via gratis accounts van een paar medewerkers: geen verwerkersovereenkomst, training niet uitgezet, klantgegevens in de invoer. Dezelfde tool, twee besluiten. Voor het controleteam werd het: niet toegestaan via een gratis account, wel via de licentie, met als voorwaarde dat klantnamen vooraf worden vervangen.
De vragen die je de leverancier stelt om de eerste zeven dimensies te vullen, staan uitgeschreven in een AI-tool goedkeuren: welke vragen stel je de leverancier, met per vraag wat een bruikbaar en wat een ontwijkend antwoord is.
Hoe wordt dit een besluit?
Een beoordeling is pas iets waard als er een besluit uit volgt dat is vastgelegd en dat mensen op het werkmoment tegenkomen. Anders is het een archiefstuk. Het besluit heeft één van vier statussen, en bij "beperkt toegestaan" hoort de voorwaarde die uit de beoordeling volgt.
BeeSensible houdt een catalogus bij van 865 AI-tools, met per tool de leverancier, het land, certificeringen, het trainingsbeleid, of een verwerkersovereenkomst beschikbaar is, en gedocumenteerde incidenten met bron. Elke tool krijgt een risicoscore over zes gewogen dimensies: data-governance (gewicht 6), jurisdictie (4), compliance (3), incidenten (3), integratie (2) en leveranciersvertrouwen (2), met een maximum van 100. De banden zijn Laag onder 40, Middel van 40 tot 59, Hoog van 60 tot 79 en Kritiek vanaf 80. Gratis en zakelijke versies van dezelfde tool staan er als aparte regels in, met een eigen score.