Grip op AI
Blog
AI-datalekken 8 min leestijd

Waar je data blijft: wat er met je tekst gebeurt nadat je hem typt

Drie leveranciers zeggen alle drie dat ze in Europa verwerken, en alle drie hebben ze gelijk. Het verschil zit niet in waar de server staat, maar in wat er daarna met je tekst gebeurt.

Abstracte golven in teal met verbonden datapunten
Snel antwoord

Waar de server staat is de minst nuttige van de drie vragen. Een Amerikaanse aanbieder met een Europees datacentrum valt nog steeds onder de US CLOUD Act, dus het gaat erom van wie het bedrijf is. Daarna wegen twee dingen zwaarder dan de locatie: hoe lang blijft je tekst daar, en wie kan erbij. Een leverancier die in Amsterdam verwerkt maar prompts dertig dagen bewaart, houdt langer iets van jou vast dan een leverancier die in het werkgeheugen verwerkt en meteen wist. Wat niet wordt bewaard, valt niet onder een bewaartermijn, komt niet in een datalek en is later door niemand terug te lezen. Vraag dus niet alleen naar de regio, maar naar de bewaartermijn, naar wie er inzage heeft, en naar wat er in de statistieken terechtkomt.

01

De regio van de server zegt weinig; van wie het bedrijf is zegt meer

02

Wat in het werkgeheugen wordt verwerkt en gewist, valt buiten vorderingen en datalekken

03

Vraag door op wie er inzage heeft, ook binnen de leverancier

04

Statistieken zonder gebruikers-id zijn achteraf niet tot een persoon te herleiden

05

Zet de antwoorden naast elkaar in je DPIA; verwerking die niet plaatsvindt hoef je niet te verantwoorden

In een aanbesteding staat de eis: "verwerking vindt plaats binnen de EU". Drie leveranciers vinken hem aan. De eerste draait op een Europese regio van een Amerikaanse cloud. De tweede is een Europees bedrijf met eigen servers, en bewaart prompts dertig dagen voor foutopsporing. De derde verwerkt in het werkgeheugen en bewaart de tekst niet.

Alle drie kunnen ze uitleggen waarom hun antwoord klopt. En alle drie leveren ze een wezenlijk ander risico op. Daarom is de regio maar één van de vragen, en niet eens de belangrijkste.

De drie vragen achter de vraag waar je data staat

Onder welk recht valt de aanbieder. Dit wordt meestal gesteld als "waar staat de server", en zo is het te makkelijk te beantwoorden. Een Amerikaanse aanbieder met een datacentrum in Frankfurt valt nog steeds onder de US CLOUD Act, die hem verplicht gegevens af te geven ook als ze in Europa staan. De vraag die het onderscheid maakt is niet waar de machines staan maar van wie ze zijn: een Europees bedrijf zonder Amerikaans moederbedrijf heeft niemand die zo'n bevel in ontvangst kan nemen.

Hoe lang blijft het daar. Dit is de vraag die het meeste uitmaakt en het minst wordt gesteld. Zolang tekst ergens bewaard blijft, bestaat hij: hij valt onder een bewaartermijn, hij kan in een datalek zitten, hij kan worden gevorderd en hij kan later worden teruggelezen. Verdwijnt hij direct na de controle, dan gebeurt niets van dat alles.

Wie kan erbij. Ook binnen een leverancier is dat een aparte vraag. Kunnen medewerkers bij inhoud, en zo ja waarvoor: support, kwaliteit, modeltraining? Staat dat dicht, of staat het alleen in een beleidsdocument?

Die drie samen bepalen je werkelijke risico. Een Amerikaanse leverancier met een Europese regio die dertig dagen bewaart en menselijke beoordeling toestaat, is voor je DPIA een zwaarder verhaal dan een Europese leverancier die niets vasthoudt.

Wat vluchtige verwerking precies betekent

Vluchtig verwerken wil zeggen dat de tekst alleen bestaat zolang de controle duurt. Hij komt binnen, wordt in het geheugen van de server verwerkt, en verdwijnt als het antwoord terug is. Hij wordt nooit naar schijf geschreven, dus er is geen bestand, geen back-up en geen gespreksgeschiedenis waar hij later uit te halen valt.

Dat is niet hetzelfde als "we bewaren niets langer dan nodig", een zin die vrijwel alles kan betekenen. Het verschil is te controleren, met twee vragen:

  • Welke tabellen bestaan er, welke velden staan erin en hoe lang blijven ze? Een bewaartabel die dit per soort gegeven benoemt, is een ander soort antwoord dan een geruststelling.
  • Wat staat er in de logs? Een leverancier die zegt niets te bewaren maar wel volledige verzoeken logt, bewaart alsnog je tekst, alleen op een plek waar niemand hem zoekt.

Voor een DPIA scheelt dit een hele kolom. Verwerking die niet plaatsvindt, hoef je niet te verantwoorden.

Waarom opslag het echte risico is

Bewaarde tekst is niet risicovol omdat iemand kwaad wil. Hij is risicovol omdat hij bestaat.

Wat bestaat, kan in een datalek terechtkomen, ook als de leverancier niets fout deed. Wat bestaat, kan worden opgevraagd door een rechter of een toezichthouder, zoals gebeurde in de zaak rond bewaarde chatlogs. Wat bestaat, kan jaren later worden teruggelezen door iemand die er destijds niets mee te maken had. En wat bestaat, moet je kunnen verwijderen als iemand daarom vraagt, dus het brengt zijn eigen werk mee.

Daarom is de vraag "wat bewaren jullie" belangrijker dan de vraag "hoe beveiligen jullie wat jullie bewaren". Het tweede is een maatregel. Het eerste is een ontwerpkeuze, en die weegt zwaarder.

Statistieken die geen personen bevatten

Er is nog een plek waar gegevens achterblijven, en die wordt vaak over het hoofd gezien: de rapportage. Een tool kan netjes geen tekst bewaren en toch precies vastleggen wie wat deed.

De vraag is dus niet alleen of inhoud wordt bewaard, maar of aan de cijfers een gebruikers-id hangt. Zit dat erin, dan is elk cijfer achteraf tot een persoon te herleiden, ongeacht wat het dashboard vandaag toont. Zit het er niet in, dan bestaat die mogelijkheid domweg niet, ook niet voor de leverancier.

Vraag daarom door op twee dingen: dragen de gegevens een gebruikers-id, en bestaat er een weergave per medewerker. Dat is het verschil tussen inzicht in patronen en toezicht op mensen, en het is het verschil dat je ondernemingsraad zal willen horen.

Wat je een leverancier vraagt

Vier vragen die het onderscheid blootleggen tussen een architectuur en een brochure:

  1. Welke gegevens worden bewaard, in welke velden, en hoe lang?
  2. Wordt de inhoud gebruikt voor modeltraining of menselijke beoordeling, en waar ligt dat vast?
  3. Wie kan er bij de inhoud, ook binnen jullie eigen organisatie?
  4. Hangt er een gebruikers-id aan de cijfers, en bestaat er een weergave per medewerker?

Wie die vier beantwoordt, heeft een architectuur uitgelegd. Wie alleen zegt "wij verwerken in Europa", heeft een marketingzin uitgesproken.

Hoe wij het doen

Wij krijgen deze vragen zelf ook, dus hier zijn onze antwoorden.

De detectie draait op onze eigen servers bij Europese aanbieders: de applicatie, de database en de opslag op Scaleway in de regio Amsterdam, de modellen op een eigen server bij Hetzner in Duitsland. Dat zijn geen Europese regio's van een Amerikaanse cloud maar Europese bedrijven: Scaleway is voor 96 procent eigendom van het Franse Iliad, Hetzner Online GmbH zit in Gunzenhausen in Duitsland. Er is dus geen Amerikaans moederbedrijf dat een bevel onder de CLOUD Act moet opvolgen. Beide zijn ISO 27001-gecertificeerd; Scaleway heeft daarnaast HDS voor het hosten van zorggegevens. Er komt geen externe AI-dienst aan te pas: niets gaat naar ChatGPT, Google of een andere partij, en het detectiemodel is van onszelf.

De tekst die iemand typt wordt in het werkgeheugen gecontroleerd en meteen daarna gewist. Hij wordt niet naar schijf geschreven, niet gelogd en niet gebruikt om modellen te trainen. Wat we wel bewaren is een regel per markering: om welk type gevoelige gegevens het ging, het niveau, de app, het moment en wat de gebruiker ermee deed. Geen tekst, en geen gebruikers-id, want de database heeft daar geen kolom voor. Die cijfers bewaren we maximaal 24 maanden.

Het dashboard toont dus patronen en nooit personen. Er is geen doorklik naar een individuele medewerker, en wie iets deed valt achteraf niet te achterhalen, ook niet door ons. Dat is geen instelling die je aan kunt zetten, het is hoe het is gebouwd.

Wil je het naast je eigen eisen leggen, dan staat het volledige verhaal in het Trust Center: wat we opslaan, hoe lang, met welke subverwerkers en hoe de toegang is geregeld.

FAQ

Veelgestelde vragen

Is verwerking in Europa genoeg?

Niet vanzelf. 'In de EU' zegt elke Amerikaanse aanbieder over zijn Europese regio, terwijl hij onder de US CLOUD Act nog steeds gegevens moet afgeven. Kijk dus of het bedrijf zelf Europees is, en daarna naar de bewaartermijn: wie je prompts dertig dagen bewaart, houdt langer iets van jou vast dan wie in het werkgeheugen verwerkt en meteen wist.

Wat betekent verwerken in het werkgeheugen?

Dat de tekst alleen bestaat zolang de controle duurt, in het geheugen van de server, en daarna verdwijnt zonder ooit naar schijf te zijn geschreven. Er is dan geen bestand, geen back-up en geen gespreksgeschiedenis waar hij later uit te halen valt.

Hoe controleer ik of een leverancier echt niets bewaart?

Vraag om de bewaartabel: welke tabellen bestaan er, welke velden staan erin en hoe lang blijven ze. Vraag daarnaast wat er in de logs staat. Een leverancier die zegt niets te bewaren maar wel volledige verzoeken logt, bewaart alsnog je tekst.

Wie kan er bij mijn tekst, ook binnen de leverancier?

Dat is een aparte vraag van de bewaartermijn. Vraag of medewerkers van de leverancier bij inhoud kunnen, of dat is dichtgezet, en of er menselijke beoordeling plaatsvindt voor kwaliteit of training. Vraag ook of de inhoud voor modeltraining wordt gebruikt en waar dat vastligt.

Wat komt er in de statistieken terecht?

Vraag of aan de gegevens een gebruikers-id hangt. Zonder gebruikers-id is een cijfer achteraf niet tot een persoon te herleiden, ook niet door de leverancier zelf. Vraag ook of er een weergave per medewerker bestaat, want dat is het verschil tussen inzicht in patronen en toezicht op mensen.

Portret van Rens Timmermans van BeeSensible

Liever iemand die het laat zien?

Rens, BeeSensible

Ik geef je graag een rondleiding van twintig minuten. Laat je gegevens achter, dan zoek ik een moment dat jou uitkomt. Bellen of mailen mag natuurlijk ook.

Liever eerst iemand spreken? Plan een call.

Wil je een live demo, of een offerte voor 100+ gebruikers? Laat je gegevens achter en we nemen binnen één werkdag contact op.