In een aanbesteding staat de eis: "verwerking vindt plaats binnen de EU". Drie leveranciers vinken hem aan. De eerste draait op een Europese regio van een Amerikaanse cloud. De tweede is een Europees bedrijf met eigen servers, en bewaart prompts dertig dagen voor foutopsporing. De derde verwerkt in het werkgeheugen en bewaart de tekst niet.
Alle drie kunnen ze uitleggen waarom hun antwoord klopt. En alle drie leveren ze een wezenlijk ander risico op. Daarom is de regio maar één van de vragen, en niet eens de belangrijkste.
De drie vragen achter de vraag waar je data staat
Onder welk recht valt de aanbieder. Dit wordt meestal gesteld als "waar staat de server", en zo is het te makkelijk te beantwoorden. Een Amerikaanse aanbieder met een datacentrum in Frankfurt valt nog steeds onder de US CLOUD Act, die hem verplicht gegevens af te geven ook als ze in Europa staan. De vraag die het onderscheid maakt is niet waar de machines staan maar van wie ze zijn: een Europees bedrijf zonder Amerikaans moederbedrijf heeft niemand die zo'n bevel in ontvangst kan nemen.
Hoe lang blijft het daar. Dit is de vraag die het meeste uitmaakt en het minst wordt gesteld. Zolang tekst ergens bewaard blijft, bestaat hij: hij valt onder een bewaartermijn, hij kan in een datalek zitten, hij kan worden gevorderd en hij kan later worden teruggelezen. Verdwijnt hij direct na de controle, dan gebeurt niets van dat alles.
Wie kan erbij. Ook binnen een leverancier is dat een aparte vraag. Kunnen medewerkers bij inhoud, en zo ja waarvoor: support, kwaliteit, modeltraining? Staat dat dicht, of staat het alleen in een beleidsdocument?
Die drie samen bepalen je werkelijke risico. Een Amerikaanse leverancier met een Europese regio die dertig dagen bewaart en menselijke beoordeling toestaat, is voor je DPIA een zwaarder verhaal dan een Europese leverancier die niets vasthoudt.
Wat vluchtige verwerking precies betekent
Vluchtig verwerken wil zeggen dat de tekst alleen bestaat zolang de controle duurt. Hij komt binnen, wordt in het geheugen van de server verwerkt, en verdwijnt als het antwoord terug is. Hij wordt nooit naar schijf geschreven, dus er is geen bestand, geen back-up en geen gespreksgeschiedenis waar hij later uit te halen valt.
Dat is niet hetzelfde als "we bewaren niets langer dan nodig", een zin die vrijwel alles kan betekenen. Het verschil is te controleren, met twee vragen:
- Welke tabellen bestaan er, welke velden staan erin en hoe lang blijven ze? Een bewaartabel die dit per soort gegeven benoemt, is een ander soort antwoord dan een geruststelling.
- Wat staat er in de logs? Een leverancier die zegt niets te bewaren maar wel volledige verzoeken logt, bewaart alsnog je tekst, alleen op een plek waar niemand hem zoekt.
Voor een DPIA scheelt dit een hele kolom. Verwerking die niet plaatsvindt, hoef je niet te verantwoorden.
Waarom opslag het echte risico is
Bewaarde tekst is niet risicovol omdat iemand kwaad wil. Hij is risicovol omdat hij bestaat.
Wat bestaat, kan in een datalek terechtkomen, ook als de leverancier niets fout deed. Wat bestaat, kan worden opgevraagd door een rechter of een toezichthouder, zoals gebeurde in de zaak rond bewaarde chatlogs. Wat bestaat, kan jaren later worden teruggelezen door iemand die er destijds niets mee te maken had. En wat bestaat, moet je kunnen verwijderen als iemand daarom vraagt, dus het brengt zijn eigen werk mee.
Daarom is de vraag "wat bewaren jullie" belangrijker dan de vraag "hoe beveiligen jullie wat jullie bewaren". Het tweede is een maatregel. Het eerste is een ontwerpkeuze, en die weegt zwaarder.
Statistieken die geen personen bevatten
Er is nog een plek waar gegevens achterblijven, en die wordt vaak over het hoofd gezien: de rapportage. Een tool kan netjes geen tekst bewaren en toch precies vastleggen wie wat deed.
De vraag is dus niet alleen of inhoud wordt bewaard, maar of aan de cijfers een gebruikers-id hangt. Zit dat erin, dan is elk cijfer achteraf tot een persoon te herleiden, ongeacht wat het dashboard vandaag toont. Zit het er niet in, dan bestaat die mogelijkheid domweg niet, ook niet voor de leverancier.
Vraag daarom door op twee dingen: dragen de gegevens een gebruikers-id, en bestaat er een weergave per medewerker. Dat is het verschil tussen inzicht in patronen en toezicht op mensen, en het is het verschil dat je ondernemingsraad zal willen horen.
Wat je een leverancier vraagt
Vier vragen die het onderscheid blootleggen tussen een architectuur en een brochure:
- Welke gegevens worden bewaard, in welke velden, en hoe lang?
- Wordt de inhoud gebruikt voor modeltraining of menselijke beoordeling, en waar ligt dat vast?
- Wie kan er bij de inhoud, ook binnen jullie eigen organisatie?
- Hangt er een gebruikers-id aan de cijfers, en bestaat er een weergave per medewerker?
Wie die vier beantwoordt, heeft een architectuur uitgelegd. Wie alleen zegt "wij verwerken in Europa", heeft een marketingzin uitgesproken.
Hoe wij het doen
Wij krijgen deze vragen zelf ook, dus hier zijn onze antwoorden.
De detectie draait op onze eigen servers bij Europese aanbieders: de applicatie, de database en de opslag op Scaleway in de regio Amsterdam, de modellen op een eigen server bij Hetzner in Duitsland. Dat zijn geen Europese regio's van een Amerikaanse cloud maar Europese bedrijven: Scaleway is voor 96 procent eigendom van het Franse Iliad, Hetzner Online GmbH zit in Gunzenhausen in Duitsland. Er is dus geen Amerikaans moederbedrijf dat een bevel onder de CLOUD Act moet opvolgen. Beide zijn ISO 27001-gecertificeerd; Scaleway heeft daarnaast HDS voor het hosten van zorggegevens. Er komt geen externe AI-dienst aan te pas: niets gaat naar ChatGPT, Google of een andere partij, en het detectiemodel is van onszelf.
De tekst die iemand typt wordt in het werkgeheugen gecontroleerd en meteen daarna gewist. Hij wordt niet naar schijf geschreven, niet gelogd en niet gebruikt om modellen te trainen. Wat we wel bewaren is een regel per markering: om welk type gevoelige gegevens het ging, het niveau, de app, het moment en wat de gebruiker ermee deed. Geen tekst, en geen gebruikers-id, want de database heeft daar geen kolom voor. Die cijfers bewaren we maximaal 24 maanden.
Het dashboard toont dus patronen en nooit personen. Er is geen doorklik naar een individuele medewerker, en wie iets deed valt achteraf niet te achterhalen, ook niet door ons. Dat is geen instelling die je aan kunt zetten, het is hoe het is gebouwd.
Wil je het naast je eigen eisen leggen, dan staat het volledige verhaal in het Trust Center: wat we opslaan, hoe lang, met welke subverwerkers en hoe de toegang is geregeld.