Techniek en leveranciers

Wat gebeurt er met jouw data als je op verstuur drukt?

De reis van een prompt, stap voor stap: tokens, contextvenster, caching, opslag, misbruikdetectie en wat er blijft staan als je een gesprek verwijdert.

Bijgewerkt 21 augustus 2026 · leestijd ongeveer 23 minuten

1. Tien dingen die de meeste mensen niet weten

"Waar gaat mijn data naartoe?" is de meest gestelde vraag over AI, en meestal wordt hij beantwoord met een leveranciersbelofte. Deze pagina doet het anders: hij volgt een prompt van je toetsenbord tot het antwoord terug is, en laat per stap zien wat er gebeurt en wat er blijft staan. Wie dat begrijpt, kan zelf beoordelen of een tool geschikt is voor een klantdossier.

2. Stap 1: op je eigen laptop, vóór verzending

Voordat er iets verstuurd is, staat je tekst al ergens. De webinterfaces van de grote AI-diensten zijn applicaties die in je browser draaien; wat je typt staat in het werkgeheugen, en het blijft in de meeste apps staan als je van tabblad wisselt of de pagina opnieuw laadt. Dat betekent dat er iets lokaal wordt weggeschreven.

Er zijn bovendien lokale sporen die niets met de AI-leverancier te maken hebben en die vrijwel niemand meeweegt: de spellingcontrole en het automatisch invullen van je browser, sessieherstel na een crash, de woordvoorspelling van je mobiele toetsenbord, en de synchronisatie van je browsergeschiedenis naar een cloudaccount. Een prompt met een klantnaam kan dus op je laptop staan én in een back-up van je browserprofiel.

3. Stap 2: over de lijn — en wie er meekijkt

Het verzoek gaat versleuteld over het internet, met de gebruikelijke transportversleuteling. Een netwerkbeheerder onderweg ziet dan wél naar welke dienst je verbinding maakt en hoe groot het verzoek is, maar niet de inhoud.

Aan de andere kant komt het verzoek binnen bij een reeks systemen die authenticeren, verkeer verdelen en snelheidslimieten toepassen. Dat is standaard clouddienstverlening en op zichzelf niet interessant — behalve dat elk van die lagen logregels genereert.

4. Stap 3: je tekst wordt in stukjes gehakt

Een taalmodel werkt niet met woorden maar met tokens: stukjes tekst uit een vast woordenboek die het model als één eenheid verwerkt. Volgens de documentatie van OpenAI kan een token "zo kort zijn als één teken en zo lang als een volledig woord". De vuistregels die daar staan gelden voor Engels: ongeveer vier tekens per token, ongeveer driekwart woord per token, honderd tokens is ongeveer vijfenzeventig woorden.

5. Stap 4: het hele gesprek gaat elke keer opnieuw mee

Dit is het punt dat vrijwel niemand kent en dat de meeste praktische gevolgen heeft.

Het contextvenster is alle tekst waarnaar het model kan verwijzen bij het maken van een antwoord, inclusief dat antwoord zelf. De documentatie beschrijft het als een werkgeheugen, en zet het expliciet tegenover de enorme hoeveelheid data waarop het model is getraind. Alles telt mee: de systeeminstructie, elk bericht in het gesprek, elk toolresultaat, elke afbeelding, elk document, de definities van de beschikbare tools, en het antwoord dat het model genereert.

En dan de kern: het model heeft geen geheugen tussen twee verzoeken. Bij elke nieuwe vraag wordt het gesprek opnieuw voorgelezen. De documentatie noemt dat "progressieve tokenaccumulatie" waarbij eerdere ronden volledig bewaard blijven; de invoerfase van elke ronde bevat de volledige gespreksgeschiedenis plus je nieuwe bericht.

6. Stap 5: de cache die ook bij "wij bewaren niets" bestaat

Om het sneller en goedkoper te maken, bewaren aanbieders tussenresultaten van het rekenwerk. Begint een volgend verzoek met exact dezelfde tekst, dan kan dat hergebruikt worden. Dat heet prompt caching, en het betekent dat er tijdelijk een bewerkte representatie van je prompt bestaat buiten het verzoek zelf.

AanbiederHoe lang blijft zo'n cache staan
Anthropic, standaard5 minuten, verlengd bij elk hergebruik
Anthropic, verlengde variant1 uur, tegen een hogere prijs
OpenAI, recentere modellen30 minuten, verlengd bij hergebruik
OpenAI, eerdere modellen5 tot 10 minuten inactiviteit, tot maximaal een uur; op sommige oudere modellen tot 24 uur
Google GeminiImpliciete caching staat standaard aan; geen bewaartijd gedocumenteerd op de pagina die wij ophaalden

Twee dingen zijn hier expliciet toegezegd en die zijn belangrijk. Caches worden niet gedeeld tussen organisaties — alleen leden van dezelfde organisatie kunnen bij een cache van identieke prompts, en bij één aanbieder geldt op sommige platformen zelfs isolatie per werkomgeving. En caching overleeft zero data retention in afgezwakte vorm: de aanbieder bewaart dan niet de ruwe tekst, maar houdt de cacherepresentaties en cryptografische hashes alleen in het geheugen en niet in opslag.

7. Stap 6: het rekenen zelf — en waar versleuteling stopt

Het model draait op gespecialiseerde rekenkaarten in datacenters. Die datacenters zijn niet van de AI-aanbieder zelf: die huurt capaciteit bij cloudpartijen, in meerdere landen. Eén aanbieder publiceert een lijst met infrastructuurpartijen in twintig-plus landen; een andere zegt meerdere cloudleveranciers te gebruiken en standaard te routeren naar geselecteerde landen in de VS, Europa, Azië en Australië.

Het antwoord komt daarna stukje bij stukje terug — dat "typen" dat je ziet is niet het model dat nadenkt, maar tokens die één voor één arriveren. Twee bijkomstigheden: de verbinding blijft minuten open, wat sommige bedrijfsproxy's afkappen, en als het model een intern redeneerspoor produceert, gaat dat óók over de lijn en valt het onder dezelfde bewaarregels als de rest.

8. Wat er daarna blijft staan

Dit is het deel dat je nodig hebt voor je verwerkersovereenkomst en je bewaarbeleid. De termijnen verschillen per aanbieder en per abonnementsvorm, en ze veranderen — dus verifieer ze bij contractsluiting. Het patroon is wel stabiel.

WatTermijn
Verwijderde gesprekken, zakelijkBinnen 30 dagen uit de systemen, tenzij er een wettelijke plicht is om ze te bewaren
API-invoer en -uitvoer, standaardTot 30 dagen, voor dienstverlening en misbruikdetectie
MisbruikdetectielogsTot 30 dagen
Gesprekken waar je feedback op gaf (duimpje)Het hele gesprek, tot 5 jaar, losgekoppeld van je identiteit
Voor veiligheid gemarkeerde in- en uitvoer2 jaar; de classificatiescores 7 jaar
Bij consumentenabonnement mét modelverbetering aanTot 5 jaar in gede-identificeerde vorm in trainingspijplijnen
Bestanden en containers van agent- en codefunctiesTot 30 dagen, of "tot je het zelf verwijdert"
Vectoropslag en assistent-objectenVaak onbeperkt tot je ze handmatig verwijdert of een vervaltermijn instelt
AI in de Microsoft-omgevingVolgens je eigen bewaarbeleid; prompts staan in een verborgen map in de mailbox van de gebruiker
AI in de Google-omgevingInstelbaar van 90 dagen tot onbepaald — zet dit actief op een termijn

Zero data retention: wat het is en wat het níet dekt

Zero data retention betekent dat de aanbieder je invoer en uitvoer niet opslaat, behalve waar de wet dat eist of waar het nodig is tegen misbruik. Drie dingen die je moet weten:

  1. Het is geen vinkje in de interface. Je moet het aanvragen, het is onderworpen aan goedkeuring en het wordt per organisatie beoordeeld.
  2. Het geldt niet voor consumentenabonnementen.
  3. Het vervalt per functie. Dit is het belangrijkste punt van deze hele paragraaf: code-uitvoering, bestandsopslag, batchverwerking, agentvaardigheden en connectoren naar externe systemen zijn expliciet níet geschikt voor zero retention. Zodra je agentachtige functies aanzet, verlies je dus je zero-retentiepositie voor precies die functies.

Misbruikdetectie: wie kan er meelezen

Technisch zijn dit kleinere modellen die elke in- en uitvoer scoren op categorieën uit het gebruiksbeleid. Wat gedocumenteerd is:

  • Bij één aanbieder kunnen medewerkers standaard niet bij je gesprekken, tenzij je feedback deelt of er een beleidsbeoordeling nodig is; dan mogen alleen aangewezen medewerkers erbij, op need-to-know-basis. Gemarkeerde inhoud wordt losgekoppeld van je identiteit — met de kanttekening dat de aanbieder zich het recht voorbehoudt die koppeling terug te maken om zijn voorwaarden te handhaven.
  • Bij een andere aanbieder is de toegang beperkt tot bevoegde medewerkers plus gespecialiseerde externe contractanten die uitsluitend op misbruik beoordelen. Die contractanten staan met naam en land in het register van onderaannemers — onder andere in de Filipijnen, de Verenigde Staten en Canada.
  • Bij een gratis API-variant staat het onomwonden: menselijke beoordelaars mogen je invoer en uitvoer lezen, annoteren en verwerken. Met de bijbehorende instructie om er geen gevoelige, vertrouwelijke of persoonlijke informatie in te zetten.

9. Leert het model van jouw gesprek?

Drie dingen worden hier constant door elkaar gehaald, en het onderscheid is precies waar de angst zit.

Wat het isVerandert het model?
In-context lerenHet model "leert" binnen één verzoek, uitsluitend doordat de tekst in het contextvenster staatNee. Sluit je het gesprek, dan is het weg
GeheugenfunctiesLijkt op leren, maar is gewone databaseopslag die vóór je prompt wordt geplaktNee. Alleen de invoer is aangevuld
Echte training of fine-tuningEen batchproces bij de aanbieder, los van je gesprekJa — en dit is het enige waar de gewichten veranderen

Dat de derde categorie losstaat van jouw gesprek, blijkt uit de manier waarop de opt-out werkt: uitzetten geldt alleen vóóruit, en je data blijft zitten in modellen die al getraind zijn of waarvan de training al is begonnen. Een model dat live zou leren, zou zo'n formulering niet nodig hebben.

De trainingsregels per abonnementsvorm

  • Consument, standaard: ja, er wordt op getraind. Er is een instelling om het uit te zetten, en de aanwezigheid van die opt-out zegt genoeg over de standaardstand. Let op: training uitzetten verwijdert je geschiedenis níet.
  • Zakelijk, standaard: nee. Bij de grote aanbieders is dit contractueel dichtgezet — bij één in de commerciële voorwaarden zelfs in de vorm "de aanbieder mag geen modellen trainen op klantinhoud".
  • Het lek dat vrijwel niemand kent: ook als je training hebt uitgezet, kan het hele gesprek dat je van feedback voorziet worden gebruikt om modellen te trainen. Eén duimpje omlaag onder een antwoord over een cliëntdossier stuurt dus dat hele dossierfragment de pijplijn in — en bij één aanbieder blijft zo'n gesprek vijf jaar bewaard.

Kan er data uit een model worden teruggehaald?

Ja, aantoonbaar — maar het gaat om data die in de trainingsset zat, niet om jouw prompt van vanmiddag. Onderzoekers hebben honderden letterlijke tekstfragmenten uit trainingsdata van een model gehaald, waaronder namen, telefoonnummers en e-mailadressen, ook als die maar in één document voorkwamen. Memorisatie neemt toe met de grootte van het model, met hoe vaak iets in de data voorkomt, en met de lengte van het aanknopingspunt dat je geeft. Bij productiemodellen is aangetoond dat een aanval die het model uit zijn gespreksrol duwt de emissie van trainingsdata sterk verhoogt.

En het punt dat direct raakt aan zoekende assistenten: uit embeddings alleen — de getallenreeksen in een vectordatabase — is 92% van korte teksten exact te reconstrueren, inclusief volledige namen uit medische dossiers. Een vectordatabase is dus geen anonimiseringsmaatregel.

Juridisch sluit dat aan bij het standpunt van de Europese privacytoezichthouders: een model dat op persoonsgegevens is getraind kan niet in alle gevallen als anoniem worden beschouwd. Zie Wat de Europese toezichthouders hebben vastgesteld.

10. Wat er gebeurt als je een gesprek verwijdert

Het verdwijnt direct uit je geschiedenis en binnen dertig dagen uit de opslag aan de achterkant. Wat er niet verdwijnt:

  • Voor veiligheid gemarkeerde in- en uitvoer (twee jaar) en de classificatiescores (zeven jaar).
  • Gesprekken waar je feedback op gaf (vijf jaar).
  • Data die al in een trainingsronde is meegegaan.
  • Wat er in de systemen aan de achterkant staat, naast wat jij in de interface ziet.
  • Geheugenfuncties. Een aanbieder zegt het expliciet: de opslag van bewaarde herinneringen staat los van je chatgeschiedenis, en ook als je een gesprek verwijdert kunnen de daaruit bewaarde herinneringen in latere gesprekken worden gebruikt. Om iets echt kwijt te raken moet je élke plek opruimen waar het voorkomt.
  • Back-ups. Geen enkele aanbieder publiceert een concrete back-upbewaartermijn. De standaardformulering in contracten is dat vertrouwelijke informatie op verzoek wordt vernietigd, "behalve kopieën in geautomatiseerde back-upsystemen". Dat betekent: back-ups vallen buiten de verwijderbelofte tot ze zelf verlopen.
  • Bij de betaalde API van één aanbieder: verwijderen op verzoek is niet ondersteund. Je wacht de bewaartermijn uit.

11. De zes varianten, en waarom het verschil enorm is

VariantWat blijft er staanWie is verwerker
a. Gratis consumenten-chatbotGeschiedenis tot je wist; met training aan tot 5 jaar gede-identificeerd; gemarkeerd 2 jaar plus scores 7 jaarNiemand namens jou. De aanbieder handelt voor eigen doeleinden. Geen verwerkersovereenkomst, dus geen rechtsgeldige basis voor cliëntgegevens
b. Zakelijk abonnementStandaard onbeperkt tenzij je een termijn instelt; verwijderd binnen 30 dagen; kopieën aan de achterkant naast wat je zietAanbieder is verwerker, jij verantwoordelijke. Geen training
c. Directe API-koppeling30 dagen standaard — maar assistent-objecten en vectoropslag blijven "tot je ze verwijdert", dus onbeperkt bij nalatigheidAanbieder is verwerker; zero retention mogelijk maar aan te vragen en niet voor alle functies
d. AI in bestaande softwareIn je eigen omgeving, volgens je eigen bewaarbeleid; verwijdering opgeschort bij een bewaarplicht of een juridisch beslagDe softwareleverancier is verwerker; de modelaanbieders zijn onderaannemers — en één van hen valt buiten de EU-datagrens
e. Model via cloudplatform in eigen EU-regioWat je zelf logt, plus misbruiklogging van het platformCloudleverancier is verwerker; met afgeschermd rekenen kan zelfs die worden buitengesloten
f. Open model op eigen hardwareAlleen wat je zelf bewaart. Geen misbruiklogs, geen classificatiescoresJij, volledig. Geen verwerkersovereenkomst nodig — maar ook geen certificeringen, en de beveiliging is jouw probleem

12. Als de AI in je eigen documenten zoekt

Zodra een assistent je eigen dossiers kan doorzoeken, verandert het verhaal wezenlijk. Er wordt namelijk een tweede kopie van je informatie gemaakt: je documenten worden in stukken gehakt, omgezet in getallenreeksen en geïndexeerd. Bij één aanbieder gaat dat standaard in stukken van 800 tokens met 400 tokens overlap.

Drie gevolgen:

  1. De inhoud van je dossiers verlaat de bestandsserver en komt in een tweede opslagsysteem met een eigen levensduur en een eigen back-upregime. Bij één aanbieder valt die bestandsopslag expliciet buiten zero retention en blijft de data staan tot je die zelf verwijdert.
  2. De vectoren zijn geen versleuteling. Zie paragraaf 9: het overgrote deel van korte teksten is eruit te reconstrueren.
  3. Autorisatie is het echte probleem. Een goed ingerichte assistent respecteert de bestaande rechten: hij kan geen data zien waar de gebruiker geen toegang tot heeft. Dat klinkt beruhigend, maar het gevolg is dat te ruime rechten die jarenlang onopgemerkt bleven, ineens exploiteerbaar worden. Niemand merkte het, omdat handmatig zoeken nooit efficiënt genoeg was. Een zoekende assistent maakt bestaande over-autorisatie in één keer vindbaar.

En bij agenten met gereedschap

Zodra het model tools mag gebruiken, gaat er data naar meer partijen dan je denkt. Een webzoekopdracht — mogelijk met een cliëntnaam erin — gaat naar een zoekmachine buiten de aanbieder. Een opgevraagde website ziet dat er een verzoek komt, met de bewaartermijnen van die derde partij. Bestanden die je laat analyseren belanden in een container die tot dertig dagen blijft staan. En elke connector naar een extern systeem is een extra partij in de keten met eigen logs. Wat dat verder betekent staat in Agentic AI.

13. Wie er bij een leverancier technisch bij kan

PartijWieWaarborg volgens de documentatie
Aanbieder AAangewezen medewerkers van het veiligheidsteamMedewerkers kunnen standaard niet bij gesprekken; toegang op need-to-know-basis. Of die toegang wordt gelogd en geaudit, staat niet in de documentatie
Aanbieder BBevoegde medewerkers plus externe contractanten voor misbruikbeoordelingContractanten staan met naam en land in het openbare register van onderaannemers
Aanbieder B, bij juridisch beslag"Een klein, geaudit juridisch en securityteam"Expliciet geaudit; data apart opgeslagen in een beveiligd systeem
Kantoorsoftware in de EUBeheerpersoneel buiten de EU, op gepseudonimiseerde logsVoor storingsanalyse, fraudepreventie en security; pseudonimisering via versleuteling, maskering of tokenisatie
Gratis API-variantMenselijke beoordelaarsGeen — vandaar de expliciete instructie om er niets vertrouwelijks in te zetten
Je eigen IT-afdelingBij inspectie van versleuteld verkeer: de volledige prompttekstAlleen je eigen beleid

14. En dan komt er een rechter langs

Dit is het leerzaamste praktijkgeval dat er is, en het zet alle bewaarbeloftes in perspectief.

In een civiele procedure tussen een Amerikaanse krant en een AI-aanbieder werd die aanbieder bevolen consumenten- en API-inhoud onbeperkt te bewaren. De aanbieder noemde de eis "veel te ruim". De verplichting eindigde in september 2025, maar bepaalde historische data uit de maanden daarvoor moet nog bewaard blijven. Getroffen: de gratis en betaalde consumentenvarianten, de teamvariant en de standaard-API. Niet getroffen: de enterprise- en onderwijsvarianten, en API-klanten met zero data retention. De bewaarde data staat apart in een beveiligd systeem, onder juridisch beslag, toegankelijk voor een klein geaudit team, en wordt niet automatisch met de tegenpartij gedeeld.

Ter kalibratie van de orde van grootte: een grote clouddienst rapporteerde over een half jaar ruim 27.000 verzoeken van rechtshandhaving bij consumentendiensten, waarvan ongeveer 5% tot verstrekking van inhoud leidde en ruim 20% werd afgewezen. Transparantierapporten met aantallen van de AI-aanbieders zelf hebben wij niet kunnen vinden.

15. Wat je hiermee doet

En één ding om tegen jezelf te herhalen: de vraag is nooit "is AI veilig?" maar "welke variant, met welke instellingen, voor welke gegevens?". Diezelfde tool is in de ene configuratie een AVG-overtreding en in de andere een verdedigbare keuze. Het verschil zit in tien minuten configuratie en één contract. De uitwerking daarvan staat in AI-leveranciers kiezen, vastleggen en beveiligen.

16. Bronnen

Bewaartermijnen, cachetijden en voorwaarden veranderen regelmatig en verschillen per product en per regio; verifieer ze bij contractsluiting. De factor voor Nederlandse tekst ten opzichte van Engelse tekst in paragraaf 4 is een onderbouwde schatting en geen meting. Over wat er precies lokaal in browser en app wordt opgeslagen hebben wij geen leveranciersdocumentatie gevonden; die passage is vakkennis. Of aanbieders hun productieomgeving in een afgeschermde rekenomgeving uitvoeren, en of de toegang van medewerkers tot prompts wordt gelogd, staat niet in de documentatie die wij konden inzien. Waar wij aanbieders in dit stuk niet met naam noemen, is dat omdat de betreffende voorwaarde snel kan wijzigen — de bronlinks staan erbij.

Zie hoe Accountee dit oplost

Regelgeving, risico's en beroepsregels zijn één ding. Accountee helpt je kantoor AI veilig en praktisch in te zetten — zonder dubbel werk.

Start gratis

Deze pagina geeft algemene informatie over regelgeving en risico's en is geen juridisch, fiscaal of vaktechnisch advies. Wet- en regelgeving rond AI verandert snel; de stand van zaken is die van 21 augustus 2026. Laat besluiten met gevolgen voor je kantoor of je cliënten altijd toetsen door een deskundige.