KennisbankAI

Wat is AI-inference, en waarom het uitmaakt waar het draait

11 september 20266 min leestijd

AI-inference is het moment waarop een getraind model iets voor je doet: je stuurt een prompt, het model rekent, er komt tekst terug. Het is het enige deel van AI dat je dagelijks raakt, en toch wordt het in gesprekken over "waar staat mijn data" vaak over één kam geschoren met training. Dat verschil is precies waar dit artikel over gaat, en het sluit aan bij de vraag die we bij colocatie ook altijd stellen: in welk gebouw staat het, en wie heeft de sleutel?

Training en inference zijn twee verschillende dingen

Trainen is het eenmalig bouwen van een model: weken rekenen op een grote hoeveelheid tekst, met als resultaat een set gewichten. Dat is een bestand. Een model van 24 miljard parameters is in 16-bits precisie ongeveer 48 GB, gekwantiseerd naar 4 bits ongeveer 14 GB. Open modellen worden als zo'n bestand gepubliceerd, en wie het downloadt heeft hetzelfde model als iedereen.

Inference is het gebruiken van dat bestand. Het wordt in het geheugen van een GPU geladen, en elke prompt die binnenkomt wordt door die gewichten gehaald. Er verandert niets aan het model; jouw prompt leert het niets. Het enige wat van jou in de machine komt, is de prompt zelf, en het enige wat eruit gaat is het antwoord.

De misvatting is dat "AI gebruiken" betekent dat je data in een model verdwijnt. Dat gebeurt alleen als iemand je prompts bewaart en er later op traint. Of dat gebeurt, staat niet in de techniek maar in de afspraken, en die lees je dus na.

Elke aanroep is een datatransfer

Wat de techniek wél afdwingt: het model kan alleen rekenen op tekst die het in leesbare vorm voor zich heeft. Een prompt is daarom nooit een stukje metadata, maar de volledige inhoud. Bij een samenvatting van een klantgesprek gaat het hele gesprek mee. Bij een RAG-opzet gaan de gevonden documentfragmenten mee. Bij een chat met geschiedenis gaat bij elke beurt de hele geschiedenis opnieuw mee.

Dat maakt inference anders dan de meeste SaaS. Bij een boekhoudpakket stuur je gestructureerde velden; bij een taalmodel stuur je proza, en in proza zitten namen, diagnoses en contractvoorwaarden. De Autoriteit Persoonsgegevens waarschuwde niet voor niets voor datalekken door medewerkers die patiënt- of klantgegevens in publieke chatbots plakken. Wie het model host is juridisch een verwerker, en bij dit soort inhoud is een DPIA vaak nodig.

TLS beschermt de weg, niet de bestemming

Hier zit de tweede misvatting: "de API-aanroep loopt over HTTPS, dus het is versleuteld." Dat klopt, en het is ook relevant. Maar TLS eindigt bij de ontvanger. Daar wordt je prompt ontsleuteld, want een model kan niet rekenen op versleutelde tekst. Vanaf dat moment ligt de inhoud in het werkgeheugen van een server, en in de logs als die aanstaan.

Wat er vervolgens mee gebeurt, bepaalt niet de versleuteling maar drie andere dingen:

  • Het contract — wordt de prompt bewaard, hoe lang, en wordt er op getraind? Dat hoort in een verwerkersovereenkomst te staan, niet in een privacyverklaring die eenzijdig kan wijzigen.
  • De eigendomsketen — de Amerikaanse CLOUD Act geldt voor elk Amerikaans bedrijf en zijn dochters dat data in "possession, custody or control" heeft, ongeacht waar die opgeslagen staat. Een EU-regio is dus geen EU-jurisdictie. Microsoft France verklaarde in juni 2025 onder ede in de Franse Senaat dat het niet kan garanderen dat Franse data niet aan Amerikaanse autoriteiten wordt overgedragen.
  • De fysieke locatie — welke wetgeving geldt, wie er fysiek bij kan, en of jij er zelf naartoe kunt.

Eerlijk is ook: Nederlandse en Europese autoriteiten kunnen data opvragen, op grond van de Wiv 2017, het strafrecht of de Europese e-Evidence-regels. Het verschil is dat je dan weet onder welk recht dat gebeurt, en bij welke rechter je terechtkunt.

Wat "waar het draait" in de praktijk betekent

Voor een netwerkmens is de locatie van het model gewoon een hop in het pad. Een model in een datacenter aan de andere kant van de oceaan zit op 80 tot 120 ms afstand; een model in hetzelfde gebouw, over een cross-connect, op minder dan een milliseconde. Die getallen zijn typische waarden, geen metingen van ons.

Voor één chatantwoord maakt dat niets uit. De generatie zelf duurt honderden milliseconden tot seconden, en daar valt 100 ms tegen weg. Het verschil ontstaat bij werk dat uit veel aanroepen bestaat: een agent die per taak tien tot honderd keer het model raadpleegt, een RAG-pipeline die eerst embeddings maakt, dan zoekt, dan herrangschikt en dan pas genereert, of een nachtelijke batch over een documentenarchief. Daar tikt elke netwerkheenreis mee, en daar wordt de vraag "staat het model naast mijn data" ineens een doorlooptijdvraag.

En dan is er het pad zelf. Een model over het publieke internet heeft een publiek endpoint en een API-sleutel die op internet werkt; een model achter een cross-connect of privé-VRF heeft dat niet. Dat is geen compliance-argument, maar een kleiner aanvalsoppervlak.

AI-inference bij Xyphen IT

Wij draaien open modellen in ons rack in BIT-2C in Ede, bereikbaar via een OpenAI-compatibele API. Hoe die API werkt en welke netwerkpaden er zijn, van TLS over internet tot cross-connect, staat op de technische pagina; de afweging zelf op AI-inference. Wie zijn applicatie of vectordatabase naast het model wil zetten, kan dat in colocatie bij BIT met een privé-VRF op onze EVPN-fabric, zodat de prompt het gebouw niet verlaat. Geen training op je data en geen opslag van prompts leggen we vast in een addendum bij je contract, met een verwerkersovereenkomst. Wil je weten of dit past bij wat je bouwt? Vraag een voorstel aan of neem contact op.

Veelgestelde vragen

Veelgestelde vragen

Is inference hetzelfde als een model trainen?

Nee. Trainen is het eenmalig bouwen van het model uit een grote hoeveelheid data; inference is het gebruiken ervan, elke keer dat je een prompt stuurt. Een open model dat je zelf draait is al getraind. Jouw prompts worden daar niet bij gebruikt, tenzij iemand dat expliciet doet.

Als de verbinding met TLS is versleuteld, is mijn prompt dan veilig?

Onderweg wel. TLS beschermt het transport, maar bij de ontvanger wordt je prompt ontsleuteld, want anders kan het model er niets mee. Wat er daarna gebeurt, hoe lang het bewaard wordt en wie er bij kan, staat niet in de versleuteling maar in het contract en in de locatie van de hardware.

Merk ik iets van de afstand tot het model?

Bij één chatantwoord nauwelijks. De generatie zelf duurt honderden milliseconden tot seconden, en daar valt een netwerkvertraging van tientallen milliseconden tegen weg. Het telt wel op bij agents en RAG-pipelines die per taak tientallen aanroepen doen, en bij batches met embeddings.

Antwoord niet gevonden?

Stel je vraag direct aan een engineer — we reageren doorgaans binnen één werkdag.