Het management wil “onze eigen ChatGPT”. Het datateam bestelt een server met grafische versneller voordat ze hebben geantwoord: welke latentie, welke documenten, wie heeft toegang, hoeveel verzoeken per dag. Drie maanden later: tweeduizendvierhonderd euro per maand inactieve grafische kaart, model nooit verbonden met het informatiesysteem, gedelegeerde gegevensbescherming die ontdekt dat de prompts HR-gegevens bevatten.
Het hosten van een taalmodel is geen kaart kopen. Het is een keten: modelkeuze, kwantificering, gevolgtrekkingsservice, opslag van inbedding, waarneembaarheid, beveiliging van aanwijzingen. De grafische versneller arriveert pas na deze mapping.
Beperkingen die vóór het materiaal moeten worden opgelost
| Vraag | Waarom het een prioriteit is |
|---|---|
| Doellatentie | Minder dan een seconde interactief → GPU; nachtelijke verwerking → processor mogelijk |
| Contextgrootte | Tweeëndertigduizend tokens vermenigvuldigt het videogeheugen |
| Gevoelige gegevens | AVG, medisch beroepsgeheim → regio, logs, tijdige bewaring |
| Aanvraagvolume | Tien per dag versus tienduizend veranderingen architectuur |
| Fijnafstemming of alleen RAG | RAG = vectorbasis; fijnafstemming = GPU-training |
Gemeenschappelijke zelf-hoststack
Model met open gewichten - licentie en commercieel gebruik moeten worden geverifieerd. Inferentieserver — vLLM, Text Generation Inference, llama.cpp afhankelijk van de schaal. Optionele RAG — PostgreSQL met vectoren, Qdrant, afzonderlijke inbedding. Omgekeerde proxy en authenticatie – geen blootgestelde API zonder snelheidsbeperking. Logboeken — prompts kunnen persoonlijke gegevens bevatten; verplicht bewaarbeleid.
Eén processor: Ollama of llama.cpp op royale geheugenserver voor kleine teams. GPU: geef contextmarge; multi-GPU voor ruim zeventig miljard modellen.
Zelf-host versus beheerde API
| Criterium | Zelf-gehoste GPU | Cloud-API |
|---|---|---|
| Privé | Volledige controle indien goed benut | Afhankelijk van contract en regio |
| Initiële kosten | Hoge GPU-huur | Lage gebruiksfacturering |
| Operatie | Stuurprogramma's, modelupdates | Minimaal |
| Personalisatie | Verfijning, diepe RAG | Beperkt tot API-opties |
Voor veel MKB-bedrijven is Europese API plus RAG self-host – gegevens op uw locatie, gevolgtrekking op derden – het redelijke compromis.
De bovenkant: de GPU is de laatste regel van het citaat
Vergelijk het regio- en uitgaand verkeer op de overzicht voordat u een jaar lang GPU-huur tekent.
Beslis en ga vooruit zonder blinde vlek
Document gebruik, data, latentie en volume voordat u hardware aanschaft. Voer een proof of concept uit op CPU of kleine GPU met een gekwantiseerd model en echte statistieken - geen slides. Valideren het juridisch kader: prompts, journaals, onderaannemers. Schaalbare GPU en inferentieservice alleen als het proof of concept echte gebruikers heeft.
Veelgestelde vragen
GPU vereist?
Interactieve en middelgrote modellen: ja. Batchverwerking of klein gekwantificeerd model: mogelijke processor in proof of concept.
VRAM voor 7B?
Vier tot zes gigabytes gekwantiseerd, veertien met volledige precisie; streven naar vierentwintig gigabytes in productie met contextmarge.
Zelfhost of API?
Gevoelige gegevens of volume → zelfhostende of hybride RAG. Time-to-market → Europese API.
Europese accommodatie?
EU-regio, onderaanneming, snel krantenbeleid – niet alleen de vlag.
Voordat u een kaart kiest, één vraag: wat gebeurt er als we twee weken geen GPU hebben? Als u geen antwoord heeft, bent u er niet klaar voor om een taalmodel te hosten – alleen om het te financieren.
