De datawetenschapper lanceert een notebook op een A100-instantie “om te testen”. De afsluiting in het weekend vergeten: zevenhonderdtwintig uur × drie komma vijftig euro — tweeduizendvijfhonderdtwintig euro aan GPU die alleen werd gebruikt om panda's te laden. Management spreekt van “cloud te duur”; niemand leest het elektriciteitsnet op tijd zonder automatische uitschakeling.
Het huren van een GPU in de cloud (OVHcloud, Scaleway, AWS, Lambda Labs, etc.) is toegankelijk geworden. De absurde rekening komt wanneer model, duur, uitgaande overdrachten en inactiviteit niet gereguleerd zijn – zie ook hosting an LLM voor upstream framing.
Contractuele vragen vóór de eerste klik
| Vraag | Wat ze vermijdt |
|---|---|
| Uur/maand/spotfacturering? | GPU 24/7 aan tegen uurtarief |
| Speciaal fysiek VRAM? | Mysterieuze OOM op “gedeelde” GPU |
| Regio en uitgaand verkeer naar S3? | Einde van de maand verrassing bij overboekingen |
| CUDA-image / stuurprogramma's inbegrepen? | Dagen verloren bij het installeren van de stapel |
| Spotonderbreking: SLA? | Opleidingsbaan verloren met 90% |
| Quota en accountgoedkeuring? | Project geblokkeerd in productie vanwege gebrek aan GPU-quotum |
Pas de kaart aan de werklast aan
Gekwantiseerde 7B–13B gevolgtrekking — L4, T4 of A10 24 GB vaak voldoende.
Fijnafstelling 7B — 24–48 GB VRAM, bescheiden batchgrootte.
70B+ Inference — multi-GPU of gedistilleerd model; huur een A100 niet alleen uit reflex.
Verkennende Jupyter — kleinste GPU-spotprocessor; standaard niet A100 — zie Jupyter-team.
Meet daadwerkelijk GPU-gebruik (nvidia-smi, DCGM) voordat u de upgrade uitvoert. Vijftien procent gemiddeld gebruik = te grote afmetingen of slechte batching.
Operationele kostenhygiëne
Schakel automatisch afsluiten in na inactiviteit (scripts, cloudtags). Stel budgetwaarschuwingen in op vijftig en tachtig procent van de maandelijkse limiet. Maak een back-up van controlepunten naar regionale objectopslag, niet alleen op een kortstondige schijf. Houd enkele regio – gegevens, GPU's en buckets op één plek – zie choose cloud region. Voer een wekelijkse beoordeling uit van weesinstanties na POC.
Een redelijke GPU-factuur is een factuur die uitschakelt wanneer de taak is voltooid.
De top: de prijs per uur is vleiend, de volledige maand is lager
Vergelijk Europese GPU-aanbiedingen met uitgaand verkeer gedocumenteerd in de overzicht en de vergelijker.
Beslis en ga vooruit zonder blinde vlek
Schat de werkelijke GPU-uren per maand — niet de theoretische piek uit de eerste test. Kies plek versus gereserveerd, afhankelijk van uw tolerantie voor onderbrekingen en de kritiekheid van de service. Activeer budgetwaarschuwingen en automatische uitschakeling vóór de eerste lancering, niet na de eerste onaangename verrassing. Bekijk VRAM na een week echte statistieken. Documenteer wie wat uitschakelt in het team om weesinstanties te voorkomen. Neem uitgaand verkeer en opslag op in uw kostensimulatie: een “goedkope” kaart met een hoge netwerkrekening is nog steeds een slechte deal. Herlees het rooster elke drie maanden: GPU-aanbiedingen evolueren snel en een onderhandelde reservering kan meer waard zijn dan een plek die uit gewoonte blijft staan.
Veelgestelde vragen
Tijd of maand?
Het tijdstip of de plek is geschikt voor proof of concept en eenmalige training. De maandelijkse reservering is zinvol voor 24-uurs gevolgtrekkingen, anders zullen de uurkosten van een inactieve GPU 's nachts het geplande budget overschrijden.
T4, L4 of A100?
T4 en L4 richten zich op economische gevolgtrekkingen met gematigde consumptie. De A100 en H100 bedienen trainingen en grote modellen, met veertig tot tachtig gigabyte VRAM. Kies de kaart op basis van de grootte van het model en het verwachte debiet, niet op basis van het prestige van de naam op de factuur.
Gedeelde GPU's?
Voor lichte gevolgtrekking of ontwikkeling kan delen voldoende zijn. Voor gegarandeerde latentie of een grote batch verzoeken is een gedocumenteerde speciale GPU vereist; niet-transparant delen bemoeilijkt het opsporen van fouten en vervormt metingen.
Verborgen kosten?
Bewaak uitgaande overdrachten, extra grote NVMe-schijf, openbaar IP-adres, automatische snapshots en spot-interrupts zonder een opgeslagen controlepunt. CUDA-stuurprogramma's of technische ondersteuning kunnen ook op een aparte regel verschijnen, afhankelijk van de leverancier.
Voordat u een GPU huurt, moet u het volgende berekenen: hoeveel uur aan per week als niemand de computer uitzet? Als het antwoord u verbaast, repareer dan het proces – en niet alleen de kaart.
