Le data scientist lance un notebook sur une instance A100 « pour tester ». Oubli de l'arrêt le week-end : sept cent vingt heures × trois virgule cinquante euros — deux mille cinq cent vingt euros de GPU qui n'a servi qu'à charger pandas. La direction parle de « cloud trop cher » ; personne n'a lu la grille à l'heure sans arrêt automatique.
Louer un GPU en cloud (OVHcloud, Scaleway, AWS, Lambda Labs, etc.) est devenu accessible. La facture absurde arrive quand modèle, durée, transferts sortants et inactivité ne sont pas cadrés — voir aussi héberger un LLM pour le cadrage amont.
Questions contractuelles avant le premier clic
| Question | Ce qu'elle évite |
|---|---|
| Facturation heure / mois / spot ? | GPU allumé 24/7 en tarif horaire |
| VRAM physique dédiée ? | OOM mystérieux sur GPU « partagé » |
| Région et egress vers S3 ? | Surprise fin de mois sur transferts |
| Image CUDA / drivers inclus ? | Jours perdus à installer la stack |
| Interruption spot : SLA ? | Job entraînement perdu à 90 % |
| Quota et approbation compte ? | Projet bloqué en prod faute de quota GPU |
Dimensionner la carte au workload
Inférence 7B–13B quantisé — L4, T4, ou A10 24 Go souvent suffisants.
Fine-tuning 7B — 24–48 Go VRAM, batch size modeste.
Inférence 70B+ — multi-GPU ou modèle distillé ; ne louez pas un A100 seul par réflexe.
Jupyter exploratoire — processeur plus petit GPU spot ; pas A100 par défaut — voir Jupyter équipe.
Mesurez utilisation GPU réelle (nvidia-smi, DCGM) avant d'upgrader. Quinze pour cent d'utilisation moyenne = surdimensionnement ou mauvais batching.
Hygiène de coût opérationnelle
Activez l'arrêt automatique après inactivité (scripts, tags cloud). Configurez alertes budget à cinquante et quatre-vingts pour cent du plafond mensuel. Sauvegardez checkpoints vers stockage objet régional — pas disque éphémère seul. Gardez région unique — données, GPU et buckets au même endroit — voir choisir région cloud. Faites une revue hebdomadaire des instances orphelines après POC.
Une facture GPU raisonnable est une facture éteinte quand le job est fini.
Le sommet : le prix à l'heure flatte, le mois complet accuse
Comparez offres GPU européennes avec egress documenté sur l'annuaire et le comparateur.
Décider et avancer sans angle mort
Estimez les heures GPU réelles par mois — pas le pic théorique du premier test. Choisissez spot versus réservé selon votre tolérance aux interruptions et la criticité du service. Activez alertes budget et arrêt automatique avant le premier lancement, pas après la première mauvaise surprise. Revoyez la VRAM après une semaine de métriques réelles. Documentez qui éteint quoi dans l'équipe pour éviter les instances orphelines. Incluez egress et stockage dans votre simulation de coût — une carte « pas chère » avec facture réseau élevée reste une mauvaise affaire. Relisez la grille tous les trois mois : les offres GPU évoluent vite et une réservation négociée peut valoir mieux qu'un spot laissé allumé par habitude.
Questions fréquentes
Heure ou mois ?
L'heure ou le spot conviennent aux preuves de concept et aux entraînements ponctuels. La réservation mensuelle se justifie pour une inférence vingt-quatre heures sur vingt-quatre — sinon le coût horaire d'un GPU inactif la nuit finit par dépasser le budget prévu.
T4, L4 ou A100 ?
Les T4 et L4 ciblent l'inférence économique avec une consommation modérée. Les A100 et H100 servent l'entraînement et les gros modèles, avec quarante à quatre-vingts gigaoctets de VRAM. Choisissez la carte selon la taille du modèle et le débit attendu, pas selon le prestige du nom sur la facture.
GPU partagés ?
Pour une inférence légère ou du développement, le partage peut suffire. Pour une latence garantie ou un gros lot de requêtes, exigez un GPU dédié documenté — le partage non transparent complique le débogage et fausse les mesures.
Coûts cachés ?
Surveillez les transferts sortants, le disque NVMe surdimensionné, l'adresse IP publique, les snapshots automatiques et les interruptions spot sans checkpoint sauvegardé. Les pilotes CUDA ou le support technique peuvent aussi apparaître en ligne séparée selon le fournisseur.
Avant de louer un GPU, calculez : combien d'heures allumé par semaine si personne n'éteint ? Si la réponse vous surprend, corrigez le process — pas seulement la carte.