La direction veut « notre propre ChatGPT ». L'équipe data commande un serveur avec accélérateur graphique avant d'avoir répondu à : quelle latence, quels documents, qui accède, combien de requêtes par jour. Trois mois plus tard : deux mille quatre cents euros par mois de carte graphique inactive, modèle jamais connecté au système d'information, délégué à la protection des données qui découvre que les prompts contiennent des données RH.
Héberger un modèle de langage n'est pas acheter une carte. C'est une chaîne : choix du modèle, quantification, service d'inférence, stockage des embeddings, observabilité, sécurité des prompts. L'accélérateur graphique n'arrive qu'après cette cartographie.
Les contraintes à figer avant le matériel
| Question | Pourquoi c'est prioritaire |
|---|---|
| Latence cible | Moins d'une seconde interactif → GPU ; traitement nocturne → processeur possible |
| Taille contexte | Trente-deux mille tokens multiplie la mémoire vidéo |
| Données sensibles | RGPD, secret médical → région, journaux, rétention prompts |
| Volume requêtes | Dix par jour vs dix mille change l'architecture |
| Fine-tuning ou RAG seul | RAG = base vectorielle ; fine-tuning = GPU entraînement |
Stack self-host courante
Modèle open-weights — licence et usage commercial à vérifier. Serveur d'inférence — vLLM, Text Generation Inference, llama.cpp selon échelle. RAG optionnel — PostgreSQL avec vecteurs, Qdrant, embeddings séparés. Proxy inverse et authentification — pas d'interface de programmation exposée sans limitation de débit. Journaux — prompts peuvent contenir des données personnelles ; politique de rétention obligatoire.
Processeur seul : Ollama ou llama.cpp sur serveur mémoire généreuse pour équipes restreintes. GPU : prévoir marge contexte ; multi-GPU pour modèles soixante-dix milliards plus.
Self-host vs API managée
| Critère | Self-host GPU | API cloud |
|---|---|---|
| Confidentialité | Contrôle total si bien exploité | Dépend du contrat et région |
| Coût initial | Location GPU élevée | Faible, facturation usage |
| Exploitation | Pilotes, mises à jour modèle | Minimale |
| Personnalisation | Fine-tuning, RAG profond | Limitée aux options API |
Pour beaucoup de PME, API européenne plus RAG self-host — données chez vous, inférence chez tiers — est le compromis raisonnable.
Le sommet : le GPU est la dernière ligne du devis
Comparez région et trafic sortant sur l'annuaire avant de signer un an de location GPU.
Décider et avancer sans angle mort
Documentez usage, données, latence et volume avant tout achat matériel. Lancez une preuve de concept sur processeur ou petit GPU avec modèle quantifié et métriques réelles — pas slides. Validez le cadre juridique : prompts, journaux, sous-traitants. Montez en charge GPU et service d'inférence seulement si la preuve de concept a des utilisateurs réels.
Questions fréquentes
GPU obligatoire ?
Interactif et modèles moyens : oui. Traitement par lots ou petit modèle quantifié : processeur possible en preuve de concept.
VRAM pour 7B ?
Quatre à six gigaoctets quantifié, quatorze en précision complète ; viser vingt-quatre gigaoctets en production avec marge contexte.
Self-host ou API ?
Données sensibles ou volume → self-host ou hybride RAG. Time-to-market → API européenne.
Hébergement Europe ?
Région UE, contrat de sous-traitance, politique journaux prompts — pas seulement le drapeau.
Avant de choisir une carte, une question : que se passe-t-il si on n'a pas de GPU pendant deux semaines ? Si vous n'avez pas de réponse, vous n'êtes pas prêt à héberger un modèle de langage — seulement à le financer.