Die Vergleichstabelle zeigt 0,45 €/h für einen A100. Der Datenwissenschaftler validiert das Budget. Montagmorgen: Kontingent erschöpft, Warteschlange von 36 Stunden, ein 2-TB-Datensatz für die Aufnahme wird im ausgehenden Traffic abgerechnet, CUDA 11.x-Image ist mit dem gewählten PyTorch-Stack nicht kompatibel. Mittwoch ist endlich ein Pod verfügbar – zwei verschwendete Tage. Der Stundenpreis war korrekt; Die Wartezeitkosten waren in der Verkaufspräsentation nirgends enthalten.
Der Vergleich von GPUs für KI, ohne die Verfügbarkeit zu messen, ist wie der Vergleich von Flugtickets, ohne auf die Flugdaten zu achten. Der europäische Markt bietet auf dem Papier attraktive Preise, doch GPU-Kapazität bleibt in Spitzenzeiten eine knappe Ressource. In dieser Umfrage wird ermittelt, was in Katalogen weggelassen wird und wie vor der Unterzeichnung ein ehrlicher Vergleich erstellt werden kann.
Über den Stundenpreis hinaus: fünf vergessene Kostenzeilen
Der €/h-Tarif ist nur eine Zeile auf einer größeren Rechnung. Fünf Positionen tauchen systematisch bei Budgetüberschreitungen auf.
Verfügbarkeit und Kontingente. In der öffentlichen Cloud wird die GPU-Kapazität gemeinsam genutzt. In Hype-Zeiten (Modelleinführung, Schulanfang) können die Warteschlangen mehrere Tage dauern. Eine im Katalog „verfügbare“ GPU ist in der Praxis möglicherweise nicht verfügbar.
Datensatzspeicher. Lokaler NVMe, Objektspeicher, bereitgestellte IOPS: Jedes GB/Monat erhöht die Rechenleistung. Ein Datensatz von mehreren Terabyte, der zwischen Regionen übertragen wird, generiert ebenfalls ausgehenden Datenverkehr – siehe unsere Umfrage zu Gebühren für ausgehenden Datenverkehr.
Egress. Der Export eines trainierten Modells, von Protokollen oder Kontrollpunkten in eine andere Region oder einen anderen Lieferanten kann 20 bis 40 % des Gesamtbudgets ausmachen, wenn niemand es vorab modelliert hat.
Setup und Bilder. CUDA-Treiber, ML-Frameworks, Jupyter-Notebooks: Die Entwicklungsstunden, die aufgewendet werden, um die Umgebung nutzbar zu machen, erscheinen nicht auf der GPU-Rechnung, aber sie kosten wirklich.
GPU im Leerlauf. Eine Instanz, die zwischen Epochen weiter ausgeführt wird oder über das Wochenende vergessen wurde, zehrt das Budget ebenso stark auf wie ein nicht bereitgestellter Traffic-Spitze.
| Kriterium | Auswirkungen auf die Gesamtbetriebskosten | Zu stellende Frage |
|---|---|---|
| €/h GPU | Direkt | Welche genaue Karte, welcher VRAM-Speicher? |
| Warteschlange | Projektverzögerung | Gibt es ein Zuteilungs-SLA? |
| Ausgang | +20–40 % möglich | Ist die Ausgaberegion eingefroren? |
| Reservierung | −30 % manchmal | Ist eine Verpflichtung von 1–3 Monaten erforderlich? |
Verfügbarkeit: Die in Rechnung gestellte GPU ist nicht die erhaltene GPU
In Katalogen sind Preise für Kapazitäten aufgeführt, die durch Warteschlangen manchmal fiktiv werden. Fordern Sie vor jeder Zusage eine Testzuteilung an: Starten Sie eine Instanz, messen Sie die Verzögerung zwischen der Anfrage und einer funktionierenden CUDA-Umgebung, wiederholen Sie den Vorgang über zehn Werktage.
Messen Sie auch die durchschnittliche Verzögerung über zwei Wochen, was nicht der beste Fall ist, der an einem ruhigen Dienstag beobachtet wurde. Teams, die dem Führungsgremium einen Musterliefertermin ohne diesen Test versprechen, müssen sich regelmäßig mit der Begründung einer „Infrastruktur“-Verzögerung befassen.
Bei reservierten Angeboten (Verpflichtung von 1 bis 3 Monaten) ist die Verfügbarkeit im Allgemeinen vorhersehbarer – auf Kosten einer geringeren Flexibilität. Für kontinuierliche Schulungen über 30 Tage ist die Buchung oft besser als eine On-Demand-Schulung; Bei zwanzig Stunden Feinabstimmung pro Monat ist das Gegenteil der Fall.
Die günstigste GPU ist diejenige, die läuft, wenn Sie sie brauchen – und nicht diejenige, die um Mitternacht auf einem statischen Komparator als Held angezeigt wird.
Szenarien A und B: Experimentieren vs. kontinuierliches Training
Szenario A – Experimentieren. Zwanzig GPU-Stunden pro Monat, Feinabstimmung eines 7B-Modells. Priorität: Erhalten Sie eine Instanz in weniger als einer Stunde, kleine lokale Festplatte, geringer ausgehender Datenverkehr. Eine On-Demand-Cloud ist in Ordnung; Bei einer Langzeitreservierung fallen zusätzliche Kosten an.
Szenario B – Kontinuierliches Training. Zwei GPUs 24 Stunden am Tag für dreißig Tage. Priorität: reservierter Preis, keine Warteschlangen, reaktionsschneller Support. Ein dedizierter GPU-Server oder eine Langzeitreservierung ist besser als On-Demand, solange die Auslastung stabil und vorhersehbar ist.
Vergleichen Sie OVHcloud und Scaleway auf reservierten Grids und belassen Sie Hetzner im reinen CPU-Fallback, wenn die GPU nicht verfügbar bleibt – um zumindest die Datenvorbereitungspipeline nicht zu blockieren.
Der Gipfel: Der €/h-Vergleich verbirgt die tatsächliche Kapazität
Entscheide dich und gehe ohne blinden Fleck voran
Fordern Sie zunächst einen GPU-Zuteilungstest bei den zwei oder drei ausgewählten Anbietern an und nehmen Sie sich Zeit für die Bereitstellung einer CUDA-fähigen Umgebung. Berechnen Sie den realistischen Ausgang Ihrer Datensätze, bevor Sie eine Region validieren. Vergleichen Sie die Stundenkosten mit den Kosten einer Woche, in der Sie in der Warteschlange bleiben – hier kommt oft der eigentliche Kompromiss ins Spiel. Dokumentieren Sie die Ergebnisse in einer TCO-Tabelle über zwölf Monate und vergleichen Sie die Angebote dann über unser Verzeichnis und den Vergleich.
Häufig gestellte Fragen
Warum ist der stündliche GPU-Preis irreführend?
Weil es die tatsächliche Betriebszeit, die Betriebszeit, den Speicher, den ausgehenden Datenverkehr und die Zeiten, in denen die GPU ausgeführt wird, ignoriert, ohne ein Ergebnis zu liefern. Bei einem Feinabstimmungsprojekt können sich die tatsächlichen Kosten im Vergleich zum angezeigten Preis verdoppeln. Integrieren Sie diese Zeilen, bevor Sie zwei Angebote vergleichen.
Wie vergleiche ich zwei Cloud-GPU-Angebote?
Richten Sie das gleiche Kartenmodell, die gleiche Region, die gleiche enthaltene Festplatte, den gleichen Ausgang, das gleiche ML-Bild und die gleiche Vorlaufzeit aus. Testen Sie die Zuteilung über zwei Wochen und beachten Sie die mittlere Verzögerung, nicht den besten Fall. Nur dieses Protokoll ermöglicht den Vergleich von Angeboten, die auf dem Papier gleichwertig erscheinen.
Sollten Sie eine GPU-Cloud oder einen dedizierten GPU-Server verwenden?
Die Wolke eignet sich zum Peaking und Experimentieren. Eine dedizierte Lösung wird rentabel, sobald eine GPU-Last kontinuierlich läuft und das Wirtschaftsmodell validiert ist – oft zwischen zwei und vier Wochen intensiver Nutzung. Führen Sie die Berechnung anhand Ihres realen Profils durch, nicht anhand eines theoretischen Durchschnitts.
Welche europäischen Player bieten GPUs an?
OVHcloud, Scaleway und Hetzner (begrenztes Angebot) gehören neben Hyperscalern im EU-Raum zu den in Europa sichtbaren Playern. Die Verfügbarkeit variiert stark: Testen Sie die Zuteilung vor jedem längeren Projekt und erstellen Sie einen CPU-Plan B, falls die Warteschlange außer Kontrolle gerät.
Niedriger GPU-Preis? Messen Sie die Stunden zwischen „Start“ und „CUDA bereit“ – dort wird das Budget verbrannt, nicht auf der €/h-Linie im Angebot.
