Das Management möchte „unseren eigenen ChatGPT“. Das Datenteam bestellt einen Server mit Grafikbeschleuniger, bevor es geantwortet hat: welche Latenz, welche Dokumente, wer greift zu, wie viele Anfragen pro Tag. Drei Monate später: zweitausendvierhundert Euro pro Monat inaktive Grafikkarte, Modell nie mit dem Informationssystem verbunden, Datenschutzbeauftragter, der entdeckt, dass die Eingabeaufforderungen Personaldaten enthalten.
Das Hosten eines Sprachmodells bedeutet nicht, eine Karte zu kaufen. Es handelt sich um eine Kette: Modellwahl, Quantifizierung, Inferenzdienst, Speicherung von Einbettungen, Beobachtbarkeit, Sicherheit von Eingabeaufforderungen. Der Grafikbeschleuniger kommt erst nach dieser Zuordnung.
Einschränkungen, die vor dem Material festgelegt werden müssen
| Frage | Warum es Priorität hat |
|---|---|
| Ziellatenz | Weniger als eine Sekunde interaktiv → GPU; nächtliche Verarbeitung → Prozessor möglich |
| Kontextgröße | Zweiunddreißigtausend Token vervielfachen den Videospeicher |
| Sensible Daten | DSGVO, ärztliche Schweigepflicht → Region, Protokolle, zeitnahe Aufbewahrung |
| Volumen anfordern | Zehn am Tag vs. zehntausend Änderungen in der Architektur |
| Nur Feinabstimmung oder RAG | RAG = Vektorbasis; Feinabstimmung = GPU-Training |
Gemeinsamer Self-Host-Stack
Modell mit offenen Gewichten – Lizenz und kommerzielle Nutzung müssen überprüft werden. Inferenzserver – vLLM, Text Generation Inference, llama.cpp je nach Umfang. Optionales RAG – PostgreSQL mit Vektoren, Qdrant, separate Einbettungen. Reverse-Proxy und Authentifizierung – keine offengelegte API ohne Ratenbegrenzung. Protokolle – Eingabeaufforderungen können personenbezogene Daten enthalten; verbindliche Aufbewahrungsrichtlinie.
Einzelprozessor: Ollama oder llama.cpp auf großzügigem Speicherserver für kleine Teams. GPU: Kontextspielraum bereitstellen; Multi-GPU für über siebzig Milliarden Modelle.
Selbsthost vs. verwaltete API
| Kriterium | Selbstgehostete GPU | Cloud-API |
|---|---|---|
| Datenschutz | Volle Kontrolle bei guter Ausnutzung | Abhängig von Vertrag und Region |
| Anschaffungskosten | Hohe GPU-Vermietung | Niedrige Nutzungsabrechnung |
| Betrieb | Treiber, Modellaktualisierungen | Minimal |
| Personalisierung | Feinabstimmung, tiefer RAG | Beschränkt auf API-Optionen |
Für viele KMU ist Europäische API plus RAG-Selbsthosting – Daten bei Ihnen vor Ort, Rückschluss auf Dritte – der vernünftige Kompromiss.
Oben: Die GPU ist die letzte Zeile des Zitats
Vergleichen Sie die Region und den ausgehenden Datenverkehr im Verzeichnis, bevor Sie ein Jahr GPU-Miete abschließen.
Entscheide dich und gehe ohne blinden Fleck voran
Dokumentieren Sie Nutzung, Daten, Latenz und Volumen vor jedem Hardwarekauf. Führen Sie einen Machbarkeitsnachweis auf einer CPU oder einer kleinen GPU mit quantisiertem Modell und realen Metriken durch – keine Folien. Validieren Sie den rechtlichen Rahmen: Aufforderungen, Journale, Subunternehmer. Skalierbare GPU und Inferenzdienst nur, wenn der Proof of Concept echte Benutzer hat.
Häufig gestellte Fragen
GPU erforderlich?
Interaktive und mittlere Modelle: ja. Stapelverarbeitung oder kleines quantifiziertes Modell: möglicher Prozessor im Proof of Concept.
VRAM für 7B?
Vier bis sechs Gigabyte quantisiert, vierzehn in voller Präzision; Streben Sie 24 Gigabyte in der Produktion mit Kontextspielraum an.
Selbsthost oder API?
Sensible Daten oder Volumen → Selbsthost oder Hybrid-RAG. Time-to-Market → Europäische API.
Europäische Unterkunft?
EU-Region, Unterauftragsvergabe, zeitnahe Zeitungspolitik – nicht nur die Flagge.
Bevor Sie sich für eine Karte entscheiden, eine Frage: Was passiert, wenn wir zwei Wochen lang keine GPU haben? Wenn Sie keine Antwort haben, sind Sie nicht bereit, ein Sprachmodell zu hosten – nur um es zu finanzieren.
