Cloud-GPU-Preise: Das vollständige Bild
Der beworbene Stundenpreis einer Cloud-GPU ist nicht das, was Sie tatsächlich zahlen. Die realen Cloud-GPU-Kosten umfassen versteckte Gebühren, Abrechnungsgranularitäts-Verluste und Infrastruktur-Overhead, die Ihre Rechnung um 20–40 % über den Listenpreis hinaus aufblähen können.
Dieser Leitfaden konzentriert sich auf das, was andere Preisvergleiche übersehen: die Gesamtkosten für den Betrieb eines GPU-Workloads, nicht nur den Aufkleberpreis. Wir vergleichen drei Anbietertypen, decken versteckte Kosten auf und bieten fünf konkrete Strategien zur Reduzierung Ihrer GPU-Ausgaben.
Für GPU-Spezifikationsvergleiche und Workload-Empfehlungen siehe unseren Leitfaden für die beste GPU für KI. Dieser Artikel konzentriert sich auf Anbieter und Preise — wo Sie mieten, nicht was Sie mieten.
Drei Typen von Cloud-GPU-Anbietern
Der Cloud-GPU-Markt hat drei verschiedene Stufen, jede mit unterschiedlichen Preisstrukturen, Kompromissen und Zielkunden.
Hyperscaler (AWS, Google Cloud, Azure)
Die großen Cloud-Anbieter bieten GPU-Instanzen als Teil ihrer umfassenden Infrastrukturplattform an. Sie erhalten Enterprise-SLAs, globale Regionen, tiefe Integration mit verwalteten Services (Speicher, ML-Plattformen, Monitoring) und garantierte Verfügbarkeit für reservierte Instanzen.
Der Aufschlag: 3,00–6,98 $/Std. für eine H100 On-Demand. Reservierte Instanzen (1- bis 3-Jahres-Verpflichtungen) reduzieren dies um 30–50 %, erfordern aber langfristige Bindung.
Spezialisierte GPU-Clouds (Lambda, CoreWeave)
Ausschließlich auf GPU-Infrastruktur fokussiert. Diese Anbieter bieten wettbewerbsfähige Preise (2,00–3,00 $/Std. für H100), für KI-Workloads optimierte Konfigurationen und KI-fokussierten Support — aber weniger verwaltete Services als Hyperscaler.
GPU-Marktplätze (GPUnex, Vast.ai, RunPod)
Aggregieren GPU-Kapazität aus Hunderten verteilter Rechenzentren. Durch die Bündelung des Angebots vieler Anbieter bieten Marktplätze die wettbewerbsfähigsten Preise (1,49–2,50 $/Std. für H100) mit flexibler Abrechnung — oft sekundengenau statt stundenweise. Kompromisse umfassen variable Zuverlässigkeit und weniger integrierte Tools.
Preisvergleich nach GPU-Modell
Was jede GPU Anfang 2026 bei den verschiedenen Anbietertypen tatsächlich kostet:
| GPU-Modell | Hyperscaler On-Demand | Hyperscaler Reserviert | Spezialisierte Cloud | GPU-Marktplatz |
|---|---|---|---|---|
| H100 80GB | 3,00–6,98 $/Std. | 2,00–4,50 $/Std. | 2,00–3,00 $/Std. | 1,49–2,50 $/Std. |
| A100 80GB | 1,50–3,50 $/Std. | 1,00–2,50 $/Std. | 0,80–1,50 $/Std. | 0,72–1,50 $/Std. |
| L40S 48GB | 1,20–2,50 $/Std. | 0,80–1,80 $/Std. | 0,80–1,50 $/Std. | 0,60–1,20 $/Std. |
| L4 24GB | 0,50–1,00 $/Std. | 0,30–0,70 $/Std. | 0,30–0,60 $/Std. | 0,20–0,50 $/Std. |
| RTX 4090 24GB | N/A (nicht angeboten) | N/A | 0,40–0,80 $/Std. | 0,40–0,80 $/Std. |
Wichtige Beobachtung: Die Preislücke zwischen Hyperscaler On-Demand und Marktplatzpreisen beträgt das 2- bis 4,7-Fache für identische GPU-Hardware. Für eine H100 beträgt der Unterschied zwischen 6,98 $/Std. (AWS On-Demand) und 1,49 $/Std. (Marktplatz-Spot) 5,49 $/Std. — was sich auf 4.008 $/Monat für eine einzelne GPU im 24/7-Betrieb summiert.
Versteckte Kosten, die Ihre GPU-Rechnung aufblähen
Der stündliche GPU-Tarif ist nur ein Teil der Geschichte. Fünf Kategorien versteckter Kosten überraschen regelmäßig Teams:
1. Datenausgangs-Gebühren (Egress)
Das Verschieben von Daten aus dem Netzwerk eines Cloud-Anbieters kostet Geld — typischerweise 0,05–0,12 $ pro GB. Das Training eines Modells, das 1 TB Trainingsdaten herunterlädt und regelmäßig Checkpoints exportiert, kann 50–120 $ an Egress-Gebühren pro Trainingslauf verursachen. Multi-Cloud-Workflows (Training bei einem Anbieter, Inferenz bei einem anderen) vervielfachen diese Kosten.
2. Speicherkosten
GPU-Instanzen benötigen Festplattenspeicher für Datensätze, Modell-Checkpoints und Logs. Cloud-Speicher kostet 0,02–0,08 $/GB/Monat. Ein 5-TB-Datensatz, der 3 Monate gespeichert wird, kostet 300–1.200 $ — unsichtbar im GPU-Stundenpreis, aber sehr sichtbar auf der Rechnung.
3. Networking und Load Balancing
Produktions-Inferenz erfordert Load Balancer, API-Gateways und Inter-Node-Networking. Diese Services kosten je nach Traffic-Volumen 50–200+ $/Monat. Multi-GPU-Trainingscluster verursachen zusätzliche Kosten für Hochgeschwindigkeits-Inter-Node-Networking.
4. Mindestverpflichtungen und Rundung
Einige Anbieter rechnen in Stundeninkrementen ab — ein 35-Minuten-Job kostet genauso viel wie ein 60-Minuten-Job. Sekundengenaue Abrechnung (von einigen Marktplätzen angeboten) eliminiert diese Verschwendung. Bei stoßartigen Workloads mit vielen kurzen Jobs kann stündliche Abrechnung 15–30 % Ihrer Ausgaben für ungenutzte Zeit verschwenden.
5. API- und Management-Service-Gebühren
Verwaltete ML-Services (SageMaker, Vertex AI) erheben zusätzliche Gebühren auf die GPU-Rechenkosten. Diese können 10–30 % der GPU-Basiskosten für den Komfort verwalteter Trainings- und Deployment-Pipelines hinzufügen.
Zentrale Erkenntnis: Ein Workload, der 3,15 $/Std. an GPU-Rechenkosten verursacht, kann insgesamt 4,00–4,50 $/Std. kosten, wenn Sie Egress, Speicher, Networking und Management-Gebühren hinzurechnen. Berechnen Sie immer die Gesamtkosten Ihres Workloads, nicht nur die GPU-Position.
So senken Sie Cloud-GPU-Kosten um 40 %
Fünf bewährte Strategien, die zusammen Ihre gesamten GPU-Ausgaben um 30–40 % reduzieren können:
1. Spot-/Preemptible-Instanzen nutzen (15–20 % sparen)
Spot-Instanzen bieten 40–60 % Rabatt gegenüber On-Demand-Preisen. Der Haken: Sie können mit kurzer Vorwarnung unterbrochen werden (typischerweise 2 Minuten bis 2 Stunden). Für fehlertolerante Workloads — Training mit Checkpointing, Batch-Datenverarbeitung, nicht dringende Inferenz — sind Spot-Instanzen der größte einzelne Kostenhebel.
Funktioniert am besten für: Modelltraining mit regelmäßigen Checkpoints, Datenvorverarbeitung, Batch-Inferenz, Experimentieren.
Funktioniert nicht für: Produktions-Inferenz für Live-Nutzer, zeitkritische Jobs, Workloads, die keine Unterbrechung tolerieren können.
2. GPU richtig dimensionieren (8–12 % sparen)
Viele Teams wählen standardmäßig die leistungsstärkste GPU „um sicher zu gehen”. Ein Workload, der auf einer A100 (0,72 $/Std.) einwandfrei läuft, braucht keine H100 (3,15 $/Std.). Unser Leitfaden für die beste GPU für KI bietet einen Workload-Entscheidungsrahmen — die Zuordnung des GPU-Modells zur Aufgabe kann die Kosten um 50 %+ bei überdimensionierten Workloads senken.
Häufige Fehler: H100 für Inferenz verwenden, wenn L40S ausreicht. A100 für das Feintuning kleiner Modelle verwenden, wenn RTX 4090 funktioniert. Batch-Inferenz auf On-Demand-Instanzen ausführen, wenn Spot verfügbar ist.
3. Scheduling und Auto-Scaling (5–8 % sparen)
GPU-Instanzen, die 24/7 laufen, wenn Ihr Team 8 Stunden/Tag arbeitet, verschwenden zwei Drittel der Ausgaben. Auto-Scaling-Richtlinien, die GPUs für Trainingsjobs hochfahren und sie im Leerlauf beenden, können erhebliche Verschwendung zurückgewinnen. Selbst einfaches Scheduling — „GPUs um 8 Uhr an, um 20 Uhr aus” — spart 50 % bei Entwicklungsinstanzen.
4. Workloads auf Marktplätze migrieren (10–15 % sparen)
Für Workloads, die keine Hyperscaler-spezifischen verwalteten Services benötigen, kann der Wechsel zu einem GPU-Marktplatz das 3- bis 6-Fache an Rechenleistung sparen. Die Hauptanforderung: Ihr Workload muss containerisiert (Docker) sein und darf nicht von anbieterspezifischen APIs abhängen (SageMaker, Vertex AI).
5. Reservierte/gebundene Kapazität nutzen (zusätzlich 5–10 % sparen)
Für planbare, dauerhafte Workloads (Produktions-Inferenz, laufendes Training) bieten reservierte Kapazitätsverpflichtungen 30–50 % Rabatt gegenüber On-Demand-Preisen. Der Kompromiss ist die Bindung — typischerweise 1–3 Jahre. Kombinieren Sie reservierte Kapazität für Ihre Basislast mit Spot/Marktplatz für variable Last.
Anbieter-für-Anbieter-Aufschlüsselung
AWS (Amazon Web Services)
GPU-Instanzen: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Preise: H100 On-Demand: ~4,50–6,98 $/Std. Reserviert (1 Jahr): ~3,00–4,50 $/Std. Spot: ~1,50–2,50 $/Std. Stärken: Breitestes Managed-Service-Ökosystem (SageMaker, EKS, S3), globale Verfügbarkeit, Enterprise-Support. Achtung: Egress-Gebühren (0,09 $/GB), komplexe Preisstufen, Schwankungen bei der Instanzverfügbarkeit für On-Demand.
Google Cloud Platform
GPU-Instanzen: A3 (H100), A2 (A100), G2 (L4). Preise: H100 On-Demand: ~3,50–5,50 $/Std. Committed (1 Jahr): ~2,50–3,50 $/Std. Spot: ~1,50–2,00 $/Std. Stärken: Starke TPU-Alternative, ausgezeichnete JAX/TensorFlow-Integration, Vertex AI Managed Platform, wettbewerbsfähige Spot-Preise. Achtung: Kleinere GPU-Flotte als AWS, geringere Verfügbarkeit in einigen Regionen.
Microsoft Azure
GPU-Instanzen: ND H100 (H100), NC A100 (A100), NC T4 (T4). Preise: H100 On-Demand: ~3,00–5,00 $/Std. Reserviert (1 Jahr): ~2,00–3,50 $/Std. Stärken: OpenAI-Integration (Azure OpenAI Service), starke Enterprise-Identitäts-/Sicherheitslösungen, Hybrid-Cloud-Fähigkeiten. Achtung: GPU-Verfügbarkeit kann in beliebten Regionen eingeschränkt sein.
GPU-Marktplätze
Verfügbare GPUs: H100, A100, L40S, L4, RTX 4090 und mehr. Preise: H100: 1,49–2,50 $/Std. A100: 0,72–1,50 $/Std. RTX 4090: 0,40–0,80 $/Std. Stärken: Niedrigste Preise, flexible Abrechnung (sekundengenau bei einigen Plattformen), keine Verpflichtungen, breite GPU-Auswahl einschließlich Consumer-Karten. Achtung: Variable Zuverlässigkeit je nach Anbieter, weniger verwaltete Tools, möglicherweise mehr Self-Service-Konfiguration erforderlich.
Wann welchen Anbietertyp nutzen
| Szenario | Bester Anbietertyp | Warum |
|---|---|---|
| Enterprise-Produktions-Inferenz | Hyperscaler | SLAs, globale Verfügbarkeit, verwaltete Services |
| Großangelegtes Training (1.000+ GPUs) | Hyperscaler oder Spezialisierte Cloud | Garantierte Kapazität, NVLink-Networking |
| Kostenoptimiertes Training | GPU-Marktplatz (Spot) | Niedrigste Preise, Checkpointing bewältigt Unterbrechungen |
| Entwicklung und Experimentieren | GPU-Marktplatz | Sekundengenaue Abrechnung, keine Verpflichtungen, günstiges Iterieren |
| Kleines Team / Startup | GPU-Marktplatz | Niedrigste Einstiegshürde, flexible Skalierung, keine Mindestmengen |
| Batch-Inferenz | GPU-Marktplatz oder Spot | Toleriert Unterbrechung, preissensitiv |
| Regulierte Workloads (Finanzen, Gesundheit) | Hyperscaler | Compliance-Zertifizierungen, Audit-Trails |
Zur Frage Mieten vs. Kaufen — ob Cloud-Miete wirtschaftlicher ist als eigene Hardware — siehe unseren detaillierten Kostenvergleich. Für Startups, die ihr erstes GPU-Budget planen, siehe unseren Leitfaden für KI-Startup-Rechenkosten.
Häufig gestellte Fragen
Was ist der günstigste Weg, eine H100 zu mieten?
GPU-Marktplätze bieten die niedrigsten H100-Tarife bei 1,49–2,50 $/Std.. Hyperscaler-Spot-Instanzen folgen mit 1,50–2,50 $/Std., können aber unterbrochen werden. Die günstigste zuverlässige Option ist ein Marktplatz mit einem Anbieter, der hohe Uptime-Scores hat. Für nicht zeitkritische Workloads bietet Spot-Preisgestaltung auf jeder Plattform die tiefsten Rabatte.
Sind versteckte Kosten wirklich so bedeutend?
Ja. Für einen typischen Trainings-Workload addieren versteckte Kosten (Egress, Speicher, Networking) 20–40 % auf die GPU-Rechenrechnung. Eine H100-Instanz mit 3,15 $/Std., die einen Trainingsjob mit 2 TB Datentransfer und 500 GB Checkpoint-Speicher ausführt, kann effektiv 4,00–4,50 $/Std. insgesamt kosten. Schätzen Sie immer die Gesamt-Workload-Kosten, nicht nur den GPU-Stundenpreis.
Sollte ich einen oder mehrere Anbieter nutzen?
Mehrere. Nutzen Sie GPU-Marktplätze für kostensensitive Workloads (Entwicklung, Batch-Verarbeitung, Inferenz). Nutzen Sie Hyperscaler für Produktions-Inferenz und regulierte Workloads. Nutzen Sie Spot-Preise bei allen Anbietern für fehlertolerante Jobs. Diversifizierung verhindert Lock-in und ermöglicht Kostenoptimierung auf jeder Stufe.
Was ist sekundengenaue Abrechnung und ist sie wichtig?
Sekundengenaue Abrechnung berechnet Ihnen nur die exakte Zeit, die Ihre GPU aktiv ist. Stundengenaue Abrechnung rundet auf — ein 35-Minuten-Job kostet genauso viel wie 60 Minuten. Für Workloads mit vielen kurzen Jobs (Inferenz, Experimentieren, CI/CD) spart sekundengenaue Abrechnung 15–30 %. Für lang laufende Trainingsjobs ist der Unterschied vernachlässigbar.
Wie haben sich GPU-Preise im letzten Jahr verändert?
H100-Preise fielen zwischen Juni 2024 und Juni 2025 um 44 %, getrieben durch wachsendes Angebot und Marktplatzwettbewerb. A100-Preise fielen noch stärker, da die GPU altert. Die Preise werden voraussichtlich weiterhin allmählich sinken, da NVIDIA und AMD die Produktion steigern, obwohl GPUs der neuen Generation (B200, Rubin) bei Markteinführung Premium-Preise erzielen werden. Für breiteren Marktkontext siehe unsere OpenAI-NVIDIA-Marktanalyse.