GPUnex
Cloud Computing 13 Min. Lesezeit ·

Cloud-GPU-Preisvergleich 2026: Anbieter, Kosten und versteckte Gebühren

Vollständiger Cloud-GPU-Preisleitfaden für 2026. Vergleichen Sie Hyperscaler, spezialisierte Clouds und GPU-Marktplätze. Versteckte Kosten aufgedeckt und 5 Strategien, um Ihre GPU-Rechnung um 40 % zu senken.

G

GPUnex Research Team

GPU- & KI-Infrastruktur-Experten

Share

Wichtigste Erkenntnisse

  • H100-Preise erstrecken sich über eine 4,7-fache Spanne: von 1,49 $/Std. (Marktplatz-Spot) bis 6,98 $/Std. (Hyperscaler On-Demand) für identische Hardware
  • Versteckte Kosten — Egress-Gebühren, Speicher, Networking, API-Aufrufe, Mindestverpflichtungen — können 20–40 % auf den beworbenen GPU-Stundenpreis aufschlagen
  • GPU-Marktplätze bieten 3- bis 6-fach niedrigere Preise als Hyperscaler, indem sie verteilte Kapazität ohne Hyperscaler-Infrastruktur-Overhead aggregieren
  • 5 Strategien können die Cloud-GPU-Ausgaben um 40 % senken: Spot-Instanzen, Richtige Dimensionierung, Scheduling, Marktplatz-Migration und reservierte Kapazität
  • Sekundengenaue Abrechnung (bei ausgewählten Anbietern verfügbar) spart 15–30 % bei stoßartigen Workloads im Vergleich zur stündlichen Abrechnung mit Leerlaufzeit

Cloud-GPU-Preise: Das vollständige Bild

Der beworbene Stundenpreis einer Cloud-GPU ist nicht das, was Sie tatsächlich zahlen. Die realen Cloud-GPU-Kosten umfassen versteckte Gebühren, Abrechnungsgranularitäts-Verluste und Infrastruktur-Overhead, die Ihre Rechnung um 20–40 % über den Listenpreis hinaus aufblähen können.

Dieser Leitfaden konzentriert sich auf das, was andere Preisvergleiche übersehen: die Gesamtkosten für den Betrieb eines GPU-Workloads, nicht nur den Aufkleberpreis. Wir vergleichen drei Anbietertypen, decken versteckte Kosten auf und bieten fünf konkrete Strategien zur Reduzierung Ihrer GPU-Ausgaben.

Für GPU-Spezifikationsvergleiche und Workload-Empfehlungen siehe unseren Leitfaden für die beste GPU für KI. Dieser Artikel konzentriert sich auf Anbieter und Preise — wo Sie mieten, nicht was Sie mieten.

Drei Typen von Cloud-GPU-Anbietern

Der Cloud-GPU-Markt hat drei verschiedene Stufen, jede mit unterschiedlichen Preisstrukturen, Kompromissen und Zielkunden.

Three types of cloud GPU providers compared: Hyperscalers, Specialized Clouds, and GPU Marketplaces with price ranges Hyperscalers AWS, GCP, Azure $3.00–$6.98/hr + Full managed services + Global availability + Enterprise SLAs - Highest prices - Egress fees - Complex pricing tiers Specialized Clouds Lambda, CoreWeave $2.00–$3.00/hr + GPU-optimized infra + Competitive pricing + AI-focused support - Fewer managed services - Smaller regions - Less ecosystem depth GPU Marketplaces GPUnex, Vast.ai, RunPod $1.49–$2.50/hr + Lowest prices + Flexible billing + No commitments - Variable SLAs - Less managed services - Provider quality varies

Hyperscaler (AWS, Google Cloud, Azure)

Die großen Cloud-Anbieter bieten GPU-Instanzen als Teil ihrer umfassenden Infrastrukturplattform an. Sie erhalten Enterprise-SLAs, globale Regionen, tiefe Integration mit verwalteten Services (Speicher, ML-Plattformen, Monitoring) und garantierte Verfügbarkeit für reservierte Instanzen.

Der Aufschlag: 3,00–6,98 $/Std. für eine H100 On-Demand. Reservierte Instanzen (1- bis 3-Jahres-Verpflichtungen) reduzieren dies um 30–50 %, erfordern aber langfristige Bindung.

Spezialisierte GPU-Clouds (Lambda, CoreWeave)

Ausschließlich auf GPU-Infrastruktur fokussiert. Diese Anbieter bieten wettbewerbsfähige Preise (2,00–3,00 $/Std. für H100), für KI-Workloads optimierte Konfigurationen und KI-fokussierten Support — aber weniger verwaltete Services als Hyperscaler.

GPU-Marktplätze (GPUnex, Vast.ai, RunPod)

Aggregieren GPU-Kapazität aus Hunderten verteilter Rechenzentren. Durch die Bündelung des Angebots vieler Anbieter bieten Marktplätze die wettbewerbsfähigsten Preise (1,49–2,50 $/Std. für H100) mit flexibler Abrechnung — oft sekundengenau statt stundenweise. Kompromisse umfassen variable Zuverlässigkeit und weniger integrierte Tools.

Preisvergleich nach GPU-Modell

Was jede GPU Anfang 2026 bei den verschiedenen Anbietertypen tatsächlich kostet:

GPU-ModellHyperscaler On-DemandHyperscaler ReserviertSpezialisierte CloudGPU-Marktplatz
H100 80GB3,00–6,98 $/Std.2,00–4,50 $/Std.2,00–3,00 $/Std.1,49–2,50 $/Std.
A100 80GB1,50–3,50 $/Std.1,00–2,50 $/Std.0,80–1,50 $/Std.0,72–1,50 $/Std.
L40S 48GB1,20–2,50 $/Std.0,80–1,80 $/Std.0,80–1,50 $/Std.0,60–1,20 $/Std.
L4 24GB0,50–1,00 $/Std.0,30–0,70 $/Std.0,30–0,60 $/Std.0,20–0,50 $/Std.
RTX 4090 24GBN/A (nicht angeboten)N/A0,40–0,80 $/Std.0,40–0,80 $/Std.

Wichtige Beobachtung: Die Preislücke zwischen Hyperscaler On-Demand und Marktplatzpreisen beträgt das 2- bis 4,7-Fache für identische GPU-Hardware. Für eine H100 beträgt der Unterschied zwischen 6,98 $/Std. (AWS On-Demand) und 1,49 $/Std. (Marktplatz-Spot) 5,49 $/Std. — was sich auf 4.008 $/Monat für eine einzelne GPU im 24/7-Betrieb summiert.

Versteckte Kosten, die Ihre GPU-Rechnung aufblähen

Der stündliche GPU-Tarif ist nur ein Teil der Geschichte. Fünf Kategorien versteckter Kosten überraschen regelmäßig Teams:

1. Datenausgangs-Gebühren (Egress)

Das Verschieben von Daten aus dem Netzwerk eines Cloud-Anbieters kostet Geld — typischerweise 0,05–0,12 $ pro GB. Das Training eines Modells, das 1 TB Trainingsdaten herunterlädt und regelmäßig Checkpoints exportiert, kann 50–120 $ an Egress-Gebühren pro Trainingslauf verursachen. Multi-Cloud-Workflows (Training bei einem Anbieter, Inferenz bei einem anderen) vervielfachen diese Kosten.

2. Speicherkosten

GPU-Instanzen benötigen Festplattenspeicher für Datensätze, Modell-Checkpoints und Logs. Cloud-Speicher kostet 0,02–0,08 $/GB/Monat. Ein 5-TB-Datensatz, der 3 Monate gespeichert wird, kostet 300–1.200 $ — unsichtbar im GPU-Stundenpreis, aber sehr sichtbar auf der Rechnung.

3. Networking und Load Balancing

Produktions-Inferenz erfordert Load Balancer, API-Gateways und Inter-Node-Networking. Diese Services kosten je nach Traffic-Volumen 50–200+ $/Monat. Multi-GPU-Trainingscluster verursachen zusätzliche Kosten für Hochgeschwindigkeits-Inter-Node-Networking.

4. Mindestverpflichtungen und Rundung

Einige Anbieter rechnen in Stundeninkrementen ab — ein 35-Minuten-Job kostet genauso viel wie ein 60-Minuten-Job. Sekundengenaue Abrechnung (von einigen Marktplätzen angeboten) eliminiert diese Verschwendung. Bei stoßartigen Workloads mit vielen kurzen Jobs kann stündliche Abrechnung 15–30 % Ihrer Ausgaben für ungenutzte Zeit verschwenden.

5. API- und Management-Service-Gebühren

Verwaltete ML-Services (SageMaker, Vertex AI) erheben zusätzliche Gebühren auf die GPU-Rechenkosten. Diese können 10–30 % der GPU-Basiskosten für den Komfort verwalteter Trainings- und Deployment-Pipelines hinzufügen.

Zentrale Erkenntnis: Ein Workload, der 3,15 $/Std. an GPU-Rechenkosten verursacht, kann insgesamt 4,00–4,50 $/Std. kosten, wenn Sie Egress, Speicher, Networking und Management-Gebühren hinzurechnen. Berechnen Sie immer die Gesamtkosten Ihres Workloads, nicht nur die GPU-Position.

So senken Sie Cloud-GPU-Kosten um 40 %

Fünf bewährte Strategien, die zusammen Ihre gesamten GPU-Ausgaben um 30–40 % reduzieren können:

Cost savings waterfall: 5 strategies that reduce a $10,000 GPU bill to approximately $6,000 $10,000 Starting GPU Bill -$1,500 Spot Instances -$850 Right- sizing -$425 Auto- scheduling -$725 Marketplace Migration ~$6,000 Optimized GPU Bill

1. Spot-/Preemptible-Instanzen nutzen (15–20 % sparen)

Spot-Instanzen bieten 40–60 % Rabatt gegenüber On-Demand-Preisen. Der Haken: Sie können mit kurzer Vorwarnung unterbrochen werden (typischerweise 2 Minuten bis 2 Stunden). Für fehlertolerante Workloads — Training mit Checkpointing, Batch-Datenverarbeitung, nicht dringende Inferenz — sind Spot-Instanzen der größte einzelne Kostenhebel.

Funktioniert am besten für: Modelltraining mit regelmäßigen Checkpoints, Datenvorverarbeitung, Batch-Inferenz, Experimentieren.

Funktioniert nicht für: Produktions-Inferenz für Live-Nutzer, zeitkritische Jobs, Workloads, die keine Unterbrechung tolerieren können.

2. GPU richtig dimensionieren (8–12 % sparen)

Viele Teams wählen standardmäßig die leistungsstärkste GPU „um sicher zu gehen”. Ein Workload, der auf einer A100 (0,72 $/Std.) einwandfrei läuft, braucht keine H100 (3,15 $/Std.). Unser Leitfaden für die beste GPU für KI bietet einen Workload-Entscheidungsrahmen — die Zuordnung des GPU-Modells zur Aufgabe kann die Kosten um 50 %+ bei überdimensionierten Workloads senken.

Häufige Fehler: H100 für Inferenz verwenden, wenn L40S ausreicht. A100 für das Feintuning kleiner Modelle verwenden, wenn RTX 4090 funktioniert. Batch-Inferenz auf On-Demand-Instanzen ausführen, wenn Spot verfügbar ist.

3. Scheduling und Auto-Scaling (5–8 % sparen)

GPU-Instanzen, die 24/7 laufen, wenn Ihr Team 8 Stunden/Tag arbeitet, verschwenden zwei Drittel der Ausgaben. Auto-Scaling-Richtlinien, die GPUs für Trainingsjobs hochfahren und sie im Leerlauf beenden, können erhebliche Verschwendung zurückgewinnen. Selbst einfaches Scheduling — „GPUs um 8 Uhr an, um 20 Uhr aus” — spart 50 % bei Entwicklungsinstanzen.

4. Workloads auf Marktplätze migrieren (10–15 % sparen)

Für Workloads, die keine Hyperscaler-spezifischen verwalteten Services benötigen, kann der Wechsel zu einem GPU-Marktplatz das 3- bis 6-Fache an Rechenleistung sparen. Die Hauptanforderung: Ihr Workload muss containerisiert (Docker) sein und darf nicht von anbieterspezifischen APIs abhängen (SageMaker, Vertex AI).

5. Reservierte/gebundene Kapazität nutzen (zusätzlich 5–10 % sparen)

Für planbare, dauerhafte Workloads (Produktions-Inferenz, laufendes Training) bieten reservierte Kapazitätsverpflichtungen 30–50 % Rabatt gegenüber On-Demand-Preisen. Der Kompromiss ist die Bindung — typischerweise 1–3 Jahre. Kombinieren Sie reservierte Kapazität für Ihre Basislast mit Spot/Marktplatz für variable Last.

Anbieter-für-Anbieter-Aufschlüsselung

AWS (Amazon Web Services)

GPU-Instanzen: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Preise: H100 On-Demand: ~4,50–6,98 $/Std. Reserviert (1 Jahr): ~3,00–4,50 $/Std. Spot: ~1,50–2,50 $/Std. Stärken: Breitestes Managed-Service-Ökosystem (SageMaker, EKS, S3), globale Verfügbarkeit, Enterprise-Support. Achtung: Egress-Gebühren (0,09 $/GB), komplexe Preisstufen, Schwankungen bei der Instanzverfügbarkeit für On-Demand.

Google Cloud Platform

GPU-Instanzen: A3 (H100), A2 (A100), G2 (L4). Preise: H100 On-Demand: ~3,50–5,50 $/Std. Committed (1 Jahr): ~2,50–3,50 $/Std. Spot: ~1,50–2,00 $/Std. Stärken: Starke TPU-Alternative, ausgezeichnete JAX/TensorFlow-Integration, Vertex AI Managed Platform, wettbewerbsfähige Spot-Preise. Achtung: Kleinere GPU-Flotte als AWS, geringere Verfügbarkeit in einigen Regionen.

Microsoft Azure

GPU-Instanzen: ND H100 (H100), NC A100 (A100), NC T4 (T4). Preise: H100 On-Demand: ~3,00–5,00 $/Std. Reserviert (1 Jahr): ~2,00–3,50 $/Std. Stärken: OpenAI-Integration (Azure OpenAI Service), starke Enterprise-Identitäts-/Sicherheitslösungen, Hybrid-Cloud-Fähigkeiten. Achtung: GPU-Verfügbarkeit kann in beliebten Regionen eingeschränkt sein.

GPU-Marktplätze

Verfügbare GPUs: H100, A100, L40S, L4, RTX 4090 und mehr. Preise: H100: 1,49–2,50 $/Std. A100: 0,72–1,50 $/Std. RTX 4090: 0,40–0,80 $/Std. Stärken: Niedrigste Preise, flexible Abrechnung (sekundengenau bei einigen Plattformen), keine Verpflichtungen, breite GPU-Auswahl einschließlich Consumer-Karten. Achtung: Variable Zuverlässigkeit je nach Anbieter, weniger verwaltete Tools, möglicherweise mehr Self-Service-Konfiguration erforderlich.

Wann welchen Anbietertyp nutzen

SzenarioBester AnbietertypWarum
Enterprise-Produktions-InferenzHyperscalerSLAs, globale Verfügbarkeit, verwaltete Services
Großangelegtes Training (1.000+ GPUs)Hyperscaler oder Spezialisierte CloudGarantierte Kapazität, NVLink-Networking
Kostenoptimiertes TrainingGPU-Marktplatz (Spot)Niedrigste Preise, Checkpointing bewältigt Unterbrechungen
Entwicklung und ExperimentierenGPU-MarktplatzSekundengenaue Abrechnung, keine Verpflichtungen, günstiges Iterieren
Kleines Team / StartupGPU-MarktplatzNiedrigste Einstiegshürde, flexible Skalierung, keine Mindestmengen
Batch-InferenzGPU-Marktplatz oder SpotToleriert Unterbrechung, preissensitiv
Regulierte Workloads (Finanzen, Gesundheit)HyperscalerCompliance-Zertifizierungen, Audit-Trails

Zur Frage Mieten vs. Kaufen — ob Cloud-Miete wirtschaftlicher ist als eigene Hardware — siehe unseren detaillierten Kostenvergleich. Für Startups, die ihr erstes GPU-Budget planen, siehe unseren Leitfaden für KI-Startup-Rechenkosten.

Häufig gestellte Fragen

Was ist der günstigste Weg, eine H100 zu mieten?

GPU-Marktplätze bieten die niedrigsten H100-Tarife bei 1,49–2,50 $/Std.. Hyperscaler-Spot-Instanzen folgen mit 1,50–2,50 $/Std., können aber unterbrochen werden. Die günstigste zuverlässige Option ist ein Marktplatz mit einem Anbieter, der hohe Uptime-Scores hat. Für nicht zeitkritische Workloads bietet Spot-Preisgestaltung auf jeder Plattform die tiefsten Rabatte.

Sind versteckte Kosten wirklich so bedeutend?

Ja. Für einen typischen Trainings-Workload addieren versteckte Kosten (Egress, Speicher, Networking) 20–40 % auf die GPU-Rechenrechnung. Eine H100-Instanz mit 3,15 $/Std., die einen Trainingsjob mit 2 TB Datentransfer und 500 GB Checkpoint-Speicher ausführt, kann effektiv 4,00–4,50 $/Std. insgesamt kosten. Schätzen Sie immer die Gesamt-Workload-Kosten, nicht nur den GPU-Stundenpreis.

Sollte ich einen oder mehrere Anbieter nutzen?

Mehrere. Nutzen Sie GPU-Marktplätze für kostensensitive Workloads (Entwicklung, Batch-Verarbeitung, Inferenz). Nutzen Sie Hyperscaler für Produktions-Inferenz und regulierte Workloads. Nutzen Sie Spot-Preise bei allen Anbietern für fehlertolerante Jobs. Diversifizierung verhindert Lock-in und ermöglicht Kostenoptimierung auf jeder Stufe.

Was ist sekundengenaue Abrechnung und ist sie wichtig?

Sekundengenaue Abrechnung berechnet Ihnen nur die exakte Zeit, die Ihre GPU aktiv ist. Stundengenaue Abrechnung rundet auf — ein 35-Minuten-Job kostet genauso viel wie 60 Minuten. Für Workloads mit vielen kurzen Jobs (Inferenz, Experimentieren, CI/CD) spart sekundengenaue Abrechnung 15–30 %. Für lang laufende Trainingsjobs ist der Unterschied vernachlässigbar.

Wie haben sich GPU-Preise im letzten Jahr verändert?

H100-Preise fielen zwischen Juni 2024 und Juni 2025 um 44 %, getrieben durch wachsendes Angebot und Marktplatzwettbewerb. A100-Preise fielen noch stärker, da die GPU altert. Die Preise werden voraussichtlich weiterhin allmählich sinken, da NVIDIA und AMD die Produktion steigern, obwohl GPUs der neuen Generation (B200, Rubin) bei Markteinführung Premium-Preise erzielen werden. Für breiteren Marktkontext siehe unsere OpenAI-NVIDIA-Marktanalyse.

Share

Ready to Get Started?

Access enterprise GPUs from $0.39/hr. No long-term contracts, deploy in minutes.