Ceny GPU w chmurze: pełny obraz
Reklamowana stawka godzinowa GPU w chmurze to nie jest to, co rzeczywiście płacisz. Prawdziwe koszty GPU w chmurze obejmują ukryte opłaty, kary za granulację rozliczeń i overhead infrastrukturalny, które mogą zawyżyć rachunek o 20–40% ponad cenę nagłówkową.
Ten przewodnik skupia się na tym, co inne porównania cenowe pomijają: całkowitym koszcie uruchomienia obciążenia GPU, a nie tylko cenie naklejkowej. Porównujemy trzy typy dostawców, ujawniamy ukryte koszty i przedstawiamy pięć konkretnych strategii na zmniejszenie wydatków na GPU.
Porównania specyfikacji GPU i rekomendacje obciążeń znajdziesz w naszym przewodniku po najlepszym GPU dla AI. Ten artykuł skupia się na dostawcach i cenach — gdzie wynajmujesz, a nie co wynajmujesz.
Trzy typy dostawców GPU w chmurze
Rynek GPU w chmurze ma trzy odrębne warstwy, każda z inną strukturą cenową, kompromisami i docelowymi klientami.
Hiperscalerzy (AWS, Google Cloud, Azure)
Główni dostawcy chmury oferują instancje GPU jako część swojej szerokiej platformy infrastrukturalnej. Otrzymujesz SLA enterprise, regiony globalne, głęboką integrację z zarządzanymi usługami (storage, platformy ML, monitoring) i gwarantowaną dostępność dla zarezerwowanych instancji.
Premium: 3,00–6,98 USD/godz. za H100 on-demand. Zarezerwowane instancje (zobowiązania 1–3 lata) zmniejszają to o 30–50%, ale wymagają długoterminowego lock-in’u.
Wyspecjalizowane chmury GPU (Lambda, CoreWeave)
Skoncentrowane wyłącznie na infrastrukturze GPU. Ci dostawcy oferują konkurencyjne ceny (2,00–3,00 USD/godz. za H100), konfiguracje zoptymalizowane pod obciążenia AI i wsparcie AI-focused — ale mniej zarządzanych usług niż hiperscalerzy.
Marketplace’y GPU (GPUnex, Vast.ai, RunPod)
Agregują pojemność GPU z setek rozproszonych centrów danych. Łącząc podaż od wielu dostawców, marketplace’y oferują najbardziej konkurencyjne ceny (1,49–2,50 USD/godz. za H100) z elastycznym rozliczaniem — często per sekundę zamiast per godzinę. Kompromisy obejmują zmienną niezawodność i mniej zintegrowane narzędzia.
Porównanie cen według modelu GPU
Oto ile każdy GPU rzeczywiście kosztuje u różnych typów dostawców na początku 2026:
| Model GPU | Hiperscaler on-demand | Hiperscaler zarezerwowany | Wyspecjalizowana chmura | Marketplace GPU |
|---|---|---|---|---|
| H100 80GB | 3,00–6,98 USD/godz. | 2,00–4,50 USD/godz. | 2,00–3,00 USD/godz. | 1,49–2,50 USD/godz. |
| A100 80GB | 1,50–3,50 USD/godz. | 1,00–2,50 USD/godz. | 0,80–1,50 USD/godz. | 0,72–1,50 USD/godz. |
| L40S 48GB | 1,20–2,50 USD/godz. | 0,80–1,80 USD/godz. | 0,80–1,50 USD/godz. | 0,60–1,20 USD/godz. |
| L4 24GB | 0,50–1,00 USD/godz. | 0,30–0,70 USD/godz. | 0,30–0,60 USD/godz. | 0,20–0,50 USD/godz. |
| RTX 4090 24GB | N/D (nieofertowane) | N/D | 0,40–0,80 USD/godz. | 0,40–0,80 USD/godz. |
Kluczowa obserwacja: Różnica cenowa między hiperscalerem on-demand a marketplace’em wynosi 2–4,7× za ten sam sprzęt GPU. Dla H100 różnica między 6,98 USD/godz. (AWS on-demand) a 1,49 USD/godz. (marketplace spot) to 5,49 USD/godz. — co składa się na 4008 USD/miesiąc za pojedynczy GPU działający 24/7.
Ukryte koszty zawyżające rachunek za GPU
Godzinowa stawka za GPU to tylko część historii. Pięć kategorii ukrytych kosztów regularnie zaskakuje zespoły:
1. Opłaty za egress danych
Przenoszenie danych poza sieć dostawcy chmury kosztuje — typowo 0,05–0,12 USD za GB. Trenowanie modelu, który pobiera 1 TB danych treningowych i regularnie eksportuje checkpointy, może dodać 50–120 USD w opłatach egress za przebieg treningowy. Przepływy pracy multi-cloud (trening u jednego dostawcy, inferencja u innego) mnożą te koszty.
2. Koszty storage
Instancje GPU potrzebują miejsca na dysku na datasety, checkpointy modeli i logi. Storage w chmurze kosztuje 0,02–0,08 USD/GB/miesiąc. Dataset 5 TB przechowywany przez 3 miesiące kosztuje 300–1200 USD — niewidoczny w stawce godzinowej GPU, ale bardzo widoczny na rachunku.
3. Sieć i load balancing
Produkcyjna inferencja wymaga load balancerów, API gateway’ów i sieci między węzłami. Te usługi dodają 50–200+ USD/miesiąc w zależności od wolumenu ruchu. Klastry treningowe multi-GPU ponoszą dodatkowe koszty za szybką sieć między węzłami.
4. Minimalne zobowiązania i zaokrąglanie
Niektórzy dostawcy rozliczają w godzinnych przyrostach — 35-minutowe zadanie kosztuje tyle samo co 60-minutowe. Rozliczanie per sekundę (oferowane przez niektóre marketplace’y) eliminuje to marnotrawstwo. Dla obciążeń burst’owych z wieloma krótkimi zadaniami, rozliczanie per godzinę może marnować 15–30% wydatków na niewykorzystany czas.
5. Opłaty za API i usługi zarządzania
Zarządzane usługi ML (SageMaker, Vertex AI) pobierają dodatkowe opłaty ponad obliczenia GPU. Mogą one dodać 10–30% do bazowego kosztu GPU za wygodę zarządzanych pipeline’ów treningowych i wdrożeniowych.
Kluczowa informacja: Obciążenie kosztujące 3,15 USD/godz. w obliczeniach GPU może kosztować 4,00–4,50 USD/godz. łącznie, gdy dodasz egress, storage, sieć i opłaty za zarządzanie. Zawsze obliczaj całkowity koszt obciążenia, nie tylko pozycję GPU.
Jak obniżyć koszty GPU w chmurze o 40%
Pięć sprawdzonych strategii, które łącznie mogą zmniejszyć całkowite wydatki na GPU o 30–40%:
1. Używaj instancji spot/preemptible (oszczędność 15–20%)
Instancje spot oferują zniżki 40–60% w porównaniu z cenami on-demand. Haczyk: mogą być przerwane z krótkim wyprzedzeniem (typowo 2 minuty do 2 godzin). Dla obciążeń odpornych na błędy — trening z checkpointowaniem, wsadowe przetwarzanie danych, niekrytyczna inferencja — instancje spot to największa pojedyncza dźwignia kosztowa.
Najlepiej działa dla: treningu modeli z regularnymi checkpointami, preprocessingu danych, inferencji wsadowej, eksperymentowania.
Nie działa dla: produkcyjnej inferencji obsługującej żywych użytkowników, zadań krytycznych czasowo, obciążeń nietolerujących przerwań.
2. Dobierz odpowiedni GPU (oszczędność 8–12%)
Wiele zespołów domyślnie wybiera najpotężniejszy GPU „dla bezpieczeństwa”. Obciążenie, które działa dobrze na A100 (0,72 USD/godz.) nie potrzebuje H100 (3,15 USD/godz.). Nasz przewodnik po najlepszym GPU dla AI zawiera framework decyzyjny obciążeń — dopasowanie modelu GPU do zadania może zmniejszyć koszty o ponad 50% dla przeskalowanych obciążeń.
Częste błędy: Używanie H100 do inferencji, gdy L40S wystarcza. Używanie A100 do fine-tuningu małych modeli, gdy RTX 4090 działa. Uruchamianie inferencji wsadowej na instancjach on-demand, gdy spot jest dostępny.
3. Harmonogramuj i auto-skaluj (oszczędność 5–8%)
Instancje GPU działające 24/7, gdy zespół pracuje 8 godzin dziennie, marnują dwie trzecie wydatków. Polityki auto-skalowania, które uruchamiają GPU dla zadań treningowych i wyłączają je po zakończeniu, mogą odzyskać znaczne marnotrawstwo. Nawet proste harmonogramowanie — „GPU włączone o 8 rano, wyłączone o 20” — oszczędza 50% na instancjach deweloperskich.
4. Migruj obciążenia na marketplace’y (oszczędność 10–15%)
Dla obciążeń niewymagających zarządzanych usług specyficznych dla hiperscalerów, przeniesienie na marketplace GPU może zaoszczędzić 3–6× na obliczeniach. Kluczowy wymóg: obciążenie musi być konteneryzowane (Docker) i niezależne od API specyficznych dla dostawcy (SageMaker, Vertex AI).
5. Używaj zarezerwowanej/zobowiązanej pojemności (dodatkowa oszczędność 5–10%)
Dla przewidywalnych, trwałych obciążeń (produkcyjna inferencja, ciągły trening), zobowiązania zarezerwowanej pojemności oferują zniżki 30–50% w porównaniu z cenami on-demand. Kompromis to zobowiązanie — typowo 1–3 lata. Łącz zarezerwowaną pojemność na obciążenie bazowe ze spot/marketplace’em na obciążenie zmienne.
Podział dostawca po dostawcy
AWS (Amazon Web Services)
Instancje GPU: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Ceny: H100 on-demand: ~4,50–6,98 USD/godz. Zarezerwowany (1 rok): ~3,00–4,50 USD/godz. Spot: ~1,50–2,50 USD/godz. Mocne strony: Najszerszy ekosystem zarządzanych usług (SageMaker, EKS, S3), globalna dostępność, wsparcie enterprise. Uwaga na: Opłaty egress (0,09 USD/GB), złożone warstwy cenowe, wahania dostępności instancji on-demand.
Google Cloud Platform
Instancje GPU: A3 (H100), A2 (A100), G2 (L4). Ceny: H100 on-demand: ~3,50–5,50 USD/godz. Zobowiązanie (1 rok): ~2,50–3,50 USD/godz. Spot: ~1,50–2,00 USD/godz. Mocne strony: Silna alternatywa TPU, doskonała integracja JAX/TensorFlow, zarządzana platforma Vertex AI, konkurencyjne ceny spot. Uwaga na: Mniejsza flota GPU niż AWS, mniejsza dostępność w niektórych regionach.
Microsoft Azure
Instancje GPU: ND H100 (H100), NC A100 (A100), NC T4 (T4). Ceny: H100 on-demand: ~3,00–5,00 USD/godz. Zarezerwowany (1 rok): ~2,00–3,50 USD/godz. Mocne strony: Integracja OpenAI (Azure OpenAI Service), silne enterprise identity/security, możliwości chmury hybrydowej. Uwaga na: Dostępność GPU może być ograniczona w popularnych regionach.
Marketplace’y GPU
Dostępne GPU: H100, A100, L40S, L4, RTX 4090 i więcej. Ceny: H100: 1,49–2,50 USD/godz. A100: 0,72–1,50 USD/godz. RTX 4090: 0,40–0,80 USD/godz. Mocne strony: Najniższe ceny, elastyczne rozliczanie (per sekundę na niektórych platformach), brak zobowiązań, szeroki wybór GPU w tym karty konsumenckie. Uwaga na: Zmienna niezawodność w zależności od dostawcy, mniej zarządzanych narzędzi, może wymagać więcej konfiguracji samodzielnej.
Kiedy używać którego typu dostawcy
| Scenariusz | Najlepszy typ dostawcy | Dlaczego |
|---|---|---|
| Enterprise produkcyjna inferencja | Hiperscaler | SLA, globalna dostępność, zarządzane usługi |
| Trening dużej skali (1000+ GPU) | Hiperscaler lub wyspecjalizowana chmura | Gwarantowana pojemność, sieć NVLink |
| Zoptymalizowany kosztowo trening | Marketplace GPU (spot) | Najniższe ceny, checkpointowanie obsługuje przerwania |
| Rozwój i eksperymenty | Marketplace GPU | Rozliczanie per sekundę, brak zobowiązań, tania iteracja |
| Mały zespół / startup | Marketplace GPU | Najniższa bariera, elastyczne skalowanie, brak minimów |
| Inferencja wsadowa | Marketplace GPU lub spot | Toleruje przerwania, wrażliwa cenowo |
| Regulowane obciążenia (finanse, zdrowie) | Hiperscaler | Certyfikaty zgodności, ścieżki audytu |
Kwestię wynajem vs kupno — czy wynajem chmury ma więcej sensu niż posiadanie sprzętu — znajdziesz w naszym szczegółowym porównaniu kosztów. Dla startupów budżetujących pierwsze wydatki na GPU zobacz nasz przewodnik po kosztach obliczeniowych startupów AI.
Najczęściej zadawane pytania
Jaki jest najtańszy sposób wynajmu H100?
Marketplace’y GPU oferują najniższe stawki H100 na poziomie 1,49–2,50 USD/godz. Instancje spot hiperscalerów są następne za 1,50–2,50 USD/godz., ale mogą być przerwane. Najtańszą niezawodną opcją jest marketplace z dostawcą o wysokich wynikach uptime. Dla obciążeń niekrytycznych czasowo, ceny spot na dowolnej platformie oferują najgłębsze zniżki.
Czy ukryte koszty są naprawdę tak znaczące?
Tak. Dla typowego obciążenia treningowego ukryte koszty (egress, storage, sieć) dodają 20–40% do rachunku za obliczenia GPU. Instancja H100 za 3,15 USD/godz. uruchamiająca zadanie treningowe z 2 TB transferu danych i 500 GB storage’u checkpointów może efektywnie kosztować 4,00–4,50 USD/godz. łącznie. Zawsze szacuj całkowity koszt obciążenia, nie tylko stawkę GPU za godzinę.
Czy powinienem używać jednego dostawcy czy wielu?
Wielu. Używaj marketplace’ów GPU dla obciążeń wrażliwych kosztowo (rozwój, przetwarzanie wsadowe, inferencja). Używaj hiperscalerów do produkcyjnej inferencji i regulowanych obciążeń. Używaj cen spot u wszystkich dostawców dla zadań odpornych na błędy. Dywersyfikacja zapobiega lock-in’owi i pozwala optymalizować koszty na każdej warstwie.
Czym jest rozliczanie per sekundę i czy ma znaczenie?
Rozliczanie per sekundę nalicza opłaty tylko za dokładny czas aktywności GPU. Rozliczanie per godzinę zaokrągla w górę — 35-minutowe zadanie kosztuje tyle samo co 60 minut. Dla obciążeń z wieloma krótkimi zadaniami (inferencja, eksperymenty, CI/CD) rozliczanie per sekundę oszczędza 15–30%. Dla długotrwałych zadań treningowych różnica jest znikoma.
Jak zmieniły się ceny GPU w ciągu ostatniego roku?
Ceny H100 spadły o 44% między czerwcem 2024 a czerwcem 2025, napędzane rosnącą podażą i konkurencją marketplace’ów. Ceny A100 spadły jeszcze bardziej w miarę starzenia się GPU. Oczekuje się, że ceny będą nadal stopniowo spadać w miarę zwiększania produkcji przez NVIDIA i AMD, choć GPU nowej generacji (B200, Rubin) będą wyceniane z premium przy premierze. Dla szerszego kontekstu rynkowego zobacz naszą analizę rynkową OpenAI-NVIDIA.