Manşet Rakamlar: Öncü Modeller Gerçekte Ne Kadara Mal Oluyor
Öncü bir AI modelini eğitmek, insanlık tarihinin en pahalı mühendislik projelerinden biridir. İşte gerçek rakamlar:
| Model | Yıl | Tahmini Eğitim Maliyeti | GPU Donanımı | Eğitim Süresi |
|---|---|---|---|---|
| GPT-3 (175B) | 2020 | ~4,6 milyon $ | ~1.000 V100 GPU | ~34 gün |
| PaLM (540B) | 2022 | ~12 milyon $ | 6.144 TPU v4 çip | ~50 gün |
| GPT-4 (~1,8T MoE) | 2023 | ~79 milyon $ | 10.000+ A100 GPU | ~100 gün |
| Gemini Ultra | 2024 | ~191 milyon $ | 16.384 TPU v5 çip | ~130 gün |
| Llama 3.1 405B | 2024 | ~60 milyon $ | 16.384 H100 GPU | ~54 gün |
| DeepSeek R1 | 2025 | ~294.000$ | ~2.000 H800 GPU | ~55 gün |
DeepSeek R1 rakamı dikkat çekicidir. Öncü laboratuvarlar yüz milyonlar harcarken, DeepSeek agresif verimlilik optimizasyonları kullanarak 300.000$‘ın altında rekabetçi performans elde etti — maliyetin tamamen model kalitesinin bir fonksiyonu olmadığını kanıtladı.
Eğitim Maliyetlerinin Dökümü: Hesaplama, Veri ve Mühendislik
Eğitim maliyeti sadece GPU kiralama değildir. Paranın gerçekte nereye gittiği:
GPU hesaplama (%65) baskın maliyettir. 79M$‘lık bir eğitim çalışması için yaklaşık 51 milyon dolar GPU kiralama veya amortize edilmiş donanım maliyetlerine gider. Bu, sağlayıcı seçimi ve donanım verimliliğine en duyarlı maliyet bileşenidir.
Veri hazırlığı (%15) web tarama, filtreleme, tekilleştirme, tokenizasyon ve RLHF için insan etiketlemeyi içerir. Yüksek kaliteli veri giderek pahalılaşıyor — sentetik veri ve otomatik hatlar maliyetleri azaltıyor ama ortadan kaldırmıyor.
Mühendislik (%12) eğitimi tasarlayan, çalıştıran ve hata ayıklayan ML araştırmacıları, altyapı mühendisleri ve destek personelini kapsar. En iyi AI araştırmacıları yıllık 1M$+ maaş alır. Öncü bir eğitim çalışması aylarca 20-50+ mühendislik ekibi gerektirir.
Altyapı (%8) depolama (petabaytlarca eğitim verisi), yüksek hızlı ağ (düğümler arası 400 GbE), orkestrasyon yazılımı ve izlemeyi içerir. İlk bütçelerde genellikle hafife alınır.
Maliyet Paradoksu: Birim Maliyetler Çökerken Harcama Neden Büyüyor
İşte sezgiye aykırı gerçeklik: toplam eğitim maliyetleri üssel olarak artarken birim-hesaplama başına maliyet üssel olarak düşüyor.
- Toplam harcama yılda 2,4× büyüyor — laboratuvarlar daha büyük modelleri daha fazla verilerle eğitiyor
- FLOP başına maliyet kabaca yılda 10× düşüyor — daha iyi donanım, daha iyi algoritmalar
- Gelirin yüzdesi olarak eğitim maliyeti artıyor — trilyon dolarlık şirketler bile baskıyı hissediyor
Bu paradoks var çünkü laboratuvarlar verimlilik kazanımlarının telafi edebileceğinden daha hızlı ölçekleniyor. Her yeni model nesli öncekinden 5-10× daha büyükken, verimlilik kazanımları FLOP başına maliyetleri nesil başına 2-3× düşürüyor. Net etki: daha ucuz hesaplamaya rağmen daha fazla harcama.
Bu GPU talebi için ne anlama geliyor: Bireysel GPU’lar daha güçlü ve verimli hale gelse bile, öncü eğitim için gereken toplam GPU sayısı artmaya devam ediyor. Bu, GPU altyapı sağlayıcıları için talep — ve fiyatlandırma gücü — sürdürüyor.
Model Boyutuna Göre Eğitim Maliyeti: 7B’den 1T+ Parametreye
Herkes öncü modeller eğitmiyor. Farklı ölçeklerde eğitim neye mal olur:
| Model Boyutu | Tipik Eğitim Hesaplaması | Tahmini Maliyet (H100 pazaryeri) | Tahmini Maliyet (AWS) |
|---|---|---|---|
| 1B parametre | ~1.000 GPU-saat | ~1.500$–2.500$ | ~4.000$–7.000$ |
| 7B parametre | ~10.000 GPU-saat | ~15.000$–25.000$ | ~40.000$–70.000$ |
| 13B parametre | ~25.000 GPU-saat | ~37.500$–62.500$ | ~100.000$–175.000$ |
| 70B parametre | ~200.000 GPU-saat | ~300.000$–500.000$ | ~800.000$–1,4M$ |
| 405B parametre | ~1.500.000 GPU-saat | ~2,2M$–3,7M$ | ~6M$–10,5M$ |
| 1T+ (öncü) | ~10.000.000+ GPU-saat | ~15M$–25M$ | ~40M$–70M$ |
Not: Bunlar kaba tahminlerdir. Gerçek maliyetler eğitim verimliliği, veri kalitesi, hiperparametre ayarlama başarısızlıkları ve donanım kullanımına göre önemli ölçüde değişir.
Pazaryeri ve hiper ölçekleyici fiyatlandırma arasındaki 2-3× maliyet farkı tüm ölçeklerde tutarlıdır. 7B model eğiten bir girişim için bu 15K$ ile 40K$ arası fark — anlamlı ama yönetilebilir. 1T+ model eğiten bir öncü laboratuvar için on milyonlarca dolardır.
Sağlayıcı Seçimi Eğitim Bütçelerini Nasıl Etkiler
GPU’ları nerede kiraladığınız, AI’daki en yüksek kaldıraçlı maliyet kararlarından biridir:
| Sağlayıcı Tipi | H100 Aylık Maliyet (7/24) | 12 Aylık Maliyet | AWS’ye Göre Tasarruf |
|---|---|---|---|
| AWS (talep üzerine) | ~2.800$ | ~33.600$ | — |
| Uzman bulut (Lambda) | ~2.150$ | ~25.800$ | %23 |
| Pazaryeri (doğrulanmış ev sahibi) | ~1.150$ | ~13.800$ | %59 |
| Ayrılmış/taahhütlü | ~1.700$ | ~20.400$ | %39 |
1.000 GPU-saatlik bir eğitim çalışması için AWS talep üzerine ile pazaryeri arasındaki fark yaklaşık 2.000$‘dır. Bunu 100.000 GPU-saatlik bir çalışmaya ölçekleyin ve fark 200.000$ olur. Öncü ölçekte, sağlayıcı seçimi bütçeleri milyonlarla etkiler.
Tüm büyük sağlayıcılar genelinde ayrıntılı fiyat karşılaştırmaları için bulut GPU fiyatlandırma kılavuzumuza bakın. Hangi GPU modelini seçeceğinizi anlamak için AI için en iyi GPU kılavuzumuza bakın.
Temel içgörü: Birçok ekip mevcut bulut sağlayıcılarını (AWS, GCP, Azure) kolaylık nedeniyle eğitim için varsayılan olarak kullanır. Bu kolaylık, pazaryeri alternatiflerinden %40-60 daha pahalıya mal olabilir. 10.000$‘ı aşan eğitim çalışmaları için pazaryeri hesabı kurmak için harcanan 30 dakika kendini yüzlerce kez geri öder.
Verimlilik Atılımları: Daha Azla Daha İyi Modeller Eğitmek
DeepSeek R1 örneği (rekabetçi performans için 294.000$) ham harcamanın tek yol olmadığını gösteriyor. 2026’daki temel verimlilik teknikleri:
Mixture of Experts (MoE): Girdi başına model parametrelerinin yalnızca bir alt kümesi etkinleşerek ileri geçiş başına hesaplamayı 4-8× azaltır. GPT-4’ün MoE kullandığı bildiriliyor — token başına yalnızca ~280B parametrenin etkinleştiği ~1,8T parametreli bir model. Bu, efektif parametre başına eğitim FLOP gereksinimlerini dramatik olarak azaltır.
Kuantizasyon farkındalıklı eğitim: Baştan düşük hassasiyette (BF16, FP8) eğitim, minimum kalite etkisiyle bellek ve hesaplama gereksinimlerini 2-4× azaltır. NVIDIA Blackwell GPU’lar yerel olarak FP4 eğitimini destekler.
Miktar yerine veri kalitesi: OpenAI’ın araştırması, daha küçük, yüksek kaliteli veri kümelerinde eğitimin 10× daha fazla düşük kaliteli veriyle eğitilen modellerle eşleşebileceğini gösteriyor. Veri küratörlüğüne yatırım hesaplama gereksinimlerini azaltır.
Mimari yenilikler: Ring Attention (uzun bağlam için), FlashAttention (bellek verimliliği için) ve spekülatif kod çözme (daha hızlı çıkarım için) gibi teknikler verimlilik kazanımlarını birleştirir. Her teknik nesli, belirli bir kalite seviyesi için gereken hesaplamayı azaltır.
Damıtma: Daha küçük bir “öğrenci” modeli, daha büyük bir “öğretmen” modelini taklit etmek üzere eğitmek, 10-100× daha düşük eğitim ve çıkarım maliyetiyle öğretmenin performansının %80-95’ine ulaşabilir.
Projeksiyonlar: Eğitim Maliyetleri Nereye Gidiyor (2026-2028)
Üst sınır yükselmeye devam ediyor. Anthropic’in Dario Amodei, öncü modellerin 2028’e kadar 10 milyar dolara eğitime mal olabileceğini belirtti. Herhangi bir modelin gerçekten o kadara mal olup olmayacağı verimlilik kazanımlarına ve azalan getiri ekonomisine bağlı.
Taban düşmeye devam ediyor. Aynı zamanda, “GPT-4 eşdeğeri” bir modeli eğitme maliyeti düşmeye devam ediyor — 2023’te 79M$‘dan mevcut nesil donanım ve verimlilik tekniklerini kullanarak 2026’da tahminen 5M$-10M$‘a. İki yıl önce öncü-pahalı olan şey, iyi finanse edilmiş girişimler için ulaşılabilir hale geliyor.
GPU talebi için etki: Her iki trend de GPU talebini sürdürüyor. Öncü laboratuvarlar daha büyük modeller için daha fazla GPU’ya ihtiyaç duyuyor. Daha küçük kuruluşlar yakın zamana kadar imkansız olanı eğitmek için GPU’lara ihtiyaç duyuyor. Eğitim hesaplaması için toplam adreslenebilir pazar her iki yönde de genişliyor.
Çıkarım maliyetlerinin benzer ama daha dik bir düşüşü nasıl izlediği için çıkarım ekonomisi analizimize bakın. Girişime özel bütçeleme rehberliği için AI girişim hesaplama kılavuzumuza bakın.
Sıkça Sorulan Sorular
Bir modeli ince ayar yapmak ne kadara mal olur?
İnce ayar, ön eğitimden dramatik olarak daha ucuzdur. GPU pazaryerinde 7B modeli ince ayar yapmak yaklaşık 50$–500$ (birkaç yüz GPU-saat) maliyetindedir. 70B modeli ince ayar yapmak 500$–5.000$ tutar. LoRA ve QLoRA teknikleri bu maliyetleri 5-10× daha azaltır. İnce ayar, birkaç yüz dolarla neredeyse her ekip için erişilebilirdir.
GPT-4 eğitimi neden bu kadar pahalı?
Ölçek. GPT-4’ün yaklaşık 100 gün boyunca 10.000+ A100 GPU kullanarak 13 trilyon token üzerinde eğitildiği bildiriliyor. A100 pazaryeri fiyatlarıyla (~1,00$/saat), 10.000 GPU’nun 2.400 saat çalışması yalnızca hesaplamada 24 milyon$ — ve gerçek maliyetler eğitim yeniden başlatmaları, hiperparametre ayarlama ve altyapı yükü nedeniyle daha yüksekti.
1.000$‘ın altında kullanışlı bir AI modeli eğitebilir miyim?
Evet. Mevcut açık kaynak modelleri (Llama 3, Mistral) alana özgü verilerle ince ayar yapmak 50$–500$‘a yapılabilir. Sıfırdan küçük bir model (1B-3B parametre) eğitmek 1.000$–5.000$ tutar. Anahtar, sıfırdan eğitmek yerine önceden eğitilmiş modelleri ve LoRA gibi verimli teknikleri kullanmaktır.
Eğitim maliyeti AI pazarını nasıl etkiler?
Yüksek eğitim maliyetleri giriş engelleri oluşturur — yalnızca iyi finanse edilmiş kuruluşlar öncü modeller eğitebilir. Bu, gücü birkaç laboratuvarda (OpenAI, Anthropic, Google, Meta) yoğunlaştırır. Ancak açık kaynak modeller (Llama, Mistral, DeepSeek) ve düşen ince ayar maliyetleri yetenekli AI’ya erişimi demokratikleştiriyor. Eğitim maliyet engeli öncü modeller için yüksek ama uygulamalı AI için düşüktür.
Eğitim maliyetleri yükselmeye devam edecek mi?
Öncü eğitime yapılan toplam harcama muhtemelen artmaya devam edecek (1B$+‘a doğru) çünkü laboratuvarlar daha büyük, daha yetenekli modeller için baskı yapıyor. Ama belirli bir performans seviyesine ulaşma maliyeti hızla düşüyor — 2023’te 79M$‘a mal olan şey 2026’ya kadar 10M$‘ın altına inecek. Her iki ifade aynı anda doğrudur.
Projem için eğitim maliyetlerini nasıl tahmin edebilirim?
Pratik kural: N milyar parametreli ve T token üzerinde eğitilen bir model yaklaşık (6 × N × T) FLOP gerektirir. GPU’nun FLOP/sn oranına bölün ve GPU-saat elde edin. Saatlik fiyatla çarpın. Örnek: 1T token üzerinde eğitilen 7B model ~42 × 10^18 FLOP gerektirir. H100, ~990 TFLOPS (BF16) sunar. Bu yaklaşık 11.800 GPU-saat yani pazaryeri fiyatıyla (1,50$/saat) yaklaşık 17.700$. Yük için (yeniden başlatmalar, ayarlama, değerlendirme) %30-50 ekleyin.