1.000× Düşüş: Çıkarım Maliyetleri Nasıl Çöktü
2022 sonunda GPT-4 sınıfı bir modeli çalıştırmak yaklaşık milyon token başına 20$ maliyetindeydi. 2026 başında eşdeğer performans milyon token başına 0,40$ — hatta daha az. Bu, üç yılın biraz üzerinde bir sürede 1.000× düşüş anlamına geliyor ve hesaplama tarihinin en hızlı maliyet düşüşlerinden biri.
Bu çöküş tek bir faktörden kaynaklanmadı. Dört eşzamanlı iyileşmenin birleşik etkisinden oluştu:
1. Donanım verimliliği artışları. Her GPU nesli, dolar başına 2-3× daha fazla çıkarım verimi sunuyor. H100, benzer fiyat noktasında A100’e göre saniyede yaklaşık 3× daha fazla token işliyor. Blackwell bunu daha da ileri taşıyor.
2. Yazılım ve derleyici optimizasyonu. vLLM, TensorRT-LLM ve SGLang gibi çıkarım çerçeveleri, sürekli gruplama, PagedAttention ve spekülatif kod çözme gibi tekniklerle GPU kullanımını %30-40’tan %70-80’e çıkardı.
3. Model mimarisi verimliliği. Mixtral ve DeepSeek V3 gibi Mixture-of-Experts (MoE) modeller, token başına toplam parametrelerin yalnızca bir kısmını etkinleştirerek eşdeğer yoğun modellere göre token başına 3-5× daha düşük hesaplama maliyetiyle öncü kalitede çıktı sunuyor.
4. Kuantizasyon ve damıtma. Modelleri INT8 veya INT4 hassasiyetinde çalıştırmak, minimum kalite kaybıyla bellek ve hesaplama gereksinimlerini 2-4× azaltıyor. Daha küçük damıtılmış modeller, maliyetin çok küçük bir bölümünde büyük model yeteneklerinin %90+‘ını kopyalıyor.
Donanım, yazılım, model mimarisi ve kuantizasyon iyileştirmelerinin birleşik etkisi çarpımsaldır. Her 2-3× kazanım diğerleriyle birleşerek toplamda 1.000× düşüşü üretmektedir.
Çıkarım Neden Artık GPU Talebine Hakim
Derin öğrenme döneminin büyük bölümünde eğitim, GPU hesaplamasının çoğunluğunu tüketiyordu. Büyük bir modeli eğitmek haftalarca veya aylarca binlerce GPU gerektirirken, çıkarım nispeten küçük bir kullanıcı tabanına hizmet ediyordu.
Bu oran tersine döndü. 2026’da çıkarım, tüm AI hesaplama talebinin yaklaşık üçte ikisini oluşturuyor; 2023’te bu oran kabaca üçte birdi.
Bu geçişi üç güç yönlendiriyor:
Kitlesel tüketici benimsemesi. ChatGPT, Claude, Gemini ve rakipleri artık yüz milyonlarca kullanıcıya hizmet veriyor. Her sohbet, her kod tamamlama, her görsel üretim bir çıkarım iş yüküdür. Tek bir eğitim çalışması bir model üretir; çıkarım o modeli sürekli olarak milyonlarca kullanıcıya sunar.
AI’ın kurumsal iş akışlarına entegrasyonu. Şirketler AI ile deneysel çalışmadan onu üretim uygulamalarına — müşteri hizmetleri, kod üretimi, belge analizi, arama — yerleştirmeye geçti. Bu her zaman açık uygulamalar sürekli çıkarım talebi yaratıyor.
Ajan ve çok adımlı muhakeme. Modern AI sistemleri giderek daha fazla çok turlu muhakeme, araç kullanımı ve düşünce zinciri işleme kullanıyor; bu da kullanıcı etkileşimi başına üretilen tokenleri 5-50× artırıyor. Planlayan, yürüten ve doğrulayan bir AI ajanı, basit bir Soru-Cevap yanıtının 500 tokenine karşılık görev başına 10.000+ token üretebilir.
Temel içgörü: Bir modeli eğitmek tek seferlik bir maliyettir. Modeli sunmak, kullanıcılarla ölçeklenen sürekli bir maliyettir. AI bir kamu hizmeti haline geldikçe — her zaman açık, her zaman erişilebilir — çıkarım hesaplama talebi sınırsız büyür. Bu, 2026 ve sonrasındaki GPU talebinin temel itici gücüdür.
Token Başına Maliyet: AI Şirketlerini Yöneten Metrik
AI şirketleri için token başına maliyet, iş sürdürülebilirliğini belirleyen metrik olarak FLOPS’un yerini aldı. Matematik doğrudandır: çıkarım maliyetiniz milyon token başına 1,00$ ise ve 2,00$ ücret alıyorsanız, brüt marjınız %50’dir. Çıkarım maliyetleri milyon token başına 0,40$‘a düşerse, aynı fiyatlandırma %80 marj verir — veya kullanıcıları büyütmek için fiyatları düşürebilirsiniz.
Güncel Token Başına Maliyet Karşılaştırmaları (2026)
| Model Sınıfı | Milyon Giriş Tokeni Başına Maliyet | Milyon Çıkış Tokeni Başına Maliyet | Tipik Kullanım Alanı |
|---|---|---|---|
| Öncü (GPT-4.5, Claude Opus) | 2,00$–15,00$ | 8,00$–75,00$ | Karmaşık muhakeme, araştırma |
| Orta düzey (GPT-4o, Claude Sonnet) | 0,50$–3,00$ | 1,00$–15,00$ | Genel amaçlı, kodlama |
| Verimli (GPT-4o-mini, Haiku) | 0,10$–0,25$ | 0,30$–1,00$ | Yüksek hacimli uygulamalar |
| Açık kaynak sunulan (Llama, Mixtral) | 0,05$–0,30$ | 0,10$–0,60$ | Maliyete duyarlı, kendi sunucusu |
| Damıtılmış / Kuantize | 0,01$–0,10$ | 0,03$–0,20$ | Uç, toplu işleme |
Token Başına Maliyet GPU Operatörleri İçin Neden Önemli
GPU altyapısı işletiyorsanız — ister tek bir düğüm ister çok raflı bir küme — çıkarım iş yükleri giderek birincil gelir kaynağınız oluyor. Ekonomi, eğitimden farklı çalışıyor:
Eğitim geliri: Büyük, toplu sözleşmeler. Bir müşteri 2-8 hafta boyunca 64-512 GPU kiralar. Yüksek toplam değer ama nadir.
Çıkarım geliri: İstek başına daha küçük ama sürekli. Müşteriler modelleri dağıtır ve trafiği 7/24 sunar. Daha öngörülebilir, daha yüksek kullanım, kapasite planlaması için daha iyi.
Gelir etkisi: Çıkarım iş yükleri için optimize eden GPU operatörleri — gruplama, model sunum altyapısı ve SLA yönetimi aracılığıyla — eğitim müşterilerine ham hesaplama sunan operatörlere göre GPU-saat başına %20-40 daha fazla gelir elde ediyor. GPU operatör ekonomisi hakkında daha fazla bilgi için küme ekonomisi kılavuzumuza bakın.
Çıkarım İçin Donanım: H100’ler Neden Her Zaman Cevap Değil
H100, AI eğitimine hakimdir çünkü eğitim maksimum bellek bant genişliği, GPU’lar arası iletişim ve FP16/BF16 hesaplama gerektirir. Çıkarımın farklı gereksinimleri vardır — ve farklı donanım genellikle daha iyi ekonomi sunar.
Çıkarım Donanımı Karşılaştırması
| GPU | MSRP | Çıkarım Verimi (token/sn, Llama 70B) | 1M Token Başına Maliyet | En İyi Kullanım |
|---|---|---|---|---|
| H100 80GB SXM | 30.000$ | ~2.800 | 0,30$ | Büyük modeller, toplu çıkarım |
| L40S 48GB | 7.500$ | ~1.200 | 0,18$ | Orta boy modeller, karma iş yükleri |
| L4 24GB | 2.500$ | ~400 | 0,17$ | Küçük-orta modeller, yüksek yoğunluk |
| A100 80GB | 10.000$ (kullanılmış) | ~1.600 | 0,17$ | Ölçekte maliyet-etkin çıkarım |
| RTX 4090 24GB | 1.600$ | ~350 | 0,13$ | Bütçe çıkarımı, küçük modeller |
Temel içgörü: Saf çıkarım iş yükleri için H100’ün premium fiyatı genellikle haklı değildir. L40S, fiyatın dörtte birinde karşılaştırılabilir token başına maliyet sunarak çıkarım ağırlıklı dağıtımlar için daha iyi bir seçimdir. H100’ün avantajları — NVLink, HBM3, devasa FP16 verimi — çıkarım iş yüklerinin yetersiz kullandığı eğitim özellikleridir.
NVIDIA’nın çıkarım yapabilen GPU’larının ayrıntılı karşılaştırması için GPU karşılaştırma kılavuzumuza bakın. Güçlü çıkarım değeri sunan eski nesil seçenekler için A100 vs A6000 vs A2000 analizimize bakın.
Özel ASIC’ler: Yalnızca Çıkarım Alternatifi
Google’ın TPU v5e’si, Amazon’un Trainium/Inferentia’sı ve yeni ortaya çıkan özel silikon, yalnızca çıkarım için tasarlanmıştır. Bu çipler, çıkarım görevlerinde 3-5× daha iyi güç verimliliği için eğitim esnekliğinden vazgeçer.
Ödünleşim: özel ASIC’ler sizi belirli bir sağlayıcının ekosistemine ve model formatına kilitler. GPU’lar herhangi bir çerçeveden herhangi bir modeli değişiklik yapılmadan çalıştırdıkları için evrensel seçim olmaya devam ediyor. Çoğu GPU pazaryeri katılımcısı için, çıkarım iş yüklerine hizmet veren NVIDIA GPU’lar esneklik ve maliyet arasındaki en iyi dengeyi sağlar.
Çıkarım Tedarik Zinciri: Buluttan Uca
Çıkarım iş yükleri, eğitimden daha geniş bir dağıtım yüzeyini kapsar. Eğitim merkezi veri merkezlerinde gerçekleşirken, çıkarım kullanıcıların ihtiyaç duyduğu her yerde çalışır.
Dağıtım Katmanları
Katman 1: Hiper ölçekli bulut (ölçekte en düşük token başına maliyet) AWS, Azure, GCP ve CoreWeave ve Lambda gibi uzman sağlayıcılar, yönetilen API’ler ve özel GPU örnekleri aracılığıyla çıkarım sunar. Yüksek hacimli, gecikme toleranslı iş yükleri için en iyisi. Güncel fiyatlar: H100 başına 1,50$–6,98$/saat.
Katman 2: GPU pazaryerleri (maliyet optimize edilmiş) Vast.ai, RunPod ve diğer pazaryerleri gibi platformlar, dağıtılmış GPU arzını bir araya getirerek hiper ölçekleyicilere göre %40-60 daha düşük maliyetle çıkarım barındırma sunar. Biraz gecikme değişkenliğinin kabul edilebilir olduğu maliyete duyarlı iş yükleri için en iyisi.
Katman 3: Yerinde / ortak yerleşim (öngörülebilir maliyet) Ayda 50.000 GPU-saatin üzerinde sürekli çıkarım iş yükleri çalıştıran şirketler giderek artan bir şekilde ortak yerleşim tesislerinde sahip olunan veya kiralanan donanım dağıtıyor. En yüksek ön maliyet ancak ölçekte en düşük token başına maliyet. Finansman seçenekleri için GPU finansman kılavuzumuza bakın.
Katman 4: Uç çıkarım (gecikme optimize edilmiş) Tüketici GPU’ları (RTX 4090), mobil çipler ve özel uç cihazlar, gecikme kritik uygulamalar (otonom araçlar, gerçek zamanlı çeviri, cihaz üstü asistanlar) için yerel olarak çıkarım sunar. Küçük modeller ve agresif kuantizasyon bunu mümkün kılar.
| Katman | Token Başına Maliyet | Gecikme | Ölçek | Örnek Kullanım Alanı |
|---|---|---|---|---|
| Hiper ölçekli bulut | Orta | 50–200ms | Sınırsız | API sunulan LLM’ler |
| GPU pazaryeri | Düşük | 80–300ms | Esnek | Toplu çıkarım, ince ayar API’leri |
| Yerinde | En düşük (ölçekte) | 10–50ms | Sabit | Kurumsal AI uygulamaları |
| Uç | Token başına en yüksek | 5–20ms | Cihaz başına | Gerçek zamanlı, gizlilik duyarlı |
Temel içgörü: “Doğru” çıkarım dağıtımı yalnızca maliyete değil, gecikme gereksinimlerine bağlıdır. 10ms yanıt süresine ihtiyaç duyan bir tıbbi görüntüleme AI’ı, fiyatından bağımsız olarak uzak bir bulut API’si kullanamaz. Çıkarım tedarik zinciri gecikme katmanına göre tabakalaşıyor ve her biri için ayrı GPU talebi yaratıyor.
Düşen Çıkarım Maliyetleri GPU Pazarları İçin Ne Anlama Geliyor
Çıkarımdaki 1.000× maliyet düşüşü sadece teknik bir dönüm noktası değil — tüm GPU ekosisteminin ekonomisini yeniden şekillendiriyor.
Talep Etkisi: Daha Ucuz Çıkarım Daha Fazla Talep Yaratıyor
Bu, AI hesaplamaya uygulanmış Jevons Paradoksu’dur. Çıkarım ucuzladıkça, kuruluşlar daha önce maliyetçe engelleyici olan iş yüklerinde AI dağıtıyor. Sonuç: birim maliyetler düşerken toplam çıkarım harcaması artıyor.
Düşünün: milyon token başına 20$ ile yalnızca en yüksek değerli kurumsal uygulamalar LLM dağıtımını haklı kılıyordu. Milyon token başına 0,40$ ile her SaaS ürünü, her dahili araç ve her tüketici uygulaması AI yerleştirebilir. Adreslenebilir pazar büyüklük mertebeleriyle genişliyor.
GPU Pazarı Etkileri
1. Çıkarım talebi GPU fiyatlarını destekliyor. Token başına maliyetler düşse bile, çıkarım iş yüklerinin hacmi daha hızlı büyüyor. Çıkarım için tüketilen toplam GPU-saat artıyor ve GPU pazaryerlerindeki kiralama oranlarını destekliyor.
2. Eski GPU’lar yeni hayat buluyor. Başlangıçta eğitim güç merkezleri olan A100’ler artık maliyet-etkin çıkarım kartlarıdır. Eğitim geliri için artık rekabet edemeyen GPU’lar, çıkarım iş yüklerini karlı bir şekilde sunmak üzere “değer kaskadı”nda aşağıya hareket eder. Bu, GPU donanımının faydalı ekonomik ömrünü uzatır. Bu dinamik hakkında daha fazla bilgi için GPU varlık sınıfı analizimize bakın.
3. Çıkarım için optimize edilmiş arz büyüyor. NVIDIA’nın ürün yelpazesi çıkarım yapabilen SKU’lara (L4, L40S, daha büyük bellekli H200) doğru kaymıştır. Pazar sinyali açıktır: hacim talebin yöneldiği yer çıkarımdır.
4. Pazaryeri dinamikleri değişiyor. GPU pazaryerleri giderek eğitim müşterilerinin yanı sıra çıkarım müşterilerine de hizmet veriyor. Çıkarım iş yükleri müşteri başına daha küçük ama daha çok sayıda ve daha kalıcı olma eğilimindedir — kullanım profilini dalgalıdan sabit’e değiştiriyor.
Çıkarım Pazarı Büyüklüğü
| Yıl | Tahmini Çıkarım Hesaplama Pazarı | Yıllık Büyüme | Toplam AI Hesaplamasındaki Pay |
|---|---|---|---|
| 2023 | ~12 milyar $ | — | ~%33 |
| 2024 | ~25 milyar $ | +%108 | ~%50 |
| 2025 | ~38 milyar $ | +%52 | ~%58 |
| 2026 (öngörülen) | ~55 milyar $ | +%45 | ~%67 |
Çıkarım pazarının 2026’da 50 milyar doları aşması öngörülüyor ve ilk kez eğitimden daha hızlı büyüyor. Bu, GPU talebinin neye benzediğinde yapısal bir değişimi temsil ediyor — nadir, devasa eğitim kümelerinden her zaman açık, küresel olarak dağıtılmış çıkarım altyapısına.
Projeksiyonlar: Milyon Token Başına 0,01$‘a Giden Yol
Mevcut gidişat devam ederse, GPT-4 eşdeğeri çıkarım 2028’e kadar milyon token başına 0,01$‘ın altına düşecek. Bu fiyat noktasında, AI çıkarımı çoğu uygulama için fiilen ücretsiz hale gelir — veritabanı sorgularından, CDN bant genişliğinden, günlük kaydından daha ucuz.
Süregelen Maliyet Düşüşünü Ne Yönlendiriyor
Yeni nesil donanım. NVIDIA Blackwell ve Rubin mimarileri, Hopper üzerinden 2-4× çıkarım verimi sunuyor. AMD MI350 ve Intel Gaudi 3 rekabet baskısı ekliyor. Her donanım nesli maliyet eğrisini sıfırlıyor.
Spekülatif kod çözme ve önbelleğe alma. Olası token dizilerini tahmin eden ve ara hesaplamaları önbelleğe alan teknikler, tekrarlayan veya öngörülebilir iş yükleri için efektif token başına hesaplamayı 2-5× azaltabilir.
Ölçekte model damıtma. Öncü modeller referans uygulamaları haline geldikçe, daha küçük damıtılmış sürümler 10-100× daha düşük çıkarım maliyetiyle çoğu yeteneği yakalar. Çoğu görev için “yeterince iyi” model küçülmeye devam ediyor.
Çıkarıma özel silikon. Amaç-doğrultusunda üretilmiş çıkarım çipleri (Groq LPU, Google TPU, Amazon Inferentia) eğitim esnekliği yerine token verimi için optimize eder. Bunlar olgunlaştıkça, GPU operatörlerini token başına maliyette rekabet etmeye zorlayacaklar.
Bu GPU Yatırımcıları ve Operatörleri İçin Ne Anlama Geliyor
Kısa vadeli (2026–2027): Çıkarım talebi büyümesi maliyet düşüşünü geçiyor. Toplam çıkarım geliri büyümeye devam ediyor. GPU operatörleri, özellikle mükemmel çıkarım ekonomisi sunan orta kademe kartlardan (A100, L40S) sürekli talepten faydalanıyor.
Orta vadeli (2027–2029): Token başına maliyet emtia seviyelerine yaklaşıyor. Farklılaşma donanımdan yazılıma (sunum çerçeveleri, SLA garantileri, coğrafi yerleşim) kayıyor. Çıkarım sunumu etrafında yazılım hendekleri kuran GPU pazaryeri operatörleri orantısız değer yakalayacak.
Uzun vadeli (2029+): Çıkarım bir kamu hizmeti haline geliyor, bant genişliği veya depolama gibi fiyatlandırılıyor. GPU pazarı ikiye ayrılıyor: eğitim donanımı, öncü model geliştirme için premium fiyatlarını sürdürüyor; çıkarım donanımı ise ince marjlı ama devasa ölçekli bir hacim emtia işi haline geliyor.
Hesaplama bütçelerini planlayan AI girişimleri için bu çıkarım maliyet gidişatını anlamak kritiktir — aşama aşama bütçeleme önerilerimiz için girişim hesaplama maliyetleri kılavuzumuza bakın.
Sıkça Sorulan Sorular
Çıkarım maliyetleri neden bu kadar hızlı düştü?
Dört faktör birleşiyor: donanım iyileştirmeleri (nesil başına 2-3×), yazılım optimizasyonu (sürekli gruplama, PagedAttention — 2-3×), model mimarisi verimliliği (MoE modeller — 3-5×) ve kuantizasyon (2-4×). Her iyileştirme diğerleriyle çarpılarak 3 yılda ~1.000× toplam düşüşü üretiyor.
GPU talebi için eğitim mi çıkarım mı daha önemli?
Çıkarım artık baskın. Öncü bir modeli eğitmek, haftalarca binlerce GPU gerektiren tek seferlik bir olaydır. O modeli sunmak, yıllarca 7/24 çalışan GPU’lar gerektirir. Sürekli token üreten yüz milyonlarca AI kullanıcısıyla, çıkarım 2026’da toplam AI hesaplamasının yaklaşık %67’sini oluşturuyor.
Çıkarım için en iyi GPU hangisi?
Model boyutuna bağlıdır. Büyük modeller (70B+ parametre) için H100 ve A100 gerekli bellek ve bant genişliğini sağlar. Orta boy modeller (7B–30B) için L40S en iyi token başına maliyeti sunar. Küçük modeller için L4 veya hatta RTX 4090 çok düşük maliyetle çıkarım sunabilir. Kapsamlı karşılaştırma için AI için en iyi GPU kılavuzumuza bakın.
Düşen çıkarım maliyeti GPU kiralama fiyatlarını nasıl etkiliyor?
Sezgiye aykırı olarak, düşen token başına maliyetler GPU kiralama oranlarını azaltmadı. Jevons Paradoksu geçerlidir: daha ucuz çıkarım yeni kullanım alanları açarak toplam talebi büyütür. H100’ler için GPU pazaryeri oranları, token başına maliyet düşerken bile sabit kalmış veya artmıştır, çünkü daha fazla müşteri çıkarım iş yükleri için GPU kiralıyor.
Özel ASIC’ler çıkarım için GPU’ların yerini alacak mı?
Kısmen. Google’ın TPU’su, Amazon’un Inferentia’sı ve Groq’un LPU’su gibi özel çipler, belirli model mimarileri için üstün çıkarım verimliliği sunuyor. Ancak GPU’lar esneklik (herhangi bir modeli çalıştırma), ekosistem olgunluğu ve erişilebilirlik konusunda avantajlarını koruyor. Muhtemel sonuç birlikte varoluştur: yüksek hacimli, standartlaştırılmış çıkarım için ASIC’ler; geri kalan her şey için GPU’lar. Bu maliyet denkleminin eğitim tarafı hakkında daha fazla bilgi için AI eğitim maliyetleri analizimize bakın.