Was ist eine GPU? Die 30-Sekunden-Antwort
Eine GPU (Graphics Processing Unit) ist ein spezialisierter Prozessor, der dafür entwickelt wurde, Tausende mathematischer Operationen gleichzeitig durchzuführen. Ursprünglich wurde sie erfunden, um Pixel auf einem Bildschirm darzustellen, doch die GPU hat sich zur Rechenmaschine hinter künstlicher Intelligenz, wissenschaftlicher Forschung, autonomen Fahrzeugen und vielem mehr entwickelt.
Hier ist der einfachste Weg, den Unterschied zwischen einer CPU und einer GPU zu verstehen. Denken Sie an ein Orchester. Eine CPU ist der Dirigent — außerordentlich fähig, koordiniert komplexe Arrangements, liest die vollständige Partitur, steuert Tempowechsel und trifft in Echtzeit Entscheidungen auf hoher Ebene. Doch ein Dirigent spielt kein Instrument. Stellen Sie sich nun 16.000 Musiker vor, von denen jeder im genau richtigen Moment eine einzelne, einfache Note spielt. Einzeln betrachtet ist jede Note trivial. Zusammen erzeugen sie eine Symphonie der Berechnung — Milliarden von Berechnungen, verwoben zu einem kohärenten Ergebnis. Das ist eine GPU.
Dies ist wichtig, weil die prägenden Technologien unserer Ära — große Sprachmodelle, Echtzeit-Raytracing, Wirkstoffforschungs-Simulationen, Klimamodellierung — alle ein gemeinsames Merkmal teilen: Sie erfordern enorme Mengen einfacher, sich wiederholender Mathematik, die gleichzeitig ausgeführt wird. CPUs wurden dafür nie gebaut. GPUs schon.
Die Zahlen sprechen für sich. Der globale GPU-Markt wurde 2025 auf 101,5 Milliarden Dollar geschätzt und soll bis 2035 1,7 Billionen Dollar erreichen, mit einer jährlichen Wachstumsrate von 32,6 % (Precedence Research). GPUs haben sich von einer Nischenkomponente in Gaming-PCs zur grundlegenden Infrastruktur der KI-Wirtschaft entwickelt.
Wie eine GPU tatsächlich funktioniert: Parallelverarbeitung erklärt
Um eine GPU zu verstehen, müssen Sie Parallelverarbeitung verstehen — und warum sie sich grundlegend von dem unterscheidet, was eine CPU tut.
Eine CPU führt Aufgaben sequenziell aus. Sie hat eine kleine Anzahl extrem leistungsstarker Kerne (typischerweise 8–24 auf einem Desktop-Chip), von denen jeder komplexe, verzweigte Logik verarbeiten kann. Sie ist auf Vielseitigkeit ausgelegt: ein Betriebssystem ausführen, Datei-I/O verwalten, bedingte Codepfade ausführen. Ein CPU-Kern ist wie ein Experten-Ingenieur, der jede Art von Problem lösen kann, aber nur ein Problem auf einmal.
Eine GPU verfolgt den gegenteiligen Ansatz. Sie packt Tausende einfacher Kerne, die jeweils einen winzigen Teil eines größeren Problems bearbeiten — alles gleichzeitig. Das ist Parallelverarbeitung. Anstatt dass ein Experte ein Problem löst, lösen Tausende von Arbeitern gleichzeitig jeweils ein Stück eines Puzzles.
CUDA-Kerne
Die Arbeitspferde einer NVIDIA GPU werden CUDA-Kerne (Compute Unified Device Architecture) genannt. Jeder CUDA-Kern ist ein einfacher Prozessor, der eine Gleitkomma- oder Ganzzahloperation pro Taktzyklus durchführen kann. Was sie leistungsstark macht, ist die Menge. Die NVIDIA H100, das Arbeitspferd der modernen KI-Infrastruktur, hat 16.896 CUDA-Kerne. Eine Consumer-RTX 4090 hat 16.384. Wenn eine Aufgabe wie das Rendern eines Frames oder das Training eines neuronalen Netzwerks in Tausende unabhängiger Teilaufgaben aufgeteilt werden kann, feuern alle diese Kerne gleichzeitig.
Tensor-Kerne
Mit der Volta-Architektur im Jahr 2017 eingeführt, sind Tensor-Kerne spezialisierte Einheiten, die für Matrixmultiplikation und -akkumulation entwickelt wurden — die mathematische Operation im Herzen jedes neuronalen Netzwerks. Während ein CUDA-Kern eine Zahl nach der anderen verarbeitet, verarbeitet ein Tensor-Kern eine gesamte kleine Matrix (zum Beispiel einen 4x4-Block) in einer einzigen Operation. Die H100 enthält 528 Tensor-Kerne, von denen jeder gemischt-präzise Berechnungen (FP8, FP16, TF32) durchführen kann, die das KI-Training und die Inferenz dramatisch beschleunigen.
Deshalb dominieren GPUs die KI: Neuronale Netzwerke sind im Kern riesige Abfolgen von Matrixmultiplikationen. Jede Schicht eines Transformer-Modells — die Architektur hinter GPT-4, Claude und Gemini — multipliziert Eingabematrizen mit Gewichtsmatrizen. Diese Operation ist embarrassingly parallel, was bedeutet, dass sie mit praktisch keinem Koordinationsaufwand auf Tausende von Prozessoren aufgeteilt werden kann. Die GPU-Architektur passt zu dieser Aufgabe so präzise wie ein Schlüssel zum Schloss.
RT-Kerne
Ray-Tracing-Kerne übernehmen die Physik des Lichts — sie verfolgen die Bahn von Millionen einzelner Strahlen, die in einer virtuellen Szene reflektiert, gebrochen und gestreut werden. Mit der Turing-Architektur 2018 eingeführt, entlasten RT-Kerne die CUDA-Kerne von dieser rechenintensiven Aufgabe und ermöglichen fotorealistisches Echtzeit-Rendering in Spielen und professioneller Visualisierung.
Zusammen bilden CUDA-Kerne, Tensor-Kerne und RT-Kerne ein Dreiergespann, das moderne GPUs vielseitig genug für Gaming, KI und wissenschaftliches Computing innerhalb eines einzigen Chips macht.
Die GPU-Zeitlinie: Von Pixeln zu Petaflops (1999–2026)
Die Transformation der GPU von einem Grafikperipheriegerät zum bedeutendsten Chip der Informatik dauerte nur 27 Jahre.
-
1999 — NVIDIA veröffentlicht die GeForce 256 und prägt den Begriff „GPU”. Es ist der erste Chip, der Transform- und Beleuchtungsberechnungen auf der Grafikkarte übernimmt und damit die CPU entlastet.
-
2006 — NVIDIA lanciert CUDA, ein Programmier-Framework, das Entwicklern ermöglicht, universellen Code für GPUs zu schreiben. Diese einzelne Entscheidung verwandelt die GPU von einem reinen Grafik-Chip in eine parallele Rechenplattform.
-
2012 — Alex Krizhevskys AlexNet gewinnt den ImageNet-Wettbewerb mit historischem Vorsprung und nutzt zwei NVIDIA GTX 580 GPUs, um ein tiefes konvolutionelles neuronales Netzwerk zu trainieren. Die Deep-Learning-Revolution beginnt.
-
2016 — Jensen Huang liefert persönlich das erste DGX-1-System an OpenAI. Das System enthält acht P100 GPUs und 170 Teraflops Rechenleistung — ein frühes Signal für die zentrale Bedeutung der GPU für die KI-Forschung.
-
2017 — Die Volta-Architektur führt Tensor-Kerne ein, zweckgebundenes Silizium für Matrixmathematik. Die Leistung beim KI-Training steigt dramatisch.
-
2020 — Die A100 (Ampere) erscheint mit Tensor-Kernen der 3. Generation und unterstützt die Formate TF32 und FP64, die sowohl KI als auch wissenschaftliches Computing beschleunigen. Sie wird zur Standard-GPU für Rechenzentren weltweit.
-
2022 — Ethereum wechselt zu Proof of Stake und beendet damit effektiv die Ära des GPU-Minings. Millionen von GPUs strömen auf den Sekundärmarkt, während NVIDIA sich entschieden auf KI-Rechenzentrumsumsätze ausrichtet.
-
2024 — Die Blackwell-Architektur kommt mit 208 Milliarden Transistoren, einer Transformer-Engine der 2. Generation und FP4-Präzisionsunterstützung. Die B200 GPU liefert die 4-fache KI-Trainingsleistung der H100.
-
2025 — NVIDIA wird das erste Unternehmen der Geschichte, das eine Marktbewertung von 4 Billionen Dollar erreicht, angetrieben durch den unstillbaren Bedarf an KI-Infrastruktur.
-
2026 — NVIDIA kündigt die Rubin-Architektur an — 336 Milliarden Transistoren, 50 PFLOPS FP4-Inferenz und HBM4-Speicher. Die nächste Ära der GPU-Berechnung beginnt.
GPU vs. CPU: Der wesentliche Unterschied
GPU und CPU sind keine Konkurrenten — sie ergänzen sich. Das Verständnis ihrer Unterschiede hilft Ihnen, das richtige Werkzeug für jede Arbeitslast zu wählen.
| Merkmal | CPU | GPU |
|---|---|---|
| Kernanzahl | 8–128 Hochleistungskerne | 1.000–16.896+ einfache Kerne |
| Taktfrequenz | 3,0–5,8 GHz | 1,5–2,5 GHz |
| Speichertyp | DDR5 System-RAM (~50 GB/s) | HBM3/GDDR6X VRAM (bis zu 3,35 TB/s) |
| Ideal für | Sequenzielle Logik, OS-Aufgaben, Datenbanken, verzweigter Code | Parallele Workloads: KI, Rendering, Simulationen |
| Architektur | Wenige leistungsstarke Kerne, große Caches, Sprungvorhersage | Tausende einfacher Kerne, hohe Speicherbandbreite |
Die entscheidende Erkenntnis: CPUs optimieren für Latenz (eine Aufgabe so schnell wie möglich abschließen), während GPUs für Durchsatz optimieren (so viele Aufgaben wie möglich pro Sekunde abschließen).
Für einen detaillierten Vergleich von GPU- und CPU-Leistung, Benchmarks und Kostenanalyse lesen Sie unseren vollständigen GPU-vs.-CPU-Vergleich.
Typen von GPUs: Consumer, Rechenzentrum und Mobil
Nicht alle GPUs sind gleich. Sie umfassen ein breites Spektrum an Formfaktoren, Leistungsbudgets und Preispunkten.
Integriert vs. Diskret
Integrierte GPUs sind in den CPU-Chip eingebaut und teilen sich den Hauptspeicher des Systems. Intel UHD und AMD Radeon integrierte Grafik fallen in diese Kategorie. Sie verbrauchen minimale Energie und bewältigen alltägliche Aufgaben — Videowiedergabe, leichte Fotobearbeitung, Desktop-Compositing — verfügen aber nicht über die Rohleistung für anspruchsvolle Workloads.
Diskrete GPUs sind eigenständige Chips mit eigenem dedizierten VRAM, eigener Stromversorgung und Kühlung. Sie liefern dramatisch höhere Leistung und sind erforderlich für Gaming auf hohen Einstellungen, professionelle 3D-Arbeit sowie jede KI- oder Rechenaufgabe.
Consumer-GPUs
Die NVIDIA GeForce RTX-Serie (RTX 4060 bis RTX 5090) und AMD Radeon RX-Serie (RX 7600 bis RX 9070 XT) richten sich an Gamer und Content-Ersteller. Die Preise reichen von 250 bis über 2.000 Dollar. Diese GPUs bieten schnelle Taktfrequenzen, GDDR6X-Speicher und optimierte Treiber für Spiele und Kreativsoftware.
Rechenzentrum-GPUs
Die NVIDIA H100, A100, L40S und AMD MI300X sind für künstliche Intelligenz, Hochleistungsrechnen (HPC) und groß angelegte Inferenz konzipiert. Sie verfügen über massiven VRAM (80–192 GB), ultraschnellen HBM-Speicher, NVLink-Verbindungen und fehlerkorrigierenden Speicher. Ein einzelnes H100 SXM-Modul verbraucht bis zu 700 W und kostet 25.000–40.000 Dollar.
Mobile GPUs und NPUs
Smartphones und Laptops verwenden mobile GPUs wie Qualcomm Adreno und die Apple GPU-Kerne in den M-Serien- und A-Serien-Chips. Zunehmend enthalten diese Geräte auch dedizierte NPUs (Neural Processing Units), die für gerätebasierte KI-Aufgaben optimiert sind — Bilderkennung, Sprachverarbeitung und Echtzeit-Übersetzung — bei einem Bruchteil des Stromverbrauchs einer diskreten GPU.
GPU vs. Grafikkarte
Ein häufiger Verwechslungspunkt: Die GPU ist der Siliziumchip selbst. Eine Grafikkarte ist die vollständige Baugruppe — GPU-Chip, VRAM-Module, Kühllösung, Stromversorgungsschaltung und Platine — die in Ihr Motherboard eingesteckt wird. Wenn jemand sagt „Ich habe eine GPU gekauft”, meint er fast immer die vollständige Grafikkarte.
Wofür werden GPUs eingesetzt? 8 Branchen jenseits von Gaming
Gaming hat die GPU-Industrie aufgebaut, aber heute macht es nur einen Bruchteil dessen aus, was GPUs leisten. Hier sind acht Branchen, in denen GPU-Rechenleistung mittlerweile unverzichtbar ist.
1. KI und maschinelles Lernen. GPUs treiben das Training und die Inferenz hinter großen Sprachmodellen wie GPT-4 und Claude, Bildgeneratoren wie Stable Diffusion und den Empfehlungssystemen an, die Netflix und Spotify antreiben. Das Training eines Frontier-LLM erfordert Zehntausende von GPUs, die monatelang laufen. Ohne GPU-Parallelismus würde moderne KI schlicht nicht existieren.
2. Gesundheitswesen. GPU-beschleunigte Analyse von MRT- und CT-Scans reduziert die Diagnosezeit von Stunden auf Minuten. In der pharmazeutischen Forschung verkürzen Molekulardynamik-Simulationen auf GPU-Clustern die Zeitpläne der Wirkstoffforschung. NVIDIAs BioNeMo-Framework wurde bei großen Pharmaunternehmen eingesetzt, um die Vorhersage von Proteinstrukturen und generative Chemie zu beschleunigen.
3. Klimawissenschaft. Der JUPITER-Exascale-Computer, eines der leistungsstärksten Systeme, die je gebaut wurden, führt kilometerauflösende globale Klimasimulationen auf GPU-Clustern durch. Wettervorhersagemodelle erreichen heute eine 10-Tage-Prognosegenauigkeit, die noch vor einem Jahrzehnt einen Monat Rechenzeit benötigt hätte. GPU-beschleunigte Klimamodellierung verändert, wie Regierungen und Institutionen sich auf Umweltveränderungen vorbereiten.
4. Autonome Fahrzeuge. Stellantis, Mercedes-Benz, Volvo und Lucid Motors nutzen die NVIDIA DRIVE-Plattform für Echtzeitwahrnehmung, HD-Kartierung und autonome Entscheidungsfindung. Jedes selbstfahrende Fahrzeug muss Daten von Kameras, LiDAR, Radar und Ultraschallsensoren gleichzeitig verarbeiten — eine Herausforderung der Parallelverarbeitung, wie geschaffen für GPUs.
5. Digitale Zwillinge. Siemens und NVIDIA Omniverse ermöglichen es Unternehmen, KI-gesteuerte virtuelle Repliken physischer Abläufe zu erstellen. PepsiCo optimiert Lieferkettenlogistik, Foxconn simuliert Fabriklayouts und HD Hyundai modelliert Werftabläufe — alles als GPU-betriebene digitale Zwillinge, die Ergebnisse vorhersagen, bevor reale Entscheidungen getroffen werden.
6. Fusionsenergie. Commonwealth Fusion Systems nutzt GPU-beschleunigte digitale Zwillinge, um Plasmeverhalten in Tokamak-Reaktoren zu simulieren. Fusionsreaktoren erzeugen Bedingungen, die heißer sind als der Sonnenkern, was physische Experimente gefährlich und teuer macht. GPU-Simulationen ermöglichen es Ingenieuren, Reaktordesigns in einem Tempo zu iterieren, das sonst unmöglich wäre.
7. Finanzwesen. Große Banken und Hedgefonds betreiben Echtzeit-Betrugserkennung, Monte-Carlo-Risikosimulationen und algorithmische Handelsstrategien auf GPU-Clustern. Eine Monte-Carlo-Simulation, die Millionen von Marktszenarien auswertet, profitiert enorm von GPU-Parallelismus — was eine CPU-Farm Stunden kosten könnte, wird auf einem Multi-GPU-Knoten in Sekunden abgeschlossen.
8. Content-Erstellung. Hollywood-VFX-Studios, Architekturvisualisierungsfirmen und Spieleentwickler verlassen sich auf GPUs für Rendering, Compositing und virtuelle Echtzeit-Produktion. Die Kombination aus Unreal Engine und High-End-GPUs hat virtuelle Produktionsbühnen (die Technologie hinter The Mandalorian) ermöglicht, die traditionelle Greenscreen-Workflows in der gesamten Unterhaltungsindustrie ersetzen.
GPU-Spezifikationen entschlüsselt: Ein Spickzettel für Einsteiger
GPU-Datenblätter können überwältigend sein. Hier erfahren Sie, was jede Zahl tatsächlich bedeutet — und warum sie wichtig ist.
VRAM (Video Random Access Memory) — Der Kurzzeitspeicher der GPU. VRAM bestimmt, wie groß ein KI-Modell sein kann oder wie viele hochauflösende Texturen gleichzeitig auf die Karte passen. Die H100 hat 80 GB HBM3 — genug, um ein Modell mit 70 Milliarden Parametern vollständig im Speicher zu halten. Wenn Ihr Modell nicht in den VRAM passt, bricht die Leistung ein oder das Training scheitert völlig.
Speicherbandbreite — Wie schnell Daten zwischen der GPU und ihrem Speicher fließen. Die H100 erreicht 3,35 TB/s. Stellen Sie sich die VRAM-Kapazität als die Größe eines Lagers vor und die Bandbreite als die Breite der Autobahn, die es mit der Fabrikhalle verbindet. Ein riesiges Lager nützt nichts, wenn die Straße davor einspurig ist. Hohe Bandbreite stellt sicher, dass die GPU-Kerne ständig mit Daten versorgt werden.
Tensor-Kerne — Spezialisierte Matrixrecheneinheiten, die für die Operationen gebaut wurden, die neuronale Netzwerke antreiben. Sie führen gemischt-präzise Berechnungen (FP8, FP16, TF32) weitaus schneller durch als universelle CUDA-Kerne. Wenn ein KI-Benchmark die „AI TOPS” (Billionen Operationen pro Sekunde) einer GPU angibt, misst er den Tensor-Core-Durchsatz.
Interconnect (NVLink und InfiniBand) — Das Kommunikationsnetzwerk, das es mehreren GPUs ermöglicht, Daten während des verteilten Trainings zu teilen. Das Training eines großen Sprachmodells erfordert 256 bis über 32.000 GPUs, die im Gleichklang arbeiten. NVLink 4.0 auf der H100 liefert 900 GB/s bidirektionale Bandbreite zwischen GPU-Paaren, während InfiniBand-Netzwerke Knoten über einen Cluster verbinden. Ohne schnelle Interconnects würde Multi-GPU-Training an der Kommunikation scheitern, nicht an der Berechnung.
Rechenzentrum-GPU-Vergleich (2026)
| Spezifikation | H100 80GB SXM | A100 80GB | L40S 48GB | L4 24GB |
|---|---|---|---|---|
| VRAM | 80 GB | 80 GB | 48 GB | 24 GB |
| Speichertyp | HBM3 | HBM2e | GDDR6 | GDDR6 |
| Bandbreite | 3,35 TB/s | 2,0 TB/s | 864 GB/s | 300 GB/s |
| Tensor-Kerne | 528 (4. Gen.) | 432 (3. Gen.) | 568 (4. Gen.) | 240 (4. Gen.) |
| Interconnect | NVLink 4.0 | NVLink 3.0 | PCIe Gen4 | PCIe Gen4 |
| Ideal für | LLM-Training, HPC | KI-Training, Inferenz | Inferenz, Rendering | Leichtgewichtige Inferenz |
| Cloud-Preisspanne | 1,49–6,98 $/Std. | 0,80–3,50 $/Std. | 0,80–2,50 $/Std. | 0,30–1,00 $/Std. |
Die GPU-Landschaft: NVIDIA, AMD und Intel im Jahr 2026
Drei Unternehmen bestimmen den GPU-Markt im Jahr 2026, doch die Wettbewerbsdynamik ist alles andere als ausgeglichen.
NVIDIA: Die dominante Kraft
NVIDIA beherrscht 92 % des diskreten GPU-Marktes und einen noch größeren Anteil bei KI-Rechenzentrum-GPUs. Die Roadmap des Unternehmens — Blackwell (2024) → Rubin (2026) → Feynman (2027+) — gibt das Tempo für die gesamte Branche vor. Allein im 3. Quartal des Geschäftsjahres 2026 erwirtschaftete NVIDIAs Rechenzentrumssegment 30,77 Milliarden Dollar Umsatz. Im Jahr 2025 wurde NVIDIA zum ersten Unternehmen der Geschichte, das eine Marktbewertung von über 4 Billionen Dollar überschritt. Sein CUDA-Software-Ökosystem, mittlerweile fast 20 Jahre alt, schafft einen tiefen Burggraben: Millionen von Entwicklern, Tausende optimierter Bibliotheken und eine komplette KI-Toolchain, die auf NVIDIAs Plattform aufgebaut ist.
AMD: Der aufstrebende Herausforderer
AMDs MI300X hat sich als glaubwürdige Alternative für KI-Inferenz-Workloads etabliert, insbesondere bei kostenbewussten Cloud-Anbietern. Die kommende MI350X verspricht die 4-fache Leistung gegenüber der MI300X, während die MI400 für eine Veröffentlichung 2026 anvisiert wird. AMDs ROCm-Software-Stack hat sich erheblich verbessert, liegt aber bei der Bibliotheksbreite und Community-Akzeptanz noch hinter CUDA zurück. Für Kunden, die wettbewerbsfähige Preise und Multi-Vendor-Flexibilität suchen, ist AMD eine zunehmend tragfähige Option.
Intel: Im Rennen angekommen
Intels Gaudi 3 KI-Beschleuniger gewinnt bei bestimmten Inferenz-Workloads an Bedeutung, und die Falcon Shores-Plattform zielt darauf ab, GPU- und KI-Rechenfähigkeiten in einer einzigen Architektur zu vereinen. Intels Marktanteil bleibt im Vergleich zu NVIDIA und AMD gering, aber die aggressive Preisstrategie und Integration mit den eigenen Foundry-Diensten positionieren das Unternehmen als potenziellen Disruptor in kostensensiblen Segmenten.
Eine beeindruckende Statistik: Mehr als 75 % der Fortune-500-Unternehmen nutzen mittlerweile in irgendeiner Form NVIDIA-GPU-Infrastruktur — ein Zeugnis dafür, wie tief GPUs in die Unternehmens-IT eingedrungen sind.
GPU, TPU oder NPU: Welchen KI-Chip brauchen Sie?
Die GPU ist nicht der einzige KI-Beschleuniger. Googles TPU und die wachsende Kategorie der NPUs haben jeweils eigene Stärken.
GPU (Graphics Processing Unit) — Der universelle Parallelprozessor. GPUs zeichnen sich durch KI-Training, gemischte Workloads und jede Aufgabe aus, die Flexibilität erfordert. Die CUDA- und ROCm-Ökosysteme unterstützen PyTorch, TensorFlow, JAX und praktisch jedes KI-Framework. GPUs sind die Standardwahl für die meisten KI-Teams aufgrund ihrer Vielseitigkeit und der Reife ihres Software-Stacks.
TPU (Tensor Processing Unit) — Googles maßgeschneiderter Chip, der um systolische Arrays herum aufgebaut ist, die für Matrixoperationen optimiert sind. TPUs eignen sich hervorragend für Large-Batch-Inferenz und TensorFlow-native Workloads, insbesondere auf Google Cloud. Allerdings sind sie exklusiv auf die Google Cloud Platform beschränkt, was die Flexibilität für Teams einschränkt, die Multi-Cloud- oder On-Premises-Bereitstellung benötigen.
NPU (Neural Processing Unit) — Zweckgebundenes Silizium für gerätebasierte KI-Inferenz. NPUs sind 40–60-mal energieeffizienter als GPUs für Edge-Aufgaben wie Spracherkennung, Bildklassifizierung und Echtzeit-Übersetzung. Sie finden sie in Smartphones (Apple Neural Engine, Qualcomm Hexagon), Laptops (Intel AI Boost, AMD XDNA) und IoT-Geräten. Sie sind nicht für Training ausgelegt — sondern für schnelle, stromsparende Inferenz am Edge.
Entscheidungsrahmen
| Anwendungsfall | Bester Chip |
|---|---|
| Training großer KI-Modelle | GPU |
| Google Cloud Inferenz im großen Maßstab | TPU |
| Gerätebasierte, stromsparende KI | NPU |
| Gemischte Workloads, maximale Flexibilität | GPU |
Für die meisten Teams bleibt die GPU die sicherste und vielseitigste Wahl. TPUs sind im Google-Cloud-Ökosystem sinnvoll, und NPUs sind essenziell für Edge-Bereitstellung, wo Energieeffizienz im Vordergrund steht.
Zugang zu einer GPU: Kaufen, Mieten oder Cloud
Der Zugang zu GPU-Rechenleistung im Jahr 2026 fällt im Allgemeinen in drei Wege, jeder mit eigenen Vor- und Nachteilen.
Hardware kaufen
Eine einzelne NVIDIA H100 kostet im Handel 25.000–40.000 Dollar — und das nur, wenn Sie eine finden, angesichts der anhaltenden Lieferengpässe. Der Aufbau eines Multi-GPU-Servers verursacht zusätzliche Kosten für CPU, Arbeitsspeicher, Netzwerk, Stromversorgung, Kühlung und Rackplatz. Ein Kauf ist wirtschaftlich nur sinnvoll, wenn Sie planen, GPUs bei hoher Auslastung (über 60 %) rund um die Uhr über Jahre zu betreiben. Für Forschungslabore und große Unternehmen mit vorhersehbaren, anhaltenden Workloads kann Eigentum die niedrigsten Gesamtkosten bieten.
Große Cloud-Anbieter
AWS (p5-Instanzen), Google Cloud (A3-Instanzen) und Microsoft Azure (ND H100-Serie) bieten alle GPU-Instanzen mit Enterprise-Grade-Zuverlässigkeit, globaler Verfügbarkeit und integriertem Speicher und Netzwerk. Der Nachteil ist die Komplexität: Cloud-GPU-Preise variieren je nach Region, Bindungsniveau und Instanztyp. Reservierte Instanzen erfordern 1–3-jährige Verpflichtungen, während On-Demand-Preise zwei- bis dreimal höher sein können als Spot-Preise.
GPU-Marktplätze
Eine wachsende Kategorie von Plattformen aggregiert GPU-Kapazität aus verteilten Rechenzentren und bietet flexiblere Zugangsmodelle. GPUnex zum Beispiel bündelt Kapazität aus über 150 Rechenzentren und bietet sekundengenaue Abrechnung mit vorinstallierten KI-Frameworks (PyTorch, TensorFlow, JAX) — was den Setup-Aufwand eliminiert, der Forschungsteams oft ausbremst. Diese Marktplätze eignen sich besonders gut für Startups, akademische Forscher und Teams mit variablen Workloads, die keine reservierten Cloud-Verpflichtungen rechtfertigen.
Die Schlüsselfrage
Wenn Ihre durchschnittliche GPU-Auslastung unter 60 % liegt, ist Mieten fast immer kosteneffektiver als Besitzen. Erfassen Sie Ihre tatsächliche Nutzung, bevor Sie Kapital in Hardware investieren.
Die Zukunft der GPUs
Die Entwicklung der GPU zeigt keine Anzeichen einer Verlangsamung. Wenn überhaupt, beschleunigt sich das Tempo der Fortschritte.
Rubin-Architektur (2026) stellt einen Generationssprung dar: 336 Milliarden Transistoren, 50 PFLOPS FP4-Inferenz und die branchenweit erste HBM4-Speicherintegration. Das entspricht einer ca. 5-fachen Verbesserung gegenüber Blackwell beim KI-Inferenzdurchsatz — ein Fortschrittstempo, das das Mooresche Gesetz weit übertrifft.
Die Energieherausforderung wird dringend. Ein einzelner GPU-Server verbraucht 3.000–5.000 Watt, verglichen mit 300–500 Watt für einen CPU-Server. Der globale Stromverbrauch von Rechenzentren soll bis 2026 96 GW erreichen (Deloitte), und GPUs sind ein Haupttreiber. Flüssigkühlung, effizientere Chipdesigns und atombetriebene Rechenzentren werden alle aktiv entwickelt, um diesem Problem zu begegnen.
Lieferkettenengpässe prägen weiterhin den Markt. High-Bandwidth Memory (HBM) ist bis 2026 ausverkauft, wobei SK Hynix, Samsung und Micron alle mit maximaler Kapazität produzieren. TSMCs CoWoS Advanced Packaging — die Technologie, die GPU-Dies mit HBM-Stacks verbindet — bleibt der primäre Produktionsengpass.
Neuromorphes Computing stellt eine längerfristige Verschiebung dar. Chips wie Intels Loihi und BrainChips Akida ahmen die Struktur biologischer Neuronen nach und sind 1.000-mal energieeffizienter als GPUs für bestimmte Mustererkennungsaufgaben. Allerdings fehlen ihnen die Programmier-Frameworks und Software-Ökosysteme, die für eine breite Einführung nötig sind, und sie sind noch Jahre davon entfernt, GPUs in produktiven KI-Workloads herauszufordern.
Der Marktausblick ist atemberaubend. Von 101,5 Milliarden Dollar im Jahr 2025 auf prognostizierte 1,7 Billionen Dollar bis 2035 (Precedence Research) wächst der GPU-Markt mit einer jährlichen Rate von 32,6 %. GPUs sind nicht mehr nur eine Komponentenkategorie — sie werden zur prägenden Infrastruktur der KI-Ära, so grundlegend für die Wirtschaft der 2020er Jahre wie der Mikroprozessor für die 1990er Jahre war.
Häufig gestellte Fragen
Was macht eine GPU eigentlich?
Eine GPU führt Tausende mathematischer Berechnungen gleichzeitig durch. Ursprünglich für das Rendering von Grafiken entwickelt — die Berechnung von Farbe, Helligkeit und Position von Millionen von Pixeln pro Frame — treiben GPUs heute KI-Modelltraining, wissenschaftliche Simulationen, Videoverarbeitung und jeden Workload an, der von massiver Parallelität profitiert. Die Schlüsselfähigkeit ist der Durchsatz: Eine GPU tauscht Einzelaufgaben-Geschwindigkeit gegen die Fähigkeit, enorme Mengen einfacher Operationen gleichzeitig zu verarbeiten.
Brauche ich eine GPU für KI?
Für das Training von Modellen mit mehr als ein paar hundert Millionen Parametern, ja. Eine Aufgabe, die ein GPU-Cluster in Stunden erledigt, könnte eine CPU Wochen oder Monate kosten. Für Inferenz auf kleineren Modellen (unter 1,5 Milliarden Parametern) können moderne CPUs manchmal mit der GPU-Leistung mithalten, besonders mit optimierten Laufzeitumgebungen wie ONNX. Aber für ernsthafte KI-Entwicklung — Fine-Tuning großer Sprachmodelle, Training von Diffusionsmodellen, Durchführung von Reinforcement-Learning-Experimenten — reduziert eine GPU die Iterationszeit dramatisch und ist praktisch unverzichtbar.
Was ist der Unterschied zwischen VRAM und RAM?
RAM (Arbeitsspeicher) dient der CPU und dem Betriebssystem. Er hält laufende Anwendungen, Datei-Caches und OS-Prozesse. VRAM (Videospeicher) ist der GPU gewidmet und hält Texturen, Framebuffer, Modellgewichte und Zwischenergebnisse von Berechnungen. VRAM ist typischerweise viel schneller — HBM3 erreicht 3,35 TB/s verglichen mit DDR5 bei etwa 50 GB/s — aber geringer in der Gesamtkapazität. Für KI-Workloads ist VRAM der kritische Engpass: Die Gewichte, Aktivierungen und Optimizer-Zustände Ihres Modells müssen alle in den VRAM passen, damit effizientes Training möglich ist.
Warum sind GPUs so teuer?
Drei zusammenwirkende Faktoren treiben die GPU-Preise. Erstens die Fertigungskomplexität: TSMCs modernste Fertigungsknoten kosten über 20 Milliarden Dollar pro Fabrik, und jeder Wafer liefert nur eine begrenzte Anzahl großer, komplexer GPU-Dies. Zweitens der knappe High-Bandwidth Memory: HBM3- und HBM4-Vorräte sind bis 2026 ausverkauft, wobei die Nachfrage von KI-Unternehmen die Produktionskapazität bei Weitem übersteigt. Drittens die beispiellose Nachfrage: KI-Unternehmen geben zusammen über 600 Milliarden Dollar für Infrastruktur im Jahr 2026 aus, was einen Verkäufermarkt schafft, auf dem NVIDIA Premiumpreise für Rechenzentrums-GPUs verlangen kann.
Kann ich eine GPU ohne CPU verwenden?
Nein. Eine GPU ist ein Beschleuniger, kein eigenständiger Prozessor. Sie braucht eine CPU (den „Host”), um Aufgaben zu koordinieren, das Betriebssystem zu verwalten, Datei-I/O zu handhaben und sequenzielle Logik auszuführen. Die CPU sendet Arbeit an die GPU, die sie parallel verarbeitet und die Ergebnisse zurückgibt. Sie funktionieren als Team — die CPU orchestriert, während die GPU berechnet. Selbst in einem massiven GPU-Cluster mit 32.000 GPUs enthält jeder Knoten CPUs, die Scheduling, Netzwerk und Datenbewegung verwalten.
Was kostet es, eine GPU zu mieten?
Die Preise für Cloud-GPUs variieren stark je nach GPU-Modell, Anbieter, Region und Bindungsniveau. Eine NVIDIA H100 reicht von 1,49 bis 6,98 Dollar pro Stunde, abhängig vom Anbieter und ob Sie Spot-, On-Demand- oder reservierte Preise nutzen. Eine A100 ist auf GPU-Marktplätzen für unter 1 $/Stunde zu finden. Für leichtere Inferenz-Workloads beginnt eine NVIDIA L4 bei etwa 0,30 $/Stunde. Sekundengenaue Abrechnungsoptionen auf einigen Plattformen können die Kosten für stoßartige, kurzlaufende Jobs weiter senken.