त्वरित उत्तर: आपको कौन सा GPU चुनना चाहिए?
“AI के लिए सबसे अच्छा GPU” जैसा कोई एक नहीं है। सही विकल्प तीन कारकों पर निर्भर करता है: आप क्या कर रहे हैं (ट्रेनिंग, फाइन-ट्यूनिंग, या इंफरेंस), आपका मॉडल कितना बड़ा है (1B पैरामीटर या 70B+), और आप कितना खर्च करना चाहते हैं (प्रति घंटा और कुल)।
अगर आप एक-लाइन जवाब चाहते हैं: बड़े पैमाने की ट्रेनिंग के लिए, H100 या B200। लागत-प्रभावी फाइन-ट्यूनिंग के लिए, RTX 4090 या A100। प्रोडक्शन इंफरेंस के लिए, L40S या L4। लेकिन असली कहानी आंकड़ों में है — विशेष रूप से, वह मेट्रिक जो अधिकांश GPU गाइड अनदेखा करते हैं: कॉस्ट पर TFLOP।
यह गाइड उस मेट्रिक पर केंद्रित है। हमारे पूर्ण GPU गाइड में उपलब्ध कच्चे स्पेक टेबल दोहराने के बजाय, हम विश्लेषण करते हैं कि कौन सा GPU आपके विशिष्ट वर्कलोड के लिए प्रति डॉलर सबसे अधिक AI प्रदर्शन देता है।
कॉस्ट-पर-TFLOP: वह मेट्रिक जो वास्तव में मायने रखती है
कच्चे TFLOPS (प्रति सेकंड ट्रिलियन फ्लोटिंग-पॉइंट ऑपरेशन) आपको बताते हैं कि GPU कितनी तेजी से कंप्यूट करता है। लेकिन तेज़ का संदर्भ के बिना कोई मतलब नहीं। H200 ~1,000 FP16 TFLOPS देता है, लेकिन इसकी लागत $3.80/hr है। RTX 4090 ~330 FP16 TFLOPS $0.60/hr पर देता है। वास्तव में कौन सा बेहतर सौदा है?
कॉस्ट-पर-TFLOP इसका जवाब देती है: प्रति घंटा क्लाउड किराया मूल्य को FP16 TFLOPS रेटिंग से विभाजित करें। कम बेहतर है।
परिणाम प्रतिकूल-सहज हैं। RTX 4090 — एक उपभोक्ता गेमिंग कार्ड — पूरी लाइनअप में सबसे अच्छी कॉस्ट-पर-TFLOP देता है। B200 — NVIDIA का नवीनतम डेटा सेंटर फ्लैगशिप — दूसरे स्थान पर आता है। लोकप्रिय H100 बीच में बैठता है, और L40S प्रति TFLOP सबसे कम कुशल है।
लेकिन कॉस्ट-पर-TFLOP पूरी कहानी नहीं है। RTX 4090 में केवल 24 GB GDDR6X VRAM है, जो इसे उस मेमोरी में फिट होने वाले मॉडलों तक सीमित करता है। B200 में 192 GB HBM3e है, जो 8x बड़े मॉडल रख सकता है। कच्ची दक्षता को क्षमता के साथ संतुलित करना होगा।
| GPU | VRAM | FP16 TFLOPS | क्लाउड $/hr | कॉस्ट/TFLOP/hr | खरीद मूल्य | TDP |
|---|---|---|---|---|---|---|
| B200 | 192 GB HBM3e | ~2,500 | ~$4.70 | $0.0019 | $45–50K | 1,000W |
| H200 | 141 GB HBM3e | ~1,000 | ~$3.80 | $0.0038 | $30–40K | 700W |
| H100 | 80 GB HBM3 | ~1,000 | ~$3.15 | $0.0032 | ~$25K | 700W |
| A100 80GB | 80 GB HBM2e | ~312 | ~$0.72 | $0.0023 | ~$15K (इस्तेमाल किया) | 300W |
| L40S | 48 GB GDDR6X | ~366 | ~$1.50 | $0.0041 | ~$8K | 350W |
| RTX 4090 | 24 GB GDDR6X | ~330 | ~$0.60 | $0.0018 | ~$1,600 | 450W |
मुख्य अंतर्दृष्टि: प्रति घंटा सबसे महंगा GPU हमेशा प्रति कार्य इकाई सबसे महंगा नहीं होता। कॉस्ट-पर-TFLOP दिखाती है कि RTX 4090 और B200 दक्षता के अग्रणी हैं — क्षमता स्पेक्ट्रम के विपरीत छोरों पर।
वर्कलोड सिफारिशें: GPU को कार्य से मिलाना
सही GPU सबसे तेज़ या सबसे सस्ता नहीं है — यह वह है जो आपके वर्कलोड से मेल खाता है। यहाँ एक व्यावहारिक निर्णय ढाँचा है।
छोटे से मध्यम मॉडलों की फाइन-ट्यूनिंग (7B–13B पैरामीटर)
सबसे अच्छा विकल्प: RTX 4090 ($0.60/hr) या A100 40GB
LoRA या QLoRA के साथ 7B पैरामीटर मॉडल को फाइन-ट्यून करने के लिए लगभग 14–20 GB VRAM की आवश्यकता होती है — RTX 4090 के 24 GB के भीतर आरामदायक। GPU मार्केटप्लेस पर $0.60/hr पर, 10-घंटे का फाइन-ट्यूनिंग रन केवल $6 लागत देता है। H100 पर $3.15/hr पर वही काम $31.50 लागत देता है — ऐसे वर्कलोड के लिए 5x से अधिक जिसे H100 की अतिरिक्त VRAM या बैंडविड्थ की आवश्यकता नहीं।
13B मॉडलों की पूर्ण फाइन-ट्यूनिंग (LoRA के बिना) के लिए, ~$0.72/hr पर A100 40GB H100 प्राइसिंग के एक अंश पर पर्याप्त VRAM प्रदान करता है।
बड़े मॉडलों की प्री-ट्रेनिंग (70B+ पैरामीटर)
सबसे अच्छा विकल्प: मल्टी-GPU क्लस्टर में H100 या B200
70B+ पैरामीटर मॉडल की प्री-ट्रेनिंग के लिए केवल मॉडल के लिए 140+ GB VRAM की आवश्यकता होती है, साथ ही एक्टिवेशन, ग्रेडिएंट, और ऑप्टिमाइज़र स्टेट्स। B200 (192 GB) को छोड़कर कोई एकल GPU इसे मेमोरी में नहीं रख सकता। व्यवहार में, ये वर्कलोड 8–128+ GPU पर मॉडल पैरेललिज़्म और डेटा पैरेललिज़्म का उपयोग करते हुए मल्टी-GPU क्लस्टर पर चलते हैं।
H100 का NVLink 4.0 इंटरकनेक्ट (900 GB/s बाइडायरेक्शनल) कुशल मल्टी-GPU संचार को सक्षम करता है — डिस्ट्रिब्यूटेड ट्रेनिंग के लिए महत्वपूर्ण जहाँ GPU को हर फॉरवर्ड/बैकवर्ड पास पर ग्रेडिएंट साझा करने होते हैं। B200 उच्च बैंडविड्थ और बड़ी मेमोरी के साथ इसे आगे ले जाता है, लेकिन उपलब्धता 2027 तक सीमित रहती है।
स्केल पर, कुल लागत चौंकाने वाली है। GPT-4 ट्रेनिंग ने कथित तौर पर 10,000+ A100 GPU का महीनों तक उपयोग किया। मार्केटप्लेस प्राइसिंग पर भी, 1,000-GPU H100 क्लस्टर 30 दिन चलाने की लागत लगभग $2.3 मिलियन है।
प्रोडक्शन इंफरेंस (बैच प्रोसेसिंग)
सबसे अच्छा विकल्प: लागत दक्षता के लिए L40S ($1.50/hr)
बैच इंफरेंस — एक साथ कई अनुरोधों को प्रोसेस करना — L40S के 48 GB GDDR6X VRAM और मजबूत FP16 प्रदर्शन से लाभ उठाता है। हालाँकि इसकी कॉस्ट-पर-TFLOP RTX 4090 से अधिक है, इसकी दोगुनी VRAM क्षमता इसे बड़े मॉडल और बड़े बैच साइज़ सर्व करने देती है, प्रति डॉलर थ्रूपुट में सुधार करती है।
इंफरेंस वर्कलोड जहाँ मॉडल 24 GB में फिट होता है (क्वांटाइज़ेशन के बाद अधिकांश 7B मॉडल), RTX 4090 सबसे लागत-प्रभावी विकल्प बना रहता है।
प्रोडक्शन इंफरेंस (कम लेटेंसी)
सबसे अच्छा विकल्प: गति के लिए H200, एज के लिए L4
जब सिंगल-रिक्वेस्ट लेटेंसी थ्रूपुट से ज़्यादा मायने रखती है (चैटबॉट, रियल-टाइम API), H200 की 4,800 GB/s मेमोरी बैंडविड्थ सबसे तेज़ टोकन जनरेशन देती है। L4 ($0.30–$1.00/hr) एज पर लाइटवेट इंफरेंस के लिए बजट विकल्प के रूप में काम करता है — लागत के एक अंश पर 24 GB VRAM।
पावर खपत और परिचालन लागत
GPU चयन केवल कंप्यूट और क्लाउड प्राइसिंग के बारे में नहीं है। अगर आप हार्डवेयर के मालिक हैं (या विचार कर रहे हैं), बिजली की लागत समय के साथ काफी बढ़ जाती है।
| GPU | TDP (वॉट) | वार्षिक बिजली लागत* | प्रभावी $/hr (3 साल में स्वामित्व) |
|---|---|---|---|
| B200 | 1,000W | ~$526/वर्ष | ~$1.80 |
| H100 / H200 | 700W | ~$368/वर्ष | ~$1.05 |
| RTX 4090 | 450W | ~$237/वर्ष | ~$0.25 |
| L40S | 350W | ~$184/वर्ष | ~$0.40 |
| A100 | 300W | ~$158/वर्ष | ~$0.55 |
60% औसत उपयोग और $0.10/kWh बिजली दर मानते हुए।
B200 का 1,000W TDP इसे लाइनअप में सबसे अधिक बिजली खपत वाला GPU बनाता है — मध्यम उपयोग पर केवल बिजली में प्रति वर्ष $500 से अधिक खपत करता है। उच्च बिजली लागत वाले क्षेत्रों ($0.25/kWh से ऊपर, यूरोप के अधिकांश भागों में सामान्य) में हार्डवेयर मालिकों के लिए, यह GPU स्वामित्व बनाम क्लाउड किराये की अर्थव्यवस्था को काफी प्रभावित करता है।
ब्रेक-ईवन विश्लेषण: खरीदना बनाम किराये पर लेना
GPU खरीदने या किराये पर लेने का निर्णय उपयोग और समय सीमा पर निर्भर करता है। H100 के लिए गणित — सबसे सामान्य निर्णय बिंदु:
- H100 खरीद मूल्य: ~$25,000
- मार्केटप्लेस किराया दर: ~$3.15/hr
- ब्रेक-ईवन घंटे: 25,000 ÷ 3.15 = ~7,937 घंटे
- 24/7 संचालन पर: ~11 महीने ब्रेक-ईवन
- 60% उपयोग पर: ~18 महीने ब्रेक-ईवन
बिजली ($0.07/hr), कूलिंग ओवरहेड ($0.02/hr), और रखरखाव जोड़ें, और 3 साल में प्रभावी स्वामित्व लागत लगभग $1.05/hr है — मार्केटप्लेस प्राइसिंग के साथ प्रतिस्पर्धी लेकिन केवल निरंतर उच्च उपयोग पर।
महत्वपूर्ण चर उपयोग है। अगर आपके GPU 50% समय बेकार बैठते हैं, तो आप प्रभावी दर का दोगुना भुगतान कर रहे हैं। क्लाउड किराया बेकार लागत को पूरी तरह समाप्त करता है — आप केवल तभी भुगतान करते हैं जब कंप्यूट चल रहा हो।
कूलिंग, सुविधाओं, स्टाफिंग, और मूल्यह्रास सहित पूर्ण किराया-बनाम-खरीद ढाँचे के लिए, हमारी विस्तृत लागत तुलना देखें।
2026 आउटलुक: Blackwell, Rubin, और आगे क्या है
GPU परिदृश्य तेजी से बदल रहा है। यहाँ बताया गया है कि आपके AI इंफ्रास्ट्रक्चर की योजना बनाने के लिए क्या मायने रखता है:
NVIDIA B200 (Blackwell आर्किटेक्चर) — सीमित मात्रा में शिपिंग शुरू, B200 192 GB HBM3e और 1,000W TDP के साथ H100 की तुलना में लगभग 4x ट्रेनिंग प्रदर्शन देता है। नए बड़े पैमाने के ट्रेनिंग क्लस्टर के लिए सबसे अच्छा विकल्प लेकिन 2027 तक आपूर्ति-सीमित रहता है। हाइपरस्केलर और विशेष प्रदाताओं में क्लाउड उपलब्धता का विस्तार हो रहा है।
NVIDIA Rubin आर्किटेक्चर — 2026 के अंत में घोषित, Rubin में 336 बिलियन ट्रांजिस्टर हैं और 50 PFLOPS FP4 इंफरेंस को लक्षित करता है। अगर समय पर डिलीवर होता है, तो यह इंफरेंस थ्रूपुट के लिए Blackwell पर लगभग 5x की छलांग है। यह कॉस्ट-पर-TFLOP समीकरण को नाटकीय रूप से बदल देगा — लेकिन प्रोक्योरमेंट लीड टाइम का मतलब है कि अधिकांश टीमें 2027 तक Rubin हार्डवेयर तक नहीं पहुँचेंगी।
AMD MI350X और MI355X — Blackwell के लिए AMD का जवाब। MI355X ने Llama 3.1 405B पर B200 से 30% तेज़ इंफरेंस दिखाया है, प्रतिस्पर्धी मूल्य निर्धारण के साथ। AMD का बढ़ता ROCm इकोसिस्टम इंफरेंस वर्कलोड के लिए CUDA निर्भरता कम कर रहा है। विस्तृत तुलना के लिए, हमारा NVIDIA बनाम AMD विश्लेषण देखें।
व्यावहारिक निहितार्थ: आज हार्डवेयर न खरीदें और उम्मीद करें कि यह 3+ साल तक शीर्ष-स्तरीय रहेगा। GPU पीढ़ियाँ हर 18–24 महीने बदलती हैं, और प्रत्येक पीढ़ी अपने पूर्ववर्ती से 2–4x प्रदर्शन देती है। अधिकांश टीमों के लिए, किराये पर लेना आपको मूल्यह्रास जोखिम के बिना नवीनतम हार्डवेयर तक पहुँच देता है।
कैसे चुनें: निर्णय चेकलिस्ट
GPU चुनने से पहले, इन पाँच सवालों का जवाब दें:
-
आपका वर्कलोड क्या है? ट्रेनिंग, फाइन-ट्यूनिंग, या इंफरेंस? प्रत्येक की अलग कंप्यूट, मेमोरी, और बैंडविड्थ आवश्यकताएँ हैं।
-
आपका मॉडल कितना बड़ा है? 13B पैरामीटर से कम के मॉडल 24 GB GPU पर चल सकते हैं। 70B से अधिक के मॉडल के लिए प्रति GPU 80+ GB के साथ मल्टी-GPU सेटअप आवश्यक है।
-
प्रति घंटा आपका बजट क्या है? $1/hr से कम हो तो, आपके विकल्प RTX 4090, स्पॉट पर A100, या L4 हैं। $3+/hr हो तो, आप H100 या B200 एक्सेस कर सकते हैं।
-
प्रति माह कितने घंटे उपयोग करेंगे? 100 घंटे से कम → हमेशा किराये पर लें। 100–500 घंटे → मार्केटप्लेस से किराये पर लें। 500 घंटे से अधिक उच्च उपयोग पर → स्वामित्व पर विचार करें।
-
यह हार्डवेयर कितने समय के लिए चाहिए? 18 महीने से कम → किराये पर लें (मूल्यह्रास से बचाता है)। 18+ महीने उच्च उपयोग पर → खरीदना ब्रेक-ईवन हो सकता है। GPU आर्किटेक्चर की गहन तुलना के लिए, सहित CPU और GPU एक-दूसरे को कैसे पूरक करते हैं, हमारा GPU बनाम CPU गाइड देखें।
मुख्य अंतर्दृष्टि: “सबसे अच्छा” GPU वह सबसे सस्ता है जो आपका विशिष्ट वर्कलोड चला सके। 7B मॉडल फाइन-ट्यून करता RTX 4090 वही काम करते H100 से बेहतर निवेश है — आपको 1/5 लागत पर वही परिणाम मिलता है।
अक्सर पूछे जाने वाले प्रश्न
बड़े भाषा मॉडल ट्रेन करने के लिए सबसे अच्छा GPU कौन सा है?
70B पैरामीटर से अधिक के मॉडलों के लिए, NVIDIA H100 मानक बना हुआ है — यह 80 GB HBM3, मल्टी-GPU स्केलिंग के लिए NVLink 4.0, और सबसे परिपक्व सॉफ्टवेयर इकोसिस्टम प्रदान करता है। B200 192 GB HBM3e और लगभग 4x ट्रेनिंग प्रदर्शन के साथ अगला कदम है, लेकिन उपलब्धता सीमित है। छोटे मॉडल (7B–13B) के लिए, RTX 4090 या A100 लागत के एक अंश पर उत्कृष्ट प्रदर्शन प्रदान करते हैं। NVIDIA के Ampere-जनरेशन विकल्पों की विस्तृत तुलना के लिए, हमारा A100 बनाम A6000 बनाम A2000 विश्लेषण देखें।
क्या RTX 4090 AI के लिए अच्छा है?
हाँ — यह छोटे से मध्यम मॉडलों की AI फाइन-ट्यूनिंग और इंफरेंस के लिए सबसे लागत-प्रभावी GPU में से एक है। इसका 24 GB VRAM क्वांटाइज़ेशन के साथ ~13B पैरामीटर तक के मॉडल संभालता है, और इसकी कॉस्ट-पर-TFLOP उद्योग में सबसे अच्छी है। सीमा VRAM है: 24 GB से अधिक के मॉडलों के लिए, आपको अधिक मेमोरी वाले डेटा सेंटर GPU की आवश्यकता है। इसमें NVLink भी नहीं है, जो मल्टी-GPU स्केलिंग को डेटा सेंटर कार्ड्स की तुलना में कम कुशल बनाता है।
AI के लिए GPU खरीदना या किराये पर लेना चाहिए?
किराये पर लें अगर उपयोग 60% से कम है या समय सीमा 18 महीने से कम। GPU बाज़ार तेजी से चलता है — हर 2 साल में नया आर्किटेक्चर यानी खरीदा हार्डवेयर तेजी से मूल्यह्रास होता है। GPU मार्केटप्लेस से किराये पर लेना आपको बिना पूँजी निवेश के $0.60–$3.15/hr पर नवीनतम हार्डवेयर तक पहुँच देता है। तभी खरीदें जब आपके पास 2+ साल के लिए 500+ घंटे/माह चलने वाले स्थिर, पूर्वानुमेय वर्कलोड हों।
कॉस्ट-पर-TFLOP क्या है और यह क्यों मायने रखती है?
कॉस्ट-पर-TFLOP GPU के प्रति घंटा किराया मूल्य को TFLOPS में उसके फ्लोटिंग-पॉइंट प्रदर्शन से विभाजित करती है। यह GPU मॉडलों में प्रदर्शन को सामान्यीकृत करती है, यह दिखाती है कि कौन सा कार्ड आपको प्रति डॉलर सबसे अधिक AI कंप्यूट देता है। कम प्रति घंटा दर लेकिन कम प्रदर्शन वाला GPU वास्तव में प्रति कार्य इकाई अधिक महंगे, उच्च-प्रदर्शन GPU से अधिक लागत दे सकता है। GPU कंप्यूटिंग में “पैसे की सबसे अच्छी कीमत” का यह सबसे करीबी एकल मेट्रिक है।
AI के लिए मुझे कितना VRAM चाहिए?
अंगूठे का नियम: N बिलियन पैरामीटर वाले मॉडल को FP16 में इंफरेंस के लिए लगभग 2×N GB VRAM और ट्रेनिंग के लिए 4×N GB (ग्रेडिएंट और ऑप्टिमाइज़र स्टेट्स के कारण) चाहिए। 7B मॉडल को इंफरेंस के लिए ~14 GB, पूर्ण फाइन-ट्यूनिंग के लिए ~28 GB चाहिए। क्वांटाइज़ेशन (INT8, INT4) VRAM आवश्यकताओं को 2–4x कम कर सकता है। ~13B क्वांटाइज़्ड तक के मॉडलों के लिए RTX 4090 (24 GB), ~40B तक के मॉडलों के लिए A100/L40S (48–80 GB), और 70B+ मॉडलों के लिए H100/H200/B200 (80–192 GB) उपयोग करें।