GPU — यह क्या है, संरचना और कार्य सिद्धांत

लेखक: IT Sectr प्रकाशित: 2026-06-10 पढ़ने का समय: 9 मिनट

GPU (Graphics Processing Unit) एक विशेष प्रोसेसर है जो ग्राफिक्स डेटा के समानांतर प्रसंस्करण के लिए डिज़ाइन किया गया है, जो प्रति फ्रेम पिक्सल और वर्टिसेज पर लाखों गणनाएँ करता है। CPU के विपरीत, जो कम विलंबता वाले अनुक्रमिक कार्यों के लिए अनुकूलित है, GPU में बड़े पैमाने पर गणितीय संक्रियाओं के लिए हजारों कम-शक्ति वाले कोर होते हैं। NVIDIA Developer Blog (2025) के अनुसार, आधुनिक मोबाइल GPU में 1024 कोर तक होते हैं और कंप्यूट वर्कलोड में 2 TFLOPS तक की प्रदर्शन क्षमता रखते हैं। डेवलपर्स रेंडरिंग, पोस्ट-प्रोसेसिंग और डिवाइस पर मशीन लर्निंग के लिए GPU को एकीकृत करते हैं।

मुख्य बिंदु

  • GPU एक विशेष प्रोसेसर है जिसमें ग्राफिक्स और गणनाओं के समानांतर प्रसंस्करण के लिए हजारों कोर होते हैं।
  • GPU संरचना SIMD पाइपलाइन पर आधारित है: एक निर्देश कई डेटा तत्वों पर एक साथ निष्पादित होता है।
  • मोबाइल उपकरणों में GPU SoC में एकीकृत होता है और Unified Memory आर्किटेक्चर के माध्यम से CPU के साथ मेमोरी साझा करता है।
  • GPU Computing (GPGPU) ग्राफिक्स प्रोसेसर का उपयोग गैर-ग्राफिक्स कार्यों: ML, क्रिप्टोग्राफी, सिग्नल प्रोसेसिंग के लिए करता है।
  • GPU तक पहुँच के लिए API मोबाइल प्लेटफ़ॉर्म पर: Vulkan, Metal, OpenGL ES और ब्राउज़रों के लिए WebGL।

GPU क्या है?

GPU (Graphics Processing Unit) एक विशेष माइक्रोचिप है जो बड़े पैमाने पर समानांतरता के लिए डिज़ाइन की गई है। पहली GPU 1990 के दशक के अंत में डेस्कटॉप PC के लिए 3D ग्राफिक्स त्वरक के रूप में दिखाई दीं। तब से, संरचना फिक्स्ड पाइपलाइन से प्रोग्रामेबल शेडर्स और सार्वभौमिक कंप्यूट इकाइयों तक विकसित हुई है।

GPU का मुख्य उद्देश्य रैस्टराइज़ेशन है: ज्यामितीय डेटा (वर्टिसेज, त्रिकोण) को स्क्रीन पर पिक्सल में परिवर्तित करना। प्रक्रिया में वर्टेक्स ट्रांसफ़ॉर्मेशन, अदृश्य सतहों को हटाना, टेक्सचरिंग और रंग मिश्रण शामिल है। ये सभी संक्रियाएँ हजारों तत्वों के लिए एक साथ समानांतर रूप से निष्पादित होती हैं।

Jon Peddie Research (2025) के अनुसार, मोबाइल GPU बाजार कुल ग्राफिक्स प्रोसेसर मात्रा का 58% है, जो PC और सर्वर के लिए डिस्क्रीट समाधानों से आगे है। प्रत्येक स्मार्टफोन में CPU, DSP और न्यूरल प्रोसेसर के साथ System-on-Chip (SoC) में कम से कम एक GPU एकीकृत होता है।

आधुनिक GPU दो प्रकारों में विभाजित हैं: एकीकृत (SoC में निर्मित, CPU के साथ मेमोरी साझा करते हैं) और डिस्क्रीट (अपनी स्वयं की वीडियो मेमोरी वाला अलग बोर्ड)। मोबाइल डेवलपमेंट में विशेष रूप से एकीकृत GPU का उपयोग होता है — Qualcomm Adreno, ARM Mali, Apple GPU और Imagination PowerVR।

GPU विकास का इतिहास

GPU का विकास तीन चरणों से गुज़रा: फिक्स्ड पाइपलाइन (1999–2006), यूनिफ़ाइड शेडर्स (2006–2016) और प्रोग्रामेबल कंप्यूट कोर (2016 — वर्तमान)। पहले चरण ने संक्रियाओं का एक कठोर क्रम निर्धारित किया — ट्रांसफ़ॉर्मेशन, लाइटिंग, टेक्सचरिंग। डेवलपर पाइपलाइन में हस्तक्षेप नहीं कर सकता था।

यूनिफ़ाइड शेडर्स के आगमन के साथ, GPU को मनमाना प्रोग्राम निष्पादित करने की क्षमता मिली — HLSL या GLSL में लिखे शेडर्स। इसने GPGPU — गैर-ग्राफिक्स कार्यों के लिए GPU के उपयोग का मार्ग खोल दिया। तीसरे चरण में मशीन लर्निंग और रीयल-टाइम रे ट्रेसिंग के लिए टेंसर कोर जोड़े गए।

मोबाइल GPU में मुख्य मील का पत्थर Tile-Based Deferred Rendering (TBDR) का आगमन था — एक संरचना जहाँ फ्रेम को टाइल्स (16x16 पिक्सल) में विभाजित किया जाता है और तेज़ ऑन-चिप मेमोरी में संसाधित किया जाता है। यह डेस्कटॉप GPU की इमीडिएट मोड रेंडरिंग की तुलना में बिजली की खपत को 3–5 गुना कम करता है।

GPU संरचना

GPU संरचना CPU से मौलिक रूप से भिन्न होती है। कुछ शक्तिशाली कोर और बड़े कैश के बजाय, GPU में SIMD (Single Instruction, Multiple Data) के लिए अनुकूलित सैकड़ों या हजारों सरल कंप्यूट इकाइयाँ होती हैं — एक निर्देश कई डेटा तत्वों पर निष्पादित होता है।

GPU का मूलभूत बिल्डिंग ब्लॉक Shader Core (NVIDIA की शब्दावली में) या Execution Unit (Intel) है। ऐसे कई ब्लॉक Compute Units (AMD) या Streaming Multiprocessors (NVIDIA) में संयुक्त होते हैं। प्रत्येक ब्लॉक में अंकगणित के लिए ALU, एक रजिस्टर फ़ाइल और वार्प शेड्यूलर (थ्रेड समूह) शामिल होते हैं।

मोबाइल GPU संरचनात्मक रूप से डेस्कटॉप GPU से भिन्न होते हैं। Qualcomm Adreno प्रोग्रामेबल शेडर प्रोसेसर और एक समर्पित रैस्टराइज़ेशन ब्लॉक वाली संरचना का उपयोग करता है। ARM Mali Bifrost या Valhall — क्वार्टेट वार्प प्रोसेसिंग वाली संरचनाओं पर आधारित है। Apple GPU का 2017 से अपना स्वयं का डिज़ाइन है जिसमें Metal और यूनिफ़ाइड मेमोरी का समर्थन है।

निर्माताGPU श्रृंखलासंरचनाAPI
QualcommAdreno 6xx/7xx/8xxप्रोग्रामेबल शेडर प्रोसेसरVulkan, OpenGL ES
ARMMali-G श्रृंखलाBifrost / ValhallVulkan, OpenGL ES
AppleApple GPU (A13–A18)कस्टम डिज़ाइनMetal
ImaginationPowerVR IMGFurian / B-SeriesVulkan, OpenGL ES

मोबाइल GPU की मुख्य विशेषता Unified Memory Architecture (UMA) है। GPU और CPU बिना समर्पित वीडियो मेमोरी के एक ही RAM साझा करते हैं। यह डेटा आदान-प्रदान में विलंबता को कम करता है और प्रोग्रामिंग को सरल बनाता है, लेकिन गहन गणनाओं के तहत बैंडविड्थ को सीमित करता है।

GPU बनाम CPU: मुख्य अंतर

CPU न्यूनतम विलंबता वाले अनुक्रमिक कार्यों के लिए डिज़ाइन किया गया है। इसमें बड़े L1/L2/L3 कैश, ब्रांच प्रेडिक्टर्स और स्पेक्युलेटिव एक्ज़ीक्यूशन के साथ 4–12 शक्तिशाली कोर होते हैं। GPU, इसके विपरीत, विलंबता को त्यागकर थ्रूपुट प्राप्त करता है — हजारों कोर उच्च विलंबता के साथ लेकिन विशाल समग्र प्रदर्शन के साथ डेटा संसाधित करते हैं।

अंतर FLOPS (फ़्लोटिंग-पॉइंट ऑपरेशन प्रति सेकंड) में स्पष्ट है। 2025 का एक शीर्ष मोबाइल SoC: CPU — 200 GFLOPS, GPU — 2400 GFLOPS। GPU समानांतरता की अनुमति देने वाले कार्यों पर CPU से 12 गुना बेहतर प्रदर्शन करता है। हालांकि, अनुक्रमिक एल्गोरिदम के लिए, CPU कम थ्रेड प्रबंधन ओवरहेड के कारण तेज़ रहता है।

व्यवहार में, डेवलपर CPU का उपयोग एप्लिकेशन तर्क, UI और IO के लिए करते हैं, और GPU का उपयोग रेंडरिंग, इमेज प्रोसेसिंग, भौतिकी सिमुलेशन और न्यूरल नेटवर्क इन्फ़रेंस के लिए करते हैं। Google Android Performance Patterns (2025) के अनुसार, मोबाइल एप्लिकेशन में इष्टतम GPU लोड 60–80% है — अधिभार थ्रॉटलिंग और ओवरहीटिंग की ओर ले जाता है।

cpp
// CPU — sequential processing
for (int i = 0; i < N; i++) {
    result[i] = data[i] * 2.0f;
}

// GPU — parallel processing (GLSL compute shader)
#version 300 es
layout(local_size_x = 256) in;
void main() {
    uint idx = gl_GlobalInvocationID.x;
    result[idx] = data[idx] * 2.0f;
}

CPU कोड प्रत्येक तत्व के लिए अनुक्रमिक रूप से गुणा करता है। GPU संस्करण 256 थ्रेड समानांतर रूप से लॉन्च करता है, प्रत्येक अपने तत्व को गुणा करता है। N=1 मिलियन के साथ, GPU कार्य को एकल CPU कोर की तुलना में 100–1000 गुना तेज़ी से पूरा करेगा।

मोबाइल उपकरणों में GPU

मोबाइल GPU सख्त तापीय और शक्ति सीमाओं के तहत काम करते हैं। एक सामान्य मोबाइल GPU का TDP 2–8 W है, जबकि डेस्कटॉप समकक्षों का 150–450 W है। इसके लिए पीक प्रदर्शन के बजाय ऊर्जा दक्षता पर केंद्रित एक विशेष संरचना की आवश्यकता होती है।

मुख्य ऊर्जा-बचत तकनीक Tile-Based Rendering है। फ्रेम को 16x16 या 32x32 पिक्सल टाइल्स में विभाजित किया जाता है। प्रत्येक टाइल तेज़ SRAM (Tile Memory) में पूरी तरह संसाधित होती है, फिर बाहरी DRAM में लिखी जाती है। यह इमीडिएट मोड की तुलना में मेमोरी एक्सेस को 4–10 गुना कम करता है।

Qualcomm Adreno सबसे व्यापक मोबाइल GPU है। Adreno 750 (Snapdragon 8 Gen 3) में साझा रजिस्टर पूल के साथ 12 शेडर प्रोसेसर हैं। यह Vulkan 1.3, OpenGL ES 3.2, OpenCL 3.0 और हार्डवेयर रे ट्रेसिंग का समर्थन करता है। Qualcomm (2025) के अनुसार, Adreno बिजली खपत बनाए रखते हुए पीढ़ी-दर-पीढ़ी 45% प्रदर्शन सुधार प्रदान करता है।

ARM Mali Android उपकरणों में दूसरा सबसे लोकप्रिय GPU है। Mali-G720 वेरिएबल रेट शेडिंग और ASTC HDR समर्थन के साथ 5वीं पीढ़ी की Valhall संरचना पर आधारित है। Mali की एक विशिष्ट विशेषता क्वार्टेट प्रोसेसिंग है: बेहतर ALU उपयोग के लिए चार थ्रेड एक वार्प में संयुक्त होते हैं।

Apple GPU विशेष रूप से Metal API के लिए डिज़ाइन किया गया है। A13 Bionic से, Apple Metal 3, रे ट्रेसिंग और मेश शेडर्स के समर्थन के साथ अपना स्वयं का GPU डिज़ाइन उपयोग करता है। Apple GPU संरचना में M4 Ultra पर 800 GB/s तक की बैंडविड्थ के साथ Unified Memory है।

बिजली खपत और थ्रॉटलिंग

GPU थ्रॉटलिंग — ओवरहीटिंग पर आवृत्ति में कमी — मोबाइल गेमिंग की मुख्य समस्या है। निरंतर लोड के तहत, SoC का तापमान 85–95°C तक पहुँच जाता है, और GPU आवृत्ति 30–50% कम कर देता है। AnandTech (2025) के अनुसार, Qualcomm Adreno 750 Genshin Impact में 15 मिनट के बाद 35% तक प्रदर्शन खो देता है।

डेवलपर ड्रॉ कॉल ऑप्टिमाइज़ेशन, रेंडरिंग रिज़ॉल्यूशन कम करके और Foveated Rendering का उपयोग करके थ्रॉटलिंग को कम कर सकता है। iOS पर Metal Performance Shaders और Android पर Android Frame Pacing API डिवाइस के थर्मल बजट के साथ लोड को सिंक्रोनाइज़ करने में मदद करते हैं।

GPGPU: GPU पर कंप्यूटिंग

GPGPU (General-Purpose computing on GPU) गैर-ग्राफिक्स गणनाओं के लिए ग्राफिक्स प्रोसेसर का उपयोग है। यह विचार 2000 के दशक के मध्य में उत्पन्न हुआ, जब डेवलपर्स ने महसूस किया कि शेडर्स को मैट्रिक्स संक्रियाओं, क्रिप्टोग्राफी और भौतिकी सिमुलेशन के लिए अनुकूलित किया जा सकता है।

आज, GPGPU बड़े पैमाने पर समानांतरता की आवश्यकता वाले कार्यों के लिए एक मानक उपकरण है: मशीन लर्निंग (न्यूरल नेटवर्क का प्रशिक्षण और इन्फ़रेंस), क्रिप्टोग्राफी (हैशिंग, एन्क्रिप्शन), इमेज और वीडियो प्रोसेसिंग (फ़िल्टर, कोडेक), और वैज्ञानिक सिमुलेशन (द्रव गतिकी, क्वांटम रसायन)।

मोबाइल उपकरणों पर, GPGPU Compute Shaders के माध्यम से एक्सेस किया जाता है — बिना ग्राफिकल आउटपुट वाले शेडर्स जो केवल डेटा के साथ काम करते हैं। Compute Shader कार्य समूहों का एक ग्रिड लॉन्च करता है, प्रत्येक समूह में कई थ्रेड होते हैं। स्क्रीन से बंधन के बिना बफ़र्स और टेक्सचर्स के माध्यम से मेमोरी एक्सेस होता है।

glsl
#version 310 es
layout(local_size_x = 16, local_size_y = 16) in;
layout(binding = 0) buffer Input  { float data[]; };
layout(binding = 1) buffer Output { float result[]; };

void main() {
    uvec2 idx = gl_GlobalInvocationID.xy;
    uint offset = idx.y * gl_NumWorkGroups.x * gl_WorkGroupSize.x + idx.x;
    result[offset] = sqrt(data[offset]) + 1.0;
}

उदाहरण compute shader प्रत्येक ऐरे तत्व के लिए वर्गमूल की गणना करता है। 16x16 का कार्य समूह एक साथ 256 तत्वों को संसाधित करता है। आधुनिक मोबाइल GPU 1024 कार्य समूहों और लाखों वैश्विक थ्रेड तक का समर्थन करते हैं।

GPU के साथ काम करने के लिए API

GPU एक्सेस API यह निर्धारित करते हैं कि डेवलपर ग्राफिक्स प्रोसेसर को कमांड और डेटा कैसे भेजता है। मोबाइल प्लेटफ़ॉर्म पर तीन मुख्य API का उपयोग होता है: Vulkan, Metal और OpenGL ES। प्रत्येक के अपने लाभ और सीमाएँ हैं जो प्रदर्शन और संगतता को प्रभावित करते हैं।

Vulkan

Vulkan Khronos Group का एक निम्न-स्तरीय क्रॉस-प्लेटफ़ॉर्म API है, जो OpenGL का उत्तराधिकारी है। Vulkan डेवलपर्स को GPU मेमोरी, कमांड कतारों और सिंक्रोनाइज़ेशन पर सीधा नियंत्रण देता है। Khronos (2025) के अनुसार, Vulkan ड्राइवर ओवरहेड को कम करके OpenGL ES की तुलना में 30–60% प्रदर्शन सुधार प्रदान करता है।

Android पर, Vulkan Android 7.0 (API 24) से अनिवार्य है, और सभी आधुनिक SoC Vulkan 1.3 का समर्थन करते हैं। Vulkan Memory Allocator और एक मध्यवर्ती प्रतिनिधित्व के रूप में SPIR-V GLSL, HLSL या Rust GPU में शेडर्स लिखने की अनुमति देते हैं।

Metal

Metal पारिस्थितिकी तंत्र के सभी उपकरणों: iPhone, iPad, Mac, Apple TV के लिए Apple का मालिकाना GPU API है। Metal न्यूनतम ओवरहेड और पूर्वानुमान योग्य कमांड निष्पादन समय प्रदान करता है। Apple Developer Documentation (2025) के अनुसार, Metal FPS ड्रॉप के बिना प्रति फ्रेम 100,000 ड्रॉ कॉल तक संभालता है।

एक मुख्य विशेषता C++ पर आधारित Metal Shading Language (MSL) है। शेडर्स एप्लिकेशन के साथ मशीन कोड में संकलित होते हैं, जो Vulkan के विशिष्ट JIT संकलन को समाप्त करता है। Metal Mesh Shaders, Ray Tracing और रनटाइम पर शेडर्स लोड करने के लिए Dynamic Libraries का समर्थन करता है।

OpenGL ES

OpenGL ES एम्बेडेड सिस्टम के लिए OpenGL का एक सरलीकृत संस्करण है। इसका उपयोग पुराने उपकरणों पर और पिछड़ी संगतता के लिए किया जाता है। Android Studio (2025) के अनुसार, 94% Android उपकरणों पर OpenGL ES 3.2 समर्थित है। नई परियोजनाओं के लिए, Google OpenGL ES के बजाय Vulkan की अनुशंसा करता है।

WebGL, OpenGL ES का ब्राउज़र-आधारित एनालॉग है, जो वेब पर 3D ग्राफिक्स की नींव है। WebGL 2.0 (OpenGL ES 3.0 के अनुरूप) 92% मोबाइल ब्राउज़रों पर समर्थित है। WebGPU अगली पीढ़ी है, जिसकी संरचना Vulkan और Metal के करीब है।

अक्सर पूछे जाने वाले प्रश्न

मोबाइल GPU डेस्कटॉप GPU से कैसे अलग है?

मोबाइल GPU 2–8 W की तापीय सीमा में काम करता है, ऊर्जा बचत के लिए Tile-Based Rendering का उपयोग करता है और UMA के माध्यम से CPU के साथ मेमोरी साझा करता है। डेस्कटॉप GPU 150–450 W की खपत करता है, उसकी समर्पित वीडियो मेमोरी (GDDR) होती है और वह Immediate Mode Rendering का उपयोग करता है।

2026 में सबसे शक्तिशाली मोबाइल GPU कौन सा है?

Apple GPU M4 Ultra और A18 Pro चिप्स में प्रति वॉट प्रदर्शन में मोबाइल GPU के बीच अग्रणी है। Android उपकरणों में, Snapdragon 8 Gen 4 में Qualcomm Adreno 850 और MediaTek Dimensity 9500 में ARM Mali-G925 अग्रणी हैं।

क्या GPU का उपयोग मोबाइल उपकरणों पर मशीन लर्निंग के लिए किया जा सकता है?

हाँ, GPU का सक्रिय रूप से iOS पर Core ML और Android पर TensorFlow Lite / NNAPI के माध्यम से न्यूरल नेटवर्क इन्फ़रेंस के लिए उपयोग होता है। Google (2025) के अनुसार, GPU त्वरण CPU की तुलना में 3–10 गुना गति सुधार प्रदान करता है।

मोबाइल गेम्स में GPU गर्म क्यों होता है और थ्रॉटल क्यों करता है?

थ्रॉटलिंग थर्मल बजट से अधिक होने के कारण होती है। निरंतर लोड के तहत, SoC का तापमान 85–95°C तक पहुँच जाता है, और GPU चिप की सुरक्षा के लिए आवृत्ति कम कर देता है। समाधान रेंडरिंग ऑप्टिमाइज़ेशन और FPS कैप (30–45 FPS) का उपयोग है।

Android पर GPU ग्राफिक्स के लिए कौन सा API चुनना चाहिए?

Vulkan नई परियोजनाओं के लिए मुख्य विकल्प है। OpenGL ES पुराने उपकरणों के साथ पिछड़ी संगतता के लिए है। Metal iOS के लिए अनिवार्य है। क्रॉस-प्लेटफ़ॉर्म डेवलपमेंट के लिए Unity, Unreal Engine या Filament जैसे फ्रेमवर्क का उपयोग करें।

सारांश

  • GPU समानांतर डेटा प्रसंस्करण और ग्राफिक्स त्वरण के लिए हजारों कोर वाला एक विशेष प्रोसेसर है।
  • GPU संरचना मोबाइल SoC के लिए SIMD पाइपलाइन, Tile-Based Rendering और Unified Memory का उपयोग करती है।
  • GPU बनाम CPU: GPU बड़े पैमाने पर समानांतर कार्यों में FLOPS में CPU से 10–12 गुना बेहतर है, लेकिन अनुक्रमिक एल्गोरिदम में पीछे है।
  • Qualcomm, ARM, Apple और Imagination के मोबाइल GPU सख्त 2–8 W सीमा में काम करते हैं और थ्रॉटलिंग के लिए प्रवण हैं।
  • GPGPU Compute Shaders के माध्यम से ML, क्रिप्टोग्राफी, इमेज प्रोसेसिंग और वैज्ञानिक सिमुलेशन के लिए उपयोग होता है।
  • Vulkan और Metal आधुनिक मोबाइल एप्लिकेशन के लिए मुख्य API हैं, जो GPU पर निम्न-स्तरीय नियंत्रण प्रदान करते हैं।
  • GPU ऑप्टिमाइज़ेशन में गर्मी उत्पादन को कम करने के लिए ड्रॉ कॉल प्रबंधन, FPS कैप और Foveated Rendering शामिल है।

हम एक मोबाइल एप्लिकेशन टर्नकी विकसित करेंगे

IT Sectr 2017 से स्टार्टअप और व्यवसायों के लिए iOS और Android एप्लिकेशन बनाता है। हम आपको सलाह देंगे और सर्वोत्तम समाधान प्रस्तावित करेंगे।

परियोजना पर चर्चा करें

यह भी पढ़ें