GPU (Graphics Processing Unit) एक विशेष प्रोसेसर है जो ग्राफिक्स डेटा के समानांतर प्रसंस्करण के लिए डिज़ाइन किया गया है, जो प्रति फ्रेम पिक्सल और वर्टिसेज पर लाखों गणनाएँ करता है। CPU के विपरीत, जो कम विलंबता वाले अनुक्रमिक कार्यों के लिए अनुकूलित है, GPU में बड़े पैमाने पर गणितीय संक्रियाओं के लिए हजारों कम-शक्ति वाले कोर होते हैं। NVIDIA Developer Blog (2025) के अनुसार, आधुनिक मोबाइल GPU में 1024 कोर तक होते हैं और कंप्यूट वर्कलोड में 2 TFLOPS तक की प्रदर्शन क्षमता रखते हैं। डेवलपर्स रेंडरिंग, पोस्ट-प्रोसेसिंग और डिवाइस पर मशीन लर्निंग के लिए GPU को एकीकृत करते हैं।
मुख्य बिंदु
GPU (Graphics Processing Unit) एक विशेष माइक्रोचिप है जो बड़े पैमाने पर समानांतरता के लिए डिज़ाइन की गई है। पहली GPU 1990 के दशक के अंत में डेस्कटॉप PC के लिए 3D ग्राफिक्स त्वरक के रूप में दिखाई दीं। तब से, संरचना फिक्स्ड पाइपलाइन से प्रोग्रामेबल शेडर्स और सार्वभौमिक कंप्यूट इकाइयों तक विकसित हुई है।
GPU का मुख्य उद्देश्य रैस्टराइज़ेशन है: ज्यामितीय डेटा (वर्टिसेज, त्रिकोण) को स्क्रीन पर पिक्सल में परिवर्तित करना। प्रक्रिया में वर्टेक्स ट्रांसफ़ॉर्मेशन, अदृश्य सतहों को हटाना, टेक्सचरिंग और रंग मिश्रण शामिल है। ये सभी संक्रियाएँ हजारों तत्वों के लिए एक साथ समानांतर रूप से निष्पादित होती हैं।
Jon Peddie Research (2025) के अनुसार, मोबाइल GPU बाजार कुल ग्राफिक्स प्रोसेसर मात्रा का 58% है, जो PC और सर्वर के लिए डिस्क्रीट समाधानों से आगे है। प्रत्येक स्मार्टफोन में CPU, DSP और न्यूरल प्रोसेसर के साथ System-on-Chip (SoC) में कम से कम एक GPU एकीकृत होता है।
आधुनिक GPU दो प्रकारों में विभाजित हैं: एकीकृत (SoC में निर्मित, CPU के साथ मेमोरी साझा करते हैं) और डिस्क्रीट (अपनी स्वयं की वीडियो मेमोरी वाला अलग बोर्ड)। मोबाइल डेवलपमेंट में विशेष रूप से एकीकृत GPU का उपयोग होता है — Qualcomm Adreno, ARM Mali, Apple GPU और Imagination PowerVR।
GPU का विकास तीन चरणों से गुज़रा: फिक्स्ड पाइपलाइन (1999–2006), यूनिफ़ाइड शेडर्स (2006–2016) और प्रोग्रामेबल कंप्यूट कोर (2016 — वर्तमान)। पहले चरण ने संक्रियाओं का एक कठोर क्रम निर्धारित किया — ट्रांसफ़ॉर्मेशन, लाइटिंग, टेक्सचरिंग। डेवलपर पाइपलाइन में हस्तक्षेप नहीं कर सकता था।
यूनिफ़ाइड शेडर्स के आगमन के साथ, GPU को मनमाना प्रोग्राम निष्पादित करने की क्षमता मिली — HLSL या GLSL में लिखे शेडर्स। इसने GPGPU — गैर-ग्राफिक्स कार्यों के लिए GPU के उपयोग का मार्ग खोल दिया। तीसरे चरण में मशीन लर्निंग और रीयल-टाइम रे ट्रेसिंग के लिए टेंसर कोर जोड़े गए।
मोबाइल GPU में मुख्य मील का पत्थर Tile-Based Deferred Rendering (TBDR) का आगमन था — एक संरचना जहाँ फ्रेम को टाइल्स (16x16 पिक्सल) में विभाजित किया जाता है और तेज़ ऑन-चिप मेमोरी में संसाधित किया जाता है। यह डेस्कटॉप GPU की इमीडिएट मोड रेंडरिंग की तुलना में बिजली की खपत को 3–5 गुना कम करता है।
GPU संरचना CPU से मौलिक रूप से भिन्न होती है। कुछ शक्तिशाली कोर और बड़े कैश के बजाय, GPU में SIMD (Single Instruction, Multiple Data) के लिए अनुकूलित सैकड़ों या हजारों सरल कंप्यूट इकाइयाँ होती हैं — एक निर्देश कई डेटा तत्वों पर निष्पादित होता है।
GPU का मूलभूत बिल्डिंग ब्लॉक Shader Core (NVIDIA की शब्दावली में) या Execution Unit (Intel) है। ऐसे कई ब्लॉक Compute Units (AMD) या Streaming Multiprocessors (NVIDIA) में संयुक्त होते हैं। प्रत्येक ब्लॉक में अंकगणित के लिए ALU, एक रजिस्टर फ़ाइल और वार्प शेड्यूलर (थ्रेड समूह) शामिल होते हैं।
मोबाइल GPU संरचनात्मक रूप से डेस्कटॉप GPU से भिन्न होते हैं। Qualcomm Adreno प्रोग्रामेबल शेडर प्रोसेसर और एक समर्पित रैस्टराइज़ेशन ब्लॉक वाली संरचना का उपयोग करता है। ARM Mali Bifrost या Valhall — क्वार्टेट वार्प प्रोसेसिंग वाली संरचनाओं पर आधारित है। Apple GPU का 2017 से अपना स्वयं का डिज़ाइन है जिसमें Metal और यूनिफ़ाइड मेमोरी का समर्थन है।
| निर्माता | GPU श्रृंखला | संरचना | API |
|---|---|---|---|
| Qualcomm | Adreno 6xx/7xx/8xx | प्रोग्रामेबल शेडर प्रोसेसर | Vulkan, OpenGL ES |
| ARM | Mali-G श्रृंखला | Bifrost / Valhall | Vulkan, OpenGL ES |
| Apple | Apple GPU (A13–A18) | कस्टम डिज़ाइन | Metal |
| Imagination | PowerVR IMG | Furian / B-Series | Vulkan, OpenGL ES |
मोबाइल GPU की मुख्य विशेषता Unified Memory Architecture (UMA) है। GPU और CPU बिना समर्पित वीडियो मेमोरी के एक ही RAM साझा करते हैं। यह डेटा आदान-प्रदान में विलंबता को कम करता है और प्रोग्रामिंग को सरल बनाता है, लेकिन गहन गणनाओं के तहत बैंडविड्थ को सीमित करता है।
CPU न्यूनतम विलंबता वाले अनुक्रमिक कार्यों के लिए डिज़ाइन किया गया है। इसमें बड़े L1/L2/L3 कैश, ब्रांच प्रेडिक्टर्स और स्पेक्युलेटिव एक्ज़ीक्यूशन के साथ 4–12 शक्तिशाली कोर होते हैं। GPU, इसके विपरीत, विलंबता को त्यागकर थ्रूपुट प्राप्त करता है — हजारों कोर उच्च विलंबता के साथ लेकिन विशाल समग्र प्रदर्शन के साथ डेटा संसाधित करते हैं।
अंतर FLOPS (फ़्लोटिंग-पॉइंट ऑपरेशन प्रति सेकंड) में स्पष्ट है। 2025 का एक शीर्ष मोबाइल SoC: CPU — 200 GFLOPS, GPU — 2400 GFLOPS। GPU समानांतरता की अनुमति देने वाले कार्यों पर CPU से 12 गुना बेहतर प्रदर्शन करता है। हालांकि, अनुक्रमिक एल्गोरिदम के लिए, CPU कम थ्रेड प्रबंधन ओवरहेड के कारण तेज़ रहता है।
व्यवहार में, डेवलपर CPU का उपयोग एप्लिकेशन तर्क, UI और IO के लिए करते हैं, और GPU का उपयोग रेंडरिंग, इमेज प्रोसेसिंग, भौतिकी सिमुलेशन और न्यूरल नेटवर्क इन्फ़रेंस के लिए करते हैं। Google Android Performance Patterns (2025) के अनुसार, मोबाइल एप्लिकेशन में इष्टतम GPU लोड 60–80% है — अधिभार थ्रॉटलिंग और ओवरहीटिंग की ओर ले जाता है।
// CPU — sequential processing
for (int i = 0; i < N; i++) {
result[i] = data[i] * 2.0f;
}
// GPU — parallel processing (GLSL compute shader)
#version 300 es
layout(local_size_x = 256) in;
void main() {
uint idx = gl_GlobalInvocationID.x;
result[idx] = data[idx] * 2.0f;
}
CPU कोड प्रत्येक तत्व के लिए अनुक्रमिक रूप से गुणा करता है। GPU संस्करण 256 थ्रेड समानांतर रूप से लॉन्च करता है, प्रत्येक अपने तत्व को गुणा करता है। N=1 मिलियन के साथ, GPU कार्य को एकल CPU कोर की तुलना में 100–1000 गुना तेज़ी से पूरा करेगा।
मोबाइल GPU सख्त तापीय और शक्ति सीमाओं के तहत काम करते हैं। एक सामान्य मोबाइल GPU का TDP 2–8 W है, जबकि डेस्कटॉप समकक्षों का 150–450 W है। इसके लिए पीक प्रदर्शन के बजाय ऊर्जा दक्षता पर केंद्रित एक विशेष संरचना की आवश्यकता होती है।
मुख्य ऊर्जा-बचत तकनीक Tile-Based Rendering है। फ्रेम को 16x16 या 32x32 पिक्सल टाइल्स में विभाजित किया जाता है। प्रत्येक टाइल तेज़ SRAM (Tile Memory) में पूरी तरह संसाधित होती है, फिर बाहरी DRAM में लिखी जाती है। यह इमीडिएट मोड की तुलना में मेमोरी एक्सेस को 4–10 गुना कम करता है।
Qualcomm Adreno सबसे व्यापक मोबाइल GPU है। Adreno 750 (Snapdragon 8 Gen 3) में साझा रजिस्टर पूल के साथ 12 शेडर प्रोसेसर हैं। यह Vulkan 1.3, OpenGL ES 3.2, OpenCL 3.0 और हार्डवेयर रे ट्रेसिंग का समर्थन करता है। Qualcomm (2025) के अनुसार, Adreno बिजली खपत बनाए रखते हुए पीढ़ी-दर-पीढ़ी 45% प्रदर्शन सुधार प्रदान करता है।
ARM Mali Android उपकरणों में दूसरा सबसे लोकप्रिय GPU है। Mali-G720 वेरिएबल रेट शेडिंग और ASTC HDR समर्थन के साथ 5वीं पीढ़ी की Valhall संरचना पर आधारित है। Mali की एक विशिष्ट विशेषता क्वार्टेट प्रोसेसिंग है: बेहतर ALU उपयोग के लिए चार थ्रेड एक वार्प में संयुक्त होते हैं।
Apple GPU विशेष रूप से Metal API के लिए डिज़ाइन किया गया है। A13 Bionic से, Apple Metal 3, रे ट्रेसिंग और मेश शेडर्स के समर्थन के साथ अपना स्वयं का GPU डिज़ाइन उपयोग करता है। Apple GPU संरचना में M4 Ultra पर 800 GB/s तक की बैंडविड्थ के साथ Unified Memory है।
GPU थ्रॉटलिंग — ओवरहीटिंग पर आवृत्ति में कमी — मोबाइल गेमिंग की मुख्य समस्या है। निरंतर लोड के तहत, SoC का तापमान 85–95°C तक पहुँच जाता है, और GPU आवृत्ति 30–50% कम कर देता है। AnandTech (2025) के अनुसार, Qualcomm Adreno 750 Genshin Impact में 15 मिनट के बाद 35% तक प्रदर्शन खो देता है।
डेवलपर ड्रॉ कॉल ऑप्टिमाइज़ेशन, रेंडरिंग रिज़ॉल्यूशन कम करके और Foveated Rendering का उपयोग करके थ्रॉटलिंग को कम कर सकता है। iOS पर Metal Performance Shaders और Android पर Android Frame Pacing API डिवाइस के थर्मल बजट के साथ लोड को सिंक्रोनाइज़ करने में मदद करते हैं।
GPGPU (General-Purpose computing on GPU) गैर-ग्राफिक्स गणनाओं के लिए ग्राफिक्स प्रोसेसर का उपयोग है। यह विचार 2000 के दशक के मध्य में उत्पन्न हुआ, जब डेवलपर्स ने महसूस किया कि शेडर्स को मैट्रिक्स संक्रियाओं, क्रिप्टोग्राफी और भौतिकी सिमुलेशन के लिए अनुकूलित किया जा सकता है।
आज, GPGPU बड़े पैमाने पर समानांतरता की आवश्यकता वाले कार्यों के लिए एक मानक उपकरण है: मशीन लर्निंग (न्यूरल नेटवर्क का प्रशिक्षण और इन्फ़रेंस), क्रिप्टोग्राफी (हैशिंग, एन्क्रिप्शन), इमेज और वीडियो प्रोसेसिंग (फ़िल्टर, कोडेक), और वैज्ञानिक सिमुलेशन (द्रव गतिकी, क्वांटम रसायन)।
मोबाइल उपकरणों पर, GPGPU Compute Shaders के माध्यम से एक्सेस किया जाता है — बिना ग्राफिकल आउटपुट वाले शेडर्स जो केवल डेटा के साथ काम करते हैं। Compute Shader कार्य समूहों का एक ग्रिड लॉन्च करता है, प्रत्येक समूह में कई थ्रेड होते हैं। स्क्रीन से बंधन के बिना बफ़र्स और टेक्सचर्स के माध्यम से मेमोरी एक्सेस होता है।
#version 310 es
layout(local_size_x = 16, local_size_y = 16) in;
layout(binding = 0) buffer Input { float data[]; };
layout(binding = 1) buffer Output { float result[]; };
void main() {
uvec2 idx = gl_GlobalInvocationID.xy;
uint offset = idx.y * gl_NumWorkGroups.x * gl_WorkGroupSize.x + idx.x;
result[offset] = sqrt(data[offset]) + 1.0;
}
उदाहरण compute shader प्रत्येक ऐरे तत्व के लिए वर्गमूल की गणना करता है। 16x16 का कार्य समूह एक साथ 256 तत्वों को संसाधित करता है। आधुनिक मोबाइल GPU 1024 कार्य समूहों और लाखों वैश्विक थ्रेड तक का समर्थन करते हैं।
GPU एक्सेस API यह निर्धारित करते हैं कि डेवलपर ग्राफिक्स प्रोसेसर को कमांड और डेटा कैसे भेजता है। मोबाइल प्लेटफ़ॉर्म पर तीन मुख्य API का उपयोग होता है: Vulkan, Metal और OpenGL ES। प्रत्येक के अपने लाभ और सीमाएँ हैं जो प्रदर्शन और संगतता को प्रभावित करते हैं।
Vulkan Khronos Group का एक निम्न-स्तरीय क्रॉस-प्लेटफ़ॉर्म API है, जो OpenGL का उत्तराधिकारी है। Vulkan डेवलपर्स को GPU मेमोरी, कमांड कतारों और सिंक्रोनाइज़ेशन पर सीधा नियंत्रण देता है। Khronos (2025) के अनुसार, Vulkan ड्राइवर ओवरहेड को कम करके OpenGL ES की तुलना में 30–60% प्रदर्शन सुधार प्रदान करता है।
Android पर, Vulkan Android 7.0 (API 24) से अनिवार्य है, और सभी आधुनिक SoC Vulkan 1.3 का समर्थन करते हैं। Vulkan Memory Allocator और एक मध्यवर्ती प्रतिनिधित्व के रूप में SPIR-V GLSL, HLSL या Rust GPU में शेडर्स लिखने की अनुमति देते हैं।
Metal पारिस्थितिकी तंत्र के सभी उपकरणों: iPhone, iPad, Mac, Apple TV के लिए Apple का मालिकाना GPU API है। Metal न्यूनतम ओवरहेड और पूर्वानुमान योग्य कमांड निष्पादन समय प्रदान करता है। Apple Developer Documentation (2025) के अनुसार, Metal FPS ड्रॉप के बिना प्रति फ्रेम 100,000 ड्रॉ कॉल तक संभालता है।
एक मुख्य विशेषता C++ पर आधारित Metal Shading Language (MSL) है। शेडर्स एप्लिकेशन के साथ मशीन कोड में संकलित होते हैं, जो Vulkan के विशिष्ट JIT संकलन को समाप्त करता है। Metal Mesh Shaders, Ray Tracing और रनटाइम पर शेडर्स लोड करने के लिए Dynamic Libraries का समर्थन करता है।
OpenGL ES एम्बेडेड सिस्टम के लिए OpenGL का एक सरलीकृत संस्करण है। इसका उपयोग पुराने उपकरणों पर और पिछड़ी संगतता के लिए किया जाता है। Android Studio (2025) के अनुसार, 94% Android उपकरणों पर OpenGL ES 3.2 समर्थित है। नई परियोजनाओं के लिए, Google OpenGL ES के बजाय Vulkan की अनुशंसा करता है।
WebGL, OpenGL ES का ब्राउज़र-आधारित एनालॉग है, जो वेब पर 3D ग्राफिक्स की नींव है। WebGL 2.0 (OpenGL ES 3.0 के अनुरूप) 92% मोबाइल ब्राउज़रों पर समर्थित है। WebGPU अगली पीढ़ी है, जिसकी संरचना Vulkan और Metal के करीब है।
अक्सर पूछे जाने वाले प्रश्न
मोबाइल GPU 2–8 W की तापीय सीमा में काम करता है, ऊर्जा बचत के लिए Tile-Based Rendering का उपयोग करता है और UMA के माध्यम से CPU के साथ मेमोरी साझा करता है। डेस्कटॉप GPU 150–450 W की खपत करता है, उसकी समर्पित वीडियो मेमोरी (GDDR) होती है और वह Immediate Mode Rendering का उपयोग करता है।
Apple GPU M4 Ultra और A18 Pro चिप्स में प्रति वॉट प्रदर्शन में मोबाइल GPU के बीच अग्रणी है। Android उपकरणों में, Snapdragon 8 Gen 4 में Qualcomm Adreno 850 और MediaTek Dimensity 9500 में ARM Mali-G925 अग्रणी हैं।
हाँ, GPU का सक्रिय रूप से iOS पर Core ML और Android पर TensorFlow Lite / NNAPI के माध्यम से न्यूरल नेटवर्क इन्फ़रेंस के लिए उपयोग होता है। Google (2025) के अनुसार, GPU त्वरण CPU की तुलना में 3–10 गुना गति सुधार प्रदान करता है।
थ्रॉटलिंग थर्मल बजट से अधिक होने के कारण होती है। निरंतर लोड के तहत, SoC का तापमान 85–95°C तक पहुँच जाता है, और GPU चिप की सुरक्षा के लिए आवृत्ति कम कर देता है। समाधान रेंडरिंग ऑप्टिमाइज़ेशन और FPS कैप (30–45 FPS) का उपयोग है।
Vulkan नई परियोजनाओं के लिए मुख्य विकल्प है। OpenGL ES पुराने उपकरणों के साथ पिछड़ी संगतता के लिए है। Metal iOS के लिए अनिवार्य है। क्रॉस-प्लेटफ़ॉर्म डेवलपमेंट के लिए Unity, Unreal Engine या Filament जैसे फ्रेमवर्क का उपयोग करें।
सारांश
हम एक मोबाइल एप्लिकेशन टर्नकी विकसित करेंगे
IT Sectr 2017 से स्टार्टअप और व्यवसायों के लिए iOS और Android एप्लिकेशन बनाता है। हम आपको सलाह देंगे और सर्वोत्तम समाधान प्रस्तावित करेंगे।
यह भी पढ़ें