आँकड़ा विश्लेषण — स्रोत, प्रस्तुतीकरण एवं विश्लेषण
इकाई 7 वास्तव में क्या पूछती है — और अंक-रणनीति
आँकड़ा विश्लेषण गणित नहीं परखता। यह तीन विनम्र कौशल परखता है: क्या आप लेबल और इकाई पढ़ सकते हैं, क्या आप लंबा भाग करने के बदले अनुमान लगा सकते हैं, और क्या आप इस बात पर ईमानदार रहते हैं कि आँकड़ा वास्तव में क्या कह रहा है — वह नहीं जो आप अपेक्षा कर रहे थे। हर DI प्रश्न संख्याओं में लिखा एक छोटा गद्यांश ही है।
- चरण 1 — शीर्ष पढ़िएएक भी संख्या छूने से पहले शीर्षक, इकाई व पाद-टिप्पणी पढ़िए। "लाख में" बनाम "हज़ार में" बनाम "प्रतिशत में" — यही पूरा उत्तर तय करता है।
- चरण 2 — पूछिए कि संख्या किस प्रकार की हैयह निरपेक्ष संख्या है, दर है, कुल में हिस्सा है, या सूचकांक है? गिनती घटते हुए भी दर बढ़ सकती है; संख्या बढ़ते हुए भी हिस्सा घट सकता है। अधिकांश गलत उत्तर यहीं जन्म लेते हैं।
- चरण 3 — पहले अनुमानअंकों को पूर्णांकित करके मोटा उत्तर निकालिए। फिर चारों विकल्प देखिए — प्रायः केवल एक आपके अनुमान के निकट होता है, और प्रश्न समाप्त।
- चरण 4 — विवश हों तभी गणनासटीक गणित केवल तब कीजिए जब दो विकल्प निकट बैठे हों। सटीक गणना अंतिम उपाय है, पहला कदम कभी नहीं।
आँकड़ों के स्रोत, संग्रहण एवं वर्गीकरण
आँकड़े (Data) कच्चे, असंगठित तथ्य और अंक हैं; संसाधित होकर अर्थ पा जाने पर वे सूचना (Information) बन जाते हैं; और कार्य का मार्गदर्शन करने वाली संगठित सूचना ज्ञान (Knowledge) बनती है। परीक्षक को यह सीढ़ी प्रिय है — आँकड़ा → सूचना → ज्ञान → विवेक (DIKW पदानुक्रम) — क्योंकि यह समझाती है कि संख्याएँ जुटाना उन्हें समझने के समान नहीं है।
संग्रहण वह प्रक्रिया है जिससे संख्याएँ आप तक पहुँचती हैं। आँकड़े जनगणना द्वारा (जनसंख्या की प्रत्येक इकाई की गणना) या प्रतिदर्श सर्वेक्षण द्वारा (प्रतिनिधि अंश का अध्ययन कर परिणाम का सामान्यीकरण) एकत्र किए जा सकते हैं। सामान्य उपकरण हैं — अवलोकन, साक्षात्कार, प्रश्नावली (उत्तरदाता भरता है), अनुसूची (अन्वेषक भरता है), प्रयोग, तथा प्रशासनिक या पंजीकरण अभिलेख। अब एक चौथा माध्यम भी बढ़ रहा है: संवेदकों, लेनदेनों, मोबाइल फोनों व वेब-लॉग से आने वाला मशीन-जनित आँकड़ा — यही बिग डेटा का कच्चा माल है।
| आधार | प्राथमिक आँकड़े | द्वितीयक आँकड़े |
|---|---|---|
| अर्थ | वर्तमान अध्ययन के लिए अन्वेषक द्वारा प्रत्यक्ष एकत्रित | किसी अन्य द्वारा किसी अन्य प्रयोजन से पहले ही एकत्रित, फिर पुनः प्रयुक्त |
| मौलिकता | मौलिक; शोधार्थी प्रथम उपयोगकर्ता है | द्वितीयक; शोधार्थी बाद का उपयोगकर्ता है |
| लागत व समय | महँगा व धीमा | सस्ता व शीघ्र |
| गुणवत्ता पर नियंत्रण | उच्च — उपकरण व प्रतिदर्श आप ही बनाते हैं | निम्न — प्रयोग से पूर्व उपयुक्तता, पर्याप्तता व विश्वसनीयता आँकनी पड़ती है |
| प्रमुख उपकरण/स्रोत | प्रश्नावली, अनुसूची, साक्षात्कार, अवलोकन, प्रयोग, क्षेत्रीय मापन | भारत की जनगणना (RGI), NSO/MoSPI सर्वेक्षण, AISHE (शिक्षा मंत्रालय), NCRB, RBI बुलेटिन, आर्थिक समीक्षा, NFHS, प्रकाशित शोध-पत्रिकाएँ |
| आंतरिक बनाम बाह्य | सामान्यतः शोधार्थी का बाह्य क्षेत्र-कार्य | आंतरिक (अपने संस्थान के अभिलेख) या बाह्य (सरकार, अभिकरण, वेब पोर्टल) |
संग्रहण के बाद आँकड़ों का वर्गीकरण आवश्यक है — समरूप समूहों में रखना। चार मानक आधार हैं: भौगोलिक (स्थान के अनुसार, जिसे स्थानिक भी कहते हैं), कालानुक्रमिक (समय के अनुसार, जिससे काल-श्रेणी बनती है), गुणात्मक (लिंग या शिक्षा-माध्यम जैसे गुण के अनुसार — एक गुण हो तो सरल, कई हों तो बहुविध), और मात्रात्मक (अंक या आय जैसे मापनीय चर के अनुसार, जिससे बारंबारता बंटन बनता है)। मात्रात्मक श्रेणी व्यक्तिगत (प्रत्येक मान सूचीबद्ध), असतत (मान व बारंबारता), या सतत (वर्ग-अंतराल व बारंबारता) हो सकती है।
- सारणीयन वर्गीकरण के बाद आता है: अच्छी तालिका में शीर्षक, स्टब (पंक्ति-शीर्ष), कैप्शन (स्तंभ-शीर्ष), मुख्य भाग, इकाई-कथन, शीर्ष-टिप्पणी और पाद-टिप्पणी/स्रोत होते हैं। NET ने इन भागों के नाम पूछे हैं।
- एकत्रित आँकड़ों का संपादन का अर्थ है विश्लेषण से पहले पूर्णता, संगति, शुद्धता व समरूपता की जाँच; कोडिंग उत्तरों को संसाधन हेतु संकेतों/संख्याओं में बदलती है।
- अनुप्रस्थ-काट आँकड़े एक समय-बिंदु पर अनेक इकाइयों का वर्णन करते हैं; काल-श्रेणी आँकड़े एक इकाई का अनेक समय-बिंदुओं पर; पैनल (अनुदैर्ध्य) आँकड़े उन्हीं इकाइयों का समय के साथ अनुसरण करते हैं — परिवर्तन के अध्ययन हेतु तीनों में सर्वाधिक सशक्त।
मात्रात्मक बनाम गुणात्मक आँकड़े, और मापन की चार मापनियाँ
मात्रात्मक आँकड़े कितना / कितने का उत्तर देते हैं और संख्यात्मक होते हैं। ये असतत (गणनीय, केवल पूर्ण मान — कक्षा में विद्यार्थियों की संख्या) और सतत (मापनीय, परिसर में कोई भी मान — ऊँचाई, समय, तापमान) में बँटते हैं। गुणात्मक (श्रेणीगत) आँकड़े किस प्रकार का उत्तर देते हैं और किसी गुण का वर्णन करते हैं — लिंग, धर्म, शिक्षा-माध्यम, संतुष्टि-स्तर। गुणात्मक आँकड़ों की गणना (प्रत्येक श्रेणी की बारंबारता) तो हो सकती है, पर उनका सार्थक औसत नहीं निकलता।
| मापनी | यह क्या करती है | अनुमत | उदाहरण | उपयुक्त औसत |
|---|---|---|---|---|
| नामिक (Nominal) | केवल नाम या लेबल; कोई क्रम नहीं | गणना, बहुलक, काई-वर्ग | लिंग, धर्म, रक्त-समूह, अनुक्रमांक, जर्सी संख्या | केवल बहुलक |
| क्रमिक (Ordinal) | क्रम में श्रेणियाँ, पर श्रेणियों के बीच अंतर असमान/अज्ञात | क्रम, माध्यिका, शतमक, कोटि-सहसंबंध | योग्यता क्रम 1–2–3, लिकर्ट सहमति, सामाजिक-आर्थिक वर्ग, NAAC ग्रेड | माध्यिका (व बहुलक) |
| अंतराल (Interval) | समान अंतराल, पर शून्य मनमाना — वास्तविक शून्य नहीं | योग व घटाव, माध्य, मानक विचलन | °C में तापमान, IQ अंक, कैलेंडर वर्ष, अनेक अभिवृत्ति परीक्षणों के अंक | माध्य, माध्यिका, बहुलक |
| अनुपात (Ratio) | समान अंतराल तथा निरपेक्ष (वास्तविक) शून्य | गुणा, भाग व वास्तविक अनुपात सहित सभी अंकगणित | ऊँचाई, भार, आयु, आय, दूरी, लिया गया समय, पुस्तकों की संख्या | गुणोत्तर माध्य सहित सभी माप |
आरेखीय प्रस्तुतीकरण एवं आँकड़ों का मानचित्रण
आरेख सजावट नहीं, संपीड़न-यंत्र है। यह तात्कालिक तुलना के बदले सूक्ष्मता का सौदा करता है। अतः परीक्षक बहुत विशिष्ट प्रश्न पूछता है: इस प्रकार के आँकड़े के लिए कौन-सा आरेख उपयुक्त है? नीचे की तालिका मिलान-अभ्यास के रूप में सीखिए, क्योंकि परीक्षा में ठीक इसी रूप में पूछा जाता है।
| आरेख | क्या आलेखित होता है | किसके लिए | मुख्य बिंदु / जाल |
|---|---|---|---|
| दंड आरेख (सरल, बहु, विभाजित/स्तरित, प्रतिशत दंड) | अलग-अलग दंडों की लंबाई | असतत या श्रेणीगत मदों की तुलना | दंडों के बीच अंतराल होता है; केवल लंबाई सार्थक, चौड़ाई निरर्थक |
| रेखा आरेख / हिस्टोरिग्राम | सरल रेखाओं से जुड़े बिंदु | काल-श्रेणी — वर्षों/माहों में प्रवृत्ति | परिवर्तन की दिशा दिखाने हेतु श्रेष्ठ; कटा Y-अक्ष उसे बढ़ा-चढ़ा दिखाता है |
| वृत्त आरेख (पाई चार्ट) | त्रिज्यखंडों के केंद्रीय कोण | एक कुल के हिस्से/घटक | 1% = 3.6°; लगभग छह घटकों से आगे व्यर्थ, और दो भिन्न कुलों की तुलना हेतु निरुपयोगी |
| आयतचित्र (Histogram) | वर्ग-अंतरालों पर सटे आयत; क्षेत्रफल बारंबारता दर्शाता है | सतत वर्गीकृत बारंबारता बंटन | दंडों के बीच अंतराल नहीं; बहुलक आरेख से पढ़ा जा सकता है; असमान वर्गों में बारंबारता घनत्व आलेखित करना पड़ता है |
| बारंबारता बहुभुज | वर्ग-मध्यमानों को सरल रेखाओं से जोड़ना | एक ही अक्ष पर दो या अधिक बंटनों की तुलना | मध्यमानों पर, सीमाओं पर नहीं; इसके नीचे का क्षेत्रफल आयतचित्र के क्षेत्रफल के बराबर |
| बारंबारता वक्र (चिकना बहुभुज) | बहुभुज से गुज़रता मुक्त-हस्त चिकना वक्र | बंटन का आकार दिखाना — सममित, विषम | घंटी-आकार सममित वक्र प्रसामान्य वक्र है |
| तोरण / ओजाइव (संचयी बारंबारता वक्र) | वर्ग-सीमाओं के सामने संचयी बारंबारता | माध्यिका, चतुर्थक व शतमक आरेख से पढ़ना | "से कम" तोरण चढ़ता है, "से अधिक" तोरण गिरता है; उनके प्रतिच्छेदन का X-निर्देशांक माध्यिका है |
| प्रकीर्ण आरेख (बिंदु आरेख) | दो चरों के सामने प्रति इकाई एक बिंदु | सहसंबंध दिखाना — दिशा, प्रबलता, रैखिकता, बहिर्मान | ऊपर उठता बादल = धनात्मक, नीचे गिरता = ऋणात्मक, आकारहीन = सहसंबंध नहीं। सहसंबंध कारणता नहीं है। |
| तना-पत्ती आरेख | अग्र अंक तना, अंतिम अंक पत्ती | छोटे आँकड़े जहाँ आकार तथा प्रत्येक मूल मान दोनों चाहिए | आयतचित्र के विपरीत यह कोई कच्चा आँकड़ा नहीं खोता; माध्यिका व बहुलक सीधे गिने जा सकते हैं |
| बॉक्स प्लॉट (बॉक्स-व्हिस्कर) | न्यूनतम, Q1, माध्यिका, Q3, अधिकतम | प्रसार की तुलना व बहिर्मान पहचानना | बॉक्स की लंबाई = अंतर-चतुर्थक विस्तार (Q3 − Q1) |
आँकड़ों का मानचित्रण (कार्टोग्राफ़िक प्रस्तुति) उसी कौशल की भौगोलिक शाखा है: अक्ष के स्थान पर स्थान स्वयं संख्या धारण करता है। शासन के लिए यह महत्वपूर्ण है क्योंकि नीति ज़िले-दर-ज़िले पहुँचाई जाती है।
| मानचित्र प्रकार | आँकड़े कैसे दिखाए जाते हैं | प्रमुख उदाहरण |
|---|---|---|
| कोरोप्लेथ (छायांकित) | किसी अनुपात या दर के उच्च मान पर प्रशासनिक इकाई गहरी छायांकित | ज़िलेवार साक्षरता दर या लिंगानुपात |
| बिंदु मानचित्र | एक बिंदु एक निश्चित संख्या दर्शाता है, घटना-स्थल पर रखा जाता है | जनसंख्या या पशुधन का वितरण |
| समानुपाती प्रतीक (मानचित्र पर गोला/दंड) | प्रतीक का आकार निरपेक्ष मान के साथ बदलता है | नगरों की जनसंख्या, पत्तन यातायात |
| समरेख / आइसोप्लेथ | समान मान वाले बिंदुओं को जोड़ती रेखाएँ | समवर्षा रेखा, समताप रेखा, समोच्च रेखा (ऊँचाई) |
| प्रवाह मानचित्र | तीर की मोटाई स्थानों के बीच गतिमान परिमाण दर्शाती है | अंतर-राज्यीय प्रवास, माल-परिवहन |
| कार्टोग्राम | मान के अनुपात में इकाई का क्षेत्रफल स्वयं विकृत किया जाता है | राज्यों को भू-क्षेत्र के बदले लोकसभा सीटों के अनुसार बनाना |
| GIS परत / डैशबोर्ड | भू-संदर्भित आँकड़े परतों में रखकर प्रश्न पूछना | भुवन (ISRO), पीएम गति शक्ति राष्ट्रीय मास्टर प्लान |
केंद्रीय प्रवृत्ति व अपकिरण — केवल जितना DI को चाहिए
कोई भी आँकड़ा-समूह दो संख्याओं से संक्षिप्त हो जाता है: केंद्रीय प्रवृत्ति का माप (मध्य कहाँ है) और अपकिरण का माप (मान कितने फैले हैं)। NET प्रमाण नहीं चाहता — वह चाहता है कि आप शीघ्र गणना करें और जानें कि कौन-सा माप सुरक्षित है।
- समांतर माध्य = Σx ÷ n। प्रत्येक मान का उपयोग करता है, अतः सर्वाधिक कार्यकुशल — परंतु एक चरम मान इसे खींच लेता है।
- माध्यिका = क्रम में लगाने के बाद मध्य मान। विषम n हेतु ((n+1)/2)-वाँ मान; सम n हेतु दोनों मध्य मानों का औसत। चरम मानों से अप्रभावित — आय, भू-जोत तथा किसी भी क्रमिक आँकड़े हेतु सही चुनाव।
- बहुलक = सर्वाधिक बार आने वाला मान। नामिक आँकड़ों हेतु उपलब्ध एकमात्र औसत। किसी समूह में बहुलक न हो, एक हो, या दो हों (द्विबहुलकीय)।
- परिसर = अधिकतम − न्यूनतम। सबसे स्थूल अपकिरण-माप, जो पूर्णतः दो सर्वाधिक असामान्य मानों से तय होता है।
- मानक विचलन (σ) = माध्य से विचलनों के वर्गों के औसत का वर्गमूल। इसका वर्ग प्रसरण है। विचरण गुणांक = (σ ÷ माध्य) × 100 भिन्न इकाइयों में मापे दो समूहों की संगति की तुलना कराता है।
एक छोटे आँकड़े को पूरा हल कीजिए। आठ अंक लीजिए: 2, 4, 4, 4, 5, 5, 7, 9 (पहले से आरोही क्रम में)।
| माप | क्रिया | मान |
|---|---|---|
| योग (Σx) | 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 | 40 |
| माध्य | 40 ÷ 8 | 5 |
| माध्यिका | n सम है, अतः 4था व 5वाँ मान औसत करें: (4 + 5) ÷ 2 | 4.5 |
| बहुलक | 4 तीन बार, 5 दो बार, शेष सभी एक बार | 4 |
| परिसर | 9 − 2 | 7 |
| Σ(x − माध्य)² | विचलन −3, −1, −1, −1, 0, 0, +2, +4 → वर्ग 9, 1, 1, 1, 0, 0, 4, 16 | 32 |
| प्रसरण (÷ n) | 32 ÷ 8 | 4 |
| मानक विचलन | √4 | 2 |
| विचरण गुणांक | (2 ÷ 5) × 100 | 40% |
पैटर्न पढ़िए: बहुलक 4 < माध्यिका 4.5 < माध्य 5। जब माध्य माध्यिका के दाईं ओर खिंच जाता है, तो बंटन धनात्मक (दक्षिण) विषम होता है — कुछ ऊँचे मान (यहाँ 7 व 9) पुच्छ को खींच रहे हैं। यह भी ध्यान दें कि Σ(x − माध्य)² को n से भाग देने पर समष्टि मानक विचलन मिलता है (ठीक 2); n − 1 = 7 से भाग देने पर प्रतिदर्श मानक विचलन, √(32 ÷ 7) ≈ 2.14। दोनों सही हैं — प्रश्न को बताना होगा कि कौन-सा।
हल किया सेट 1 — काल-श्रेणी से वृद्धि, हिस्सा व अनुपात
नीचे की तालिका परीक्षा में बहु-दंड आरेख (प्रति वर्ष दो दंड) या दो रेखा आरेखों के रूप में आती। तालिका के रूप में लिखने पर कुछ नहीं खोता। ये अंक उदाहरणार्थ हैं, अभ्यास हेतु बनाए गए — ये सरकारी आँकड़े नहीं हैं। अंतिम दो स्तंभ दिए नहीं गए थे; हमने उनकी गणना की, और यही पूरा काम है।
| वर्ष | कुल नामांकन | छात्रा नामांकन | छात्रा हिस्सा (%) | पिछले वर्ष पर कुल में वृद्धि (%) |
|---|---|---|---|---|
| 2019 | 2,000 | 800 | 40.0 | — |
| 2020 | 2,400 | 1,080 | 45.0 | +20.0 |
| 2021 | 2,700 | 1,296 | 48.0 | +12.5 |
| 2022 | 3,240 | 1,458 | 45.0 | +20.0 |
| 2023 | 3,564 | 1,782 | 50.0 | +10.0 |
| पाँच-वर्षीय कुल | 13,904 | 6,416 | 46.1 (समग्र) | — |
- वृद्धि दर। सूत्र: (नया − पुराना) ÷ पुराना × 100। 2020 हेतु: (2,400 − 2,000) ÷ 2,000 × 100 = 400 ÷ 2,000 × 100 = 20%। 2021 हेतु: 300 ÷ 2,400 × 100 = 12.5%। 2022 हेतु: 540 ÷ 2,700 × 100 = 20%। 2023 हेतु: 324 ÷ 3,240 × 100 = 10%।
- निरपेक्ष बनाम प्रतिशत — जाल क्रियाशील। 2020 व 2022 की वृद्धि दोनों ठीक 20% हैं, फिर भी संख्या में बहुत भिन्न: 2020 में +400 विद्यार्थी और 2022 में +540। समान प्रतिशत, असमान संख्या, क्योंकि आधार 2,000 से 2,700 हो गया। इसके विपरीत सर्वाधिक निरपेक्ष वृद्धि (2022 में +540) सर्वाधिक प्रतिशत वृद्धि नहीं है — वह उसकी केवल बराबरी करती है।
- अवधि में कुल वृद्धि। 2019 → 2023: (3,564 − 2,000) ÷ 2,000 × 100 = 1,564 ÷ 2,000 × 100 = 78.2%। वार्षिक दरें कभी न जोड़ें (20 + 12.5 + 20 + 10 = 62.5%) — यह चक्रवृद्धि की अवहेलना करता है और गलत है।
- छात्रा नामांकन तेज़ बढ़ा। 800 → 1,782 में 982 की वृद्धि, अर्थात् 982 ÷ 800 × 100 = 122.75%, जबकि कुल में 78.2%। जब कोई भाग सम्पूर्ण से तेज़ बढ़ता है, तो उस भाग का हिस्सा अवश्य बढ़ेगा — और वस्तुतः हिस्सा 40.0% से 50.0% हो गया।
- संख्या बढ़ते हुए भी हिस्सा घट सकता है — 2022 इसका प्रमाण है। छात्रा नामांकन 1,296 से 1,458 हुआ, अर्थात् स्वस्थ 162 ÷ 1,296 × 100 = 12.5% वृद्धि। फिर भी छात्रा हिस्सा 48.0% से घटकर 45.0% हो गया, क्योंकि कुल तेज़ बढ़ा (20%)। सम्पूर्ण से धीमे बढ़ने का अर्थ है बढ़ते हुए भी हिस्सा खोना।
- अनुपात। 2019 में छात्रा : छात्र = 800 : (2,000 − 800) = 800 : 1,200 = 2 : 3। 2023 में छात्रा : छात्र = 1,782 : (3,564 − 1,782) = 1,782 : 1,782 = 1 : 1 — पूर्ण समता।
- श्रेणी के औसत। माध्य वार्षिक नामांकन = 13,904 ÷ 5 = 2,780.8। 2,000 / 2,400 / 2,700 / 3,240 / 3,564 की माध्यिका = तीसरा मान = 2,700। बहुलक नहीं है (प्रत्येक मान एक बार)। परिसर = 3,564 − 2,000 = 1,564। समग्र छात्रा हिस्सा = 6,416 ÷ 13,904 × 100 = 46.1% (एक दशमलव तक)।
हल किया सेट 3 — वर्गीकृत आँकड़े: आयतचित्र, तोरण, माध्यिका व बहुलक वर्ग
यही वह आँकड़ा है जिससे परीक्षा आयतचित्र, बारंबारता बहुभुज और तोरण — तीनों — एक ही तालिका से खींचती है। एक परीक्षा में 200 विद्यार्थियों के अंक (उदाहरणार्थ, अभ्यास हेतु बनाए गए):
| वर्ग अंतराल (अंक) | मध्यमान | बारंबारता (f) | "से कम" संचयी बारंबारता | f × मध्यमान |
|---|---|---|---|---|
| 10–20 | 15 | 12 | 20 से कम → 12 | 180 |
| 20–30 | 25 | 28 | 30 से कम → 40 | 700 |
| 30–40 | 35 | 46 | 40 से कम → 86 | 1,610 |
| 40–50 | 45 | 54 (सर्वाधिक) | 50 से कम → 140 | 2,430 |
| 50–60 | 55 | 38 | 60 से कम → 178 | 2,090 |
| 60–70 | 65 | 22 | 70 से कम → 200 | 1,430 |
| कुल | — | 200 | — | 8,440 |
- संचयी स्तंभ सीधे पढ़ना। 40 से कम अंक पाने वाले = 86, अर्थात् 86 ÷ 200 × 100 = 43%। 50 या अधिक पाने वाले = 38 + 22 = 60, अर्थात् 60 ÷ 200 × 100 = 30% — समान रूप से 200 − 140 = 60। 30–50 परिसर में = 46 + 54 = 100, ठीक आधी कक्षा।
- वर्गीकृत आँकड़ों का माध्य = Σ(f × मध्यमान) ÷ Σf = 8,440 ÷ 200 = 42.2 अंक। अंश जाँचिए: 180 + 700 + 1,610 + 2,430 + 2,090 + 1,430 = 8,440।
- माध्यिका वर्ग व माध्यिका। N ÷ 2 = 100। संचयी स्तंभ देखिए: 86, 100 से कम है और 140 उससे अधिक, अतः 100वाँ विद्यार्थी वर्ग 40–50 में है — यही माध्यिका वर्ग है। तब माध्यिका = L + [(N/2 − cf) ÷ f] × h = 40 + [(100 − 86) ÷ 54] × 10 = 40 + (14 ÷ 54) × 10 = 40 + 2.59 = 42.59 अंक।
- बहुलक वर्ग व बहुलक। सर्वाधिक बारंबारता 54 है, अतः बहुलक वर्ग 40–50 है। बहुलक = L + [(f₁ − f₀) ÷ (2f₁ − f₀ − f₂)] × h = 40 + [(54 − 46) ÷ (108 − 46 − 38)] × 10 = 40 + (8 ÷ 24) × 10 = 40 + 3.33 = 43.33 अंक।
- आनुभविक संबंध से पुनः जाँच। बहुलक ≈ 3 × माध्यिका − 2 × माध्य = 3 × 42.59 − 2 × 42.2 = 127.77 − 84.40 = 43.37, जो गणित 43.33 के अत्यंत निकट है। चूँकि माध्य 42.2 < माध्यिका 42.59 < बहुलक 43.33, बंटन हल्का ऋणात्मक (वाम) विषम है।
- प्रत्येक आरेख क्या दिखाएगा। इस तालिका के आयतचित्र में छह सटे आयत होंगे, सबसे ऊँचा 40–50 पर। बारंबारता बहुभुज छह मध्यमान 15, 25, 35, 45, 55, 65 को जोड़ेगा। "से कम" तोरण ऊपरी सीमाओं 20, 30, 40, 50, 60, 70 के सामने 12, 40, 86, 140, 178, 200 आलेखित करेगा; संचयी बारंबारता 100 से X-अक्ष पर लंब गिराने से माध्यिका ≈ 42.6 पढ़ी जाती है।
आँकड़े एवं शासन — ई-गवर्नेंस, मुक्त आँकड़े, बिग डेटा व निजता
इकाई 7 वहाँ समाप्त होती है जहाँ सांख्यिकी राज्य से मिलती है: "आँकड़े एवं शासन"। विचार सरल है। जो सरकार मापती है वह लक्षित कर सकती है; जो प्रकाशित करती है उसकी जवाबदेही बनती है; और जो एकत्र करती है उसे रक्षा करनी होती है। साक्ष्य-आधारित नीति अनुमान के स्थान पर गणना रखती है — इसीलिए आधार-जुड़ा प्रत्यक्ष लाभ अंतरण, वास्तविक-समय डैशबोर्ड और भू-चिह्नित परिसंपत्ति पंजी ने भारतीय प्रशासन को किसी एक कानून से अधिक बदला।
| साधन | यह क्या है | आँकड़ों के लिए क्यों महत्वपूर्ण |
|---|---|---|
| NDSAP, 2012 | राष्ट्रीय आँकड़ा साझाकरण एवं अभिगम्यता नीति | भारत में मुक्त सरकारी आँकड़ों की आधार-नीति — असंवेदनशील सार्वजनिक आँकड़े सक्रिय रूप से साझा किए जाएँ |
| data.gov.in | भारत का मुक्त सरकारी आँकड़ा मंच | मंत्रालयों के मशीन-पठनीय आँकड़ा-समूह, निःशुल्क डाउनलोड व पुनःप्रयोग हेतु |
| NDAP (नीति आयोग) | राष्ट्रीय आँकड़ा एवं विश्लेषण मंच | मंत्रालयों के आँकड़ों को समरूप बनाता है जिससे उनकी तुलना व चित्रण संभव हो |
| सूचना का अधिकार अधिनियम, 2005 | लोक प्राधिकारियों के पास उपलब्ध सूचना पर नागरिक का विधिक अधिकार | सरकारी अभिलेखों को मांग योग्य आँकड़ों में बदलता है; पारदर्शिता प्रवर्तनीय बनती है |
| आधार / UIDAI (आधार अधिनियम, 2016) | बायोमेट्रिक अपुनरावृत्ति सहित अद्वितीय 12-अंकीय पहचान | DBT व e-KYC की रीढ़; निजता-विवाद का केंद्र भी |
| पुट्टस्वामी निर्णय, 2017 | नौ-न्यायाधीश उच्चतम न्यायालय पीठ, के. एस. पुट्टस्वामी बनाम भारत संघ | निजता को अनुच्छेद 21 के अंतर्गत मूल अधिकार माना — आँकड़ा-संरक्षण का संवैधानिक आधार |
| DPDP अधिनियम, 2023 | डिजिटल व्यक्तिगत डेटा संरक्षण अधिनियम | भारत का आँकड़ा-संरक्षण कानून: सहमति, प्रयोजन-सीमा, आँकड़ा-न्यूनीकरण, डेटा न्यासी के कर्तव्य, डेटा प्रधान के अधिकार |
| सूचना प्रौद्योगिकी अधिनियम, 2000 (2008 में संशोधित) | भारत का प्रमुख साइबर कानून; CERT-In राष्ट्रीय घटना-प्रतिक्रिया अभिकरण है | इलेक्ट्रॉनिक अभिलेखों को विधिक मान्यता देता है और आँकड़ा-चोरी व उल्लंघन को दंडनीय बनाता है |
| डिजिटल इंडिया, 2015 | नौ स्तंभों पर आधारित प्रमुख कार्यक्रम (1 जुलाई 2015 को प्रारंभ) | आधारभूत ढाँचा देता है — ब्रॉडबैंड राजमार्ग, e-क्रांति सेवा-प्रदाय, सभी के लिए सूचना |
- ई-गवर्नेंस लोक सेवाएँ पहुँचाने हेतु ICT का प्रयोग है, और उसके चार अंतःक्रिया प्रकार हैं — G2C (सरकार से नागरिक), G2B (सरकार से व्यवसाय), G2G (सरकार से सरकार) और G2E (सरकार से कर्मचारी)। वचनित लाभ SMART हैं — सरल, नैतिक, जवाबदेह, उत्तरदायी, पारदर्शी शासन।
- बिग डेटा को पाँच V से वर्णित किया जाता है — Volume (परिमाण), Velocity (आगमन की गति), Variety (पाठ, चित्र, संवेदक, लॉग), Veracity (विश्वसनीयता) और Value (उपयोगी अंतर्दृष्टि)। प्रशासन में यह GST विश्लेषण, उपग्रह चित्रों से फसल-उपज आकलन, महामारी निगरानी व यातायात प्रबंधन को शक्ति देता है।
- मुक्त आँकड़े केवल प्रकाशित होने से अधिक होने चाहिए: स्वीकृत जाँच यह है कि वे मशीन-पठनीय, गैर-स्वामित्व प्रारूप में, पूर्ण, समयबद्ध, और निःशुल्क पुनःप्रयोग हेतु अनुज्ञप्त हों। तालिका की स्कैन की गई PDF प्रकाशित है पर मुक्त नहीं, क्योंकि संख्याएँ सॉफ़्टवेयर से पढ़ी नहीं जा सकतीं।
- लागतें भी वास्तविक हैं: डिजिटल विभाजन (पहुँच, वहनीयता, डिजिटल साक्षरता, भाषा), बायोमेट्रिक प्रमाणन विफल होने पर अपवर्जन त्रुटियाँ, निगरानी का जोखिम, विषम प्रशिक्षण-आँकड़ों से आई कलन-विधिक अभिनति, और संख्या के साथ पद्धति प्रकाशित न होने पर सांख्यिकीय अपारदर्शिता का खतरा।
मुख्य बिंदु
- पहले शीर्षक, इकाई व पाद-टिप्पणी पढ़ें; फिर पूछें कि प्रत्येक संख्या निरपेक्ष गिनती, दर, हिस्सा या सूचकांक है — अधिकांश गलत DI उत्तर इसी भ्रम में जन्म लेते हैं।
- प्राथमिक आँकड़े शोधार्थी प्रत्यक्ष एकत्र करता है; द्वितीयक आँकड़े जनगणना, NSO/MoSPI, AISHE, NCRB, RBI आदि से पुनःप्रयुक्त होते हैं — सस्ते व शीघ्र, पर प्रयोग से पूर्व उपयुक्तता व विश्वसनीयता आँकनी होगी।
- बढ़ती शक्ति में मापनियाँ — NOIR: नामिक (लेबल, केवल बहुलक), क्रमिक (श्रेणी, माध्यिका), अंतराल (समान अंतर, मनमाना शून्य, माध्य), अनुपात (वास्तविक शून्य, सभी अंकगणित)। अनुक्रमांक नामिक है; लिकर्ट मापनी क्रमिक।
- दंड आरेख में अंतराल होते हैं और वह श्रेणियाँ दिखाता है; आयतचित्र में अंतराल नहीं और वह सतत वर्ग दिखाता है। बारंबारता बहुभुज मध्यमान जोड़ता है; तोरण वर्ग-सीमाओं के सामने संचयी बारंबारता आलेखित करके माध्यिका, चतुर्थक व शतमक देता है; प्रकीर्ण आरेख सहसंबंध दिखाता है, कारणता कभी नहीं; तना-पत्ती प्रत्येक कच्चा मान रखता है।
- वृत्त आरेख गणित: 1% = 3.6°, 25% = 90°, और प्रति अंश राशि = कुल ÷ 360। कोणों का योग 360° होना चाहिए — इसे मुफ़्त स्व-जाँच बनाइए। भिन्न कुल वाले दो वृत्तों की तुलना केवल प्रतिशत से नहीं हो सकती।
- वृद्धि = (नया − पुराना) ÷ पुराना × 100। कुल वृद्धि हेतु वार्षिक दरें कभी न जोड़ें, और वृद्धि उलटने हेतु भाग दें (20% बढ़कर 3,240 हुआ अंक 3,240 ÷ 1.20 = 2,700 था)। प्रतिशत-बिंदु और प्रतिशत में भेद कीजिए।
- किसी भाग का हिस्सा तभी बढ़ता है जब भाग सम्पूर्ण से तेज़ बढ़े — कोई संख्या 12.5% बढ़कर भी हिस्सा खो सकती है यदि कुल 20% बढ़ा हो। भिन्न आधारों पर समान प्रतिशत वृद्धि असमान निरपेक्ष वृद्धि देती है।
- वर्गीकृत आँकड़ों में: माध्य = Σfx ÷ Σf; माध्यिका वर्ग वहाँ है जहाँ संचयी स्तंभ में N/2 पहली बार आता है; बहुलक वर्ग में सर्वाधिक बारंबारता होती है; और बहुलक ≈ 3 × माध्यिका − 2 × माध्य तीनों की जाँच कर देता है। आय व भूमि हेतु ईमानदार औसत माध्य नहीं, माध्यिका है।
- आँकड़े एवं शासन: मुक्त आँकड़ों हेतु NDSAP 2012 व data.gov.in, मांग योग्य सूचना हेतु RTI 2005, पुट्टस्वामी 2017 (अनुच्छेद 21 के अंतर्गत निजता मूल अधिकार), व्यक्तिगत आँकड़ों हेतु DPDP अधिनियम 2023, साइबर सुरक्षा हेतु IT अधिनियम 2000/CERT-In, आधारभूत ढाँचे हेतु डिजिटल इंडिया (2015, नौ स्तंभ); बिग डेटा के पाँच V — Volume, Velocity, Variety, Veracity, Value।
अभ्यास प्रश्न (8)
उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।
वह मापनी जिसमें समान अंतराल तथा निरपेक्ष (वास्तविक) शून्य होता है, जिससे गुणा, भाग व वास्तविक अनुपात सार्थक हो जाते हैं, कहलाती है:
उत्तर देखें
उत्तर: D — अनुपात मापनी
बढ़ती शक्ति में NOIR याद रखें। नामिक केवल लेबल देती है (लिंग, अनुक्रमांक)। क्रमिक क्रम जोड़ती है पर अंतर असमान (योग्यता क्रम, लिकर्ट)। अंतराल समान अंतर जोड़ती है पर उसका शून्य मनमाना है — 0 °C का अर्थ "तापमान नहीं" नहीं, इसीलिए 40 °C, 20 °C से दुगुना गर्म नहीं। अनुपात निरपेक्ष शून्य जोड़ती है: 0 किग्रा का अर्थ वास्तव में द्रव्यमान नहीं, अतः 40 किग्रा वस्तुतः 20 किग्रा का दुगुना है। ऊँचाई, भार, आयु, आय व लिया गया समय अनुपात-मापनी चर हैं।सतत वर्गीकृत बारंबारता बंटन के लिए कौन-सा आरेख उपयुक्त है, जो सटे हुए आयतों से बनाया जाता है और जिनके बीच कोई अंतराल नहीं छोड़ा जाता?
उत्तर देखें
उत्तर: A — आयतचित्र (Histogram)
आयतचित्र सतत वर्गीकृत बंटन का आरेख है: वर्ग-अंतराल संख्या-रेखा का अखंड खंड बनाते हैं, अतः आयत सटे होते हैं, और बारंबारता क्षेत्रफल से दर्शाई जाती है। दंड आरेख जान-बूझकर अंतराल छोड़ता है क्योंकि उसकी श्रेणियाँ (कला, विज्ञान, वाणिज्य) पृथक् हैं और केवल दंड की लंबाई सार्थक है। वृत्त आरेख एक कुल के हिस्से दिखाता है, और प्रकीर्ण आरेख दो चरों का संबंध। बाड़ के खंभों में अंतराल होता है, ईंट की दीवार में नहीं।एक विश्वविद्यालय में नामांकन था — 2,000 (2019), 2,400 (2020), 2,700 (2021), 3,240 (2022) और 3,564 (2023)। 2021 की तुलना में 2022 में नामांकन में प्रतिशत वृद्धि थी:
उत्तर देखें
उत्तर: C — 20%
प्रतिशत परिवर्तन = (नया − पुराना) ÷ पुराना × 100। यहाँ नया = 3,240 और पुराना = 2,700, अतः वृद्धि 3,240 − 2,700 = 540, और 540 ÷ 2,700 × 100 = 20%। जाल है नए मान से भाग देना (540 ÷ 3,240 = 16.67%, विकल्प ख) — प्रतिशत परिवर्तन सदा आधार, अर्थात् पूर्व अंक, से भाग देता है। यह भी ध्यान दें कि 2020 में छोटे आधार पर वही 20% वृद्धि हुई थी, अतः उसने केवल 400 विद्यार्थी जोड़े जबकि 2022 में 540: समान प्रतिशत, असमान संख्या।₹9,000 करोड़ के कुल शिक्षा बजट के वृत्त आरेख में शोध व नवाचार कुल का 15% है। शोध वाले त्रिज्यखंड का केंद्रीय कोण तथा उसे आवंटित राशि क्रमशः हैं:
उत्तर देखें
उत्तर: B — 54° तथा ₹1,350 करोड़
चूँकि पूरा वृत्त 360° = 100% है, 1% = 3.6°। अतः 15% × 3.6 = 54°। राशि हेतु या तो 9,000 का 15% = ₹1,350 करोड़ लें, या प्रति-अंश शॉर्टकट: 9,000 ÷ 360 = ₹25 करोड़ प्रति अंश, अतः 54 × 25 = ₹1,350 करोड़। दोनों मार्ग सहमत हैं, यही आपकी स्व-जाँच है। यह भी स्मरण रखें कि सभी त्रिज्यखंडों के कोणों का योग ठीक 360° होना चाहिए।200 विद्यार्थियों के अंक इस प्रकार वर्गीकृत हैं: 10–20 → 12, 20–30 → 28, 30–40 → 46, 40–50 → 54, 50–60 → 38, 60–70 → 22। इस बंटन का माध्यिका वर्ग है:
उत्तर देखें
उत्तर: C — 40–50
"से कम" संचयी बारंबारता बनाइए: 12, 40, 86, 140, 178, 200। अब N ÷ 2 = 200 ÷ 2 = 100। 40 अंक तक संचयी बारंबारता 86 है (100 से कम) और 50 अंक तक 140 (100 से अधिक), अतः 100वाँ विद्यार्थी वर्ग 40–50 में है — यही माध्यिका वर्ग है। सूत्र लगाने पर माध्यिका = L + [(N/2 − cf) ÷ f] × h = 40 + [(100 − 86) ÷ 54] × 10 = 40 + 2.59 = 42.59 अंक। यहाँ 40–50 बहुलक वर्ग भी है क्योंकि उसकी बारंबारता सर्वाधिक, 54 है।आँकड़ा-समूह पर विचार करें: 2, 4, 4, 4, 5, 5, 7, 9।
निम्नलिखित कथनों की जाँच करें:
1. इस आँकड़े की माध्यिका 5 है।
2. इस आँकड़े का परिसर 9 है।
कौन-सा/से कथन सही है/हैं?उत्तर देखें
उत्तर: D — न 1, न 2
दोनों कथन गलत हैं। कथन 1: n = 8 सम है, अतः माध्यिका क्रम में 4थे व 5वें मानों का औसत है, अर्थात् (4 + 5) ÷ 2 = 4.5, 5 नहीं। मान 5 तो माध्य है (योग 40 ÷ 8), जिससे कथन उसे भ्रमित कर रहा है। कथन 2: परिसर = अधिकतम − न्यूनतम = 9 − 2 = 7, 9 नहीं; कथन ने अंतर के स्थान पर केवल सबसे बड़ा मान बता दिया है। पूर्णता हेतु: यहाँ बहुलक 4 है (तीन बार आता है), और चूँकि बहुलक 4 < माध्यिका 4.5 < माध्य 5, बंटन धनात्मक विषम है।डिजिटल व्यक्तिगत डेटा संरक्षण (DPDP) अधिनियम, जो भारत में व्यक्तिगत आँकड़ों के प्रबंधन हेतु सहमति-आधारित नियम बनाता है और "डेटा न्यासी" व "डेटा प्रधान" शब्दों का प्रयोग करता है, किस वर्ष अधिनियमित हुआ?
उत्तर देखें
उत्तर: A — 2023
डिजिटल व्यक्तिगत डेटा संरक्षण अधिनियम 2023 में अधिनियमित हुआ। इस श्रृंखला के पड़ावों को न मिलाएँ: आधार अधिनियम 2016 का है; उच्चतम न्यायालय का पुट्टस्वामी निर्णय, जिसने निजता को अनुच्छेद 21 के अंतर्गत मूल अधिकार माना, 2017 का है और उसने आँकड़ा-संरक्षण कानून का संवैधानिक आधार दिया; सूचना प्रौद्योगिकी अधिनियम 2000 का है (2008 में संशोधित) और वही भारत का प्रमुख साइबर कानून है; तथा राष्ट्रीय आँकड़ा साझाकरण एवं अभिगम्यता नीति (NDSAP), जिसने भारत में मुक्त-आँकड़ा आंदोलन आरंभ किया, 2012 की है।नामांकन प्रवृत्तियों का अध्ययन करता एक शोधार्थी अखिल भारतीय उच्च शिक्षा सर्वेक्षण (AISHE) तथा जनगणना 2011 की प्रकाशित तालिकाएँ डाउनलोड करके विश्लेषण करता है। आँकड़ों के स्रोत के दृष्टिकोण से शोधार्थी प्रयोग कर रहा है:
उत्तर देखें
उत्तर: B — द्वितीयक आँकड़े, क्योंकि वे पहले किसी अन्य अभिकरण द्वारा किसी अन्य प्रयोजन से एकत्र किए गए थे
द्वितीयक आँकड़ों की निर्णायक जाँच यह नहीं है कि फ़ाइल कौन लाया, बल्कि यह कि मूलतः किसने और किस प्रयोजन से एकत्र की। AISHE तालिकाएँ शिक्षा मंत्रालय और जनगणना तालिकाएँ भारत के महापंजीयक अपने प्रशासनिक प्रयोजनों हेतु संकलित करते हैं; अतः उन्हें पुनःप्रयोग करने वाला शोधार्थी द्वितीय उपयोगकर्ता है, और ये द्वितीयक आँकड़े हैं — सस्ते, शीघ्र, परंतु प्रयोग से पूर्व उपयुक्तता, पर्याप्तता व विश्वसनीयता का निर्णय आवश्यक। विकल्प (क) डाउनलोड करने को प्रत्यक्ष संग्रहण समझ लेता है। विकल्प (ग) व (घ) आँकड़ों का गलत वर्णन करते हैं: नामांकन की गणनाएँ मात्रात्मक हैं, और ज़िलों के नाम नामिक होते हुए भी उनसे जुड़े नामांकन अंक अनुपात-मापनी के हैं।