व्यावसायिक सांख्यिकी II: शोध, प्रतिचयन एवं परिकल्पना परीक्षण
1. शोध: संकल्पना, प्रकार तथा अभिकल्प
शोध तथ्य स्थापित करने या नए निष्कर्ष तक पहुँचने की व्यवस्थित जिज्ञासा है। उसके प्रकार एक साथ अनेक अक्षों पर वर्गीकृत हैं, और प्रश्न इनमें से कोई भी प्रयोग कर सकता है: उद्देश्य से, मूल अथवा शुद्ध शोध में जो ज्ञान बढ़ाता है और अनुप्रयुक्त शोध में जो व्यावहारिक समस्या हल करता है; दृष्टिकोण से, मात्रात्मक कार्य में जो मापता है और गुणात्मक में जो व्याख्या करता है; लक्ष्य से, वर्णनात्मक, अन्वेषणात्मक, व्याख्यात्मक तथा प्रयोगात्मक अध्ययनों में।
| अभिकल्प | उद्देश्य | विशिष्ट लक्षण |
|---|---|---|
| अन्वेषणात्मक | अस्पष्ट समस्या स्पष्ट करना व परिकल्पनाएँ उत्पन्न करना | लोचदार व असंरचित; साहित्य सर्वेक्षण, विशेषज्ञ साक्षात्कार, वृत्त अध्ययन |
| वर्णनात्मक | किसी समष्टि या परिघटना की विशेषताओं का यथावत् वर्णन | संरचित; कौन, क्या, कहाँ व कितना का उत्तर, क्यों का नहीं |
| कारणात्मक, अथवा प्रयोगात्मक | यह स्थापित करना कि एक चर का परिवर्तन दूसरे में परिवर्तन उत्पन्न करता है | स्वतंत्र चर का प्रहस्तन और शेष का नियंत्रण, आदर्शतः नियंत्रण समूह व यादृच्छिक नियतन सहित |
2. आँकड़े: संग्रहण तथा वर्गीकरण
प्राथमिक आँकड़े हाथ के उद्देश्य हेतु एकत्र किए जाते हैं — प्रेक्षण, साक्षात्कार, प्रश्नावली या प्रयोग से — और वे वर्तमान व विशिष्ट हैं पर महँगे। द्वितीयक आँकड़े पहले से विद्यमान हैं, किसी अन्य ने किसी अन्य उद्देश्य से एकत्र किए — प्रकाशित सांख्यिकी, कंपनी अभिलेख, पूर्ववर्ती अध्ययन — और वे सस्ते व शीघ्र हैं पर वर्तमान अध्ययन को अपेक्षित परिभाषाओं या अवधि में न बैठ सकते हैं। प्रश्नावली उत्तरदाता भरता है; अनुसूची गणनाकार भरता है, इसीलिए अनुसूचियाँ वहाँ काम करती हैं जहाँ साक्षरता कम हो और प्रश्नावलियाँ नहीं।
आँकड़े उस मापनी से वर्गीकृत होते हैं जिस पर वे मापे गए, और मापनी तय करती है कि कौन-सी सांख्यिकी वैध है — इसीलिए चारों मापनियाँ अलंकार नहीं, परीक्षा-योग्य हैं।
| मापनी | क्या दर्ज करती है | उदाहरण | कौन-सा औसत सार्थक |
|---|---|---|---|
| नामिक | बिना क्रम की श्रेणियाँ | लिंग, क्षेत्र, चुना गया ब्रांड | केवल बहुलक |
| क्रमिक | क्रम सहित पर बिना निश्चित अंतराल की श्रेणियाँ | कोटियाँ, संतुष्टि निकृष्ट से उत्कृष्ट तक | माध्यिका व बहुलक |
| अंतराल | समान अंतराल पर मनमाना शून्य | सेल्सियस में तापमान, पंचांग वर्ष | माध्य, माध्यिका, बहुलक — पर अनुपात निरर्थक |
| अनुपात | समान अंतराल व वास्तविक शून्य | आय, भार, विक्रय मात्रा | सब कुछ, गुणोत्तर माध्य सहित |
3. प्रतिचयन: प्रायिकता व अप्रायिकता विधियाँ
जनगणना प्रत्येक इकाई की परीक्षा करती है; प्रतिदर्श कुछ की परीक्षा कर शेष का अनुमान लगाता है। प्रतिचयन इसलिए प्रयुक्त होता है कि वह सस्ता है, शीघ्र है, कभी एकमात्र संभावना — हर बल्ब को नष्ट होने तक जाँचने पर बेचने को कोई नहीं बचता — और प्रायः अधिक शुद्ध, क्योंकि छोटा सुचालित अध्ययन विशाल असावधान अध्ययन से कम अप्रतिचयन त्रुटियाँ करता है। जो विभाजन महत्वपूर्ण है वह यह कि प्रत्येक इकाई के चुने जाने की ज्ञात, शून्येतर संभावना है या नहीं।
| विधि | इकाइयाँ कैसे चुनी जाती हैं | कब उचित है |
|---|---|---|
| सरल यादृच्छिक | प्रत्येक इकाई व प्रत्येक संयोजन समसंभाव्य, लॉटरी या यादृच्छिक संख्याओं से | पूर्ण सूची वाली समरूप समष्टि |
| स्तरित | समरूप स्तरों में बाँटिए, प्रत्येक के भीतर यादृच्छिक प्रतिदर्श लीजिए | विषमरूप समष्टि; प्रत्येक स्तर का प्रतिनिधित्व सुनिश्चित और त्रुटि कम |
| क्रमबद्ध | यादृच्छिक आरंभ, फिर प्रत्येक k-वीं इकाई | लंबी क्रमबद्ध सूची; विफल यदि सूची में k से मिलता चक्र हो |
| गुच्छ | विषमरूप गुच्छों में बाँटिए, पूरे गुच्छ यादृच्छिक चुनिए | बिना सूची की बिखरी समष्टि; सस्ता, परिशुद्धता की कीमत पर |
| बहु-चरण | गुच्छ चुनिए, फिर चुने गुच्छों के भीतर इकाइयाँ | बड़े राष्ट्रीय सर्वेक्षण |
अप्रायिकता विधियाँ किसी इकाई को ज्ञात संभावना नहीं देतीं, अतः कोई मानक त्रुटि नहीं निकल सकती और परिणाम कथित विश्वास के साथ सामान्यीकृत नहीं हो सकते। सुविधा प्रतिचयन जो हाथ में हो उसे लेता है; निर्णय अथवा सोद्देश्य प्रतिचयन उसे जिसे शोधकर्ता प्रतिरूपी समझे; कोटा प्रतिचयन प्रत्येक श्रेणी से संख्या निश्चित कर उसे सुविधा से भरता है; हिमगोल प्रतिचयन प्रत्येक उत्तरदाता से अगले का नाम पूछता है, और छिपी समष्टियों तक पहुँचा ही इसी से जाता है।
4. प्रतिचयन बंटन, केंद्रीय सीमा प्रमेय तथा आकलन
समष्टि से आकार n का प्रत्येक संभव प्रतिदर्श लीजिए और प्रत्येक का माध्य निकालिए; उन माध्यों का बंटन माध्य का प्रतिचयन बंटन है। उसका अपना माध्य समष्टि माध्य के बराबर है, और उसका मानक विचलन — जिसे मानक त्रुटि कहते हैं — σ/√n है। मानक त्रुटि अनुमान का पूरा आधार है: वह बताती है कि प्रतिदर्श माध्य सत्य से कितनी दूर बैठने की संभावना है, और वह प्रतिदर्श आकार के वर्गमूल के साथ सिकुड़ती है, अतः प्रतिदर्श चौगुना करने से त्रुटि आधी होती है।
आकलन प्रतिदर्श का प्रयोग समष्टि प्राचल के विषय में कुछ कहने हेतु करता है। बिंदु आकलन एक अकेला आँकड़ा है — समष्टि माध्य हेतु प्रतिदर्श माध्य। अंतराल आकलन कथित विश्वास सहित एक परास देता है: प्रतिदर्श माध्य ± z × मानक त्रुटि, जहाँ 95% विश्वास हेतु z = 1.96 और 99% हेतु 2.58। विश्वास बढ़ने पर अंतराल चौड़ा होता है और प्रतिदर्श बढ़ने पर संकरा, और अच्छा आकलक अनभिनत, संगत, दक्ष व पर्याप्त होता है — चार शब्द जो पेपर नाम से पूछता है।
5. परिकल्पना परीक्षण: तर्क, फिर सात परीक्षण
परिकल्पना परीक्षण शून्य परिकल्पना H₀ से आरंभ होता है, प्रायः यह कि कोई अंतर या प्रभाव नहीं है, और पूछता है कि क्या प्रतिदर्श का प्रमाण H₀ के अंतर्गत इतना असंभाव्य है कि उसे संयोग नहीं माना जा सकता। सार्थकता स्तर α सत्य H₀ को अस्वीकार करने की प्रायिकता है — प्रकार I त्रुटि — और पहले से निश्चित होता है, प्रायः 5% पर। असत्य H₀ को अस्वीकार न करना प्रकार II त्रुटि है, प्रायिकता β सहित, और परीक्षण की शक्ति 1 − β है। p-मान कम से कम इतने चरम प्रमाण की प्रायिकता है यदि H₀ सत्य हो; α से नीचे गिरे तो अस्वीकार कीजिए।
| परीक्षण | किस प्रश्न का उत्तर | आँकड़े व मान्यताएँ |
|---|---|---|
| z-परीक्षण | क्या माध्य या अनुपात किसी दावे से भिन्न है, या दो परस्पर? | बड़ा प्रतिदर्श (n ≥ 30) या ज्ञात समष्टि σ; केंद्रीय सीमा प्रमेय से प्रसामान्य |
| t-परीक्षण | वही, छोटे प्रतिदर्श हेतु | n < 30, σ अज्ञात व प्रतिदर्श से आकलित; प्रसामान्य समष्टि; समान इकाइयों पर पहले-बाद हेतु युग्मित रूप |
| ANOVA (F-परीक्षण) | क्या तीन या अधिक समूह-माध्य भिन्न हैं? | समान प्रसरण वाली प्रसामान्य समष्टियाँ; समूहों के बीच के प्रसरण की उनके भीतर के प्रसरण से तुलना |
| काई-वर्ग | क्या प्रेक्षित बारंबारताएँ अपेक्षित से मिलती हैं, या दो गुण स्वतंत्र हैं? | आसंग सारणी में श्रेणीगत गिनतियाँ; प्रत्येक कोष्ठ की अपेक्षित बारंबारता कम से कम पाँच |
| मैन-व्हिटनी U | क्या दो स्वतंत्र समूह भिन्न हैं? | क्रमिक आँकड़े या अप्रसामान्य समष्टियाँ; स्वतंत्र-प्रतिदर्श t-परीक्षण का अप्राचलिक प्रतिस्थापी |
| क्रुस्कल-वालिस H | क्या तीन या अधिक स्वतंत्र समूह भिन्न हैं? | क्रमिक या अप्रसामान्य; एक-मार्गी ANOVA का अप्राचलिक प्रतिस्थापी |
| कोटि सहसंबंध | क्या दो कोटि-क्रम संबद्ध हैं? | क्रमिक आँकड़े; स्पीयरमैन के ρ की सार्थकता का परीक्षण |
6. प्रतिवेदन लेखन
शोध प्रतिवेदन यह संप्रेषित करता है कि क्या पूछा गया, कैसे खोजा गया, क्या पाया गया और उससे क्या निकलता है, ऐसे रूप में जिसे पाठक जाँच सके। उसकी मानक संरचना प्रारंभिक पृष्ठों — शीर्षक, आभार, विषय-सूची, सारणियों की सूची, सारांश अथवा कार्यकारी सार — से होकर मुख्य भाग में, और फिर संदर्भों व परिशिष्टों के अंत-भाग तक चलती है।
- प्रस्तावना — समस्या, उसकी पृष्ठभूमि, लक्ष्य तथा परिकल्पनाएँ।
- साहित्य समीक्षा — जो पहले से ज्ञात है और वह अंतराल कहाँ है जिसे यह अध्ययन भरता है।
- कार्यप्रणाली — अभिकल्प, समष्टि, प्रतिचयन विधि व आकार, उपकरण, प्रक्रिया तथा प्रयुक्त परीक्षण, इतने विस्तार में कि अध्ययन दोहराया जा सके।
- विश्लेषण व निष्कर्ष — परिणाम, सारणियों व आकृतियों सहित, बिना व्याख्या के प्रतिवेदित।
- विवेचन व निष्कर्ष — लक्ष्यों व पूर्व साहित्य के सामने निष्कर्षों का अर्थ, सीमाएँ, तथा संस्तुतियाँ।
- संदर्भ व परिशिष्ट — उद्धृत प्रत्येक स्रोत, एक सुसंगत शैली में, तथा प्रश्नावली, कच्ची सारणियाँ व गणनाएँ जो मुख्य भाग को अटा देतीं।
मुख्य बिंदु
- वर्णनात्मक शोध वर्णन करता है और व्याख्या नहीं कर सकता; लक्ष्य में प्रभाव, असर व कारण शब्द प्रयोगात्मक अभिकल्प की माँग करते हैं।
- स्तरित प्रतिचयन परिशुद्धता हेतु प्रत्येक समरूप समूह से लेता है; गुच्छ प्रतिचयन मितव्ययिता हेतु पूरे विषमरूप समूह लेता है। दोनों समष्टि को विपरीत कारणों से बाँटते हैं।
- मानक त्रुटि σ/√n समस्त अनुमान का आधार है, और केंद्रीय सीमा प्रमेय ही कारण है कि प्रसामान्य सारणियाँ प्रतिदर्श माध्यों पर लागू होती हैं, समष्टि चाहे कैसी भी दिखे।
- H₀ को अस्वीकार न कर पाना अपर्याप्त प्रमाण है, कभी यह नहीं कि H₀ सत्य है; प्रकार I त्रुटि सत्य शून्य को अस्वीकार करती है और उसकी प्रायिकता सार्थकता स्तर है।
- श्रेणियों में गिनतियाँ अर्थात् काई-वर्ग; फिर समूह गिनिए और पूछिए कि आँकड़े प्रसामान्य हैं या नहीं — मैन-व्हिटनी t-परीक्षण के लिए वही है जो क्रुस्कल-वालिस ANOVA के लिए।
अभ्यास प्रश्न (9)
उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।
कोई शोधकर्ता पाँच-बिंदु क्रमिक मापनी पर मापे गए ग्राहक-संतुष्टि अंकों की चार शाखाओं में तुलना करना चाहता है। उपयुक्त परीक्षण है:
उत्तर देखें
उत्तर: A — क्रुस्कल-वालिस H परीक्षण
तीनों प्रश्न क्रम से लगाइए। आँकड़े श्रेणियों में गिनतियाँ नहीं, अंक हैं, अतः काई-वर्ग बाहर। चार समूह हैं, अतः कोई दो-समूह परीक्षण — मैन-व्हिटनी या कोई t-परीक्षण — बाहर। मापनी क्रमिक है, अतः आँकड़ों को प्रसामान्य व अंतराल-मापित नहीं माना जा सकता, जो ANOVA को बाहर करता है और तीन या अधिक स्वतंत्र समूहों हेतु उसके अप्राचलिक प्रतिस्थापी की ओर इंगित करता है: क्रुस्कल-वालिस। मैन-व्हिटनी उसी विचार का दो-समूह रूप है, और युग्मित t-परीक्षण हेतु समान इकाइयों का दो बार मापन चाहिए, जो चार अलग शाखाएँ नहीं हैं।जो शून्य परिकल्पना वस्तुतः सत्य हो उसे अस्वीकार करना है:
उत्तर देखें
उत्तर: A — प्रकार I त्रुटि, जिसकी प्रायिकता सार्थकता स्तर के बराबर है
दोनों त्रुटियाँ इससे परिभाषित हैं कि निर्णय किस दिशा में ग़लत जाता है। सत्य शून्य परिकल्पना को अस्वीकार करना प्रकार I त्रुटि है, और उसकी प्रायिकता α है, वह सार्थकता स्तर जो शोधकर्ता पहले से निश्चित करता है — 5% चुनने का अर्थ इस भूल की बीस में एक संभावना स्वीकार करना है। असत्य शून्य परिकल्पना को अस्वीकार न कर पाना प्रकार II त्रुटि है, प्रायिकता β सहित, और परीक्षण की शक्ति 1 − β है, वास्तविक प्रभाव को सही पकड़ने की संभावना। मानक त्रुटि प्रतिचयन बंटन के फैलाव का माप है, किसी निर्णय-त्रुटि की प्रायिकता नहीं, अतः अंतिम विकल्प दो असंबद्ध राशियों को मिला देता है।किसी ज़िले का सर्वेक्षण यादृच्छिक रूप से दस गाँव चुनता है और प्रत्येक में हर घर का साक्षात्कार करता है। यह है:
उत्तर देखें
उत्तर: A — गुच्छ प्रतिचयन
समष्टि को समूहों — गाँवों — में बाँटा गया है और कुछ पूरे समूह यादृच्छिक चुनकर उनके भीतर की प्रत्येक इकाई की परीक्षा की गई है। यही गुच्छ प्रतिचयन है, जो मितव्ययिता हेतु तब चुना जाता है जब समष्टि बिखरी हो और घरों की कोई सूची न हो। स्तरित प्रतिचयन ज़िले को समरूप स्तरों में बाँटकर प्रत्येक स्तर से घर लेता, अधिकांश गाँवों को पूरी तरह छोड़ता नहीं। क्रमबद्ध प्रतिचयन यादृच्छिक आरंभ के बाद क्रमबद्ध सूची से प्रत्येक k-वीं इकाई लेता है, और कोटा प्रतिचयन अप्रायिकता विधि है जो निश्चित श्रेणी-गिनतियाँ सुविधा से भरती है, और इनमें से कोई यहाँ वर्णित नहीं।किसी समष्टि का मानक विचलन 20 है। 100 के प्रतिदर्श के माध्य की मानक त्रुटि है:
उत्तर देखें
उत्तर: A — 2
माध्य की मानक त्रुटि समष्टि मानक विचलन में प्रतिदर्श आकार के वर्गमूल का भाग है, σ/√n = 20/√100 = 20/10 = 2। वर्गमूल के बजाय स्वयं n से भाग देने पर 0.2 आता है, जो मानक चूक है और त्रुटि को दस गुना कम बताती है। आँकड़े को 20 पर छोड़ना व्यक्तिगत मानों के फैलाव को प्रतिदर्श माध्यों के फैलाव से मिला देता है, जो सदा छोटा होता है क्योंकि औसत लेना विचरण को रद्द करता है। भाग के बजाय गुणा करने पर 200 आता है और किसी बात का वर्णन नहीं। वर्गमूल ही कारण है कि प्रतिदर्श चौगुना करने से त्रुटि केवल आधी होती है।किसी सर्वेक्षण की गिनतियों से यह परखने हेतु कि ब्रांड-वरीयता क्रेता के आयु-वर्ग से स्वतंत्र है या नहीं, उपयुक्त परीक्षण है:
उत्तर देखें
उत्तर: A — स्वतंत्रता का काई-वर्ग परीक्षण
यहाँ दोनों चर श्रेणीगत हैं — ब्रांड व आयु-वर्ग — और आँकड़े इस बात की गिनतियाँ हैं कि प्रत्येक संयोजन में कितने क्रेता आते हैं, आसंग सारणी में रखी हुई। यही ठीक वह स्थिति है जिसे स्वतंत्रता का काई-वर्ग परीक्षण सँभालता है: वह प्रेक्षित गिनतियों की उन गिनतियों से तुलना करता है जो दोनों गुण असंबद्ध होते तो अपेक्षित होतीं। t-परीक्षण व ANOVA किसी मापित चर के माध्यों की समूहों में तुलना करते हैं, और यहाँ कोई मापित चर नहीं। स्पीयरमैन का कोटि सहसंबंध दो क्रमिक कोटि-क्रमों के बीच संबद्धता मापता है, और ब्रांड-वरीयता नामिक है जिसमें क्रम देने को कोई क्रम नहीं।सेल्सियस डिग्री में मापा गया तापमान किस मापन-मापनी पर है?
उत्तर देखें
उत्तर: A — अंतराल
सेल्सियस में समान अंतराल हैं — 10 से 20 डिग्री का अंतर 20 से 30 जितना ही है — किंतु उसका शून्य एक मनमाना बिंदु है, जल का हिमांक, तापमान का अभाव नहीं। यह उसे अंतराल मापनी बनाता है, जिस पर अंतर सार्थक हैं पर अनुपात नहीं: 20 डिग्री 10 डिग्री से दुगुना गर्म नहीं। अनुपात मापनी हेतु वास्तविक शून्य चाहिए, जैसा आय या भार में है। क्रमिक आँकड़े बिना समान अंतराल के क्रम रखते हैं, और नामिक आँकड़े अक्रमित श्रेणियाँ हैं; डिग्री में तापमान दोनों में से कोई नहीं, क्योंकि उसके अंतराल समान हैं और वह पूर्णतः क्रमित है।0.05 सार्थकता स्तर पर किसी परीक्षण से 0.08 का p-मान मिलता है। सही निष्कर्ष है कि:
उत्तर देखें
उत्तर: A — शून्य परिकल्पना को अस्वीकार करने हेतु पर्याप्त प्रमाण नहीं है
नियम है कि जब p-मान चुने गए सार्थकता स्तर से नीचे गिरे तब शून्य परिकल्पना अस्वीकार कीजिए। यहाँ 0.08, 0.05 से अधिक है, अतः शून्य अस्वीकृत नहीं — और इसे कहने का एकमात्र सच्चा ढंग यह है कि प्रमाण अपर्याप्त है, क्योंकि जो परीक्षण अस्वीकार न कर पाए उसने शून्य को सत्य नहीं दिखाया, केवल असत्य दिखाने में विफल रहा। शून्य को सिद्ध बताना मानक ग़लत पाठ है और इस ढाँचे में कभी सही नहीं। p-मान कम से कम इतने चरम प्रमाण की प्रायिकता है यदि शून्य सत्य हो; वह किसी भी परिकल्पना के सत्य होने की प्रायिकता नहीं, जो अंतिम विकल्प का दावा है।जो शोध अस्पष्ट रूप से समझी समस्या को स्पष्ट करने और बाद के अध्ययन हेतु परिकल्पनाएँ उत्पन्न करने के लिए किया जाए वह है:
उत्तर देखें
उत्तर: A — अन्वेषणात्मक शोध
अन्वेषणात्मक शोध जिज्ञासा के कार्यक्रम में सबसे पहले आता है: उसका उद्देश्य समस्या को इतना तीखा परिभाषित करना है कि परिकल्पनाएँ कही जा सकें, और अतः वह लोचदार व असंरचित होता है, साहित्य सर्वेक्षणों, विशेषज्ञ साक्षात्कारों व वृत्त अध्ययनों पर निर्भर। वर्णनात्मक शोध उसके बाद संरचित अभिकल्प से विशेषताओं को यथावत् मापता है, और प्रयोगात्मक शोध किसी चर का प्रहस्तन कर कथित परिकल्पना परखता है — दोनों मानते हैं कि समस्या पहले ही परिभाषित है। अनुप्रयुक्त शोध चरण नहीं, उद्देश्य से वर्गीकरण है, और अन्वेषणात्मक अध्ययन मूल या अनुप्रयुक्त दोनों हो सकता है।शोध प्रतिवेदन में संस्तुतियाँ उचित रूप से रखी जाती हैं:
उत्तर देखें
उत्तर: A — विवेचन व निष्कर्षों में
निष्कर्ष खंड यह प्रतिवेदित करता है कि आँकड़ों ने क्या दिखाया और व्याख्या से मुक्त रखा जाता है, ताकि शोधकर्ता के पाठ से असहमत पाठक भी परिणामों का प्रयोग कर सके। संस्तुतियाँ इस विषय में शोधकर्ता का निर्णय हैं कि निष्कर्षों से क्या होना चाहिए, और वे विवेचन व निष्कर्षों के साथ आती हैं, जहाँ परिणाम लक्ष्यों व पूर्व साहित्य के सामने रखे जाते हैं। साहित्य समीक्षा अध्ययन से पहले जो ज्ञात था उसका सर्वेक्षण करती है, और कार्यप्रणाली बताती है कि अध्ययन कैसे किया गया; दोनों में से कोई भी आगे क्या करना चाहिए इस सलाह का स्थान नहीं।