आँकड़ा-भंडारण, आँकड़ा-खनन, बिग डेटा व NoSQL

यह अध्याय इकाई 4 के विश्लेषिकी-पक्ष को ढकता है, जिसका GATE CS में कोई समतुल्य नहीं: संरचित ऐतिहासिक विश्लेषण हेतु आँकड़ा-भंडारण व OLAP, आँकड़ा-खनन की वर्गीकरण/गुच्छन/साहचर्य तकनीकें (जो वास्तव में मशीन-अधिगम के क्षेत्र में पहुँचती हैं व उन्हें केवल नाम-सूचीबद्ध करने के बजाय सही ढंग से आधारित होना चाहिए), तथा बिग डेटा/NoSQL तंत्र जो उन आँकड़ा-आयतनों व आकारों हेतु बने हैं जिनके लिए संबंधात्मक इंजन कभी अभिकल्पित नहीं हुआ था।

आँकड़ा-भंडारण, प्रत्यय-पदानुक्रम, OLAP व OLTP

OLTP बनाम OLAP
गुणOLTP (प्रचालनात्मक)OLAP (विश्लेषणात्मक)
उद्देश्यदैनंदिन लेन-देन: प्रविष्टि, अद्यतन, छोटे वाचननिर्णयन हेतु ऐतिहासिक, संचित विश्लेषण
स्कीमाअत्यधिक सामान्यीकृत (3NF/BCNF), तेज़, सुरक्षित लेखन हेतु अतिरेक न्यूनतम करते हुएअ-सामान्यीकृत तारा/हिम-वल्लरी स्कीमा — संख्यात्मक मापों वाली केंद्रीय तथ्य-सारणी, चतुर्दिक आयाम-सारणियों से संयोजित
मानक संक्रियाएक पंक्ति की प्रविष्टि/अद्यतनप्रत्यय-पदानुक्रम (उदा० दिन → माह → वर्ष) के आर-पार रोल-अप/ड्रिल-डाउन/स्लाइस/डाइस
🎯 भंडार जान-बूझकर अ-सामान्यीकृत क्यों है
सामान्यीकरण अतिरेक व अद्यतन-विसंगतियाँ न्यूनतम करता है, जो तब महत्व रखता है जब आँकड़ा निरंतर लिखा जा रहा हो (OLTP)। भंडार इसके बजाय लिखे जाने से कहीं अधिक पढ़ा जाता है (लेन-देनी रूप से अद्यतित होने के बजाय ETL — निष्कर्षण, रूपांतरण, लोडन — से आवधिक रूप से लोड होता), अतः प्राथमिकता पलट जाती है: अ-सामान्यीकृत तारा-स्कीमा विश्लेषणात्मक प्रश्न प्रति कहीं कम संयोजनों हेतु कुछ अतिरेक का व्यापार करता है, जो ठीक वही है जो लाखों पंक्तियों पर संचित प्रश्नों को उपयोगी होने योग्य तेज़ बनाता है।

आँकड़ा-खनन: साहचर्य नियम, वर्गीकरण व गुच्छन

  • साहचर्य नियम खनन लेन-देन आँकड़े में 'यदि A तो B' आकार के प्रतिरूप खोजता है, समर्थन (A व B दोनों वाले सभी लेन-देनों का भाग — प्रतिरूप कितना आम है) व विश्वास (A वाले लेन-देनों में से भी B वाले का भाग — A उपस्थित होने पर नियम कितना विश्वसनीय है) से मूल्यांकित; मानक Apriori कलनविधि इस तथ्य का लाभ उठाती है कि किसी बारंबार आइटमसमुच्चय का हर उपसमुच्चय स्वयं बारंबार होना ही चाहिए, खोज-स्थान छाँटने हेतु।
  • वर्गीकरण (पर्यवेक्षित — लेबल-युक्त उदाहरणों पर प्रशिक्षित) किसी नए दृष्टांत को पूर्वनिर्धारित श्रेणियों के स्थिर समुच्चय में से एक सौंपता है: निर्णय-वृक्ष, नैवे बेज़ व सपोर्ट वेक्टर मशीन मानक वर्गीकारक हैं, प्रत्येक का मूल्यांकन उस आँकड़े पर नहीं जिस पर वह प्रशिक्षित था, बल्कि रोके गए (परीक्षण) आँकड़े पर सटीकता से।
  • गुच्छन (अपर्यवेक्षित — कोई लेबल नहीं दिया गया) दृष्टांतों को केवल समानता से समूहित करता है, श्रेणियाँ बताए जाने के बजाय खोजते हुए — k-माध्य (विभाजन-आधारित, पहले से चुना k चाहिए) व पदानुक्रमिक गुच्छन (डेंड्रोग्राम बनाता है, पहले से k नहीं चाहिए) दो मानक कुल हैं; धारण करने योग्य मौलिक रेखा यह है कि वर्गीकरण को लेबल-युक्त प्रशिक्षण-आँकड़ा चाहिए और गुच्छन को नहीं।

समाश्रयण, SVM, KNN, HMM व लिंक/अनुक्रम/सामाजिक-संजाल विश्लेषण

  • समाश्रयण एक सतत संख्यात्मक निर्गम (घर की कीमत) की भविष्यवाणी करता है, विविक्त श्रेणी की नहीं, जो वह रेखा है जो इसे वर्गीकरण से पृथक करती है — वही पर्यवेक्षित-अधिगम यंत्रावली (लेबल-युक्त प्रशिक्षण-आँकड़े पर प्रतिरूप फिट करना) भिन्न प्रकार के लक्ष्य पर लक्षित है।
  • सपोर्ट वेक्टर मशीन (SVM): वह वर्गीकारक जो हर वर्ग के निकटतम बिंदुओं (सपोर्ट वेक्टर) से हाशिया (लंबवत दूरी) अधिकतम करने वाला अतिसमतल खोजता है — वर्गों को सही ढंग से पृथक करने वाले सभी अतिसमतलों में से, अधिकतम-हाशिए वाला अनदेखे आँकड़े पर सर्वोत्तम सामान्यीकरण करता है, व कर्नल-युक्ति इसे उन आँकड़ों तक विस्तारित करती है जो अपने मूल समष्टि में रैखिक रूप से पृथक्य नहीं हैं।
  • K-निकटतम पड़ोसी (KNN): आलसी (दृष्टांत-आधारित) वर्गीकारक — यह बिल्कुल कोई स्पष्ट प्रशिक्षण/प्रतिरूप-फिटिंग नहीं करता, और इसके बजाय, प्रश्न-समय पर, नए दृष्टांत के k निकटतम प्रशिक्षण-बिंदु (किसी दूरी-मापक से) खोजता है व उनके लेबलों से मतदान कराता है; k एक अतिप्राचल है, और बहुत छोटा k शोर पर अति-फ़िट करता है जबकि बहुत बड़ा k निर्णय-सीमा धुँधली करता है।
  • छिपा मार्कोव प्रतिरूप (HMM): उस अनुक्रम का प्रतिरूपण करता है जो अवलोकित न हुई (छिपी) मार्कोव अवस्था-शृंखला से उत्पन्न हो, जहाँ हर छिपी अवस्था कुछ प्रायिकता से एक अवलोकनीय संकेत उत्सर्जित करती है — प्रयुक्त जहाँ भी वास्तविक अंतर्निहित अवस्था सीधे नहीं देखी जाती पर उसके प्रभाव देखे जाते हैं (वाक् पहचान, शब्द-भाग टैगिंग, DNA अनुक्रम विश्लेषण); विटर्बी कलनविधि अवलोकनों को देखते हुए सर्वाधिक संभाव्य छिपी अवस्था-अनुक्रम खोजती है।
  • सारांशीकरण, निर्भरता-प्रतिरूपण, लिंक विश्लेषण, अनुक्रमिक-प्रतिरूप विश्लेषण, सामाजिक संजाल विश्लेषण: सारांशीकरण आँकड़ा-समुच्चय को संहत अभिलाक्षणिक वर्णन में संकुचित करता है; निर्भरता-प्रतिरूपण चरों के बीच सार्थक प्रायिकीय निर्भरताएँ पकड़ता है; लिंक विश्लेषण संबंधों की ग्राफ-संरचना अध्ययन करता है (PageRank विहित उदाहरण); अनुक्रमिक-प्रतिरूप विश्लेषण बारंबार होने वाले क्रमित उप-अनुक्रम खोजता है (सादे साहचर्य नियमों से भिन्न, जो क्रम नज़रअंदाज़ करते हैं); सामाजिक संजाल विश्लेषण लोगों/संस्थाओं के संजालों पर ग्राफ-सैद्धांतिक माप (केंद्रीयता, समुदाय-संसूचन) लागू करता है।

बिग डेटा तंत्र: Hadoop, MapReduce, HDFS व NoSQL

बिग डेटा को रूढ़िगत रूप से 'V' से अभिलक्षित किया जाता है — आयतन (Volume), वेग (Velocity), विविधता (Variety) (व प्रायः सत्यता Veracity, मूल्य Value) — ऐसा आँकड़ा जो किसी एकल संबंधात्मक सर्वर हेतु आर्थिक रूप से सँभालने के लिए बहुत बड़ा, बहुत तेज़-आगत, या बहुत असंरचित हो। Hadoop के मूल में दो भाग हैं: HDFS (Hadoop वितरित फ़ाइल तंत्र) बहुत बड़ी फ़ाइलों को खंडों में बाँटकर व अनेक साधारण मशीनों में प्रतिकृत कर संचित करता है (आँकड़ा-हानि के बिना व्यक्तिगत मशीन-विफलता सहते हुए), तथा MapReduce एक प्रोग्रामन-प्रतिरूप है जो इस वितरित आँकड़े को दो उपयोगकर्ता-परिभाषित चरणों में प्रक्रमित करता है — एक Map चरण जो निवेश-अभिलेखों को स्वतंत्र रूप से व समांतर में कुंजी-मान युग्मों में रूपांतरित करता है, व एक Reduce चरण जो वही कुंजी साझा करने वाले सभी मानों को संचित करता है — फ़्रेमवर्क स्वयं समांतरीकरण, दोष-सहनशीलता व गणना को वहाँ ले जाना सँभालता है जहाँ आँकड़ा पहले से बैठा है (विशाल आँकड़े को केंद्रीय गणना-नोड तक ले जाने के बजाय)।

⚠️ NoSQL 'कोई स्कीमा नहीं' या 'कोई प्रश्न-क्षमता नहीं' नहीं है
'NoSQL' सामान्यतः प्रश्न-भाषाओं के शाब्दिक अभाव के बजाय 'Not Only SQL' के लिए खड़ा होता है, तथा एक के बजाय कई भिन्न आँकड़ा-प्रतिरूप ढकता है: कुंजी-मान भंडार (सरलतम — कुंजी से अपारदर्शी मान तक मानचित्र, उदा० Redis), दस्तावेज़ भंडार (अर्ध-संरचित दस्तावेज़, सामान्यतः JSON, उदा० MongoDB), स्तंभ-कुल भंडार (बहुत चौड़ी, विरल सारणियों हेतु अनुकूलित, उदा० Cassandra) व ग्राफ आँकड़ाकोश (नोड व कोर प्रथम-श्रेणी नागरिकों के रूप में, उदा० Neo4j, संबंध-भारी प्रश्नों हेतु)। अधिकांश NoSQL तंत्र क्षैतिज मापनीयता व लचीली/विकसनशील संरचना हेतु कड़े ACID लेन-देन व कठोर स्कीमा का व्यापार करते हैं — CAP प्रमेय (वितरित तंत्र एक साथ संगति, उपलब्धता व विभाजन-सहनशीलता में से अधिकतम दो की गारंटी दे सकता है) यही मानक सैद्धांतिक ढाँचा है कि यह व्यापार मापक्रम पर अपरिहार्य क्यों है।

मुख्य बिंदु

  • OLTP (सामान्यीकृत, लेखन-अनुकूलित) व OLAP (अ-सामान्यीकृत तारा-स्कीमा, वाचन/संचयन-अनुकूलित) विपरीत उद्देश्यों की सेवा करते हैं; भंडार ETL से लोड होता है, लेन-देनी रूप से अद्यतित नहीं।
  • साहचर्य नियम समर्थन व विश्वास से मापे जाते हैं; वर्गीकरण (लेबल-युक्त, विविक्त निर्गम) समाश्रयण (लेबल-युक्त, सतत निर्गम) से भिन्न है, व दोनों गुच्छन (लेबल-रहित) से भिन्न।
  • SVM हर वर्ग के निकटतम बिंदुओं से हाशिया अधिकतम करता है; KNN बिना किसी स्पष्ट प्रशिक्षण-चरण वाला आलसी, दृष्टांत-आधारित वर्गीकारक है; HMM अवलोकनीय उत्सर्जनों से किसी अनवलोकित अवस्था-शृंखला से अनुक्रमों का प्रतिरूपण करता है।
  • Hadoop का HDFS साधारण मशीनों पर प्रतिकृत खंडों में आँकड़ा संचित करता है; MapReduce स्वतंत्र Map व संचयकारी Reduce चरणों से इसे प्रक्रमित करता है, गणना को आँकड़े तक ले जाते हुए।
  • NoSQL का अर्थ 'Not Only SQL' है और यह कुंजी-मान, दस्तावेज़, स्तंभ-कुल व ग्राफ आँकड़ा-प्रतिरूप ढकता है, क्षैतिज मापक्रम हेतु कड़े ACID/कठोर स्कीमा का व्यापार करते हुए — एक CAP-प्रमेय व्यापार।

अभ्यास प्रश्न (8)

उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।

  1. आँकड़ा-भंडार की तारा-स्कीमा सामान्यतः अ-सामान्यीकृत होती है, OLTP स्कीमा के विपरीत, मुख्यतः क्योंकि:

    1. भंडार लिखे जाने से कहीं अधिक पढ़ा/संचित होता है, अतः प्रति विश्लेषणात्मक प्रश्न कम संयोजन लेखन-समय अतिरेक से अधिक महत्व रखते हैं
    2. अ-सामान्यीकरण SQL द्वारा स्वयं आवश्यक है
    3. OLTP आँकड़ाकोश बिल्कुल सामान्यीकृत नहीं किए जा सकते
    4. अ-सामान्यीकरण तथ्य-सारणी की आवश्यकता समाप्त कर देता है
    उत्तर देखें

    उत्तर: A — भंडार लिखे जाने से कहीं अधिक पढ़ा/संचित होता है, अतः प्रति विश्लेषणात्मक प्रश्न कम संयोजन लेखन-समय अतिरेक से अधिक महत्व रखते हैं

    भंडार का प्रधान कार्यभार संचयी विश्लेषणात्मक प्रश्न है, बारंबार एकल-पंक्ति लेखन नहीं, अतः कहीं कम संयोजनों हेतु कुछ अतिरेक का व्यापार सही लागत-व्यापार है — OLTP स्कीमा की प्राथमिकताओं के विपरीत।
  2. साहचर्य नियम खनन में, नियम 'A → B' का विश्वास मापता है:

    1. A वाले लेन-देनों में से B भी रखने वालों का भाग
    2. A व B दोनों वाले सभी लेन-देनों का भाग
    3. आँकड़ा-समुच्चय में लेन-देनों की कुल संख्या
    4. क्या A सख़्त कारणात्मक अर्थ में B का कारण है
    उत्तर देखें

    उत्तर: A — A वाले लेन-देनों में से B भी रखने वालों का भाग

    विश्वास लेन-देन-आँकड़े पर गणित P(B|A) है — A के उपस्थित ज्ञात होने पर नियम कितना विश्वसनीय है — जो समर्थन, P(A∩B), से भिन्न है, जो मापता है कि प्रतिरूप समग्र रूप से कितना आम है।
  3. वर्गीकरण से भिन्न, गुच्छन इससे अभिलक्षित है:

    1. कोई लेबल-युक्त प्रशिक्षण-आँकड़ा नहीं — समूह समानता से खोजे जाते हैं, पूर्वनिर्धारित श्रेणियों को नहीं सौंपे जाते
    2. सदा ठीक दो गुच्छ चाहिए
    3. केवल संख्यात्मक आँकड़े पर उपयोग करने योग्य
    4. समाश्रयण के समान
    उत्तर देखें

    उत्तर: A — कोई लेबल-युक्त प्रशिक्षण-आँकड़ा नहीं — समूह समानता से खोजे जाते हैं, पूर्वनिर्धारित श्रेणियों को नहीं सौंपे जाते

    गुच्छन अपर्यवेक्षित है — कोई लेबल-युक्त उदाहरण नहीं दिया जाता, और कलनविधि केवल समानता से समूह-संरचना खोजती है, वर्गीकरण के विपरीत, जो पहले से सही श्रेणी से लेबल किए उदाहरणों पर प्रशिक्षित होता है।
  4. सपोर्ट वेक्टर मशीन (SVM) वर्गीकारक वह पृथक्कारी अतिसमतल चुनता है जो:

    1. हर वर्ग के निकटतम बिंदुओं से हाशिया अधिकतम करता है
    2. प्रयुक्त प्रशिक्षण-उदाहरणों की संख्या न्यूनतम करता है
    3. सभी पृथक्कारी अतिसमतलों में से पूर्णतः यादृच्छिक रूप से चुना जाता है
    4. सदा निर्णय-वृक्ष के मूल विभाजन के समान होता है
    उत्तर देखें

    उत्तर: A — हर वर्ग के निकटतम बिंदुओं से हाशिया अधिकतम करता है

    दोनों वर्गों को सही ढंग से पृथक करने वाले सभी अतिसमतलों में से, वह जो हाशिया (निकटतम बिंदुओं, सपोर्ट वेक्टरों से दूरी) अधिकतम करे चुना जाता है क्योंकि वह प्रशिक्षण के दौरान न देखे गए आँकड़े पर सर्वोत्तम सामान्यीकरण करता है।
  5. K-निकटतम पड़ोसी (KNN) को 'आलसी' अधिगम कलनविधि इसलिए वर्णित किया जाता है क्योंकि:

    1. यह प्रशिक्षण के दौरान कोई स्पष्ट प्रतिरूप-फिटिंग नहीं करता व सभी गणना प्रश्न-समय तक टालता है
    2. प्रशिक्षण-समय पर यह सदा हर अन्य वर्गीकारक से धीमा है
    3. इसे बिल्कुल किसी आँकड़े की आवश्यकता नहीं
    4. यह गुच्छन कलनविधि है, वर्गीकारक नहीं
    उत्तर देखें

    उत्तर: A — यह प्रशिक्षण के दौरान कोई स्पष्ट प्रतिरूप-फिटिंग नहीं करता व सभी गणना प्रश्न-समय तक टालता है

    उत्सुक शिक्षार्थी (उदा० निर्णय-वृक्ष या SVM, जो प्रशिक्षण के दौरान स्पष्ट प्रतिरूप बनाते हैं) के विपरीत, KNN बस प्रशिक्षण-आँकड़ा संचित करता है व अपना वास्तविक काम — k निकटतम पड़ोसी खोजना — केवल तब करता है जब प्रश्न आए।
  6. MapReduce प्रोग्रामन-प्रतिरूप में, Map चरण:

    1. निवेश-अभिलेखों को स्वतंत्र रूप से व समांतर में कुंजी-मान युग्मों में रूपांतरित करता है
    2. वही कुंजी साझा करने वाले सभी मानों को संचित करता है
    3. केवल Reduce चरण पूर्ण होने के बाद चलता है
    4. एकल, गैर-वितरित मशीन की आवश्यकता रखता है
    उत्तर देखें

    उत्तर: A — निवेश-अभिलेखों को स्वतंत्र रूप से व समांतर में कुंजी-मान युग्मों में रूपांतरित करता है

    Map क्लस्टर के आर-पार स्वतंत्र रूप से व समांतर में अभिलेखों को कुंजी-मान युग्मों में रूपांतरित करता है; बाद का Reduce चरण ही वही कुंजी साझा करने वाले मानों को संचित करता है, और पूरा प्रतिरूप वितरित, न कि एकल-मशीन, निष्पादन हेतु अभिकल्पित है।
  7. निम्नलिखित में कौन मान्यता-प्राप्त NoSQL आँकड़ा-प्रतिरूप हैं? (एक से अधिक विकल्प सही हो सकते हैं।)

    1. कुंजी-मान भंडार
    2. दस्तावेज़ भंडार
    3. ग्राफ आँकड़ाकोश
    4. केवल कड़ाई से सामान्यीकृत तृतीय-सामान्य-रूप संबंधात्मक सारणियाँ
    उत्तर देखें

    उत्तर: A — कुंजी-मान भंडार; B — दस्तावेज़ भंडार; C — ग्राफ आँकड़ाकोश

    कुंजी-मान, दस्तावेज़ व ग्राफ भंडार (स्तंभ-कुल भंडार सहित) मानक NoSQL आँकड़ा-प्रतिरूप हैं; कठोर तृतीय-सामान्य-रूप संबंधात्मक सारणियाँ ठीक वह पारंपरिक प्रतिरूप हैं जिससे NoSQL तंत्र प्रस्थान करते हैं।
  8. उस प्रमेय का नाम बताइए जो कहता है कि वितरित तंत्र एक साथ संगति, उपलब्धता व विभाजन-सहनशीलता में से अधिकतम दो की ही गारंटी दे सकता है।

    संख्यात्मक उत्तर — मान टाइप करें।

    उत्तर देखें

    उत्तर: CAP theorem

    CAP प्रमेय ही वह मानक सैद्धांतिक ढाँचा है जिससे स्पष्ट होता है कि अधिकांश वितरित NoSQL तंत्र एक साथ तीनों का वचन देने के बजाय जान-बूझकर कड़ी संगति (AP चुनते हुए) या उपलब्धता (CP चुनते हुए) शिथिल क्यों करते हैं।