मशीन लर्निंग

GATE आँकड़ा विज्ञान व कृत्रिम बुद्धिमत्ता (DA) पेपर का खंड 6, तथा नामित विधियों की संख्या से इसका सबसे बड़ा खंड। यह वास्तव में एक ही शीर्षक साझा करने वाले दो विषय हैं। Supervised learning ऐसे उदाहरणों पर प्रशिक्षित होता है जिनमें से हर एक वह उत्तर भी वहन करता है जिसके विरुद्ध वह जाँचा जाता है — regression जब वह उत्तर एक संख्या हो, classification जब वह कोई श्रेणी हो — और यह अध्याय simple, multiple व ridge regression, logistic regression, k-nearest neighbour, naive Bayes, linear discriminant analysis, support vector machine, decision trees, तथा bias-variance trade-off व cross-validation से होकर गुज़रता है जो तय करते हैं कि इनमें से कोई वास्तव में generalise करता है या नहीं, साथ ही multi-layer perceptron। Unsupervised learning ऐसे उदाहरणों पर प्रशिक्षित होता है जिनमें बिलकुल कोई उत्तर संलग्न नहीं होता, और यहाँ इसे किसी बाद की सोच के बजाय अपना पूरा उपचार मिलता है: clustering (k-means, k-medoid, hierarchical) अलेबल डेटा में संरचना खोजता है, तथा dimensionality reduction, सबसे ऊपर principal component analysis, दिशाओं का एक छोटा समुच्चय खोजता है जो फिर भी अधिकांश को वर्णित करता है।

1. Regression: simple, multiple एवं ridge

Simple linear regression y = β₀ + β₁x को इस तरह फ़िट करता है कि β₀, β₁ ऐसे चुने जाएँ कि फ़िट की गई रेखा व प्रेक्षित बिंदुओं के बीच वर्ग-अवशेषों (squared residuals) का योग न्यूनतम हो (ordinary least squares)। Multiple linear regression इसे कई predictors तक बढ़ाता है, y = β₀ + β₁x₁ + ... + βₖxₖ; हर गुणांक तब उस predictor में एक-इकाई परिवर्तन हेतु y के परिवर्तन के रूप में पढ़ा जाता है, जबकि हर अन्य predictor स्थिर रखा जाए — यह उस predictor के अकेले प्रभाव से बिलकुल भिन्न कथन है।

Ridge regression least-squares उद्देश्य में एक L2 पेनल्टी, λΣβᵢ², जोड़ता है, जो हर गुणांक को शून्य की ओर उतना खींचता है जितना λ के साथ बढ़ता है। यह थोड़े bias के बदले अक्सर बड़ी variance-कमी लाता है, जो ठीक वही उपयोगी क़दम है जब predictors संख्या में अधिक हों या परस्पर सहसंबद्ध हों (multicollinearity) — उस स्थिति में ordinary least squares डेटा में छोटे बदलावों पर बुरी तरह डोलते अस्थिर गुणांक-अनुमान दे सकता है, और ridge का shrinkage उन्हें स्थिर करता है, ठीक-ठीक unbiased न रहने की क़ीमत पर।

🎯 Ridge हर गुणांक को सिकोड़ता है; यह किसी को शून्य नहीं करता
चूँकि L2 पेनल्टी पद βᵢ² हर जगह, शून्य पर भी, सहज व अवकलनीय है, वह इष्टतम जिसकी ओर यह धकेलता है गुणांकों को निरंतर रूप से सिकोड़ता है बिना किसी को कभी ठीक शून्य पर मजबूर किए — ridge regression मॉडल में हर predictor को रखता है, बस एक छोटे भार के साथ। यही ठीक कारण है कि इसे feature-selection विधि के बजाय shrinkage विधि कहा जाता है।

2. वर्गीकरण I: logistic regression, k-nearest neighbour, naive Bayes

अपने नाम के बावजूद, logistic regression एक classifier है: यह P(y=1 | x) को predictors के किसी रैखिक संयोजन के sigmoid के रूप में मॉडल करता है, और इसे least squares के बजाय likelihood अधिकतम करके (समतुल्यतः, cross-entropy loss न्यूनतम करके) प्रशिक्षित किया जाता है। k-nearest neighbour किसी नए बिंदु को प्रशिक्षण-समुच्चय के k निकटतम लेबल-युक्त बिंदुओं में बहुमत-मत से वर्गीकृत करता है, किसी दूरी-मापक से — यह बिलकुल कोई स्पष्ट प्रशिक्षण नहीं करता (एक 'lazy' learner), सारा काम भविष्यवाणी-समय पर धकेलता है, और इसकी प्रति-भविष्यवाणी लागत मॉडल-जटिलता के बजाय प्रशिक्षण-समुच्चय के आकार के साथ बढ़ती है।

Naive Bayes classification पर Bayes के प्रमेय को एक सरलीकारी ('naive') मान्यता के साथ लागू करता है: हर feature, class दिए जाने पर, हर अन्य feature से सशर्त स्वतंत्र है। वह मान्यता शायद ही ठीक-ठीक सत्य हो, पर यह एक बड़े joint distribution के आकलन को कई छोटे प्रति-feature distributions के आकलन में घटा देती है, जो सस्ता है, कम प्रशिक्षण-डेटा चाहता है, और व्यवहार में अच्छी तरह वर्गीकृत करता है, तब भी जब वह स्वतंत्रता जिसे यह मानता है दृश्यतः भंग हो रही हो।

⚠️ k-NN में बहुत छोटा k स्वतः 'अधिक सटीक' नहीं है
k = 1 प्रशिक्षण-डेटा को सबसे निकट फ़िट करता है, कम bias देते हुए, पर यह सबसे अधिक variance भी देता है: किसी भी बिंदु पर निर्णय पूरी तरह उसी एक प्रशिक्षण-उदाहरण पर निर्भर करता है जो संयोगवश निकटतम हो, अतः कोई शोर-युक्त या ग़लत-लेबल पड़ोसी भविष्यवाणी को सीधे बदल देता है। बड़ा k अधिक पड़ोसियों पर औसत लेता है, bias बढ़ाते हुए (सीमा अधिक चिकनी हो जाती है, और किसी वास्तव में तीखी सीमा को धुँधला कर सकती है) जबकि variance घटाते हुए — यह चुनाव bias-variance trade-off का सीधा उदाहरण है, न कि सबसे छोटे संभव k की तलाश।

3. वर्गीकरण II: linear discriminant analysis, support vector machine, decision trees

Linear discriminant analysis (LDA) features का वह रैखिक संयोजन खोजता है जो classes को सबसे अच्छा अलग करे — between-class scatter व within-class scatter के अनुपात को अधिकतम करते हुए — इस मान्यता के अंतर्गत कि classes (लगभग) सामान्य रूप से वितरित हैं व एक साझा covariance मैट्रिक्स रखती हैं। जहाँ वह मान्यता सत्य हो, LDA logistic regression से बेहतर प्रदर्शन कर सकता है, और यह dimensionality-reduction तकनीक का काम भी करता है, डेटा को उन दिशाओं पर प्रोजेक्ट करते हुए जो classes को सबसे अच्छा विभेदित करें, न कि, जैसा PCA करता है, class से निरपेक्ष सर्वाधिक variance की दिशाओं पर।

Support vector machine (SVM) वह hyperplane खोजता है जो classes को अधिकतम margin से अलग करे — किसी भी class के निकटतम बिंदु तक सबसे चौड़ा संभव अंतराल। केवल वे बिंदु जो ठीक उस margin पर हैं, support vectors, तय करते हैं कि hyperplane कहाँ बैठे; हर अन्य सही वर्गीकृत बिंदु को बिना उसे बिलकुल बदले हटाया या स्थानांतरित किया जा सकता है। Kernel trick किसी SVM को मूल feature स्पेस में एक अरैखिक सीमा खोजने देता है, दूरियों की गणना ऐसे करते हुए मानो डेटा को किसी बहुत उच्च-आयामी स्पेस में मैप कर दिया गया हो, उस मानचित्रण को कभी स्पष्ट रूप से बनाए बिना।

🧠 केवल support vectors ही मायने रखते हैं
यह जाँचने का एक त्वरित तरीका कि किसी बिंदु ने SVM की सीमा को प्रभावित किया या नहीं: यदि वह margin के बाहर सख्ती से बैठता है और सही वर्गीकृत है, तो नहीं किया, और उसे प्रशिक्षण-समुच्चय से हटाया जा सकता है जबकि फ़िट किया गया hyperplane ठीक वहीं रहेगा। यह ठीक विपरीत है, कहें तो, ordinary least squares के, जहाँ हर एक बिंदु फ़िट में योगदान करता है।

Decision tree प्रत्येक नोड पर उस attribute व threshold पर, जो impurity (Gini impurity या entropy से मापी गई) को सबसे अधिक घटाए, बार-बार feature स्पेस को बाँटता है, जब तक कोई रुकने-नियम न पहुँच जाए। इसे नियमों के एक समुच्चय के रूप में पढ़ना आसान है, पर प्रशिक्षण-डेटा पर पूर्ण गहराई तक उगाया गया ट्री उसके शोर को उतनी ही आसानी से फ़िट कर लेता है जितना उसके संकेत को — कम प्रशिक्षण-त्रुटि, अलेखे डेटा पर कहीं अधिक variance के साथ जोड़ी बनाते हुए — यही कारण है कि गहराई-सीमा व pruning मानक प्रति-उपाय हैं।

4. Bias-variance trade-off, cross-validation, एवं multi-layer perceptron

किसी मॉडल की नए डेटा पर अपेक्षित भविष्यवाणी-त्रुटि तीन भागों में विभाजित होती है: bias (सच्चे संबंध को पकड़ने हेतु बहुत सरल मॉडल से त्रुटि — underfitting), variance (प्रशिक्षण-डेटा के शोर को फ़िट करने जितनी संवेदनशील मॉडल से त्रुटि — overfitting), तथा irreducible noise (त्रुटि जिसे कोई मॉडल हटा नहीं सकता)। मॉडल-जटिलता बढ़ाना सामान्यतः bias घटाता है व variance बढ़ाता है, अतः दोनों एक साथ सुधरने के बजाय एक-दूसरे के विरुद्ध व्यापार करते हैं, और लक्ष्य वह जटिलता है जो उनके योग को न्यूनतम करे, अकेले किसी एक को नहीं।

💡 bias व variance की तीरंदाज़ी-लक्ष्य वाली तस्वीर
किसी लक्ष्य पर कई तीरों की कल्पना करें। उच्च bias, कम variance का अर्थ है तीरों का एक कसा हुआ गुच्छा जो सब केंद्र से हटकर एक ही स्थान पर उतरे — सुसंगत, पर सुसंगत रूप से ग़लत। कम bias, उच्च variance का अर्थ है तीर व्यापक रूप से बिखरे हों पर औसतन बुल्सआई के इर्द-गिर्द केंद्रित हों — औसतन सही, पर कोई एक शॉट अविश्वसनीय। जो मॉडल आप वास्तव में चाहते हैं वह पास-पास भी उतरता है व केंद्र के निकट भी, और जटिलता वह डायल है जो आपको इस trade-off के अनुदिश घुमाती है, इससे बचने का कोई रास्ता नहीं है।

Cross-validation उस अकेले उद्देश्य हेतु एक अलग, कभी न छुई गई परीक्षण-समुच्चय अलग रखे बिना नमूने-से-बाहर त्रुटि आँकता है। k-fold cross-validation डेटा को k लगभग बराबर folds में बाँटता है, k-1 पर प्रशिक्षित करता है व शेष एक पर जाँचता है, इसे k बार दोहराता है ताकि हर fold ठीक एक बार जाँच-समुच्चय बने, और k त्रुटि-आकलनों का औसत लेता है। Leave-one-out (LOO) cross-validation चरम स्थिति k = n है: यह सभी को छोड़कर एक उदाहरण पर प्रशिक्षित करता है, n बार, जो बहुत कम bias पर एक आकलन देता है पर folds में अधिक variance व n पूर्ण मॉडल-फ़िट की प्रशिक्षण-लागत के साथ — बड़े डेटासेट पर महँगा, फिर भी यह हर एक fold पर लगभग पूरे डेटा को प्रशिक्षण हेतु उपयोग करता है।

Multi-layer perceptron (एक feed-forward neural network) परतों को एक के ऊपर एक रखता है, हर परत पिछली परत के output का भारित योग है जो किसी अरैखिक activation फ़ंक्शन से गुज़रता है; पर्याप्त चौड़ाई की एक अकेली hidden परत के साथ भी, यह किसी compact डोमेन पर किसी भी सतत फ़ंक्शन को मनमानी सटीकता तक अनुमानित कर सकता है — universal approximation गुण। इसे backpropagation से प्रशिक्षित किया जाता है: chain rule को परत-दर-परत लागू करके यह गणित किया जाता है कि loss हर भार के साथ कैसे बदलता है, जो gradient-descent अद्यतन को फ़ीड करता है।

5. Unsupervised learning I: क्लस्टरिंग (clustering)

k-means दो चरणों को दोहराकर डेटा को k क्लस्टरों में बाँटता है: हर बिंदु को उसके निकटतम क्लस्टर-केंद्रक (centroid) को सौंपें, फिर हर केंद्रक को अब उसे सौंपे गए बिंदुओं के माध्य के रूप में फिर से गणित करें — असाइनमेंट बदलना बंद होने तक दोहराया जाता है। यह converge होता है, पर केवल एक स्थानीय इष्टतम तक जो आरंभिक केंद्रक-स्थितियों पर निर्भर करता है, और चूँकि यह माध्य का उपयोग करता है, यह outliers से ध्यान देने योग्य रूप से खिंचता है। k-medoid वही दो-चरणीय पुनरावृत्ति करता है पर किसी क्लस्टर के केंद्र को गणित माध्य के बजाय एक वास्तविक डेटा-बिंदु (medoid) तक सीमित करता है, जो outliers हेतु अधिक सुदृढ़ है, हर चरण पर सर्वोत्तम medoid की अधिक महँगी खोज की क़ीमत पर।

⚠️ k-means लगभग गोलाकार, समान आकार के क्लस्टर मानता है
चूँकि यह बिंदुओं को एक अकेले केंद्रक से दूरी के आधार पर सौंपता है, k-means परोक्ष रूप से मानता है कि क्लस्टर सुगठित व लगभग गोलाकार हैं, तुलनीय आकार व घनत्व के — यह लंबे, असमान-आकार, या non-convex क्लस्टरों पर बुरा प्रदर्शन करता है, और k को इसके चलने से पहले चुना जाना चाहिए, न कि इसके द्वारा खोजा जाना। इनमें से कोई मान्यता एल्गोरिथ्म स्वयं घोषित नहीं करता; वे तभी सामने आती हैं जब इसे ऐसे डेटा पर लागू किया जाए जो उन्हें भंग करता हो और ऐसे क्लस्टर पैदा करे जो आँख को ग़लत दिखें।

Hierarchical clustering पहले से k की माँग किए बिना नेस्टेड क्लस्टरों का एक पूरा ट्री (dendrogram) बनाता है — क्लस्टरों की संख्या बाद में ट्री को किसी चुनी ऊँचाई पर काटकर चुनी जाती है। Agglomerative (bottom-up) clustering हर बिंदु को अपना क्लस्टर मानकर आरंभ करता है और बार-बार सबसे निकट जोड़े को मिलाता है; divisive (top-down) clustering सब कुछ रखने वाले एक क्लस्टर से आरंभ करता है और बार-बार सबसे कम सुसंगत को तोड़ता है।

Agglomerative hierarchical clustering हेतु linkage मानदंड
Linkageदो क्लस्टरों के बीच दूरीप्रवृत्ति
Single-linkageकिसी भी जोड़े के बीच न्यूनतम दूरी, हर क्लस्टर से एक बिंदुनिकट बिंदुओं की एक शृंखला से दूर क्लस्टरों को जोड़ (chain) सकता है
Complete-linkage (यानी multiple-linkage)किसी भी जोड़े के बीच अधिकतम दूरी, हर क्लस्टर से एक बिंदुअधिक सुगठित, लगभग समान-आकार के क्लस्टर पैदा करता है

6. Unsupervised learning II: dimensionality reduction एवं principal component analysis

Dimensionality reduction डेटा को जितना संभव हो उतनी संरचना बनाए रखते हुए कम आयामों में पुनः-व्यक्त करता है, दोनों उद्देश्यों से — curse of dimensionality से लड़ने हेतु (आयाम बढ़ने के साथ बिंदुओं के बीच दूरियाँ कम अर्थपूर्ण होती जाती हैं, और किसी स्पेस को भरने हेतु चाहिए डेटा की मात्रा उसके साथ घातांकीय रूप से बढ़ती है) तथा उच्च-आयामी डेटा को बिलकुल दृश्यनीय बनाने हेतु।

Principal component analysis (PCA) डेटा में अधिकतम variance की लांबिक (orthogonal) दिशाएँ खोजता है, अधिकतम से न्यूनतम व्याख्यायित variance के क्रम में; ये principal components डेटा के covariance मैट्रिक्स के eigenvectors हैं (समतुल्यतः डेटा-मैट्रिक्स के singular value decomposition से भी प्राप्य), और इनमें से केवल पहले कुछ को रखना — जो कुल variance का अधिकांश व्याख्यायित करते हैं — ही वास्तव में कमी उपलब्ध कराता है, शेष को variance से मापी गई न्यूनतम संभव सूचना-हानि के साथ त्याग देता है।

⚠️ PCA class labels नहीं देखता — LDA वह तकनीक है जो देखती है
PCA पूर्णतः unsupervised है: यह पूरे डेटा में अधिकतम variance की दिशाएँ खोजता है, इस बात की कोई परवाह किए बिना कि कौन-सा बिंदु किस class का है, अतः जिस दिशा को यह पहला स्थान देता है वह आसानी से ऐसी हो सकती है जो दो classes को मिला दे जबकि कोई कम-variance दिशा उन्हें साफ़ तरह अलग कर देती। LDA (खंड 3) supervised समकक्ष है जो विशेष रूप से वह दिशा खोजने हेतु बना है जो ज्ञात classes को सबसे अच्छा अलग करे — दोनों को गड्डमड्ड करना आसान है क्योंकि दोनों डेटा को दिशाओं के एक छोटे समुच्चय पर प्रोजेक्ट करते हैं, पर वे बिलकुल भिन्न चीज़ों हेतु अनुकूलित होते हैं।
ℹ️ जब features के स्केल भिन्न हों तो PCA से पहले standardize करें
चूँकि PCA दिशाओं को केवल variance से क्रमबद्ध करता है, कोई ऐसी इकाइयों में मापा गया feature जो संयोगवश बड़े संख्यात्मक मान पैदा करे — जैसे रुपयों में आय बनाम वर्षों में आयु — बिना किसी वास्तविक कारण के variance पर व अतः पहले principal component पर हावी हो जाएगा। हर feature को पहले शून्य माध्य व इकाई प्रसरण पर standardize करना PCA के चलने से पहले ही यह विशुद्ध-इकाई-कलाकृति हटा देता है।

मुख्य बिंदु

  • Ridge regression एक L2 पेनल्टी जोड़ता है जो हर गुणांक को शून्य की ओर सिकोड़ता है, predictors अधिक या सहसंबद्ध होने पर थोड़े bias के बदले कम variance पाते हुए — पर यह किसी गुणांक को कभी ठीक शून्य नहीं करता।
  • Logistic regression, k-NN व naive Bayes classification तक तीन भिन्न रास्तों से पहुँचते हैं — एक parametric probability मॉडल, एक lazy दूरी-आधारित मत, तथा Bayes के प्रमेय के साथ सशर्त-स्वतंत्रता की मान्यता — और केवल SVM के margin पर मौजूद support vectors ही इसकी सीमा तय करते हैं।
  • मॉडल-जटिलता bias को variance के विरुद्ध व्यापार करती है; k-fold cross-validation, तथा इसकी चरम स्थिति leave-one-out, बिना कोई अलग जाँच-समुच्चय अलग रखे नमूने-से-बाहर त्रुटि आँकते हैं।
  • एक feed-forward neural network, एक भी पर्याप्त चौड़ी hidden परत के साथ, किसी भी सतत फ़ंक्शन को अनुमानित कर सकता है, loss के gradient को परत-दर-परत backpropagate करके प्रशिक्षित।
  • k-means व k-medoid दोनों लगभग गोलाकार क्लस्टर मानते हैं व पहले से नियत k चाहते हैं; hierarchical clustering को पहले से कोई k नहीं चाहिए, पर इसका आकार इस पर भारी निर्भर करता है कि linkage नियम single (chain बनाने वाला) है या complete (सुगठित)।
  • PCA covariance मैट्रिक्स के eigenvectors से अधिकतम variance की दिशाएँ खोजता है और पूर्णतः unsupervised है — यह ठीक वही दिशा त्याग सकता है जो classes को सबसे अच्छा अलग करती, जिसे केवल LDA जैसी supervised तकनीक खोजती है।

अभ्यास प्रश्न (23)

उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।

  1. Ridge regression, ordinary least-squares linear regression से मुख्यतः किस चीज़ को न्यूनतम किए जा रहे उद्देश्य में जोड़कर भिन्न होता है

    1. गुणांकों पर एक L1 पेनल्टी
    2. गुणांकों पर एक L2 पेनल्टी
    3. उपयोग किए गए प्रशिक्षण-उदाहरणों की संख्या पर एक पेनल्टी
    4. हर गुणांक को धनात्मक होने हेतु मजबूर करने वाली एक बाधा
    उत्तर देखें

    उत्तर: B — गुणांकों पर एक L2 पेनल्टी

    Ridge regression गुणांकों के वर्ग (L2) परिमाण, λΣβᵢ², को least-squares उद्देश्य में जोड़ता है, उन्हें शून्य की ओर सिकोड़ते हुए।
  2. Logistic regression किसके लिए उपयोग किया जाता है

    1. least squares से किसी सतत संख्यात्मक अनुक्रिया की भविष्यवाणी
    2. sigmoid फ़ंक्शन से आँकी गई एक प्रायिकता के ज़रिए classification
    3. अलेबल डेटा की unsupervised clustering
    4. अधिकतम variance की दिशाएँ खोजकर dimensionality reduction
    उत्तर देखें

    उत्तर: B — sigmoid फ़ंक्शन से आँकी गई एक प्रायिकता के ज़रिए classification

    अपने नाम के बावजूद, logistic regression एक classifier है: यह P(y=1|x) को predictors के किसी रैखिक संयोजन के sigmoid के रूप में मॉडल करता है।
  3. k-nearest neighbour classification में k = 1 उपयोग करना, बड़े k की तुलना में, सामान्यतः देता है

    1. उच्च bias व कम variance
    2. कम bias व उच्च variance, क्योंकि एक अकेला शोर-युक्त पड़ोसी भविष्यवाणी पलट सकता है
    3. शून्य प्रशिक्षण-समय व शून्य भविष्यवाणी-समय लागत
    4. एक निर्णय-सीमा जो सदा रैखिक हो
    उत्तर देखें

    उत्तर: B — कम bias व उच्च variance, क्योंकि एक अकेला शोर-युक्त पड़ोसी भविष्यवाणी पलट सकता है

    k=1 के साथ किसी भी बिंदु पर भविष्यवाणी पूरी तरह उस एक निकटतम प्रशिक्षण-उदाहरण पर निर्भर करती है, जो प्रशिक्षण-डेटा को क़रीब से फ़िट करती है (कम bias) पर भविष्यवाणी को उस एक पड़ोसी के शोर हेतु अत्यधिक संवेदनशील बनाती है (उच्च variance)।
  4. Naive Bayes classifier कौन-सी सरलीकारी मान्यता लेता है?

    1. सभी features संख्यात्मक होने चाहिए
    2. Features, class दिए जाने पर, आपस में सशर्त स्वतंत्र हैं
    3. Classes को रैखिक रूप से पृथक्करणीय होना चाहिए
    4. हर class की ठीक समान prior प्रायिकता होनी चाहिए
    उत्तर देखें

    उत्तर: B — Features, class दिए जाने पर, आपस में सशर्त स्वतंत्र हैं

    Naive Bayes में 'naive' ठीक यही सशर्त-स्वतंत्रता मान्यता है, जो किसी joint distribution को स्वतंत्र प्रति-feature distributions से अनुमानित करने देती है।
  5. किसी support vector machine के maximum-margin hyperplane के बारे में निम्न में से कौन-से सत्य हैं?

    1. यह केवल margin सीमा पर बैठे support vectors द्वारा तय होता है
    2. margin से बहुत बाहर बैठे किसी सही वर्गीकृत बिंदु को हिलाना hyperplane बदल सकता है
    3. Kernel trick उच्च-आयामी features की स्पष्ट गणना किए बिना एक अरैखिक निर्णय-सीमा की अनुमति देता है
    4. Soft-margin SVM प्रशिक्षण एक convex अनुकूलन समस्या है
    उत्तर देखें

    उत्तर: A — यह केवल margin सीमा पर बैठे support vectors द्वारा तय होता है; C — Kernel trick उच्च-आयामी features की स्पष्ट गणना किए बिना एक अरैखिक निर्णय-सीमा की अनुमति देता है; D — Soft-margin SVM प्रशिक्षण एक convex अनुकूलन समस्या है

    margin से बहुत बाहर बैठा, सही वर्गीकृत बिंदु hyperplane में कुछ योगदान नहीं देता और उसे बिना प्रभाव हिलाया या हटाया जा सकता है — दूसरा विकल्प यहाँ ग़लत है; शेष तीन SVM रूपांकन के मानक गुण हैं।
  6. Linear discriminant analysis (LDA), logistic regression की तुलना में, अतिरिक्त रूप से मानता है

    1. features, class दिए जाने पर, सशर्त स्वतंत्र हैं
    2. classes एक साझा covariance मैट्रिक्स रखती हैं व features हर class के भीतर लगभग सामान्य हैं
    3. निर्णय-सीमा को अरैखिक होना चाहिए
    4. दो से अधिक classes उपस्थित होनी चाहिए
    उत्तर देखें

    उत्तर: B — classes एक साझा covariance मैट्रिक्स रखती हैं व features हर class के भीतर लगभग सामान्य हैं

    LDA का व्युत्पादन मानता है कि classes लगभग सामान्य रूप से वितरित हैं व एक साझा covariance मैट्रिक्स रखती हैं, एक ऐसी मान्यता जो logistic regression को लेने की ज़रूरत नहीं।
  7. प्रशिक्षण-डेटा पर पूर्ण गहराई तक उगाया गया, बिना pruning वाला decision tree सामान्यतः

    1. underfit करता है, उच्च bias रखते हुए
    2. अलेखे परीक्षण-डेटा पर सर्वश्रेष्ठ संभव सटीकता प्राप्त करता है
    3. overfit करता है — कम प्रशिक्षण-त्रुटि, पर अलेखे डेटा पर अधिक variance व बदतर सटीकता
    4. केवल regression हेतु उपयोग किया जा सकता है, classification हेतु नहीं
    उत्तर देखें

    उत्तर: C — overfit करता है — कम प्रशिक्षण-त्रुटि, पर अलेखे डेटा पर अधिक variance व बदतर सटीकता

    एक पूर्णतः उगाया गया ट्री प्रशिक्षण-डेटा के शोर को उसके संकेत जितनी ही आसानी से फ़िट करता है, कम प्रशिक्षण-त्रुटि पर अधिक variance व बदतर सामान्यीकरण देते हुए — गहराई-सीमा व pruning का मानक कारण।
  8. अपेक्षित भविष्यवाणी-त्रुटि के bias-variance विभाजन में, सच्चे संबंध को पकड़ने हेतु बहुत सरल मॉडल मुख्यतः किससे ग्रस्त होता है

    1. उच्च variance
    2. उच्च bias
    3. अकेले irreducible noise
    4. परिभाषा से शून्य त्रुटि
    उत्तर देखें

    उत्तर: B — उच्च bias

    एक बहुत सरल मॉडल सुसंगत रूप से underfit करता है, चाहे उसने कौन-सा प्रशिक्षण-नमूना देखा हो — वह सुसंगत, व्यवस्थित त्रुटि ठीक वही है जिसे bias मापता है।
  9. 100 उदाहरणों के डेटासेट पर 5-fold cross-validation में, बराबर folds में बाँटकर, हर एक fold में जाँच हेतु कितने उदाहरण उपयोग होते हैं?

    संख्यात्मक उत्तर — मान टाइप करें।

    उत्तर देखें

    उत्तर: 20

    100 उदाहरणों को 5 बराबर folds में बाँटने पर प्रति fold 20 उदाहरण मिलते हैं, और एक बार में एक fold जाँच हेतु अलग रखा जाता है।
  10. Leave-one-out cross-validation, k-fold cross-validation की वह विशेष स्थिति है जिसमें

    1. k = 1
    2. k = 2
    3. k, प्रशिक्षण-उदाहरणों की संख्या n के बराबर है
    4. k किसी आंतरिक grid search से चुना जाता है
    उत्तर देखें

    उत्तर: C — k, प्रशिक्षण-उदाहरणों की संख्या n के बराबर है

    LOO सभी को छोड़कर एक उदाहरण पर प्रशिक्षित करता है व उस एक पर जाँचता है, n बार दोहराते हुए — ठीक k = n के साथ k-fold cross-validation।
  11. पर्याप्त चौड़ाई की एक अकेली hidden परत वाला feed-forward neural network, universal approximation गुण के अनुसार, कर सकता है

    1. केवल रैखिक फ़ंक्शनों का निरूपण
    2. किसी compact डोमेन पर किसी भी सतत फ़ंक्शन का अनुमान
    3. किसी भी डेटासेट पर शून्य प्रशिक्षण-त्रुटि की गारंटी
    4. बिना किसी अरैखिक activation फ़ंक्शन के काम
    उत्तर देखें

    उत्तर: B — किसी compact डोमेन पर किसी भी सतत फ़ंक्शन का अनुमान

    Universal approximation गुण कहता है कि एक पर्याप्त चौड़ी hidden परत, अरैखिक activation सहित, किसी compact डोमेन पर किसी भी सतत फ़ंक्शन को मनमानी सटीकता तक अनुमानित कर सकती है।
  12. हर पुनरावृत्ति पर, k-means हर क्लस्टर के केंद्र को किसकी ओर अद्यतन करता है

    1. निकटतम वास्तविक डेटा-बिंदु (एक medoid)
    2. उस क्लस्टर को अभी सौंपे गए बिंदुओं का माध्य
    3. वह बिंदु जिसकी हर अन्य बिंदु से अधिकतम दूरी हो
    4. केवल पिछली पुनरावृत्ति के केंद्रकों का माध्यक
    उत्तर देखें

    उत्तर: B — उस क्लस्टर को अभी सौंपे गए बिंदुओं का माध्य

    k-means हर केंद्रक को उसके क्लस्टर में अभी मौजूद बिंदुओं के अंकगणितीय माध्य के रूप में फिर से गणित करता है, यही कारण है कि यह outliers से खिंचता भी है।
  13. k-means की तुलना में, k-medoid clustering सामान्यतः है

    1. तेज़, व outliers हेतु कम सुदृढ़
    2. outliers हेतु अधिक सुदृढ़, अधिक गणनात्मक लागत पर
    3. दो से अधिक क्लस्टर बनाने में अक्षम
    4. हर पहलू में k-means के समान
    उत्तर देखें

    उत्तर: B — outliers हेतु अधिक सुदृढ़, अधिक गणनात्मक लागत पर

    क्लस्टर-केंद्र के रूप में माध्य के बजाय एक वास्तविक डेटा-बिंदु (medoid) का उपयोग outliers के खिंचाव का प्रतिरोध करता है, पर हर चरण पर सर्वोत्तम medoid खोजना बिंदुओं का सीधा औसत लेने से अधिक महँगा है।
  14. Single-linkage hierarchical clustering दो क्लस्टरों के बीच दूरी को किस रूप में परिभाषित करता है

    1. दोनों क्लस्टरों के बीच सभी युग्मित दूरियों का औसत
    2. किसी भी जोड़े के बीच अधिकतम दूरी, हर क्लस्टर से एक बिंदु
    3. किसी भी जोड़े के बीच न्यूनतम दूरी, हर क्लस्टर से एक बिंदु
    4. केवल दोनों क्लस्टरों के केंद्रकों के बीच दूरी
    उत्तर देखें

    उत्तर: C — किसी भी जोड़े के बीच न्यूनतम दूरी, हर क्लस्टर से एक बिंदु

    Single-linkage दोनों क्लस्टरों में सबसे निकट बिंदु-जोड़े को अंतर-क्लस्टर दूरी मानता है, यही वह है जो इसे निकट बिंदुओं की एक शृंखला से दूर क्लस्टरों को जोड़ने देता है।
  15. Complete-linkage की तुलना में, single-linkage hierarchical clustering किसकी अधिक प्रवृत्ति रखता है

    1. पूर्णतः गोलाकार क्लस्टर बनाना
    2. 'chaining' प्रभाव, जहाँ निकट बिंदुओं की एक शृंखला अन्यथा दूर क्लस्टरों को जोड़ देती है
    3. complete-linkage के विपरीत, पहले से k नियत होने की माँग करना
    4. outliers की पूरी तरह उपेक्षा करना
    उत्तर देखें

    उत्तर: B — 'chaining' प्रभाव, जहाँ निकट बिंदुओं की एक शृंखला अन्यथा दूर क्लस्टरों को जोड़ देती है

    चूँकि single-linkage को दो क्लस्टरों को मिलाने हेतु केवल एक निकट जोड़ा चाहिए, निकट-पड़ोसियों की एक शृंखला ऐसे क्लस्टरों को जोड़ सकती है जो अन्यथा समग्र रूप से बहुत दूर हों — वह दोष जिससे complete-linkage का अधिकतम-दूरी नियम बचता है।
  16. कौन-सी clustering तकनीक चलने से पहले क्लस्टरों की संख्या k नियत होने की माँग नहीं करती?

    1. k-means
    2. k-medoid
    3. Hierarchical clustering
    4. सूचीबद्ध किसी भी विधि में नहीं
    उत्तर देखें

    उत्तर: C — Hierarchical clustering

    Hierarchical clustering पहले पूरा dendrogram बनाता है और केवल बाद में इसे किसी चुनी ऊँचाई पर काटकर तय करता है कि कितने क्लस्टर पढ़ने हैं; k-means व k-medoid दोनों को शुरू होने से पहले इनपुट के रूप में k चाहिए।
  17. Principal component analysis डेटा को किन दिशाओं के अनुदिश पुनः-व्यक्त करता है

    1. अधिकतम class-पृथक्करण
    2. अधिकतम variance
    3. न्यूनतम variance
    4. एक यादृच्छिक लांबिक (orthogonal) प्रोजेक्शन
    उत्तर देखें

    उत्तर: B — अधिकतम variance

    PCA के principal components डेटा में घटती variance की क्रमबद्ध दिशाएँ हैं, जो class labels के किसी संदर्भ के बिना खोजी जाती हैं।
  18. PCA द्वारा उत्पन्न principal components किससे गणित किए जाते हैं

    1. डेटा के covariance मैट्रिक्स के eigenvectors
    2. class-लेबल सदिश के characteristic polynomial के मूल
    3. डेटा से स्वतंत्र चुना गया एक यादृच्छिक लांबिक प्रोजेक्शन
    4. हर feature का अलग-अलग विचार किया गया माध्यक
    उत्तर देखें

    उत्तर: A — डेटा के covariance मैट्रिक्स के eigenvectors

    Principal components covariance मैट्रिक्स के eigenvectors हैं, समतुल्यतः (केंद्रित) डेटा-मैट्रिक्स के singular value decomposition से भी प्राप्य।
  19. बहुत भिन्न संख्यात्मक स्केलों वाले features पर PCA लागू करने से पहले — जैसे रुपयों में आय व वर्षों में आयु — मानक अभ्यास है

    1. छोटे-स्केल वाले feature को पूर्णतः त्याग देना
    2. पहले features को standardize करना, ताकि कोई feature केवल अपनी इकाइयों के कारण हावी न हो
    3. PCA केवल बड़े-स्केल वाले feature पर लागू करना
    4. किसी भी PCA से पहले k-means clustering चलाना
    उत्तर देखें

    उत्तर: B — पहले features को standardize करना, ताकि कोई feature केवल अपनी इकाइयों के कारण हावी न हो

    चूँकि PCA दिशाओं को केवल variance से क्रमबद्ध करता है, स्वाभाविक रूप से बड़े संख्यात्मक मानों वाला कोई feature उस variance पर बिना किसी वास्तविक कारण के हावी हो जाता है जब तक हर feature को पहले एक साझा स्केल पर standardize न किया जाए।
  20. किसी डेटासेट की आयामीयता को k-NN जैसे किसी दूरी-आधारित classifier को देने से पहले घटाना मुख्यतः किससे मदद करता है

    1. features की संख्या को कृत्रिम रूप से बढ़ाना
    2. curse of dimensionality को कम करना, जहाँ आयाम बढ़ने पर दूरियाँ कम अर्थपूर्ण होती जाती हैं
    3. बिना किसी अपवाद हर डेटासेट पर उच्चतर classification सटीकता की गारंटी
    4. किसी भी लेबल-युक्त प्रशिक्षण-डेटा की आवश्यकता को पूर्णतः हटाना
    उत्तर देखें

    उत्तर: B — curse of dimensionality को कम करना, जहाँ आयाम बढ़ने पर दूरियाँ कम अर्थपूर्ण होती जाती हैं

    बहुत उच्च आयामों में, बिंदुओं के बीच दूरियाँ कम विभेदक हो जाती हैं (curse of dimensionality), और dimensionality reduction k-NN जैसी किसी दूरी-आधारित विधि को लागू करने से पहले उसका सामना करने का एक मानक तरीका है।
  21. Ridge regression में, जैसे-जैसे पेनल्टी भार λ अनंत की ओर बढ़ाया जाता है, फ़िट किए गुणांक किसकी ओर बढ़ते हैं

    1. ordinary least-squares हल
    2. सभी शून्य, एक स्थिर-माध्य मॉडल देते हुए
    3. स्वयं अनंत
    4. सच्चे जनसंख्या-गुणांकों के ठीक मान
    उत्तर देखें

    उत्तर: B — सभी शून्य, एक स्थिर-माध्य मॉडल देते हुए

    जैसे-जैसे λ बढ़ता है, गुणांकों के आकार पर पेनल्टी उद्देश्य पर उत्तरोत्तर हावी होती जाती है, हर गुणांक को शून्य की ओर सिकोड़ते हुए — सीमा में, मॉडल केवल अनुक्रिया का माध्य भविष्यवाणी करता है।
  22. Naive Bayes व k-nearest neighbour के बारे में निम्न में से कौन-से सत्य हैं?

    1. k-NN बिलकुल कोई स्पष्ट प्रशिक्षण-चरण नहीं करता, काम को भविष्यवाणी-समय पर धकेलते हुए
    2. Naive Bayes स्वतंत्र प्रति-feature distributions से एक joint distribution अनुमानित करता है
    3. k-NN की भविष्यवाणी-लागत प्रशिक्षण-समुच्चय के आकार से स्वतंत्र है
    4. Naive Bayes को अपनी सशर्त-स्वतंत्रता मान्यता का ठीक-ठीक सत्य होना चाहिए, अन्यथा इसे बिलकुल उपयोग नहीं किया जा सकता
    उत्तर देखें

    उत्तर: A — k-NN बिलकुल कोई स्पष्ट प्रशिक्षण-चरण नहीं करता, काम को भविष्यवाणी-समय पर धकेलते हुए; B — Naive Bayes स्वतंत्र प्रति-feature distributions से एक joint distribution अनुमानित करता है

    k-NN की भविष्यवाणी-लागत वास्तव में प्रशिक्षण-समुच्चय के आकार के साथ बढ़ती है, क्योंकि इसे उसमें से सबसे निकट पड़ोसी खोजने होते हैं, और naive Bayes व्यवहार में अच्छी तरह वर्गीकृत करता है तब भी जब उसकी स्वतंत्रता-मान्यता दृश्यतः भंग हो रही हो — तीसरा व चौथा विकल्प यहाँ ग़लत हैं।
  23. भिन्न यादृच्छिक आरंभिक केंद्रकों से k-means को कई बार चलाकर सर्वश्रेष्ठ परिणाम रखना मुख्यतः इसलिए मदद करता है क्योंकि

    1. k-means अपने बिलकुल पहले चलने में ही global इष्टतम खोजने की गारंटी देता है
    2. k-means केवल एक स्थानीय इष्टतम तक converge होता है, जो आरंभिक केंद्रकों पर निर्भर करता है
    3. यह पहले से क्लस्टरों की संख्या k चुनने की आवश्यकता हटा देता है
    4. यह हर परिणामी क्लस्टर को पूर्णतः गोलाकार होने हेतु मजबूर करता है
    उत्तर देखें

    उत्तर: B — k-means केवल एक स्थानीय इष्टतम तक converge होता है, जो आरंभिक केंद्रकों पर निर्भर करता है

    k-means केवल किसी एक स्थानीय इष्टतम तक converge होने की गारंटी देता है, और कौन-सा यह इस पर निर्भर है कि केंद्रक कहाँ से शुरू हुए — इसे कई बार चलाकर सर्वश्रेष्ठ (न्यूनतम within-cluster variance) परिणाम रखना इस संवेदनशीलता को घटाने का मानक तरीका है।