मशीन लर्निंग
1. Regression: simple, multiple एवं ridge
Simple linear regression y = β₀ + β₁x को इस तरह फ़िट करता है कि β₀, β₁ ऐसे चुने जाएँ कि फ़िट की गई रेखा व प्रेक्षित बिंदुओं के बीच वर्ग-अवशेषों (squared residuals) का योग न्यूनतम हो (ordinary least squares)। Multiple linear regression इसे कई predictors तक बढ़ाता है, y = β₀ + β₁x₁ + ... + βₖxₖ; हर गुणांक तब उस predictor में एक-इकाई परिवर्तन हेतु y के परिवर्तन के रूप में पढ़ा जाता है, जबकि हर अन्य predictor स्थिर रखा जाए — यह उस predictor के अकेले प्रभाव से बिलकुल भिन्न कथन है।
Ridge regression least-squares उद्देश्य में एक L2 पेनल्टी, λΣβᵢ², जोड़ता है, जो हर गुणांक को शून्य की ओर उतना खींचता है जितना λ के साथ बढ़ता है। यह थोड़े bias के बदले अक्सर बड़ी variance-कमी लाता है, जो ठीक वही उपयोगी क़दम है जब predictors संख्या में अधिक हों या परस्पर सहसंबद्ध हों (multicollinearity) — उस स्थिति में ordinary least squares डेटा में छोटे बदलावों पर बुरी तरह डोलते अस्थिर गुणांक-अनुमान दे सकता है, और ridge का shrinkage उन्हें स्थिर करता है, ठीक-ठीक unbiased न रहने की क़ीमत पर।
2. वर्गीकरण I: logistic regression, k-nearest neighbour, naive Bayes
अपने नाम के बावजूद, logistic regression एक classifier है: यह P(y=1 | x) को predictors के किसी रैखिक संयोजन के sigmoid के रूप में मॉडल करता है, और इसे least squares के बजाय likelihood अधिकतम करके (समतुल्यतः, cross-entropy loss न्यूनतम करके) प्रशिक्षित किया जाता है। k-nearest neighbour किसी नए बिंदु को प्रशिक्षण-समुच्चय के k निकटतम लेबल-युक्त बिंदुओं में बहुमत-मत से वर्गीकृत करता है, किसी दूरी-मापक से — यह बिलकुल कोई स्पष्ट प्रशिक्षण नहीं करता (एक 'lazy' learner), सारा काम भविष्यवाणी-समय पर धकेलता है, और इसकी प्रति-भविष्यवाणी लागत मॉडल-जटिलता के बजाय प्रशिक्षण-समुच्चय के आकार के साथ बढ़ती है।
Naive Bayes classification पर Bayes के प्रमेय को एक सरलीकारी ('naive') मान्यता के साथ लागू करता है: हर feature, class दिए जाने पर, हर अन्य feature से सशर्त स्वतंत्र है। वह मान्यता शायद ही ठीक-ठीक सत्य हो, पर यह एक बड़े joint distribution के आकलन को कई छोटे प्रति-feature distributions के आकलन में घटा देती है, जो सस्ता है, कम प्रशिक्षण-डेटा चाहता है, और व्यवहार में अच्छी तरह वर्गीकृत करता है, तब भी जब वह स्वतंत्रता जिसे यह मानता है दृश्यतः भंग हो रही हो।
3. वर्गीकरण II: linear discriminant analysis, support vector machine, decision trees
Linear discriminant analysis (LDA) features का वह रैखिक संयोजन खोजता है जो classes को सबसे अच्छा अलग करे — between-class scatter व within-class scatter के अनुपात को अधिकतम करते हुए — इस मान्यता के अंतर्गत कि classes (लगभग) सामान्य रूप से वितरित हैं व एक साझा covariance मैट्रिक्स रखती हैं। जहाँ वह मान्यता सत्य हो, LDA logistic regression से बेहतर प्रदर्शन कर सकता है, और यह dimensionality-reduction तकनीक का काम भी करता है, डेटा को उन दिशाओं पर प्रोजेक्ट करते हुए जो classes को सबसे अच्छा विभेदित करें, न कि, जैसा PCA करता है, class से निरपेक्ष सर्वाधिक variance की दिशाओं पर।
Support vector machine (SVM) वह hyperplane खोजता है जो classes को अधिकतम margin से अलग करे — किसी भी class के निकटतम बिंदु तक सबसे चौड़ा संभव अंतराल। केवल वे बिंदु जो ठीक उस margin पर हैं, support vectors, तय करते हैं कि hyperplane कहाँ बैठे; हर अन्य सही वर्गीकृत बिंदु को बिना उसे बिलकुल बदले हटाया या स्थानांतरित किया जा सकता है। Kernel trick किसी SVM को मूल feature स्पेस में एक अरैखिक सीमा खोजने देता है, दूरियों की गणना ऐसे करते हुए मानो डेटा को किसी बहुत उच्च-आयामी स्पेस में मैप कर दिया गया हो, उस मानचित्रण को कभी स्पष्ट रूप से बनाए बिना।
Decision tree प्रत्येक नोड पर उस attribute व threshold पर, जो impurity (Gini impurity या entropy से मापी गई) को सबसे अधिक घटाए, बार-बार feature स्पेस को बाँटता है, जब तक कोई रुकने-नियम न पहुँच जाए। इसे नियमों के एक समुच्चय के रूप में पढ़ना आसान है, पर प्रशिक्षण-डेटा पर पूर्ण गहराई तक उगाया गया ट्री उसके शोर को उतनी ही आसानी से फ़िट कर लेता है जितना उसके संकेत को — कम प्रशिक्षण-त्रुटि, अलेखे डेटा पर कहीं अधिक variance के साथ जोड़ी बनाते हुए — यही कारण है कि गहराई-सीमा व pruning मानक प्रति-उपाय हैं।
4. Bias-variance trade-off, cross-validation, एवं multi-layer perceptron
किसी मॉडल की नए डेटा पर अपेक्षित भविष्यवाणी-त्रुटि तीन भागों में विभाजित होती है: bias (सच्चे संबंध को पकड़ने हेतु बहुत सरल मॉडल से त्रुटि — underfitting), variance (प्रशिक्षण-डेटा के शोर को फ़िट करने जितनी संवेदनशील मॉडल से त्रुटि — overfitting), तथा irreducible noise (त्रुटि जिसे कोई मॉडल हटा नहीं सकता)। मॉडल-जटिलता बढ़ाना सामान्यतः bias घटाता है व variance बढ़ाता है, अतः दोनों एक साथ सुधरने के बजाय एक-दूसरे के विरुद्ध व्यापार करते हैं, और लक्ष्य वह जटिलता है जो उनके योग को न्यूनतम करे, अकेले किसी एक को नहीं।
Cross-validation उस अकेले उद्देश्य हेतु एक अलग, कभी न छुई गई परीक्षण-समुच्चय अलग रखे बिना नमूने-से-बाहर त्रुटि आँकता है। k-fold cross-validation डेटा को k लगभग बराबर folds में बाँटता है, k-1 पर प्रशिक्षित करता है व शेष एक पर जाँचता है, इसे k बार दोहराता है ताकि हर fold ठीक एक बार जाँच-समुच्चय बने, और k त्रुटि-आकलनों का औसत लेता है। Leave-one-out (LOO) cross-validation चरम स्थिति k = n है: यह सभी को छोड़कर एक उदाहरण पर प्रशिक्षित करता है, n बार, जो बहुत कम bias पर एक आकलन देता है पर folds में अधिक variance व n पूर्ण मॉडल-फ़िट की प्रशिक्षण-लागत के साथ — बड़े डेटासेट पर महँगा, फिर भी यह हर एक fold पर लगभग पूरे डेटा को प्रशिक्षण हेतु उपयोग करता है।
Multi-layer perceptron (एक feed-forward neural network) परतों को एक के ऊपर एक रखता है, हर परत पिछली परत के output का भारित योग है जो किसी अरैखिक activation फ़ंक्शन से गुज़रता है; पर्याप्त चौड़ाई की एक अकेली hidden परत के साथ भी, यह किसी compact डोमेन पर किसी भी सतत फ़ंक्शन को मनमानी सटीकता तक अनुमानित कर सकता है — universal approximation गुण। इसे backpropagation से प्रशिक्षित किया जाता है: chain rule को परत-दर-परत लागू करके यह गणित किया जाता है कि loss हर भार के साथ कैसे बदलता है, जो gradient-descent अद्यतन को फ़ीड करता है।
5. Unsupervised learning I: क्लस्टरिंग (clustering)
k-means दो चरणों को दोहराकर डेटा को k क्लस्टरों में बाँटता है: हर बिंदु को उसके निकटतम क्लस्टर-केंद्रक (centroid) को सौंपें, फिर हर केंद्रक को अब उसे सौंपे गए बिंदुओं के माध्य के रूप में फिर से गणित करें — असाइनमेंट बदलना बंद होने तक दोहराया जाता है। यह converge होता है, पर केवल एक स्थानीय इष्टतम तक जो आरंभिक केंद्रक-स्थितियों पर निर्भर करता है, और चूँकि यह माध्य का उपयोग करता है, यह outliers से ध्यान देने योग्य रूप से खिंचता है। k-medoid वही दो-चरणीय पुनरावृत्ति करता है पर किसी क्लस्टर के केंद्र को गणित माध्य के बजाय एक वास्तविक डेटा-बिंदु (medoid) तक सीमित करता है, जो outliers हेतु अधिक सुदृढ़ है, हर चरण पर सर्वोत्तम medoid की अधिक महँगी खोज की क़ीमत पर।
Hierarchical clustering पहले से k की माँग किए बिना नेस्टेड क्लस्टरों का एक पूरा ट्री (dendrogram) बनाता है — क्लस्टरों की संख्या बाद में ट्री को किसी चुनी ऊँचाई पर काटकर चुनी जाती है। Agglomerative (bottom-up) clustering हर बिंदु को अपना क्लस्टर मानकर आरंभ करता है और बार-बार सबसे निकट जोड़े को मिलाता है; divisive (top-down) clustering सब कुछ रखने वाले एक क्लस्टर से आरंभ करता है और बार-बार सबसे कम सुसंगत को तोड़ता है।
| Linkage | दो क्लस्टरों के बीच दूरी | प्रवृत्ति |
|---|---|---|
| Single-linkage | किसी भी जोड़े के बीच न्यूनतम दूरी, हर क्लस्टर से एक बिंदु | निकट बिंदुओं की एक शृंखला से दूर क्लस्टरों को जोड़ (chain) सकता है |
| Complete-linkage (यानी multiple-linkage) | किसी भी जोड़े के बीच अधिकतम दूरी, हर क्लस्टर से एक बिंदु | अधिक सुगठित, लगभग समान-आकार के क्लस्टर पैदा करता है |
6. Unsupervised learning II: dimensionality reduction एवं principal component analysis
Dimensionality reduction डेटा को जितना संभव हो उतनी संरचना बनाए रखते हुए कम आयामों में पुनः-व्यक्त करता है, दोनों उद्देश्यों से — curse of dimensionality से लड़ने हेतु (आयाम बढ़ने के साथ बिंदुओं के बीच दूरियाँ कम अर्थपूर्ण होती जाती हैं, और किसी स्पेस को भरने हेतु चाहिए डेटा की मात्रा उसके साथ घातांकीय रूप से बढ़ती है) तथा उच्च-आयामी डेटा को बिलकुल दृश्यनीय बनाने हेतु।
Principal component analysis (PCA) डेटा में अधिकतम variance की लांबिक (orthogonal) दिशाएँ खोजता है, अधिकतम से न्यूनतम व्याख्यायित variance के क्रम में; ये principal components डेटा के covariance मैट्रिक्स के eigenvectors हैं (समतुल्यतः डेटा-मैट्रिक्स के singular value decomposition से भी प्राप्य), और इनमें से केवल पहले कुछ को रखना — जो कुल variance का अधिकांश व्याख्यायित करते हैं — ही वास्तव में कमी उपलब्ध कराता है, शेष को variance से मापी गई न्यूनतम संभव सूचना-हानि के साथ त्याग देता है।
मुख्य बिंदु
- Ridge regression एक L2 पेनल्टी जोड़ता है जो हर गुणांक को शून्य की ओर सिकोड़ता है, predictors अधिक या सहसंबद्ध होने पर थोड़े bias के बदले कम variance पाते हुए — पर यह किसी गुणांक को कभी ठीक शून्य नहीं करता।
- Logistic regression, k-NN व naive Bayes classification तक तीन भिन्न रास्तों से पहुँचते हैं — एक parametric probability मॉडल, एक lazy दूरी-आधारित मत, तथा Bayes के प्रमेय के साथ सशर्त-स्वतंत्रता की मान्यता — और केवल SVM के margin पर मौजूद support vectors ही इसकी सीमा तय करते हैं।
- मॉडल-जटिलता bias को variance के विरुद्ध व्यापार करती है; k-fold cross-validation, तथा इसकी चरम स्थिति leave-one-out, बिना कोई अलग जाँच-समुच्चय अलग रखे नमूने-से-बाहर त्रुटि आँकते हैं।
- एक feed-forward neural network, एक भी पर्याप्त चौड़ी hidden परत के साथ, किसी भी सतत फ़ंक्शन को अनुमानित कर सकता है, loss के gradient को परत-दर-परत backpropagate करके प्रशिक्षित।
- k-means व k-medoid दोनों लगभग गोलाकार क्लस्टर मानते हैं व पहले से नियत k चाहते हैं; hierarchical clustering को पहले से कोई k नहीं चाहिए, पर इसका आकार इस पर भारी निर्भर करता है कि linkage नियम single (chain बनाने वाला) है या complete (सुगठित)।
- PCA covariance मैट्रिक्स के eigenvectors से अधिकतम variance की दिशाएँ खोजता है और पूर्णतः unsupervised है — यह ठीक वही दिशा त्याग सकता है जो classes को सबसे अच्छा अलग करती, जिसे केवल LDA जैसी supervised तकनीक खोजती है।
अभ्यास प्रश्न (23)
उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।
Ridge regression, ordinary least-squares linear regression से मुख्यतः किस चीज़ को न्यूनतम किए जा रहे उद्देश्य में जोड़कर भिन्न होता है
उत्तर देखें
उत्तर: B — गुणांकों पर एक L2 पेनल्टी
Ridge regression गुणांकों के वर्ग (L2) परिमाण, λΣβᵢ², को least-squares उद्देश्य में जोड़ता है, उन्हें शून्य की ओर सिकोड़ते हुए।Logistic regression किसके लिए उपयोग किया जाता है
उत्तर देखें
उत्तर: B — sigmoid फ़ंक्शन से आँकी गई एक प्रायिकता के ज़रिए classification
अपने नाम के बावजूद, logistic regression एक classifier है: यह P(y=1|x) को predictors के किसी रैखिक संयोजन के sigmoid के रूप में मॉडल करता है।k-nearest neighbour classification में k = 1 उपयोग करना, बड़े k की तुलना में, सामान्यतः देता है
उत्तर देखें
उत्तर: B — कम bias व उच्च variance, क्योंकि एक अकेला शोर-युक्त पड़ोसी भविष्यवाणी पलट सकता है
k=1 के साथ किसी भी बिंदु पर भविष्यवाणी पूरी तरह उस एक निकटतम प्रशिक्षण-उदाहरण पर निर्भर करती है, जो प्रशिक्षण-डेटा को क़रीब से फ़िट करती है (कम bias) पर भविष्यवाणी को उस एक पड़ोसी के शोर हेतु अत्यधिक संवेदनशील बनाती है (उच्च variance)।Naive Bayes classifier कौन-सी सरलीकारी मान्यता लेता है?
उत्तर देखें
उत्तर: B — Features, class दिए जाने पर, आपस में सशर्त स्वतंत्र हैं
Naive Bayes में 'naive' ठीक यही सशर्त-स्वतंत्रता मान्यता है, जो किसी joint distribution को स्वतंत्र प्रति-feature distributions से अनुमानित करने देती है।किसी support vector machine के maximum-margin hyperplane के बारे में निम्न में से कौन-से सत्य हैं?
उत्तर देखें
उत्तर: A — यह केवल margin सीमा पर बैठे support vectors द्वारा तय होता है; C — Kernel trick उच्च-आयामी features की स्पष्ट गणना किए बिना एक अरैखिक निर्णय-सीमा की अनुमति देता है; D — Soft-margin SVM प्रशिक्षण एक convex अनुकूलन समस्या है
margin से बहुत बाहर बैठा, सही वर्गीकृत बिंदु hyperplane में कुछ योगदान नहीं देता और उसे बिना प्रभाव हिलाया या हटाया जा सकता है — दूसरा विकल्प यहाँ ग़लत है; शेष तीन SVM रूपांकन के मानक गुण हैं।Linear discriminant analysis (LDA), logistic regression की तुलना में, अतिरिक्त रूप से मानता है
उत्तर देखें
उत्तर: B — classes एक साझा covariance मैट्रिक्स रखती हैं व features हर class के भीतर लगभग सामान्य हैं
LDA का व्युत्पादन मानता है कि classes लगभग सामान्य रूप से वितरित हैं व एक साझा covariance मैट्रिक्स रखती हैं, एक ऐसी मान्यता जो logistic regression को लेने की ज़रूरत नहीं।प्रशिक्षण-डेटा पर पूर्ण गहराई तक उगाया गया, बिना pruning वाला decision tree सामान्यतः
उत्तर देखें
उत्तर: C — overfit करता है — कम प्रशिक्षण-त्रुटि, पर अलेखे डेटा पर अधिक variance व बदतर सटीकता
एक पूर्णतः उगाया गया ट्री प्रशिक्षण-डेटा के शोर को उसके संकेत जितनी ही आसानी से फ़िट करता है, कम प्रशिक्षण-त्रुटि पर अधिक variance व बदतर सामान्यीकरण देते हुए — गहराई-सीमा व pruning का मानक कारण।अपेक्षित भविष्यवाणी-त्रुटि के bias-variance विभाजन में, सच्चे संबंध को पकड़ने हेतु बहुत सरल मॉडल मुख्यतः किससे ग्रस्त होता है
उत्तर देखें
उत्तर: B — उच्च bias
एक बहुत सरल मॉडल सुसंगत रूप से underfit करता है, चाहे उसने कौन-सा प्रशिक्षण-नमूना देखा हो — वह सुसंगत, व्यवस्थित त्रुटि ठीक वही है जिसे bias मापता है।100 उदाहरणों के डेटासेट पर 5-fold cross-validation में, बराबर folds में बाँटकर, हर एक fold में जाँच हेतु कितने उदाहरण उपयोग होते हैं?
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 20
100 उदाहरणों को 5 बराबर folds में बाँटने पर प्रति fold 20 उदाहरण मिलते हैं, और एक बार में एक fold जाँच हेतु अलग रखा जाता है।Leave-one-out cross-validation, k-fold cross-validation की वह विशेष स्थिति है जिसमें
उत्तर देखें
उत्तर: C — k, प्रशिक्षण-उदाहरणों की संख्या n के बराबर है
LOO सभी को छोड़कर एक उदाहरण पर प्रशिक्षित करता है व उस एक पर जाँचता है, n बार दोहराते हुए — ठीक k = n के साथ k-fold cross-validation।पर्याप्त चौड़ाई की एक अकेली hidden परत वाला feed-forward neural network, universal approximation गुण के अनुसार, कर सकता है
उत्तर देखें
उत्तर: B — किसी compact डोमेन पर किसी भी सतत फ़ंक्शन का अनुमान
Universal approximation गुण कहता है कि एक पर्याप्त चौड़ी hidden परत, अरैखिक activation सहित, किसी compact डोमेन पर किसी भी सतत फ़ंक्शन को मनमानी सटीकता तक अनुमानित कर सकती है।हर पुनरावृत्ति पर, k-means हर क्लस्टर के केंद्र को किसकी ओर अद्यतन करता है
उत्तर देखें
उत्तर: B — उस क्लस्टर को अभी सौंपे गए बिंदुओं का माध्य
k-means हर केंद्रक को उसके क्लस्टर में अभी मौजूद बिंदुओं के अंकगणितीय माध्य के रूप में फिर से गणित करता है, यही कारण है कि यह outliers से खिंचता भी है।k-means की तुलना में, k-medoid clustering सामान्यतः है
उत्तर देखें
उत्तर: B — outliers हेतु अधिक सुदृढ़, अधिक गणनात्मक लागत पर
क्लस्टर-केंद्र के रूप में माध्य के बजाय एक वास्तविक डेटा-बिंदु (medoid) का उपयोग outliers के खिंचाव का प्रतिरोध करता है, पर हर चरण पर सर्वोत्तम medoid खोजना बिंदुओं का सीधा औसत लेने से अधिक महँगा है।Single-linkage hierarchical clustering दो क्लस्टरों के बीच दूरी को किस रूप में परिभाषित करता है
उत्तर देखें
उत्तर: C — किसी भी जोड़े के बीच न्यूनतम दूरी, हर क्लस्टर से एक बिंदु
Single-linkage दोनों क्लस्टरों में सबसे निकट बिंदु-जोड़े को अंतर-क्लस्टर दूरी मानता है, यही वह है जो इसे निकट बिंदुओं की एक शृंखला से दूर क्लस्टरों को जोड़ने देता है।Complete-linkage की तुलना में, single-linkage hierarchical clustering किसकी अधिक प्रवृत्ति रखता है
उत्तर देखें
उत्तर: B — 'chaining' प्रभाव, जहाँ निकट बिंदुओं की एक शृंखला अन्यथा दूर क्लस्टरों को जोड़ देती है
चूँकि single-linkage को दो क्लस्टरों को मिलाने हेतु केवल एक निकट जोड़ा चाहिए, निकट-पड़ोसियों की एक शृंखला ऐसे क्लस्टरों को जोड़ सकती है जो अन्यथा समग्र रूप से बहुत दूर हों — वह दोष जिससे complete-linkage का अधिकतम-दूरी नियम बचता है।कौन-सी clustering तकनीक चलने से पहले क्लस्टरों की संख्या k नियत होने की माँग नहीं करती?
उत्तर देखें
उत्तर: C — Hierarchical clustering
Hierarchical clustering पहले पूरा dendrogram बनाता है और केवल बाद में इसे किसी चुनी ऊँचाई पर काटकर तय करता है कि कितने क्लस्टर पढ़ने हैं; k-means व k-medoid दोनों को शुरू होने से पहले इनपुट के रूप में k चाहिए।Principal component analysis डेटा को किन दिशाओं के अनुदिश पुनः-व्यक्त करता है
उत्तर देखें
उत्तर: B — अधिकतम variance
PCA के principal components डेटा में घटती variance की क्रमबद्ध दिशाएँ हैं, जो class labels के किसी संदर्भ के बिना खोजी जाती हैं।PCA द्वारा उत्पन्न principal components किससे गणित किए जाते हैं
उत्तर देखें
उत्तर: A — डेटा के covariance मैट्रिक्स के eigenvectors
Principal components covariance मैट्रिक्स के eigenvectors हैं, समतुल्यतः (केंद्रित) डेटा-मैट्रिक्स के singular value decomposition से भी प्राप्य।बहुत भिन्न संख्यात्मक स्केलों वाले features पर PCA लागू करने से पहले — जैसे रुपयों में आय व वर्षों में आयु — मानक अभ्यास है
उत्तर देखें
उत्तर: B — पहले features को standardize करना, ताकि कोई feature केवल अपनी इकाइयों के कारण हावी न हो
चूँकि PCA दिशाओं को केवल variance से क्रमबद्ध करता है, स्वाभाविक रूप से बड़े संख्यात्मक मानों वाला कोई feature उस variance पर बिना किसी वास्तविक कारण के हावी हो जाता है जब तक हर feature को पहले एक साझा स्केल पर standardize न किया जाए।किसी डेटासेट की आयामीयता को k-NN जैसे किसी दूरी-आधारित classifier को देने से पहले घटाना मुख्यतः किससे मदद करता है
उत्तर देखें
उत्तर: B — curse of dimensionality को कम करना, जहाँ आयाम बढ़ने पर दूरियाँ कम अर्थपूर्ण होती जाती हैं
बहुत उच्च आयामों में, बिंदुओं के बीच दूरियाँ कम विभेदक हो जाती हैं (curse of dimensionality), और dimensionality reduction k-NN जैसी किसी दूरी-आधारित विधि को लागू करने से पहले उसका सामना करने का एक मानक तरीका है।Ridge regression में, जैसे-जैसे पेनल्टी भार λ अनंत की ओर बढ़ाया जाता है, फ़िट किए गुणांक किसकी ओर बढ़ते हैं
उत्तर देखें
उत्तर: B — सभी शून्य, एक स्थिर-माध्य मॉडल देते हुए
जैसे-जैसे λ बढ़ता है, गुणांकों के आकार पर पेनल्टी उद्देश्य पर उत्तरोत्तर हावी होती जाती है, हर गुणांक को शून्य की ओर सिकोड़ते हुए — सीमा में, मॉडल केवल अनुक्रिया का माध्य भविष्यवाणी करता है।Naive Bayes व k-nearest neighbour के बारे में निम्न में से कौन-से सत्य हैं?
उत्तर देखें
उत्तर: A — k-NN बिलकुल कोई स्पष्ट प्रशिक्षण-चरण नहीं करता, काम को भविष्यवाणी-समय पर धकेलते हुए; B — Naive Bayes स्वतंत्र प्रति-feature distributions से एक joint distribution अनुमानित करता है
k-NN की भविष्यवाणी-लागत वास्तव में प्रशिक्षण-समुच्चय के आकार के साथ बढ़ती है, क्योंकि इसे उसमें से सबसे निकट पड़ोसी खोजने होते हैं, और naive Bayes व्यवहार में अच्छी तरह वर्गीकृत करता है तब भी जब उसकी स्वतंत्रता-मान्यता दृश्यतः भंग हो रही हो — तीसरा व चौथा विकल्प यहाँ ग़लत हैं।भिन्न यादृच्छिक आरंभिक केंद्रकों से k-means को कई बार चलाकर सर्वश्रेष्ठ परिणाम रखना मुख्यतः इसलिए मदद करता है क्योंकि
उत्तर देखें
उत्तर: B — k-means केवल एक स्थानीय इष्टतम तक converge होता है, जो आरंभिक केंद्रकों पर निर्भर करता है
k-means केवल किसी एक स्थानीय इष्टतम तक converge होने की गारंटी देता है, और कौन-सा यह इस पर निर्भर है कि केंद्रक कहाँ से शुरू हुए — इसे कई बार चलाकर सर्वश्रेष्ठ (न्यूनतम within-cluster variance) परिणाम रखना इस संवेदनशीलता को घटाने का मानक तरीका है।