समाश्रयण विश्लेषण: सरल व बहु रैखिक समाश्रयण, R² व समायोजित R², द्विघात रूप व फ़िशर–कॉक्रन, गॉस–मार्कोव, परीक्षण व विश्वास्यता अंतराल
1. सरल रैखिक समाश्रयण
मॉडल yᵢ = β₀ + β₁xᵢ + εᵢ, E εᵢ = 0, Var εᵢ = σ², असहसंबद्ध सहित। न्यूनतम वर्ग Σ(yᵢ − β₀ − β₁xᵢ)² न्यूनतम करता है और b₁ = Sxy/Sxx, b₀ = ȳ − b₁x̄ देता है, जहाँ Sxx = Σ(xᵢ − x̄)², Sxy = Σ(xᵢ − x̄)(yᵢ − ȳ), Syy = Σ(yᵢ − ȳ)²। अवशिष्ट eᵢ = yᵢ − ŷᵢ, Σeᵢ = 0 व Σxᵢeᵢ = 0 संतुष्ट करते हैं, रेखा (x̄, ȳ) से होकर जाती है, SSE = Syy − b₁Sxy, तथा σ̂² = SSE/(n − 2) अनभिनत है। सहसंबंध के पदों में b₁ = r s_y/s_x व r² = Sxy²/(SxxSyy); दोनों समाश्रयण ढाल b_yx · b_xy = r² संतुष्ट करते हैं।
| राशि | मान |
|---|---|
| x̄, ȳ | 3, 4 |
| Sxx, Sxy, Syy (वर्ग व गुणनफल योग) | 10, 6, 6 |
| b₁ = Sxy/Sxx | 0.6 |
| b₀ = ȳ − b₁x̄ | 2.2 |
| SSE = Syy − b₁Sxy | 6 − 3.6 = 2.4 |
| σ̂² = SSE/(n − 2) | 0.8 |
| R² = Sxy²/(SxxSyy), निर्धारण गुणांक | 36/60 = 0.6 |
2. आव्यूह रूप में बहु समाश्रयण
y = Xβ + ε, X का आकार n × p व पूर्ण स्तंभ कोटि p सहित (p अंतःखंड स्तंभ गिनता है)। न्यूनतम वर्ग प्रसामान्य समीकरण XᵀXβ̂ = Xᵀy हल करता है, अतः β̂ = (XᵀX)⁻¹Xᵀy। XᵀX = [[5, 10], [10, 30]] व Xᵀy = (20, 50) सहित (XᵀX)⁻¹ = (1/50)[[30, −10], [−10, 5]] और β̂ = (1/50)(100, 50) = (2, 1)। समंजित मान ŷ = Hy हैं, हैट आव्यूह H = X(XᵀX)⁻¹Xᵀ सहित: सममित, वर्गसम, X की स्तंभ समष्टि पर लांबिक प्रक्षेप, tr H = rank H = p सहित। अवशिष्ट e = (I − H)y, X के प्रत्येक स्तंभ के लांबिक हैं।
- E β̂ = β तथा Cov β̂ = σ²(XᵀX)⁻¹; σ̂² = eᵀe/(n − p) अनभिनत है।
- प्रसामान्य त्रुटियों सहित β̂ ~ N_p(β, σ²(XᵀX)⁻¹), (n − p)σ̂²/σ² ~ χ²n−p, और दोनों स्वतंत्र हैं।
3. गॉस–मार्कोव प्रमेय
यदि E ε = 0 व Cov ε = σ²I (शून्य-माध्य, समविचलित, असहसंबद्ध त्रुटियाँ — प्रसामान्यता नहीं), तो प्रत्येक आकलनीय cᵀβ हेतु न्यूनतम-वर्ग आकलक cᵀβ̂ सर्वोत्तम रैखिक अनभिनत आकलक (BLUE) है: उसका प्रसरण y में रैखिक व अनभिनत सभी आकलकों में न्यूनतम है। प्रमाण किसी अन्य रैखिक अनभिनत आकलक को dᵀX = 0 सहित (cᵀ(XᵀX)⁻¹Xᵀ + dᵀ)y लिखता है, जिसका प्रसरण cᵀβ̂ से σ²‖d‖² अधिक है।
4. द्विघात रूप व फ़िशर–कॉक्रन प्रमेय
- माध्य: माध्य μ व प्रकीर्णन Σ वाले किसी भी यादृच्छिक Y हेतु E[YᵀAY] = tr(AΣ) + μᵀAμ — प्रसामान्यता आवश्यक नहीं। Σ = I, μ = (1, 2) व A = [[2, 1], [1, 1]] सहित: tr A + μᵀAμ = 3 + 10 = 13।
- काई-वर्ग: यदि Y ~ N_n(0, I) व A सममित हो, तो YᵀAY ~ χ²_r यदि और केवल यदि A, कोटि r का वर्गसम हो। व्यापकतः Y ~ N(0, Σ) हेतु YᵀAY ~ χ²_r यदि और केवल यदि AΣ, कोटि r का वर्गसम हो।
- स्वतंत्रता (क्रेग): Y ~ N(0, I) हेतु YᵀAY व YᵀBY स्वतंत्र हैं यदि और केवल यदि AB = 0; रैखिक रूप LY व YᵀAY स्वतंत्र हैं यदि और केवल यदि LA = 0।
फ़िशर–कॉक्रन प्रमेय: मान लें Y ~ N_n(0, I) तथा YᵀY = Σᵢ YᵀAᵢY, Aᵢ सममित व कोटि rᵢ सहित। तब रूप YᵀAᵢY स्वतंत्र χ²rᵢ हैं यदि और केवल यदि Σrᵢ = n। इसीलिए ANOVA सारणी काम करती है: प्रसामान्य त्रुटियों, सरलता हेतु σ = 1 तथा सत्य H₀ (सभी ढाल शून्य) सहित, समाश्रयण व अवशिष्ट वर्ग-योग H − (1/n)J व I − H में द्विघात रूप हैं, कोटि p − 1 व n − p जो n − 1 तक जुड़ती हैं, अतः वे स्वतंत्र काई-वर्ग हैं और उनका अनुपात F है।
5. R², समायोजित R² व ANOVA F परीक्षण
SST = Σ(yᵢ − ȳ)², SST = SSR + SSE के रूप में विभाजित होता है (अंतःखंड वाले मॉडल हेतु)। R² = SSR/SST = 1 − SSE/SST व्याख्यात परिवर्तन का अनुपात है, और y व ŷ के बीच वर्गित सहसंबंध के बराबर है। k समाश्रयकों व n प्रेक्षणों सहित समायोजित R² = 1 − (1 − R²)(n − 1)/(n − k − 1)। समाश्रयक जोड़ने पर R² कभी नहीं घटता; समायोजित R² घटता है जब तक नए समाश्रयक का t-प्रतिदर्शज निरपेक्ष मान में 1 से अधिक न हो, इसीलिए वह भिन्न आकार के मॉडलों की तुलना हेतु प्रयुक्त होता है। n = 25, k = 4 व R² = 0.8 सहित समायोजित R² = 1 − 0.2 × 24/20 = 0.76।
| स्रोत | df | वर्ग-योग | माध्य वर्ग |
|---|---|---|---|
| समाश्रयण | k | SSR | SSR/k |
| अवशिष्ट | n − k − 1 | SSE | SSE/(n − k − 1) |
| कुल | n − 1 | SST | — |
H₀: β₁ = … = β_k = 0 का समग्र F परीक्षण F = [SSR/k]/[SSE/(n − k − 1)] = [R²/k]/[(1 − R²)/(n − k − 1)] ~ F(k, n − k − 1) प्रयोग करता है: n = 25, k = 4, R² = 0.8 सहित F = 0.2/0.01 = 20। n = 30 व k = 3 सहित स्वातंत्र्य-कोटियाँ 3, 26 व 29 हैं।
6. समाश्रयण गुणांकों हेतु परीक्षण व विश्वास्यता अंतराल
- एक गुणांक हेतु t परीक्षण: t = β̂ⱼ/SE(β̂ⱼ), SE² = σ̂²[(XᵀX)⁻¹]ⱼⱼ, tn−p से तुलना। सरल समाश्रयण में SE(b₁) = σ̂/√Sxx, और t² समग्र F के बराबर है।
- विश्वास्यता अंतराल: β̂ⱼ ± tn−p, α/2 SE(β̂ⱼ)। β̂₁ = 2.5, SE = 0.4 व t₂₀,₀.₀₂₅ = 2.086 सहित उपरि सीमा 2.5 + 0.834 = 3.33।
- q गुणांकों के उपसमुच्चय हेतु आंशिक F परीक्षण: F = [(SSE_reduced − SSE_full)/q]/[SSE_full/(n − p)] ~ F(q, n − p)।
- x₀ पर माध्य अनुक्रिया बनाम नया प्रेक्षण: E(y | x₀) हेतु अंतराल Var(ŷ₀) = σ²x₀ᵀ(XᵀX)⁻¹x₀ प्रयोग करता है; नए y₀ हेतु पूर्वानुमान अंतराल नई त्रुटि हेतु σ² जोड़ता है, अतः वह सदा अधिक चौड़ा है और n → ∞ पर शून्य तक नहीं सिकुड़ता।
मुख्य बिंदु
- b₁ = Sxy/Sxx, b₀ = ȳ − b₁x̄, σ̂² = SSE/(n − 2); अवशिष्टों का योग शून्य है और वे x के लांबिक हैं; b_yx b_xy = r²।
- β̂ = (XᵀX)⁻¹Xᵀy, Cov β̂ = σ²(XᵀX)⁻¹; H सममित वर्गसम प्रक्षेप है, ट्रेस p सहित।
- गॉस–मार्कोव: शून्य-माध्य, समविचलित, असहसंबद्ध त्रुटियाँ OLS को BLUE बनाती हैं — प्रसामान्यता नहीं, और अभिनत या अ-रैखिक आकलकों के विषय में कुछ नहीं।
- E[YᵀAY] = tr(AΣ) + μᵀAμ; YᵀAY ~ χ²_r यदि और केवल यदि A कोटि r का वर्गसम (Y ~ N(0, I)); कॉक्रन: कोटियों का योग n ⇔ स्वतंत्र χ²।
- समायोजित R² = 1 − (1 − R²)(n − 1)/(n − k − 1); (k, n − k − 1) df पर F = [R²/k]/[(1 − R²)/(n − k − 1)]।
- n − p df पर t = β̂ⱼ/SE; CI β̂ⱼ ± t SE; पूर्वानुमान अंतराल माध्य अनुक्रिया के अंतरालों से अधिक चौड़े होते हैं।
अभ्यास प्रश्न (15)
उत्तर खोलने से पहले प्रत्येक प्रश्न हल करें। हर व्याख्या सही विकल्प के साथ लुभावना गलत विकल्प भी बताती है, क्योंकि अंक वहीं जाते हैं।
आँकड़ों x = 1, 2, 3, 4, 5 व y = 2, 4, 5, 4, 5 हेतु x पर y के समाश्रयण का न्यूनतम-वर्ग अंतःखंड b₀, एक दशमलव स्थान तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 2.2
x̄ = 3, ȳ = 4, Sxx = 10, Sxy = (−2)(−2) + (−1)(0) + 0 + (1)(0) + (2)(1) = 6, अतः b₁ = 0.6 व b₀ = 4 − 0.6 × 3 = 2.2। ȳ = 4 को अंतःखंड बताना भूलता है कि रेखा (x̄, ȳ) से होकर जाती है, (0, ȳ) से नहीं।उन्हीं आँकड़ों (x = 1, 2, 3, 4, 5; y = 2, 4, 5, 4, 5) हेतु निर्धारण गुणांक R², एक दशमलव स्थान तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 0.6
Syy = 4 + 0 + 1 + 0 + 1 = 6, अतः R² = Sxy²/(SxxSyy) = 36/60 = 0.6; समतुल्यतः SSR = b₁Sxy = 3.6 व R² = 3.6/6। स्वयं सहसंबंध √0.6 = 0.775 है — r बताना भिन्न प्रश्न का उत्तर है।उन्हीं आँकड़ों (x = 1, 2, 3, 4, 5; y = 2, 4, 5, 4, 5) हेतु त्रुटि प्रसरण σ² का अनभिनत आकल, एक दशमलव स्थान तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 0.8
SSE = Syy − b₁Sxy = 6 − 0.6 × 6 = 2.4, तथा σ̂² = SSE/(n − 2) = 2.4/3 = 0.8। अवशिष्टों से जाँच: समंजित मान 2.8, 3.4, 4.0, 4.6, 5.2 अवशिष्ट −0.8, 0.6, 1.0, −0.6, −0.2 देते हैं और वर्गों का योग 2.4। n से भाग देना अभिनत 0.48 देता है।n = 25 प्रेक्षणों पर समंजित k = 4 समाश्रयकों वाले समाश्रयण का R² = 0.8 है। समायोजित R², दो दशमलव स्थानों तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 0.76
1 − (1 − R²)(n − 1)/(n − k − 1) = 1 − 0.2 × 24/20 = 1 − 0.24 = 0.76। हर में n − k लेना 1 − 0.2 × 24/21 = 0.771 देता है।उसी समाश्रयण (n = 25, k = 4, R² = 0.8) हेतु H₀: चारों ढाल शून्य हैं, का F प्रतिदर्शज ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 20
F = [R²/k]/[(1 − R²)/(n − k − 1)] = (0.8/4)/(0.2/20) = 0.2/0.01 = 20, (4, 20) स्वातंत्र्य-कोटियों पर। अवशिष्ट df n − 1 = 24 लेना 24 देता है।20 प्रेक्षणों पर एक अंतःखंड व 3 समाश्रयकों वाला समाश्रयण समंजित किया जाता है। हैट आव्यूह H = X(XᵀX)⁻¹Xᵀ का ट्रेस ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 4
tr H = tr[(XᵀX)⁻¹XᵀX] = tr I_p = p = 4 (तीन ढाल व अंतःखंड)। H, 20 × 20 है, पर प्रक्षेप के रूप में उसका ट्रेस उसकी कोटि है। 3 उत्तर अंतःखंड स्तंभ भूलता है; 20 तत्समक का ट्रेस है।पूर्ण स्तंभ कोटि वाले X सहित रैखिक मॉडल y = Xβ + ε में कौन-से कथन सत्य हैं?
उत्तर देखें
उत्तर: B — यदि E ε = 0 व Cov ε = σ²I, तो न्यूनतम-वर्ग आकलक β का सर्वोत्तम रैखिक अनभिनत आकलक है; C — β के किसी अभिनत आकलक की माध्य वर्ग त्रुटि न्यूनतम वर्ग से कम हो सकती है; D — Cov(β̂) = σ²(XᵀX)⁻¹
(A) असत्य: केवल प्रथम दो आघूर्ण माने जाते हैं। (B) प्रमेय। (C) गॉस–मार्कोव केवल अनभिनत रैखिक आकलकों की तुलना करता है; XᵀX लगभग अव्युत्क्रमणीय हो तो रिज समाश्रयण थोड़ी अभिनति के बदले प्रसरण में बड़ी कटौती करता है। (D) β̂ = (XᵀX)⁻¹Xᵀy, अतः Cov β̂ = (XᵀX)⁻¹Xᵀ(σ²I)X(XᵀX)⁻¹ = σ²(XᵀX)⁻¹।Y ~ N_n(0, I) तथा A, B, n × n सममित आव्यूह हैं। कौन-से कथन सत्य हैं?
उत्तर देखें
उत्तर: A — यदि A कोटि r का वर्गसम है, तो YᵀAY ~ χ²_r; B — यदि AB = 0, तो YᵀAY व YᵀBY स्वतंत्र हैं; C — कोटि p वाले n × p अभिकल्प के हैट आव्यूह H हेतु Yᵀ(I − H)Y ~ χ²_{n−p}
(A) A = PDPᵀ, D में r इकाइयों सहित, अतः YᵀAY, r वर्गित स्वतंत्र N(0, 1) का योग है। (B) क्रेग प्रमेय। (C) I − H, कोटि n − p का सममित वर्गसम है। (D) असत्य: A = diag(2, 0, …, 0) PSD है, और YᵀAY = 2Y₁², 2χ²₁ है, माध्य 2 व प्रसरण 8 सहित, काई-वर्ग नहीं।एक समाश्रयण गुणांक का आकल β̂₁ = 2.5 है, 20 अवशिष्ट स्वातंत्र्य-कोटियों पर मानक त्रुटि 0.4 सहित। t₂₀,₀.₀₂₅ = 2.086 प्रयोग करते हुए β₁ हेतु 95% विश्वास्यता अंतराल की उपरि सीमा, दो दशमलव स्थानों तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 3.33
2.5 + 2.086 × 0.4 = 2.5 + 0.8344 = 3.3344 → 3.33। 1.96 लेना 3.28 देता है, जो σ को ज्ञात मानता है; t क्वांटाइल अवशिष्ट स्वातंत्र्य-कोटियों का है।Y ~ N₂(μ, I), μ = (1, 2) सहित, तथा A = [[2, 1], [1, 1]]। E[YᵀAY] ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 13
E[YᵀAY] = tr(AΣ) + μᵀAμ = tr A + μᵀAμ = 3 + (2 × 1 + 2 × 1 × 2 + 1 × 4) = 3 + 10 = 13। ट्रेस पद छोड़ना 10 देता है (माध्य पर मान); μᵀAμ छोड़ना 3 (शून्य माध्य हेतु मान)।एक बहु समाश्रयण मॉडल में एक अतिरिक्त समाश्रयक जोड़ा जाता है। कौन-सा कथन सदा सत्य है?
उत्तर देखें
उत्तर: A — R² नहीं घटता
बड़ी स्तंभ समष्टि पर न्यूनतम वर्ग अवशिष्ट वर्ग-योग केवल घटा (या बनाए रख) सकता है, अतः R² = 1 − SSE/SST गिर नहीं सकता। समायोजित R² खोई स्वातंत्र्य-कोटि का मूल्य लेता है और नए समाश्रयक का |t| < 1 होने पर गिरता है — उसे प्रयोग करने का यही उद्देश्य है।एक अंतःखंड व एक समाश्रयक वाले समाश्रयण हेतु XᵀX = [[5, 10], [10, 30]] तथा Xᵀy = (20, 50)। ढाल का न्यूनतम-वर्ग आकल ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 1
det XᵀX = 150 − 100 = 50, (XᵀX)⁻¹ = (1/50)[[30, −10], [−10, 5]], β̂ = (1/50)(600 − 500, −200 + 250) = (2, 1): अंतःखंड 2, ढाल 1। प्रसामान्य समीकरणों से जाँच: 5 × 2 + 10 × 1 = 20 व 10 × 2 + 30 × 1 = 50। प्रविष्टि-दर-प्रविष्टि 50 को 30 से भाग देना 1.67 देता है, जो आव्यूह प्रतिलोम का तरीका नहीं।x पर y का समाश्रयण गुणांक 1.6 व y पर x का 0.4 है। x व y के बीच सहसंबंध गुणांक, एक दशमलव स्थान तक, ____ है।
संख्यात्मक उत्तर — मान टाइप करें।
उत्तर देखें
उत्तर: 0.8
b_yx b_xy = r² = 1.6 × 0.4 = 0.64, अतः |r| = 0.8, और r दोनों ढालों का साझा चिह्न लेता है: +0.8। समांतर माध्य (1.6 + 0.4)/2 = 1 सहसंबंध नहीं हो सकता — r उनका गुणोत्तर माध्य है।बिंदु x₀ पर माध्य अनुक्रिया E(y | x₀) हेतु 95% विश्वास्यता अंतराल की तुलना नए प्रेक्षण y₀ हेतु 95% पूर्वानुमान अंतराल से करें। कौन-सा सत्य है?
उत्तर देखें
उत्तर: A — पूर्वानुमान अंतराल सदा अधिक चौड़ा है
Var(y₀ − ŷ₀) = σ²[1 + x₀ᵀ(XᵀX)⁻¹x₀], Var(ŷ₀) = σ²x₀ᵀ(XᵀX)⁻¹x₀ से नई त्रुटि के प्रसरण σ² जितना अधिक है। n बढ़ने पर दूसरा पद लुप्त होता है पर 1 नहीं, अतः केवल विश्वास्यता अंतराल शून्य चौड़ाई तक सिकुड़ता है।30 प्रेक्षणों पर एक अंतःखंड व 3 समाश्रयकों वाला बहु समाश्रयण समंजित किया जाता है। उसकी ANOVA सारणी में समाश्रयण, अवशिष्ट व कुल हेतु स्वातंत्र्य-कोटियाँ हैं:
उत्तर देखें
उत्तर: A — 3, 26, 29
कुल n − 1 = 29 है (एक स्वातंत्र्य-कोटि माध्य को जाती है), समाश्रयण k = 3, अवशिष्ट n − k − 1 = 26, और 3 + 26 = 29 — कार्यरत कॉक्रन कोटि प्रतिबंध। अंतःखंड को समाश्रयण स्वातंत्र्य-कोटि गिनना 4 देता है, जो केवल अकेंद्रित कुल 30 हेतु सही है।