Theory
Data का Shape
अकेले averages misleading हो सकते हैं। दो classes के same average marks हो सकते हैं पर completely different shapes: एक mean के around tightly bunched, दूसरा low scorers की एक long tail के साथ जो things को नीचे खींचती है। एक variable को really समझने के लिए, आप देखते हैं इसके values कैसे distributed हैं, इनका shape।
यह lesson key shapes cover करता है: symmetric normal distribution, skewed distributions जो एक तरफ leans करती हैं, और वे दो numbers जो shape measure करते हैं, skewness (lopsidedness) और kurtosis (tailedness)। आप statistics में bell curve से मिल चुके हैं; यहाँ आप एक analyst की तरह shape पढ़ना सीखते हैं।
Theory
Normal Distribution
Normal distribution famous symmetric, bell-shaped curve है। ज़्यादातर values centre के near cluster करते हैं, और ये दोनों sides पर evenly thin out होते हैं। एक perfectly normal distribution में, mean, median, और mode सब same central point पर बैठते हैं।
कई natural measurements (heights, और अक्सर exam marks) roughly normal होती हैं। यह वह reference shape है जिसके against हम बाकी को describe करते हैं: हम पूछते हैं एक real distribution इस ideal bell से कैसे depart करती है, और वे दो तरीके जिनसे यह depart कर सकती है skewness और kurtosis से capture होते हैं।
Theory
Skewed Distributions और Skewness
एक skewed distribution asymmetric है, एक tail दूसरी से longer है, और skewness वह number है जो इस lopsidedness को measure करता है (0 का मतलब symmetric है)।
Right (positive) skew: एक long tail right तक stretch करती है (high values की तरफ), mean को median से ऊपर खींचते हुए। Example: incomes, या marks जहाँ कुछ students एक low cluster से बहुत ऊपर score करते हैं।
Left (negative) skew: एक long tail left तक stretch करती है (low values की तरफ), mean को median से नीचे खींचते हुए। Example: एक easy exam जहाँ ज़्यादातर high score करते हैं पर कुछ बुरी तरह fail करते हैं।
Handy rule: right skew के लिए mean > median; left skew के लिए mean < median; mean long tail की तरफ खिंचता है।
Formula
Skewness Leans करता है; Kurtosis Peaks करता है
दोनों shape measures को distinct रखिए। Skewness symmetry के बारे में है, distribution किस तरफ leans करती है (अगर करती है), किस tail से longer है और mean-versus-median से बताया जाता है।
Kurtosis tailedness और peakedness के बारे में है, tails कितनी heavy हैं और peak कितना sharp है। High kurtosis का मतलब heavy tails और एक sharp peak है (एक normal curve से ज़्यादा extreme outliers); low kurtosis का मतलब light tails और एक flatter shape है। तो skewness answer देता है 'यह lopsided है, और किस तरफ?' जबकि kurtosis answer देता है 'tails कितनी extreme हैं?'।
Quiz
Marks की एक distribution में, mean (3.5) median (3.0) से ज़्यादा है, और कुछ बहुत high scores right की तरफ stretch करते हैं। यह कौन सी distribution है?
- Left (negative) skew, क्योंकि mean small है
- Right (positive) skew, एक long right tail के साथ जो mean को median से ऊपर खींचती है
- Perfectly normal, क्योंकि इसमें एक mean और एक median है
- इसमें high kurtosis है, skew नहीं
Show the answer
Right (positive) skew, एक long right tail के साथ जो mean को median से ऊपर खींचती है
एक long tail जो RIGHT (high values की तरफ) stretch करती है mean के median से ABOVE खिंचने के साथ (3.5 > 3.0), right (positive) skew का signature है। Option A backwards है: left skew में tail LEFT पर होती है और mean median से BELOW होता है (mean < median), जो describe किया गया उसका opposite। Option C wrong है: एक perfectly normal distribution symmetric होती है mean = median = mode के साथ, पर यहाँ mean, median के बराबर नहीं है, तो यह normal नहीं है। Option D दोनों measures confuse करता है: kurtosis tail heaviness/peakedness describe करता है, जबकि यहाँ lopsidedness और mean-median gap SKEWNESS के बारे में है। याद रखिए: mean long tail की तरफ खिंचता है, तो mean > median का मतलब है एक right tail, right skew।
Think first
Mean Long Tail की तरफ क्यों खिंचता है?
एक right-skewed distribution में, mean median से higher क्यों end होता है? फिर tap कीजिए।
Show the answer
क्योंकि MEAN extreme values के लिए sensitive है जबकि MEDIAN नहीं है, तो extreme values की एक long tail mean को अपनी तरफ खींचती है, पर median को मुश्किल से move करती है। Mean arithmetic average है: हर value अपना पूरा size total में contribute करता है, तो कुछ बहुत बड़े values (long right tail) sum में बहुत add करते हैं और average को UP खींचते हैं। Median, इसके contrast में, बस middle value है जब data sorted होता है, यह सिर्फ़ POSITION care करता है, magnitude नहीं। Right पर कुछ enormous values add करना middle position को सिर्फ़ slightly push करता है, क्योंकि median data points count करता है, इनका size नहीं। तो एक right-skewed distribution में, extreme high values mean को median से well above inflate करते हैं, mean > median देते हुए; एक left-skewed distribution में, extreme low values mean को median से नीचे खींचते हैं। यही exactly वजह है, incomes जैसे skewed data के लिए, median अक्सर 'typical' value की तरह report किया जाता है, यह outliers से distortion resist करता है, जबकि mean misleadingly high हो सकता है। यह भी explain करता है क्यों mean और median compare करना एक इतना quick skew test है: अगर ये noticeably differ करते हैं, data mean जिस side पर है उस तरफ skewed है। Mean tail chase करता है; median middle hold करता है।
Summary
Key takeaways
- Distribution का shape, सिर्फ़ इसका average नहीं, यह reveal करता है एक variable really कैसा है।
- Normal distribution symmetric bell curve है, जहाँ mean = median = mode और values centrally cluster करते हैं।
- Skewness asymmetry measure करता है: right (positive) skew में एक long right tail है mean > median के साथ; left (negative) skew में एक long left tail है mean < median के साथ।
- Mean long tail की तरफ खिंचता है, तो mean और median compare करना एक quick skew test है।
- Kurtosis tailedness और peakedness measure करता है: high = heavy tails और sharp peak (ज़्यादा extremes), low = light tails और flatter।
- Skewness answer देता है 'यह किस तरफ leans करता है?'; kurtosis answer देता है 'tails कितनी extreme हैं?'।
- Memory hook: normal balanced bell है; skew leans करता है (mean tail chase करता है); kurtosis tails के weight के बारे में है।