Theory
Principal के पास नब्बे सेकंड हैं
CampusPulse data आ गया है। Principal screen-time findings दो meetings के बीच बिल्कुल नब्बे सेकंड के लिए देखेंगे।
60 numbers की एक table? Unread। Mean और SD जो आप अब compute कर सकते हैं? Honest, पर faceless।
नब्बे सेकंड में जो बचता है वह एक picture है। आप सही pictures में से दो को BCA303 में मिले (histogram, scatter): आज statistics इन्हें अपना claim करता है, आपको इन्हें एक examiner की तरह READ करना सिखाता है, और missing family member जोड़ता है: box plot।
Theory
एक dataset के तीन X-rays
Charts को X-rays की तरह सोचिए, हर एक एक चीज़ expose करता है:
- Histogram: data का shape: values कहाँ ढेर होती हैं, कहाँ पतली होती हैं।
- Scatter plot: relationship: क्या दो measurements साथ चलते हैं?
- Box plot: skeleton: पाँच हड्डियाँ (min, Q1, median, Q3, max) और कोई भी loose fragments (outliers) individually flagged।
वही patient, तीन views: एक पूरी diagnosis को आमतौर पर एक से ज़्यादा चाहिए।
Theory
Histogram और scatter: statistics वाली reading
Mechanics BCA303 का काम थे (plt.hist, plt.scatter); statistical READING इस subject का है:
Histogram (एक numeric variable, binned): symmetric hump = mean ≈ median; लंबी right tail = right-skewed, mean median से ऊपर खिंचा (screen-time story); दो humps = एक dataset share करती दो populations।
Scatter (दो numeric variables): up-right drift = positive correlation, down-right = negative, बेशक्ल cloud = कोई नहीं। Cloud से दूर dots = outliers जो एक roll-number lookup लायक़ हैं।
Theory
Box plot: पाँच numbers, एक glyph
Data sort कीजिए, फिर five-number summary ढूँढिए:
Min, Q1, Median, Q3, Max, जहाँ Q1 और Q3 lower और upper halves के medians हैं (25th और 75th percentiles)।
खींचिए: Q1 से Q3 तक एक box (इसमें middle 50% है: इसकी width interquartile range, IQR है), median पर अंदर एक line, और whiskers जो box के 1.5 × IQR के अंदर सबसे दूर values तक पहुँचती हैं। Whiskers से आगे जो कुछ भी है वह एक dot: एक outlier, individually named और shamed के रूप में plot होता है।
Theory
हल किया गया: screen time एक box बनता है
नौ values (sorted): 30, 60, 90, 90, 120, 150, 180, 210, 600।
- Median = 5वीं value = 120।
- Q1 = lower चार का median = (60+90)/2 = 75। Q3 = (180+210)/2 = 195।
- IQR = 195 - 75 = 120। Whisker limit: 195 + 1.5×120 = 375।
- 600, 375 से ज़्यादा है: एक outlier dot के रूप में drawn; upper whisker 210 पर रुकती है।
एक glyph अब कहता है: middle half 75 और 195 के बीच, centre 120, एक flagged extremist।
Quiz
एक box plot में, box के ANDAR line क्या mark करती है, और box ख़ुद क्या span करता है?
- Median; box Q1 से Q3 तक span करता है, data के middle 50% को होल्ड करते हुए
- Mean; box min से max तक span करता है
- Mode; box mean के दोनों तरफ़ एक SD span करता है
- Median; box data की पूरी range span करता है
Show the answer
Median; box Q1 से Q3 तक span करता है, data के middle 50% को होल्ड करते हुए
Box plot ENTIRELY five-number summary से बना है: inner line median है (mean नहीं: scripts में सबसे marked error), और box Q1 से Q3 चलता है: interquartile range जो central half रखता है। Min और max whisker tips पर रहते हैं (जब कोई outliers नहीं होते), box edges के रूप में कभी नहीं। SD box plot में कहीं भी नहीं दिखता।
Think first
Box से skew पढ़िए
Marks का एक box plot दिखाता है: median line box के BOTTOM के क़रीब बैठती है, और upper whisker lower वाली से बहुत लंबी है। tap करने से पहले: क्या data left-skewed है, right-skewed है या symmetric, और mean median से ऊपर बैठेगा या नीचे?
Show the answer
Right-skewed: data का upper half ज़्यादा दूर तक फैला है (लंबी upper whisker, median Q1 की तरफ़ भीड़ी हुई), यानी high values की एक tail।
Right skew में, tail mean को median से ऊपर खींचती है: central-tendency lesson का वही mean-vs-median signature, अब geometry के रूप में visible। बिना किसी numbers के एक box plot से skew पढ़ना बिल्कुल वह skill है जिसके लिए exams यह figure खींचते हैं।
Watch out
तीन reading errors
Box line को mean कहना: यह हमेशा median है।
Whisker tips को min/max कहना: सिर्फ़ तब सच जब कोई outliers न हों; outliers के साथ, whiskers 1.5 × IQR fence पर रुकती हैं और dots extremes ढोते हैं।
Histogram बनाम bar chart, फिर से: binned continuous variable (bars touch करते हैं) बनाम separate categories (bars अलग): यह confusion pair BCA303 से इस exam में भी आपका पीछा करता है।
Theory
Box plot की superpower: comparison
एक box plot describe करता है; side-by-side box plots compare करते हैं: hostellers बनाम day scholars की screen time एक axis पर दो boxes के रूप में medians, spreads और outliers को एक नज़र में दिखाती है: नब्बे-सेकंड वाला principal का chart। Unit 5 में, R इसे एक command से खींचता है (boxplot(time ~ type)), और five-number summary summary() से free मिलता है। जो chart आपने आज पढ़ना सीखा वही है जिसे आप R से खींचने का command देंगे।
Summary
Key takeaways
- Histogram = एक variable का shape (skew, humps); scatter = दो variables का relationship; box plot = five-number skeleton।
- Five-number summary: min, Q1, median, Q3, max; IQR = Q3 - Q1 middle 50% रखता है।
- Box = Q1 से Q3, inner line = MEDIAN, whiskers box से आगे ज़्यादा से ज़्यादा 1.5 × IQR पहुँचती हैं, आगे के dots = outliers।
- एक box edge के क़रीब median + एक लंबी whisker = skew; लंबी upper whisker मतलब mean > median।
- Side-by-side box plots groups के लिए comparison tool हैं।
- Memory hook: तीन X-rays: shape, relationship, skeleton।