Theory
એ જ સરેરાશ, બે જુદા વર્ગ
DBMS ના બે વિભાગની સરેરાશ 60 છે. એ જ સરેરાશ, એ જ અભ્યાસક્રમ. પછી પેપર સમાયોજન માટે ફરી તપાસાય છે:
- વિભાગ A: લગભગ બધા 55 અને 65 વચ્ચે.
- વિભાગ B: અડધો વર્ગ 40 પાસે, બીજો અડધો 80 પાસે, 60 પર લગભગ કોઈ નહીં.
સરેરાશને કોઈ ફરક ન દેખાયો. Marks નો આકાર ભણાવવાની બે સાવ જુદી કથા કહે છે. આકાર જોવો એ chart નું કામ છે, અને એ chart છે histogram.
Theory
કવરોને ખાનાંમાં ગોઠવવાં
0-10, 10-20, ... 90-100 લેબલવાળાં ખાનાં લો. દરેક student ની marksheet એના ખાનામાં નાખો, પછી થપ્પીની ઊંચાઈ જુઓ.
વચ્ચે ઊંચી થપ્પી: ભેગો થયેલો વર્ગ. બે અલગ ઊંચી થપ્પી: એક જ વર્ગખંડ વહેંચતાં બે અલગ જૂથ. 90-100 માં એકલું કવર: તમારો ટોપર.
Histogram એ જ ખાનાં છે: એ "મૂલ્યો કેવી રીતે વહેંચાયેલાં છે?" નો જવાબ આપે છે: એક variable, હદ પ્રમાણે ગણાયેલો.
Theory
Histogram, ઔપચારિક રીતે
plt.hist(values, bins=n) સંખ્યાની હદને n સરખી પહોળાઈનાં અંતરાલ (bins) માં વહેંચે છે અને દરેક bin દીઠ એક સ્તંભ દોરે છે: ઊંચાઈ = અંદર કેટલાં મૂલ્યો પડ્યાં.
એ શું લે છે એ નોંધો: એક numeric ખાનું. Scatter ને x અને y જોઈતાં હતાં; hist() ને ફક્ત scores જોઈએ: x અક્ષ (score ની હદ) bin બનાવવાથી જ સર્જાય છે, y અક્ષ હંમેશા ગણતરી હોય છે.
bins= એ સૂક્ષ્મ ગોઠવણનું બટન છે: બહુ ઓછાં bins કથાને સપાટ કરી નાખે છે, બહુ વધારે એને ઘોંઘાટમાં ચીરી નાખે છે. 60 ના વર્ગ માટે, લગભગ 8-12 થી શરૂ કરો.
Practical
બે વિભાગ, ઉઘાડા પડ્યા
import matplotlib.pyplot as plt
import pandas as pd
df = pd.read_csv('marks.csv')
dbms = df[df['subject'] == 'DBMS']['score'] # ONE numeric column
plt.hist(dbms, bins=10)
plt.title('Distribution of DBMS scores')
plt.xlabel('Score range')
plt.ylabel('Number of students')
plt.show()
# side by side: the two divisions on one figure
# plt.subplot(1, 2, 1); plt.hist(divA, bins=10); plt.title('Div A')
# plt.subplot(1, 2, 2); plt.hist(divB, bins=10); plt.title('Div B')
# Div A: one hump near 60. Div B: two humps: two groups, one mean.
This example runs in Gri-Learn on the web, where you can edit it and see the output.
Think first
આકારને પરીક્ષકની જેમ વાંચો
વિભાગ B નું histogram બે સ્પષ્ટ ટેકરા દેખાડે છે: એક 40 આસપાસ, એક 80 આસપાસ, 60 પર ખીણ. Tap કરતાં પહેલાં: આ બે-ટેકરાવાળો આકાર વર્ગ વિશે શું કહે છે, અને 60 ની સરેરાશે એ કેમ છુપાવ્યું?
Show the answer
બે ટેકરા = એક જ ઓરડામાં બે અલગ વસ્તી: એક જૂથ 40 પાસે સંઘર્ષ કરતું, બીજું 80 પાસે આરામથી: કદાચ જુદી તૈયારી, જુદી batch, જુદી પૃષ્ઠભૂમિ. "60 વાળા સરેરાશ student ને" ભણાવવું એટલે એવા student ને નિશાન બનાવવું જે લગભગ અસ્તિત્વમાં જ નથી.
સરેરાશે એ છુપાવ્યું કારણ કે એ બે જૂથને ગણિતથી સંતુલિત કરે છે: 40 અને 80 ની સરેરાશ 60 થાય છે. આ કેન્દ્રીય પ્રવૃત્તિના પાઠની ચેતવણી દૃશ્યમાન થયેલી છે: સારાંશની સંખ્યા હંમેશા એની પાછળના આકાર પર એક નજર લાયક છે.
Quiz
Histogram સામે bar chart: કયું વિધાન **સાચું** છે?
- Histogram એક સળંગ numeric variable ને bins માં વહેંચે છે (સ્તંભ અડે છે); bar chart અલગ શ્રેણીઓ સરખાવે છે (સ્તંભ છૂટા)
- એ જુદાં નામવાળો એક જ chart છે
- Histogram વિષયો સરખાવે છે; bar chart score ની હદ દેખાડે છે
- Bar chart ને bins= જોઈએ છે જ્યારે histogram ને નહીં
Show the answer
Histogram એક સળંગ numeric variable ને bins માં વહેંચે છે (સ્તંભ અડે છે); bar chart અલગ શ્રેણીઓ સરખાવે છે (સ્તંભ છૂટા)
ગૂંચવણની જોડી, પતાવેલી: Histogram સળંગ સંખ્યારેખા (scores 0-100) ને bins માં કાપે છે, એટલે એના સ્તંભ અડે છે અને એમનો ક્રમ સંખ્યારેખાથી નક્કી થાય છે. Bar chart (આગલો પાઠ) અલગ શ્રેણીઓ સરખાવે છે (DBMS સામે Maths), સ્તંભ છૂટા, ક્રમ તમારી પસંદગીનો. વિકલ્પ C બરાબર બંને અદલાબદલ કરે છે: એ જ ભૂલ જેની પરીક્ષકો રાહ જુએ છે. bins= ફક્ત hist() નું છે.
Watch out
bins નો ફાંદો, બંને દિશામાં
બે ટેકરાવાળા વર્ગ પર bins=2: એક જાડો ટુકડો, બંને ટેકરા ગયા, કટોકટી અદૃશ્ય. સાઠ students પર bins=60: દરેક સ્તંભની ઊંચાઈ 0 કે 1, શુદ્ધ ઘોંઘાટ.
bins નું કોઈ એક સાચું મૂલ્ય નથી: થોડાં અજમાવો (8, 10, 15) અને જ્યાં આકાર સ્થિર થાય એ રાખો. જો પરીક્ષા પૂછે કે bins કેમ મહત્ત્વનાં છે, તો છુપાવવું-કે-ચીરવું ની આ આપ-લે જ જવાબ છે.
Theory
Distributions ક્યાં નિર્ણય લે છે
પરિણામનું સમાયોજન (આ પેપરના marks માપવા જોઈએ?), normalization ના વળાંક, આવકનાં survey, servers માં પ્રતિભાવના સમયનું નિરીક્ષણ: બધું histogram થી શરૂ થાય છે, કારણ કે બધું "distribution કેવું દેખાય છે?" થી શરૂ થાય છે. તમારી પાસે હવે ચારમાંથી ત્રણ chart નાં મૂળ સ્વરૂપ છે; bar chart આગળ સમૂહ પૂરો કરે છે, અને એની સાથે ResultDesk નું dashboard.
Summary
Key takeaways
- plt.hist(values, bins=n): એક numeric ખાનું, n હદમાં વહેંચાયેલું, સ્તંભની ઊંચાઈ = ગણતરી.
- Histograms આકાર ઉઘાડે છે: ટેકરા, બે ટેકરા (બે જૂથ), પૂંછડી, outliers.
- એ જ સરેરાશ સાવ જુદા આકાર છુપાવી શકે છે: બે વિભાગની કથા.
- bins= બહુ નાનું માળખું છુપાવે છે, બહુ મોટું એને ચીરે છે: વર્ગના કદના data માટે 8-15 અજમાવો.
- Histogram = સળંગ variable bins માં (સ્તંભ અડે છે); bar chart = અલગ શ્રેણીઓ (સ્તંભ છૂટા).
- લેબલ: title, xlabel = score ની હદ, ylabel = students ની ગણતરી.
- Memory hook: ખાનાંમાં કવર, થપ્પીની ઊંચાઈ વાંચો.