Histogram chart: concepts of histogram hist(), set title, xlabel and ylabel

Histogram સંખ્યાની હદને ખાનાંમાં કાપે છે અને દરેકમાં કેટલાં મૂલ્યો પડે છે એ દેખાડે છે, જે distribution નો આકાર ઉઘાડે છે: plt.hist(scores, bins=n) એ આખું call છે.

9 min read · 9 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

એ જ સરેરાશ, બે જુદા વર્ગ

DBMS ના બે વિભાગની સરેરાશ 60 છે. એ જ સરેરાશ, એ જ અભ્યાસક્રમ. પછી પેપર સમાયોજન માટે ફરી તપાસાય છે:

  • વિભાગ A: લગભગ બધા 55 અને 65 વચ્ચે.
  • વિભાગ B: અડધો વર્ગ 40 પાસે, બીજો અડધો 80 પાસે, 60 પર લગભગ કોઈ નહીં.

સરેરાશને કોઈ ફરક ન દેખાયો. Marks નો આકાર ભણાવવાની બે સાવ જુદી કથા કહે છે. આકાર જોવો એ chart નું કામ છે, અને એ chart છે histogram.

Theory

કવરોને ખાનાંમાં ગોઠવવાં

0-10, 10-20, ... 90-100 લેબલવાળાં ખાનાં લો. દરેક student ની marksheet એના ખાનામાં નાખો, પછી થપ્પીની ઊંચાઈ જુઓ.

વચ્ચે ઊંચી થપ્પી: ભેગો થયેલો વર્ગ. બે અલગ ઊંચી થપ્પી: એક જ વર્ગખંડ વહેંચતાં બે અલગ જૂથ. 90-100 માં એકલું કવર: તમારો ટોપર.

Histogram એ જ ખાનાં છે: એ "મૂલ્યો કેવી રીતે વહેંચાયેલાં છે?" નો જવાબ આપે છે: એક variable, હદ પ્રમાણે ગણાયેલો.

Theory

Histogram, ઔપચારિક રીતે

plt.hist(values, bins=n) સંખ્યાની હદને n સરખી પહોળાઈનાં અંતરાલ (bins) માં વહેંચે છે અને દરેક bin દીઠ એક સ્તંભ દોરે છે: ઊંચાઈ = અંદર કેટલાં મૂલ્યો પડ્યાં.

એ શું લે છે એ નોંધો: એક numeric ખાનું. Scatter ને x અને y જોઈતાં હતાં; hist() ને ફક્ત scores જોઈએ: x અક્ષ (score ની હદ) bin બનાવવાથી જ સર્જાય છે, y અક્ષ હંમેશા ગણતરી હોય છે.

bins= એ સૂક્ષ્મ ગોઠવણનું બટન છે: બહુ ઓછાં bins કથાને સપાટ કરી નાખે છે, બહુ વધારે એને ઘોંઘાટમાં ચીરી નાખે છે. 60 ના વર્ગ માટે, લગભગ 8-12 થી શરૂ કરો.

Practical

બે વિભાગ, ઉઘાડા પડ્યા

import matplotlib.pyplot as plt
import pandas as pd

df = pd.read_csv('marks.csv')
dbms = df[df['subject'] == 'DBMS']['score']   # ONE numeric column

plt.hist(dbms, bins=10)
plt.title('Distribution of DBMS scores')
plt.xlabel('Score range')
plt.ylabel('Number of students')
plt.show()

# side by side: the two divisions on one figure
# plt.subplot(1, 2, 1); plt.hist(divA, bins=10); plt.title('Div A')
# plt.subplot(1, 2, 2); plt.hist(divB, bins=10); plt.title('Div B')
# Div A: one hump near 60.  Div B: two humps: two groups, one mean.

This example runs in Gri-Learn on the web, where you can edit it and see the output.

Think first

આકારને પરીક્ષકની જેમ વાંચો

વિભાગ B નું histogram બે સ્પષ્ટ ટેકરા દેખાડે છે: એક 40 આસપાસ, એક 80 આસપાસ, 60 પર ખીણ. Tap કરતાં પહેલાં: આ બે-ટેકરાવાળો આકાર વર્ગ વિશે શું કહે છે, અને 60 ની સરેરાશે એ કેમ છુપાવ્યું?

Show the answer

બે ટેકરા = એક જ ઓરડામાં બે અલગ વસ્તી: એક જૂથ 40 પાસે સંઘર્ષ કરતું, બીજું 80 પાસે આરામથી: કદાચ જુદી તૈયારી, જુદી batch, જુદી પૃષ્ઠભૂમિ. "60 વાળા સરેરાશ student ને" ભણાવવું એટલે એવા student ને નિશાન બનાવવું જે લગભગ અસ્તિત્વમાં જ નથી.

સરેરાશે એ છુપાવ્યું કારણ કે એ બે જૂથને ગણિતથી સંતુલિત કરે છે: 40 અને 80 ની સરેરાશ 60 થાય છે. આ કેન્દ્રીય પ્રવૃત્તિના પાઠની ચેતવણી દૃશ્યમાન થયેલી છે: સારાંશની સંખ્યા હંમેશા એની પાછળના આકાર પર એક નજર લાયક છે.

Quiz

Histogram સામે bar chart: કયું વિધાન **સાચું** છે?

  1. Histogram એક સળંગ numeric variable ને bins માં વહેંચે છે (સ્તંભ અડે છે); bar chart અલગ શ્રેણીઓ સરખાવે છે (સ્તંભ છૂટા)
  2. એ જુદાં નામવાળો એક જ chart છે
  3. Histogram વિષયો સરખાવે છે; bar chart score ની હદ દેખાડે છે
  4. Bar chart ને bins= જોઈએ છે જ્યારે histogram ને નહીં
Show the answer

Histogram એક સળંગ numeric variable ને bins માં વહેંચે છે (સ્તંભ અડે છે); bar chart અલગ શ્રેણીઓ સરખાવે છે (સ્તંભ છૂટા)

ગૂંચવણની જોડી, પતાવેલી: Histogram સળંગ સંખ્યારેખા (scores 0-100) ને bins માં કાપે છે, એટલે એના સ્તંભ અડે છે અને એમનો ક્રમ સંખ્યારેખાથી નક્કી થાય છે. Bar chart (આગલો પાઠ) અલગ શ્રેણીઓ સરખાવે છે (DBMS સામે Maths), સ્તંભ છૂટા, ક્રમ તમારી પસંદગીનો. વિકલ્પ C બરાબર બંને અદલાબદલ કરે છે: એ જ ભૂલ જેની પરીક્ષકો રાહ જુએ છે. bins= ફક્ત hist() નું છે.

Watch out

bins નો ફાંદો, બંને દિશામાં

બે ટેકરાવાળા વર્ગ પર bins=2: એક જાડો ટુકડો, બંને ટેકરા ગયા, કટોકટી અદૃશ્ય. સાઠ students પર bins=60: દરેક સ્તંભની ઊંચાઈ 0 કે 1, શુદ્ધ ઘોંઘાટ.

bins નું કોઈ એક સાચું મૂલ્ય નથી: થોડાં અજમાવો (8, 10, 15) અને જ્યાં આકાર સ્થિર થાય એ રાખો. જો પરીક્ષા પૂછે કે bins કેમ મહત્ત્વનાં છે, તો છુપાવવું-કે-ચીરવું ની આ આપ-લે જ જવાબ છે.

Theory

Distributions ક્યાં નિર્ણય લે છે

પરિણામનું સમાયોજન (આ પેપરના marks માપવા જોઈએ?), normalization ના વળાંક, આવકનાં survey, servers માં પ્રતિભાવના સમયનું નિરીક્ષણ: બધું histogram થી શરૂ થાય છે, કારણ કે બધું "distribution કેવું દેખાય છે?" થી શરૂ થાય છે. તમારી પાસે હવે ચારમાંથી ત્રણ chart નાં મૂળ સ્વરૂપ છે; bar chart આગળ સમૂહ પૂરો કરે છે, અને એની સાથે ResultDesk નું dashboard.

Summary

Key takeaways

  • plt.hist(values, bins=n): એક numeric ખાનું, n હદમાં વહેંચાયેલું, સ્તંભની ઊંચાઈ = ગણતરી.
  • Histograms આકાર ઉઘાડે છે: ટેકરા, બે ટેકરા (બે જૂથ), પૂંછડી, outliers.
  • એ જ સરેરાશ સાવ જુદા આકાર છુપાવી શકે છે: બે વિભાગની કથા.
  • bins= બહુ નાનું માળખું છુપાવે છે, બહુ મોટું એને ચીરે છે: વર્ગના કદના data માટે 8-15 અજમાવો.
  • Histogram = સળંગ variable bins માં (સ્તંભ અડે છે); bar chart = અલગ શ્રેણીઓ (સ્તંભ છૂટા).
  • લેબલ: title, xlabel = score ની હદ, ylabel = students ની ગણતરી.
  • Memory hook: ખાનાંમાં કવર, થપ્પીની ઊંચાઈ વાંચો.

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Data Visualization using dataframe

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Histogram chart: concepts of histogram hist(), set title, xlabel and ylabel · Database Handling using Python · Gri-Learn