Commands to explore and view data distributions graphically (Bell curve)

hist() તમારા data નો ખરેખરો આકાર દેખાડે છે, boxplot(y ~ group) એક જ અક્ષ પર જૂથો સરખાવે છે, અને curve(dnorm(...), add = TRUE) histogram પર સૈદ્ધાંતિક ઘંટ મૂકે છે: વિષયનું સમાપનનું ચિત્ર.

10 min read · 9 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

વિષય એક ચિત્રથી પૂરો થાય છે

પચીસ પાઠની સંખ્યાઓ સમાપનનું ચિત્ર લાયક છે. ડીન છેલ્લો પ્રશ્ન પૂછે છે: "તમે કહ્યા કરો છો કે ઊંચાઈઓ normal છે અને screen time નથી: મને દેખાડો."

પુરાવો એક chart છે: તમારો ખરેખરો data histogram તરીકે, અને એની ઉપર દોરાયેલો સૈદ્ધાંતિક bell curve. જ્યાં વળાંક સ્તંભોને વળગે છે, ત્યાં normal model ટકે છે અને દરેક pnorm નો જવાબ ભરોસાપાત્ર છે. જ્યાં નથી વળગતો, ત્યાં data નહીં પણ model એ નમવું પડે.

આજે: એ ચુકાદો દોરતી R ની commands.

Theory

દરજીનું માપ લેવું

Bell curve એ તૈયાર સૂટ છે (બે માપ: સરેરાશ અને sd). તમારો data એ ગ્રાહક છે.

Histogram પર curve(dnorm(...)) મૂકવું એ માપ લેવાનું છે: ઊંચાઈઓ સૂટમાં લગભગ સંપૂર્ણ રીતે સરકી જાય છે; screen time ડાબે ફૂલે છે અને લાંબી જમણી બાંય ખેંચે છે: કોઈ સિલાઈ એને બચાવી શકતી નથી.

આંકડાશાસ્ત્ર બરાબર અહીં પ્રામાણિક છે: model ને data પ્રમાણે બેસાડો, અને માપ લેવાનો ફોટો દેખાડો, સૂટ બેસે છે એવું ક્યારેય માની ન લો.

Practical

સમાપન: histogram, જૂથો, અને ઘંટનું આવરણ

survey <- read.csv("survey_clean.csv")

# 1. the data's shape
hist(survey$height, breaks = 10,
     main = "Heights of surveyed students",
     xlab = "Height (cm)", ylab = "Frequency")

# 2. groups side by side: the formula reads 'screen BY stay'
boxplot(screen ~ stay, data = survey,
        main = "Screen time by residence", ylab = "Minutes")

# 3. THE BELL OVERLAY: density scale first, then the curve
hist(survey$height, freq = FALSE,        # y-axis = density now
     main = "Heights vs the normal model", xlab = "Height (cm)")
curve(dnorm(x, mean = mean(survey$height, na.rm = TRUE),
               sd  = sd(survey$height,  na.rm = TRUE)),
      add = TRUE, col = "red", lwd = 2)  # add = TRUE: draw ON TOP
abline(v = mean(survey$height, na.rm = TRUE), lty = 2)

# same overlay on screen time: watch the suit NOT fit
hist(survey$screen, freq = FALSE, main = "Screen time vs the bell")
curve(dnorm(x, mean(survey$screen, na.rm = TRUE),
               sd(survey$screen, na.rm = TRUE)),
      add = TRUE, col = "red", lwd = 2)

Theory

બે માપનું વાચન

ઊંચાઈઓ: સ્તંભ સમમિત રીતે ચઢે અને ઊતરે છે; લાલ ઘંટ એમને નજીકથી અનુસરે છે; તૂટક સરેરાશની લીટી ચિત્રને સરખા ભાગે વહેંચે છે. ચુકાદો: normal model બેસે છે: ઊંચાઈ વિશેનો દરેક pnorm નો જવાબ મજબૂત જમીન પર છે.

Screen time: સ્તંભ ડાબે ભેગા થાય છે અને લાંબી જમણી પૂંછડી છે (સળંગ જોનારા); ઘંટ જમણી બાજુ ખાલી જગ્યા પર તરે છે અને ડાબા ઢગલા સુધી પહોંચતો નથી. ચુકાદો: normal નથી: મધ્યસ્થ અને IQR જણાવો, અને કોઈ પણ pnorm ના જવાબને શંકાથી જુઓ.

બે ચિત્ર, અને આ વિષયે કરેલો દરેક દાવો દેખાતો થાય છે.

Quiz

એક student hist(heights) ચલાવે છે પછી curve(dnorm(x, 168, 6), add = TRUE) અને લાલ વળાંક x-અક્ષ પર સપાટ ઘસડાય છે, અદૃશ્ય. શું ખોટું થયું?

  1. Histogram **આવૃત્તિ** ના પટ પર છે (ગણતરી લગભગ 15 સુધી) જ્યારે dnorm ની ઘનતાનું શિખર લગભગ 0.07 છે: ઘનતાનો પટ વહેંચવા hist ને freq = FALSE જોઈએ
  2. dnorm ને curve() થી દોરી શકાતું નથી
  3. add = TRUE એ વળાંક ભૂંસી નાખ્યો
  4. 6 નું sd દોરવા માટે બહુ નાનું છે
Show the answer

Histogram **આવૃત્તિ** ના પટ પર છે (ગણતરી લગભગ 15 સુધી) જ્યારે dnorm ની ઘનતાનું શિખર લગભગ 0.07 છે: ઘનતાનો પટ વહેંચવા hist ને freq = FALSE જોઈએ

આવૃત્તિ students ગણે છે (0 થી લગભગ 15); ઘનતાનું સંકલન 1 થાય છે (અહીં લગભગ 0.07 એ શિખર): એક જ chart પર દોરાતાં, ઘનતાનો વળાંક આવૃત્તિના પર્વતો નીચે સપાટ ગણગણાટ છે. freq = FALSE histogram ના y-અક્ષને ઘનતામાં ફેરવે છે જેથી બંને એક જ એકમમાં બોલે: આવરણનો સૌથી સામાન્ય એક bug. add = TRUE ભૂંસવાનું ઊલટું કરે છે (એ histogram સાચવે છે); એના વગર, curve() plot ને બદલી નાખત: જોડિયો ફાંદો.

Think first

ચુકાદો આપો

તમે ડીનને બંને આવરણનાં charts દેખાડો છો. બે વાક્યનો ચુકાદો રચો: દરેક variable દીઠ એક વાક્ય, દરેકમાં ચિત્રમાંનો પુરાવો અને અહેવાલ માટેનું વ્યવહારુ પરિણામ. પછી tap કરો.

Show the answer

ઊંચાઈઓ: histogram સમમિત છે અને બેસાડેલો ઘંટ એને નજીકથી અનુસરે છે, એટલે normal model લાગુ પડે છે: સરેરાશ, SD અને pnorm આધારિત ટકાવારી (દા.ત. 180 cm થી ઉપરનો હિસ્સો) ભરોસાપાત્ર છે.

Screen time: distribution જમણી બાજુ વિષમ છે અને એની લાંબી પૂંછડીને ઘંટ અનુસરી શકતો નથી, એટલે normal આધારિત જવાબ ગેરમાર્ગે દોરે: અમે મધ્યસ્થ અને IQR જણાવીએ છીએ, અને ભારે વપરાશકારોની પૂંછડી અલગ ઉજાગર કરીએ છીએ.

પુરાવો વત્તા પરિણામ, બે વાર: એ જ લઘુ સ્વરૂપમાં આંકડાશાસ્ત્રનો અહેવાલ છે, અને પરીક્ષાનો સ્વપ્નનો જવાબ.

Watch out

સમાપનના ફાંદા

કોઈ પણ dnorm ના આવરણ પહેલાં freq = FALSE: આવૃત્તિ અને ઘનતાના પટ ક્યારેય ભળતા નથી.

curve() પર add = TRUE: એના વગર ઘંટ તમારા histogram ની જગ્યા લે છે.

લેબલ એ marks છે: દરેક chart પર main, xlab, ylab: લેબલ વગરનો chart એ અધૂરો જવાબ છે.

Model data ને સેવે છે: જે આકારે સૂટ નકાર્યો હોય એના પર normal નિષ્કર્ષ ક્યારેય ન લાદો.

Theory

CampusPulse, પૂરું

આખા ચાપ પર પાછળ જુઓ: તમે નમૂનાનું આયોજન કર્યું, એના આંકડા હાથે ગણ્યા, એમની પાછળની સંભાવના શીખી, R માં ખરેખરો data આયાત કરીને સાફ કર્યો, અને તમારા પોતાના survey પર bell curve દોરીને પૂરું કર્યું. એ ચક્ર (રચના, સંગ્રહ, સફાઈ, સારાંશ, model, ચિત્ર, ચુકાદો) એ અભ્યાસક્રમ નથી: એ data ના કામનો ખરેખરો રોજિંદો આકાર છે. BCA302 પૂરું: જે જિજ્ઞાસુ રહે એની રાહ qqnorm() અને ઔપચારિક કસોટીઓ જુએ છે.

Summary

Key takeaways

  • hist(x, breaks = n) data નો આકાર દેખાડે છે; main/xlab/ylab ફરજિયાત શિષ્ટાચાર છે.
  • boxplot(y ~ group, data = df): પાસે પાસે પાંચ સંખ્યાની સરખામણી: સૂત્ર 'y જૂથ પ્રમાણે' વંચાય છે.
  • આવરણની રીત: hist(x, freq = FALSE) પછી curve(dnorm(x, mean, sd), add = TRUE).
  • freq = FALSE પટ મેળવે છે; add = TRUE histogram સાચવે છે: બંને બાંધછોડ વગરનાં.
  • નજીકનું બંધબેસવું = normal model ભરોસાપાત્ર; દેખાતી વિષમતા = એને બદલે મધ્યસ્થ/IQR જણાવો.
  • abline() સંદર્ભની લીટીઓ ઉમેરે છે; qqnorm() આ course ની બહારનું ઔપચારિક normality નું ઓજાર છે.
  • Memory hook: દરજીનું માપ લેવું: શું તૈયાર ઘંટનો સૂટ તમારા data ને બેસે છે?

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Working with Data in R

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Commands to explore and view data distributions graphically (Bell curve) · Statistical Methods and Data Analysis (MDC-03) · Gri-Learn