Theory
વિષય એક ચિત્રથી પૂરો થાય છે
પચીસ પાઠની સંખ્યાઓ સમાપનનું ચિત્ર લાયક છે. ડીન છેલ્લો પ્રશ્ન પૂછે છે: "તમે કહ્યા કરો છો કે ઊંચાઈઓ normal છે અને screen time નથી: મને દેખાડો."
પુરાવો એક chart છે: તમારો ખરેખરો data histogram તરીકે, અને એની ઉપર દોરાયેલો સૈદ્ધાંતિક bell curve. જ્યાં વળાંક સ્તંભોને વળગે છે, ત્યાં normal model ટકે છે અને દરેક pnorm નો જવાબ ભરોસાપાત્ર છે. જ્યાં નથી વળગતો, ત્યાં data નહીં પણ model એ નમવું પડે.
આજે: એ ચુકાદો દોરતી R ની commands.
Theory
દરજીનું માપ લેવું
Bell curve એ તૈયાર સૂટ છે (બે માપ: સરેરાશ અને sd). તમારો data એ ગ્રાહક છે.
Histogram પર curve(dnorm(...)) મૂકવું એ માપ લેવાનું છે: ઊંચાઈઓ સૂટમાં લગભગ સંપૂર્ણ રીતે સરકી જાય છે; screen time ડાબે ફૂલે છે અને લાંબી જમણી બાંય ખેંચે છે: કોઈ સિલાઈ એને બચાવી શકતી નથી.
આંકડાશાસ્ત્ર બરાબર અહીં પ્રામાણિક છે: model ને data પ્રમાણે બેસાડો, અને માપ લેવાનો ફોટો દેખાડો, સૂટ બેસે છે એવું ક્યારેય માની ન લો.
Practical
સમાપન: histogram, જૂથો, અને ઘંટનું આવરણ
survey <- read.csv("survey_clean.csv")
# 1. the data's shape
hist(survey$height, breaks = 10,
main = "Heights of surveyed students",
xlab = "Height (cm)", ylab = "Frequency")
# 2. groups side by side: the formula reads 'screen BY stay'
boxplot(screen ~ stay, data = survey,
main = "Screen time by residence", ylab = "Minutes")
# 3. THE BELL OVERLAY: density scale first, then the curve
hist(survey$height, freq = FALSE, # y-axis = density now
main = "Heights vs the normal model", xlab = "Height (cm)")
curve(dnorm(x, mean = mean(survey$height, na.rm = TRUE),
sd = sd(survey$height, na.rm = TRUE)),
add = TRUE, col = "red", lwd = 2) # add = TRUE: draw ON TOP
abline(v = mean(survey$height, na.rm = TRUE), lty = 2)
# same overlay on screen time: watch the suit NOT fit
hist(survey$screen, freq = FALSE, main = "Screen time vs the bell")
curve(dnorm(x, mean(survey$screen, na.rm = TRUE),
sd(survey$screen, na.rm = TRUE)),
add = TRUE, col = "red", lwd = 2)
Theory
બે માપનું વાચન
ઊંચાઈઓ: સ્તંભ સમમિત રીતે ચઢે અને ઊતરે છે; લાલ ઘંટ એમને નજીકથી અનુસરે છે; તૂટક સરેરાશની લીટી ચિત્રને સરખા ભાગે વહેંચે છે. ચુકાદો: normal model બેસે છે: ઊંચાઈ વિશેનો દરેક pnorm નો જવાબ મજબૂત જમીન પર છે.
Screen time: સ્તંભ ડાબે ભેગા થાય છે અને લાંબી જમણી પૂંછડી છે (સળંગ જોનારા); ઘંટ જમણી બાજુ ખાલી જગ્યા પર તરે છે અને ડાબા ઢગલા સુધી પહોંચતો નથી. ચુકાદો: normal નથી: મધ્યસ્થ અને IQR જણાવો, અને કોઈ પણ pnorm ના જવાબને શંકાથી જુઓ.
બે ચિત્ર, અને આ વિષયે કરેલો દરેક દાવો દેખાતો થાય છે.
Quiz
એક student hist(heights) ચલાવે છે પછી curve(dnorm(x, 168, 6), add = TRUE) અને લાલ વળાંક x-અક્ષ પર સપાટ ઘસડાય છે, અદૃશ્ય. શું ખોટું થયું?
- Histogram **આવૃત્તિ** ના પટ પર છે (ગણતરી લગભગ 15 સુધી) જ્યારે dnorm ની ઘનતાનું શિખર લગભગ 0.07 છે: ઘનતાનો પટ વહેંચવા hist ને freq = FALSE જોઈએ
- dnorm ને curve() થી દોરી શકાતું નથી
- add = TRUE એ વળાંક ભૂંસી નાખ્યો
- 6 નું sd દોરવા માટે બહુ નાનું છે
Show the answer
Histogram **આવૃત્તિ** ના પટ પર છે (ગણતરી લગભગ 15 સુધી) જ્યારે dnorm ની ઘનતાનું શિખર લગભગ 0.07 છે: ઘનતાનો પટ વહેંચવા hist ને freq = FALSE જોઈએ
આવૃત્તિ students ગણે છે (0 થી લગભગ 15); ઘનતાનું સંકલન 1 થાય છે (અહીં લગભગ 0.07 એ શિખર): એક જ chart પર દોરાતાં, ઘનતાનો વળાંક આવૃત્તિના પર્વતો નીચે સપાટ ગણગણાટ છે. freq = FALSE histogram ના y-અક્ષને ઘનતામાં ફેરવે છે જેથી બંને એક જ એકમમાં બોલે: આવરણનો સૌથી સામાન્ય એક bug. add = TRUE ભૂંસવાનું ઊલટું કરે છે (એ histogram સાચવે છે); એના વગર, curve() plot ને બદલી નાખત: જોડિયો ફાંદો.
Think first
ચુકાદો આપો
તમે ડીનને બંને આવરણનાં charts દેખાડો છો. બે વાક્યનો ચુકાદો રચો: દરેક variable દીઠ એક વાક્ય, દરેકમાં ચિત્રમાંનો પુરાવો અને અહેવાલ માટેનું વ્યવહારુ પરિણામ. પછી tap કરો.
Show the answer
ઊંચાઈઓ: histogram સમમિત છે અને બેસાડેલો ઘંટ એને નજીકથી અનુસરે છે, એટલે normal model લાગુ પડે છે: સરેરાશ, SD અને pnorm આધારિત ટકાવારી (દા.ત. 180 cm થી ઉપરનો હિસ્સો) ભરોસાપાત્ર છે.
Screen time: distribution જમણી બાજુ વિષમ છે અને એની લાંબી પૂંછડીને ઘંટ અનુસરી શકતો નથી, એટલે normal આધારિત જવાબ ગેરમાર્ગે દોરે: અમે મધ્યસ્થ અને IQR જણાવીએ છીએ, અને ભારે વપરાશકારોની પૂંછડી અલગ ઉજાગર કરીએ છીએ.
પુરાવો વત્તા પરિણામ, બે વાર: એ જ લઘુ સ્વરૂપમાં આંકડાશાસ્ત્રનો અહેવાલ છે, અને પરીક્ષાનો સ્વપ્નનો જવાબ.
Watch out
સમાપનના ફાંદા
કોઈ પણ dnorm ના આવરણ પહેલાં freq = FALSE: આવૃત્તિ અને ઘનતાના પટ ક્યારેય ભળતા નથી.
curve() પર add = TRUE: એના વગર ઘંટ તમારા histogram ની જગ્યા લે છે.
લેબલ એ marks છે: દરેક chart પર main, xlab, ylab: લેબલ વગરનો chart એ અધૂરો જવાબ છે.
Model data ને સેવે છે: જે આકારે સૂટ નકાર્યો હોય એના પર normal નિષ્કર્ષ ક્યારેય ન લાદો.
Theory
CampusPulse, પૂરું
આખા ચાપ પર પાછળ જુઓ: તમે નમૂનાનું આયોજન કર્યું, એના આંકડા હાથે ગણ્યા, એમની પાછળની સંભાવના શીખી, R માં ખરેખરો data આયાત કરીને સાફ કર્યો, અને તમારા પોતાના survey પર bell curve દોરીને પૂરું કર્યું. એ ચક્ર (રચના, સંગ્રહ, સફાઈ, સારાંશ, model, ચિત્ર, ચુકાદો) એ અભ્યાસક્રમ નથી: એ data ના કામનો ખરેખરો રોજિંદો આકાર છે. BCA302 પૂરું: જે જિજ્ઞાસુ રહે એની રાહ qqnorm() અને ઔપચારિક કસોટીઓ જુએ છે.
Summary
Key takeaways
- hist(x, breaks = n) data નો આકાર દેખાડે છે; main/xlab/ylab ફરજિયાત શિષ્ટાચાર છે.
- boxplot(y ~ group, data = df): પાસે પાસે પાંચ સંખ્યાની સરખામણી: સૂત્ર 'y જૂથ પ્રમાણે' વંચાય છે.
- આવરણની રીત: hist(x, freq = FALSE) પછી curve(dnorm(x, mean, sd), add = TRUE).
- freq = FALSE પટ મેળવે છે; add = TRUE histogram સાચવે છે: બંને બાંધછોડ વગરનાં.
- નજીકનું બંધબેસવું = normal model ભરોસાપાત્ર; દેખાતી વિષમતા = એને બદલે મધ્યસ્થ/IQR જણાવો.
- abline() સંદર્ભની લીટીઓ ઉમેરે છે; qqnorm() આ course ની બહારનું ઔપચારિક normality નું ઓજાર છે.
- Memory hook: દરજીનું માપ લેવું: શું તૈયાર ઘંટનો સૂટ તમારા data ને બેસે છે?