Concepts of normal distribution

R ચાર prefix વાળી commands દ્વારા normal distribution બોલે છે: dnorm વળાંકની ઊંચાઈ આપે છે, pnorm કોઈ મૂલ્યની ડાબે ક્ષેત્રફળ (સંભાવના), qnorm આપેલા percentile નું મૂલ્ય, અને rnorm યાદૃચ્છિક નમૂના.

10 min read · 9 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

z-કોષ્ટકની જગ્યાએ ચાર commands

Bell curve ના પાઠમાં તમે "180 cm થી ઊંચા students નો હિસ્સો કેટલો?" નો જવાબ 68-95-99.7 ના નિયમથી આપ્યો હતો: આશરે 2.5%, કારણ કે 180 બરાબર 2 SD દૂર બેઠું હતું.

પણ 178 cm નું શું? કે 183 નું? નિયમ ફક્ત આખાં વર્તુળ જાણે છે; એમની વચ્ચે, આંકડાશાસ્ત્રીઓ એક વખતે છાપેલાં z-કોષ્ટકો ના પાનાં ફેરવતા.

R એ ચાર commands ના કુટુંબથી એ કોષ્ટકો નિવૃત્ત કરી દીધાં. Prefix d, p, q, r એક વાર શીખો, અને normal વળાંકનો દરેક પ્રશ્ન એક લીટી બની જાય છે.

Theory

એક ઘંટને ચાર પ્રશ્ન

Bell curve સામે ઊભા રહીને પૂછો:

  • dnorm: અહીં વળાંક કેટલો ઊંચો છે? (ઘનતા: દોરવાનો પ્રશ્ન)
  • pnorm: અહીંની ડાબે કેટલું ક્ષેત્રફળ છે? (સંભાવના: પરીક્ષાનો પ્રશ્ન)
  • qnorm: 90% ક્ષેત્રફળ ક્યાં પૂરું થાય છે? (ચતુર્થક: હદનો પ્રશ્ન)
  • rnorm: આ ઘંટમાંથી મને યાદૃચ્છિક students આપો (અનુકરણ)

એ જ ઘંટ, ચાર દરવાજા. pnorm અને qnorm એકબીજાના વ્યસ્ત છે: એક મૂલ્યોને ક્ષેત્રફળમાં ફેરવે છે, બીજું ક્ષેત્રફળને પાછું મૂલ્યોમાં.

Practical

ઊંચાઈઓ: mu = 168, sd = 6, દરેક પ્રશ્નનો જવાબ

# P(height <= 174): area LEFT of 174
pnorm(174, mean = 168, sd = 6)      # [1] 0.841

# P(taller than 180): right tail = 1 - left area
1 - pnorm(180, 168, 6)              # [1] 0.0228   (~the 2.5% ring!)
pnorm(180, 168, 6, lower.tail = FALSE)   # same, spelled directly

# P(between 162 and 174): big area minus small area
pnorm(174, 168, 6) - pnorm(162, 168, 6)  # [1] 0.683  (the 68% ring!)

# cutoff for the tallest 10%: qnorm is pnorm's inverse
qnorm(0.90, 168, 6)                 # [1] 175.7 cm

# defaults are the STANDARD normal (mean 0, sd 1):
pnorm(2)                            # [1] 0.977  = P(z <= 2)

# simulate 60 students; set.seed makes it reproducible
set.seed(42)
heights <- rnorm(60, 168, 6)
mean(heights)                       # close to 168, not exact: sampling!

# dnorm: curve HEIGHT (for drawing, next lesson), not probability
dnorm(168, 168, 6)                  # [1] 0.066

Theory

પ્રશ્નની ત્રણ ભાત

પરીક્ષાનો દરેક પ્રશ્ન એક ભાત સાથે મળે છે:

  • ડાબું ક્ષેત્રફળ ("વધુમાં વધુ x"): pnorm(x, mean, sd).
  • જમણું ક્ષેત્રફળ ("x થી વધુ"): 1 - pnorm(x, ...) (કે lower.tail = FALSE): આ 1-ઓછા એ R ના આંકડાશાસ્ત્રમાં સૌથી વધુ ભૂલાતું ટાઈપ છે.
  • a અને b વચ્ચે: pnorm(b, ...) - pnorm(a, ...).

અને ઊલટી દિશા ("ઉપરના 10% ને કયું મૂલ્ય નક્કી કરે છે?"): qnorm(0.90, ...): નોંધો કે એ ડાબે નું ક્ષેત્રફળ લે છે, એટલે ઉપરના 10% એટલે 0.90, 0.10 નહીં.

Quiz

Scores સરેરાશ 60, sd 8 સાથે normal છે. કઈ command P(score > 70) ગણે છે, અને એ આશરે શું આપે છે?

  1. 1 - pnorm(70, 60, 8): લગભગ 0.106
  2. pnorm(70, 60, 8): લગભગ 0.894
  3. dnorm(70, 60, 8): બરાબર 70 ની સંભાવના
  4. qnorm(70, 60, 8): 70મો percentile
Show the answer

1 - pnorm(70, 60, 8): લગભગ 0.106

pnorm ડાબું ક્ષેત્રફળ આપે છે, એટલે P(70 થી ઉપર) ને પૂરકની જરૂર છે: 1 - pnorm(70, 60, 8) ≈ 1 - 0.894 = 0.106. વિકલ્પ B એ ડાબું ક્ષેત્રફળ પોતે છે: ઊલટા પ્રશ્નનો જવાબ, અને સૌથી સામાન્ય ખોટી રજૂઆત. dnorm એ વળાંકની ઊંચાઈ છે (સળંગ variable ને ચોક્કસ બિંદુએ શૂન્ય સંભાવના હોય છે: distributions ના પાઠનો નિયમ), અને qnorm input તરીકે ક્ષેત્રફળ (0 થી 1) અપેક્ષે છે, એટલે qnorm(70, ...) એ વિચારમાં જ પ્રકારની ભૂલ છે.

Think first

શિષ્યવૃત્તિની હદ, બંને દિશામાં

CGPA લગભગ normal છે: સરેરાશ 7.0, sd 0.8. બે કામ, દરેક એક લીટીમાં: (1) કેટલા હિસ્સા students CGPA 8.5 થી ઉપર છે? (2) ઉપરના 5% ને શિષ્યવૃત્તિ મળે છે: હદ કયો CGPA છે? Tap કરતાં પહેલાં બંને લખો.

Show the answer

1. 1 - pnorm(8.5, 7.0, 0.8) ≈ 0.030: લગભગ 3% 8.5 થી ઉપર છે.

2. qnorm(0.95, 7.0, 0.8) ≈ 8.32: શિષ્યવૃત્તિની રેખા.

અરીસો નોંધો: કામ 1 મૂલ્ય → ક્ષેત્રફળ જાય છે (pnorm), કામ 2 ક્ષેત્રફળ → મૂલ્ય જાય છે (qnorm, 0.95 અપાયું કારણ કે ઉપરના 5% એટલે ડાબે 95%). પ્રશ્ન કઈ દિશામાં જાય છે એ વાંચવું એ જ આ command ના કુટુંબનું આખું કૌશલ્ય છે.

Watch out

Normal commands ની ત્રણ લપસણ

dnorm એ સંભાવના નથી: એ વળાંકની ઊંચાઈ (ઘનતા) છે: સળંગ variables ની સંભાવના ક્ષેત્રફળ માં વસે છે: pnorm નો પ્રદેશ.

ભૂલાયેલું 1-ઓછા: દરેક "થી વધુ" ના પ્રશ્નને પૂરક જોઈએ (કે lower.tail = FALSE).

પહેલાં model તપાસો: pnorm ના જવાબ ત્યારે જ ચોક્કસ છે જ્યારે data (લગભગ) normal હોય: એમના પર ભરોસો કરતાં પહેલાં histogram વત્તા સરેરાશ≈મધ્યસ્થની તપાસ: screen time નિષ્ફળ જાત, ઊંચાઈઓ પાસ થાય.

Theory

નિયમ સામે ચોક્કસ જવાબ

નોંધો કે 1 - pnorm(180, 168, 6) એ 0.0228 આપ્યું જ્યાં પ્રયોગમૂલક નિયમે 2.5% નું અનુમાન કર્યું હતું: નિયમ એ માનસિક અંદાજ છે, pnorm ચોકસાઈવાળું ઓજાર: તર્કમાં નિયમ ટાંકો, વ્યવહારમાં pnorm થી ગણો. એક પાઠ બાકી છે: બધું દોરવાનું: તમારા data માટે hist, એની ઉપર સૈદ્ધાંતિક ઘંટ મૂકવા curve(dnorm(...)), અને CampusPulse ની કથા પૂરી થાય છે.

Summary

Key takeaways

  • d-p-q-r નું કુટુંબ: dnorm ઊંચાઈ, pnorm ડાબું ક્ષેત્રફળ, qnorm ક્ષેત્રફળથી મૂલ્ય, rnorm યાદૃચ્છિક નમૂના.
  • Defaults mean = 0, sd = 1: પ્રમાણિત normal; pnorm(2) ≈ 0.977.
  • જમણી પૂંછડી: 1 - pnorm(x, ...) કે lower.tail = FALSE; વચ્ચે: pnorm(b) - pnorm(a).
  • qnorm ડાબું ક્ષેત્રફળ લે છે: ઉપરના 10% ની હદ = qnorm(0.90, ...).
  • 68-95-99.7 ના અંદાજ પાછળનું ચોકસાઈવાળું ઓજાર pnorm છે.
  • ચોક્કસ જવાબ પર ભરોસો કરતાં પહેલાં normality તપાસો (hist નો આકાર, સરેરાશ ≈ મધ્યસ્થ).
  • Memory hook: એક ઘંટના ચાર દરવાજા: ઊંચાઈ, ક્ષેત્રફળ, હદ, નમૂનો.

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Working with Data in R

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Concepts of normal distribution · Statistical Methods and Data Analysis (MDC-03) · Gri-Learn