Theory
z-કોષ્ટકની જગ્યાએ ચાર commands
Bell curve ના પાઠમાં તમે "180 cm થી ઊંચા students નો હિસ્સો કેટલો?" નો જવાબ 68-95-99.7 ના નિયમથી આપ્યો હતો: આશરે 2.5%, કારણ કે 180 બરાબર 2 SD દૂર બેઠું હતું.
પણ 178 cm નું શું? કે 183 નું? નિયમ ફક્ત આખાં વર્તુળ જાણે છે; એમની વચ્ચે, આંકડાશાસ્ત્રીઓ એક વખતે છાપેલાં z-કોષ્ટકો ના પાનાં ફેરવતા.
R એ ચાર commands ના કુટુંબથી એ કોષ્ટકો નિવૃત્ત કરી દીધાં. Prefix d, p, q, r એક વાર શીખો, અને normal વળાંકનો દરેક પ્રશ્ન એક લીટી બની જાય છે.
Theory
એક ઘંટને ચાર પ્રશ્ન
Bell curve સામે ઊભા રહીને પૂછો:
- dnorm: અહીં વળાંક કેટલો ઊંચો છે? (ઘનતા: દોરવાનો પ્રશ્ન)
- pnorm: અહીંની ડાબે કેટલું ક્ષેત્રફળ છે? (સંભાવના: પરીક્ષાનો પ્રશ્ન)
- qnorm: 90% ક્ષેત્રફળ ક્યાં પૂરું થાય છે? (ચતુર્થક: હદનો પ્રશ્ન)
- rnorm: આ ઘંટમાંથી મને યાદૃચ્છિક students આપો (અનુકરણ)
એ જ ઘંટ, ચાર દરવાજા. pnorm અને qnorm એકબીજાના વ્યસ્ત છે: એક મૂલ્યોને ક્ષેત્રફળમાં ફેરવે છે, બીજું ક્ષેત્રફળને પાછું મૂલ્યોમાં.
Practical
ઊંચાઈઓ: mu = 168, sd = 6, દરેક પ્રશ્નનો જવાબ
# P(height <= 174): area LEFT of 174
pnorm(174, mean = 168, sd = 6) # [1] 0.841
# P(taller than 180): right tail = 1 - left area
1 - pnorm(180, 168, 6) # [1] 0.0228 (~the 2.5% ring!)
pnorm(180, 168, 6, lower.tail = FALSE) # same, spelled directly
# P(between 162 and 174): big area minus small area
pnorm(174, 168, 6) - pnorm(162, 168, 6) # [1] 0.683 (the 68% ring!)
# cutoff for the tallest 10%: qnorm is pnorm's inverse
qnorm(0.90, 168, 6) # [1] 175.7 cm
# defaults are the STANDARD normal (mean 0, sd 1):
pnorm(2) # [1] 0.977 = P(z <= 2)
# simulate 60 students; set.seed makes it reproducible
set.seed(42)
heights <- rnorm(60, 168, 6)
mean(heights) # close to 168, not exact: sampling!
# dnorm: curve HEIGHT (for drawing, next lesson), not probability
dnorm(168, 168, 6) # [1] 0.066
Theory
પ્રશ્નની ત્રણ ભાત
પરીક્ષાનો દરેક પ્રશ્ન એક ભાત સાથે મળે છે:
- ડાબું ક્ષેત્રફળ ("વધુમાં વધુ x"):
pnorm(x, mean, sd). - જમણું ક્ષેત્રફળ ("x થી વધુ"):
1 - pnorm(x, ...)(કે lower.tail = FALSE): આ 1-ઓછા એ R ના આંકડાશાસ્ત્રમાં સૌથી વધુ ભૂલાતું ટાઈપ છે. - a અને b વચ્ચે:
pnorm(b, ...) - pnorm(a, ...).
અને ઊલટી દિશા ("ઉપરના 10% ને કયું મૂલ્ય નક્કી કરે છે?"): qnorm(0.90, ...): નોંધો કે એ ડાબે નું ક્ષેત્રફળ લે છે, એટલે ઉપરના 10% એટલે 0.90, 0.10 નહીં.
Quiz
Scores સરેરાશ 60, sd 8 સાથે normal છે. કઈ command P(score > 70) ગણે છે, અને એ આશરે શું આપે છે?
- 1 - pnorm(70, 60, 8): લગભગ 0.106
- pnorm(70, 60, 8): લગભગ 0.894
- dnorm(70, 60, 8): બરાબર 70 ની સંભાવના
- qnorm(70, 60, 8): 70મો percentile
Show the answer
1 - pnorm(70, 60, 8): લગભગ 0.106
pnorm ડાબું ક્ષેત્રફળ આપે છે, એટલે P(70 થી ઉપર) ને પૂરકની જરૂર છે: 1 - pnorm(70, 60, 8) ≈ 1 - 0.894 = 0.106. વિકલ્પ B એ ડાબું ક્ષેત્રફળ પોતે છે: ઊલટા પ્રશ્નનો જવાબ, અને સૌથી સામાન્ય ખોટી રજૂઆત. dnorm એ વળાંકની ઊંચાઈ છે (સળંગ variable ને ચોક્કસ બિંદુએ શૂન્ય સંભાવના હોય છે: distributions ના પાઠનો નિયમ), અને qnorm input તરીકે ક્ષેત્રફળ (0 થી 1) અપેક્ષે છે, એટલે qnorm(70, ...) એ વિચારમાં જ પ્રકારની ભૂલ છે.
Think first
શિષ્યવૃત્તિની હદ, બંને દિશામાં
CGPA લગભગ normal છે: સરેરાશ 7.0, sd 0.8. બે કામ, દરેક એક લીટીમાં: (1) કેટલા હિસ્સા students CGPA 8.5 થી ઉપર છે? (2) ઉપરના 5% ને શિષ્યવૃત્તિ મળે છે: હદ કયો CGPA છે? Tap કરતાં પહેલાં બંને લખો.
Show the answer
1. 1 - pnorm(8.5, 7.0, 0.8) ≈ 0.030: લગભગ 3% 8.5 થી ઉપર છે.
2. qnorm(0.95, 7.0, 0.8) ≈ 8.32: શિષ્યવૃત્તિની રેખા.
અરીસો નોંધો: કામ 1 મૂલ્ય → ક્ષેત્રફળ જાય છે (pnorm), કામ 2 ક્ષેત્રફળ → મૂલ્ય જાય છે (qnorm, 0.95 અપાયું કારણ કે ઉપરના 5% એટલે ડાબે 95%). પ્રશ્ન કઈ દિશામાં જાય છે એ વાંચવું એ જ આ command ના કુટુંબનું આખું કૌશલ્ય છે.
Watch out
Normal commands ની ત્રણ લપસણ
dnorm એ સંભાવના નથી: એ વળાંકની ઊંચાઈ (ઘનતા) છે: સળંગ variables ની સંભાવના ક્ષેત્રફળ માં વસે છે: pnorm નો પ્રદેશ.
ભૂલાયેલું 1-ઓછા: દરેક "થી વધુ" ના પ્રશ્નને પૂરક જોઈએ (કે lower.tail = FALSE).
પહેલાં model તપાસો: pnorm ના જવાબ ત્યારે જ ચોક્કસ છે જ્યારે data (લગભગ) normal હોય: એમના પર ભરોસો કરતાં પહેલાં histogram વત્તા સરેરાશ≈મધ્યસ્થની તપાસ: screen time નિષ્ફળ જાત, ઊંચાઈઓ પાસ થાય.
Theory
નિયમ સામે ચોક્કસ જવાબ
નોંધો કે 1 - pnorm(180, 168, 6) એ 0.0228 આપ્યું જ્યાં પ્રયોગમૂલક નિયમે 2.5% નું અનુમાન કર્યું હતું: નિયમ એ માનસિક અંદાજ છે, pnorm ચોકસાઈવાળું ઓજાર: તર્કમાં નિયમ ટાંકો, વ્યવહારમાં pnorm થી ગણો. એક પાઠ બાકી છે: બધું દોરવાનું: તમારા data માટે hist, એની ઉપર સૈદ્ધાંતિક ઘંટ મૂકવા curve(dnorm(...)), અને CampusPulse ની કથા પૂરી થાય છે.
Summary
Key takeaways
- d-p-q-r નું કુટુંબ: dnorm ઊંચાઈ, pnorm ડાબું ક્ષેત્રફળ, qnorm ક્ષેત્રફળથી મૂલ્ય, rnorm યાદૃચ્છિક નમૂના.
- Defaults mean = 0, sd = 1: પ્રમાણિત normal; pnorm(2) ≈ 0.977.
- જમણી પૂંછડી: 1 - pnorm(x, ...) કે lower.tail = FALSE; વચ્ચે: pnorm(b) - pnorm(a).
- qnorm ડાબું ક્ષેત્રફળ લે છે: ઉપરના 10% ની હદ = qnorm(0.90, ...).
- 68-95-99.7 ના અંદાજ પાછળનું ચોકસાઈવાળું ઓજાર pnorm છે.
- ચોક્કસ જવાબ પર ભરોસો કરતાં પહેલાં normality તપાસો (hist નો આકાર, સરેરાશ ≈ મધ્યસ્થ).
- Memory hook: એક ઘંટના ચાર દરવાજા: ઊંચાઈ, ક્ષેત્રફળ, હદ, નમૂનો.