Theory
બે પ્રામાણિક survey, બે જુદા જવાબ
તમારું સ્તરીકૃત CampusPulse નું survey સરેરાશ screen time 178 મિનિટ જણાવે છે. એક હરીફ ટીમ એ જ પદ્ધતિ તાજા 60 students પર ચલાવે છે: 191 મિનિટ.
કોઈએ છેતરપિંડી કરી નથી. કોઈએ ભૂલ કરી નથી. એક જ તપેલામાંથી લીધેલી બે પ્રામાણિક ચમચી ખાલી જુદી પડે છે.
તો "સાચો" જવાબ કયો? ખોટો પ્રશ્ન. સાચો પ્રશ્ન, જેનો આ પાઠ જવાબ આપે છે: પ્રામાણિક નમૂનાની સરેરાશો સત્યની આસપાસ કેટલી ડોલે છે? આંકડાશાસ્ત્રનો સૌથી સુંદર વિચાર અહીં વસે છે.
Theory
હજાર ચમચી, આલેખ પર
કલ્પો કે હજાર ટીમો, દરેક પોતાના યાદૃચ્છિક 60 students નું survey કરીને એક સરેરાશ જણાવે છે. બધી હજાર સરેરાશોનો histogram દોરો.
એ histogram એ સરેરાશનું નમૂનાનું distribution છે: students નું distribution નહીં, પણ survey નાં પરિણામો નું distribution. એનું કેન્દ્ર સાચા મૂલ્ય પર બેસે છે; એની સાંકડાઈ કહે છે કે કોઈ પણ એક પ્રામાણિક survey પર કેટલો ભરોસો કરાય. તમે જીવનમાં ફક્ત એક survey ચલાવશો, પણ હજાર કેવી રીતે વર્તે છે એ જાણવાથી તમારા એકની કિંમત નક્કી થાય છે.
Theory
ત્રણ distributions (એમને અલગ રાખો)
પરીક્ષાઓ આમને ભેળવવાનું પસંદ કરે છે; ના પાડો:
1. વસ્તીનું distribution: બધા 3000 students ના screen times (કદાચ વિષમ, અજ્ઞાત).
2. નમૂનાના data નું distribution: તમારા 60 students નાં મૂલ્યો (લગભગ વસ્તી જેવું દેખાય છે).
3. સરેરાશનું નમૂનાનું distribution: n કદના બધા શક્ય નમૂનાઓમાં x̄ નાં મૂલ્યો: પરિણામો નું distribution, students નું નહીં.
ત્રીજું નવો પદાર્થ છે, અને એના બે સુંદર, પરીક્ષા લાયક ગુણધર્મ છે.
Theory
ગુણધર્મ 1: સાચે કેન્દ્રિત. ગુણધર્મ 2: ધારી શકાય એવો ફેલાવો.
કેન્દ્ર: બધી શક્ય નમૂનાની સરેરાશોની સરેરાશ વસ્તીની સરેરાશ μ બરાબર થાય છે: નમૂનાની સરેરાશ એ પક્ષપાત વગરનું અનુમાનક છે: પ્રામાણિક ચમચીઓ પદ્ધતિસર વધુ કે ઓછું ચાખતી નથી.
ફેલાવો: નમૂનાની સરેરાશોનું પ્રમાણિત વિચલન, જેને પ્રમાણિત ત્રુટિ (SE) કહેવાય છે:
SE = σ / √n
ગણેલું: σ = 60 મિનિટ, n = 36 → SE = 60/√36 = 10 મિનિટ. નમૂનાની સરેરાશો સામાન્ય રીતે સત્યથી લગભગ 10 મિનિટની અંદર પડે છે. √ નોંધો: n ને ચાર ગણું કરવાથી SE ફક્ત અડધું થાય છે: ચોકસાઈ વર્ગમૂળની કિંમતે ખરીદાય છે.
Theory
કેન્દ્રીય સીમા પ્રમેય
હવે ચમત્કાર. Screen time પોતે જમણી બાજુ વિષમ છે (થોડા સળંગ જોનારા). તો નમૂનાની સરેરાશો એ વિષમતા વારસામાં લેશે ને?
ના. કેન્દ્રીય સીમા પ્રમેય (CLT): પૂરતા મોટા n માટે (અંગૂઠાનો નિયમ n ≥ 30), સરેરાશનું નમૂનાનું distribution લગભગ normal હોય છે, વસ્તીનો આકાર ગમે તે હોય.
ઘણાં મૂલ્યોની સરેરાશ વ્યક્તિગત વિચિત્રતાઓને લીસી કરી નાખે છે. Bell curve આંકડાશાસ્ત્રનું માલિક કેમ છે એનું આ જ કારણ છે: data કદરૂપો હોય ત્યારે પણ, સરેરાશો normal રીતે વર્તે છે, એટલે આગલા પાઠની 68-95-99.7 ની માપપટ્ટી બધે survey નાં પરિણામોને લાગુ પડે છે.
Quiz
Screen time: μ = 180, σ = 60. n = 36 ના નમૂના સાથે (SE = 10), એક ટીમ 210 ની નમૂનાની સરેરાશ જણાવે છે. તમારે કેવો પ્રતિભાવ આપવો જોઈએ?
- 210 એ 180 થી 3 પ્રમાણિત ત્રુટિ ઉપર છે: પ્રામાણિક નમૂના ભાગ્યે જ આટલા દૂર પડે છે, એટલે નમૂનાની તપાસ કરો
- તદ્દન સામાન્ય: 210 એ 180 થી એક વસ્તીના SD (60) ની અંદર છે
- અશક્ય: નમૂનાની સરેરાશો હંમેશા વસ્તીની સરેરાશ બરાબર હોય છે
- ટીમે ખાતરી કરવા બીજા 36 students નું survey કરવું જોઈએ
Show the answer
210 એ 180 થી 3 પ્રમાણિત ત્રુટિ ઉપર છે: પ્રામાણિક નમૂના ભાગ્યે જ આટલા દૂર પડે છે, એટલે નમૂનાની તપાસ કરો
નમૂનાની સરેરાશો ને પ્રમાણિત ત્રુટિ સામે તોળાય છે, વસ્તીના SD સામે નહીં: (210 - 180)/10 = 3 SE દૂર, એવી ઘટના જે પ્રામાણિક નમૂનો 1% થી ઘણી ઓછી વાર બનાવે છે: પક્ષપાતી ચોકઠું કે ભૂલની શંકા કરો. વિકલ્પ B ખોટી માપપટ્ટી લગાડે છે (σ વ્યક્તિગત students માટે છે; σ/√n સરેરાશો માટે): બરાબર એ જ ગૂંચવણ મટાડવા આ વિષય છે. સરેરાશો ડોલે છે (C ખોટું છે), અને વધુ data ખામીભર્યા નમૂનાને પાછળથી માન્ય કરી શકતો નથી (D ગયા પાઠનો પડઘો છે).
Think first
વધુ ચોકસાઈ ખરીદો, વર્ગમૂળની કિંમતે
n = 36 સાથે SE 10 મિનિટ હતી. આચાર્યને SE = 5 મિનિટ જોઈએ છે. Tap કરતાં પહેલાં: કેટલા નમૂનાનું કદ જોઈએ, અને જવાબ 72 કેમ નથી?
Show the answer
SE = σ/√n → 5 = 60/√n → √n = 12 → n = 144.
ત્રુટિ અડધી કરવા ચાર ગણા students જોઈએ, બમણા નહીં, કારણ કે n વર્ગમૂળ નીચે બેસે છે. આ √n નું અર્થશાસ્ત્ર ખરેખરી આયોજનની હકીકત છે: ચોકસાઈનો દરેક વધારાનો આંકડો ઘાતાંકીય રીતે વધુ મોંઘો પડે છે, અને એટલે જ વ્યાવસાયિક survey "પૂરતું સારું" પર અટકે છે, "સંપૂર્ણ" પર નહીં.
Watch out
બે જાણીતી ગૂંચવણ
SD સામે SE: σ એ students નો ફેલાવો વર્ણવે છે; σ/√n એ નમૂનાની સરેરાશો નો ફેલાવો વર્ણવે છે. એ જ એકમ, જુદા પદાર્થ: એમને ભેળવવી એ આ પ્રકરણની સૌથી વધુ દંડાતી ભૂલ છે.
CLT શું normal બનાવે છે: સરેરાશ નું નમૂનાનું distribution: કાચો data ક્યારેય નહીં. Screen time કાયમ વિષમ રહે છે; ફક્ત survey ની સરેરાશો ઘંટ આકારની થાય છે. "મોટા નમૂના data ને normal બનાવે છે" લખવાથી marks તરત જાય છે.
Theory
Polls હજારોમાંથી કરોડોની આગાહી કરવાની હિંમત કેમ કરે છે
એક exit poll આશરે 10,000 મતદારોને પૂછે છે અને 90 કરોડ વિશે બોલે છે, જાહેર કરેલી "ત્રુટિની હદ" સાથે: એ હદ જ બે-એક પ્રમાણિત ત્રુટિ છે. CLT ખાતરી આપે છે કે poll ની સરેરાશ normal રીતે વર્તે છે; SE = σ/√n એની ડોલવાની કિંમત નક્કી કરે છે. આગલો પાઠ તમને bell curve ની માપપટ્ટી આપે છે (68-95-99.7 અને z-scores): એ જ માપપટ્ટી જે તમે બાકીના વિષયમાં નમૂનાની સરેરાશો પર મૂકશો.
Summary
Key takeaways
- આંકડો નમૂને નમૂને બદલાય છે; સરેરાશનું નમૂનાનું distribution એ n કદના બધા નમૂનાઓમાં x̄ નું distribution છે.
- એ μ પર કેન્દ્રિત છે (નમૂનાની સરેરાશ પક્ષપાત વગરની છે).
- એનો ફેલાવો એ પ્રમાણિત ત્રુટિ છે: SE = σ/√n: SE અડધી કરવા n ચાર ગણું કરો.
- CLT: n ≥ 30 માટે, નમૂનાની સરેરાશો વસ્તીના આકારને ધ્યાનમાં લીધા વગર લગભગ normal હોય છે.
- વ્યક્તિગત મૂલ્યો σ થી તોળો; નમૂનાની સરેરાશો SE થી તોળો.
- CLT સરેરાશોને normal બનાવે છે, કાચા data ને ક્યારેય નહીં.
- Memory hook: હજાર ચમચી, આલેખ પર.