Sampling distributions

ઘણા નમૂના લો અને દરેક સહેજ જુદી સરેરાશ આપે છે: એ સરેરાશો નમૂનાનું distribution બનાવે છે, જેનો ફેલાવો 1/√n પ્રમાણે સંકોચાય છે અને જેનો આકાર કેન્દ્રીય સીમા પ્રમેય પ્રમાણે normal બની જાય છે.

10 min read · 10 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

બે પ્રામાણિક survey, બે જુદા જવાબ

તમારું સ્તરીકૃત CampusPulse નું survey સરેરાશ screen time 178 મિનિટ જણાવે છે. એક હરીફ ટીમ એ જ પદ્ધતિ તાજા 60 students પર ચલાવે છે: 191 મિનિટ.

કોઈએ છેતરપિંડી કરી નથી. કોઈએ ભૂલ કરી નથી. એક જ તપેલામાંથી લીધેલી બે પ્રામાણિક ચમચી ખાલી જુદી પડે છે.

તો "સાચો" જવાબ કયો? ખોટો પ્રશ્ન. સાચો પ્રશ્ન, જેનો આ પાઠ જવાબ આપે છે: પ્રામાણિક નમૂનાની સરેરાશો સત્યની આસપાસ કેટલી ડોલે છે? આંકડાશાસ્ત્રનો સૌથી સુંદર વિચાર અહીં વસે છે.

Theory

હજાર ચમચી, આલેખ પર

કલ્પો કે હજાર ટીમો, દરેક પોતાના યાદૃચ્છિક 60 students નું survey કરીને એક સરેરાશ જણાવે છે. બધી હજાર સરેરાશોનો histogram દોરો.

એ histogram એ સરેરાશનું નમૂનાનું distribution છે: students નું distribution નહીં, પણ survey નાં પરિણામો નું distribution. એનું કેન્દ્ર સાચા મૂલ્ય પર બેસે છે; એની સાંકડાઈ કહે છે કે કોઈ પણ એક પ્રામાણિક survey પર કેટલો ભરોસો કરાય. તમે જીવનમાં ફક્ત એક survey ચલાવશો, પણ હજાર કેવી રીતે વર્તે છે એ જાણવાથી તમારા એકની કિંમત નક્કી થાય છે.

Theory

ત્રણ distributions (એમને અલગ રાખો)

પરીક્ષાઓ આમને ભેળવવાનું પસંદ કરે છે; ના પાડો:

1. વસ્તીનું distribution: બધા 3000 students ના screen times (કદાચ વિષમ, અજ્ઞાત).

2. નમૂનાના data નું distribution: તમારા 60 students નાં મૂલ્યો (લગભગ વસ્તી જેવું દેખાય છે).

3. સરેરાશનું નમૂનાનું distribution: n કદના બધા શક્ય નમૂનાઓમાં x̄ નાં મૂલ્યો: પરિણામો નું distribution, students નું નહીં.

ત્રીજું નવો પદાર્થ છે, અને એના બે સુંદર, પરીક્ષા લાયક ગુણધર્મ છે.

Theory

ગુણધર્મ 1: સાચે કેન્દ્રિત. ગુણધર્મ 2: ધારી શકાય એવો ફેલાવો.

કેન્દ્ર: બધી શક્ય નમૂનાની સરેરાશોની સરેરાશ વસ્તીની સરેરાશ μ બરાબર થાય છે: નમૂનાની સરેરાશ એ પક્ષપાત વગરનું અનુમાનક છે: પ્રામાણિક ચમચીઓ પદ્ધતિસર વધુ કે ઓછું ચાખતી નથી.

ફેલાવો: નમૂનાની સરેરાશોનું પ્રમાણિત વિચલન, જેને પ્રમાણિત ત્રુટિ (SE) કહેવાય છે:

SE = σ / √n

ગણેલું: σ = 60 મિનિટ, n = 36 → SE = 60/√36 = 10 મિનિટ. નમૂનાની સરેરાશો સામાન્ય રીતે સત્યથી લગભગ 10 મિનિટની અંદર પડે છે. √ નોંધો: n ને ચાર ગણું કરવાથી SE ફક્ત અડધું થાય છે: ચોકસાઈ વર્ગમૂળની કિંમતે ખરીદાય છે.

Theory

કેન્દ્રીય સીમા પ્રમેય

હવે ચમત્કાર. Screen time પોતે જમણી બાજુ વિષમ છે (થોડા સળંગ જોનારા). તો નમૂનાની સરેરાશો એ વિષમતા વારસામાં લેશે ને?

ના. કેન્દ્રીય સીમા પ્રમેય (CLT): પૂરતા મોટા n માટે (અંગૂઠાનો નિયમ n ≥ 30), સરેરાશનું નમૂનાનું distribution લગભગ normal હોય છે, વસ્તીનો આકાર ગમે તે હોય.

ઘણાં મૂલ્યોની સરેરાશ વ્યક્તિગત વિચિત્રતાઓને લીસી કરી નાખે છે. Bell curve આંકડાશાસ્ત્રનું માલિક કેમ છે એનું આ જ કારણ છે: data કદરૂપો હોય ત્યારે પણ, સરેરાશો normal રીતે વર્તે છે, એટલે આગલા પાઠની 68-95-99.7 ની માપપટ્ટી બધે survey નાં પરિણામોને લાગુ પડે છે.

Quiz

Screen time: μ = 180, σ = 60. n = 36 ના નમૂના સાથે (SE = 10), એક ટીમ 210 ની નમૂનાની સરેરાશ જણાવે છે. તમારે કેવો પ્રતિભાવ આપવો જોઈએ?

  1. 210 એ 180 થી 3 પ્રમાણિત ત્રુટિ ઉપર છે: પ્રામાણિક નમૂના ભાગ્યે જ આટલા દૂર પડે છે, એટલે નમૂનાની તપાસ કરો
  2. તદ્દન સામાન્ય: 210 એ 180 થી એક વસ્તીના SD (60) ની અંદર છે
  3. અશક્ય: નમૂનાની સરેરાશો હંમેશા વસ્તીની સરેરાશ બરાબર હોય છે
  4. ટીમે ખાતરી કરવા બીજા 36 students નું survey કરવું જોઈએ
Show the answer

210 એ 180 થી 3 પ્રમાણિત ત્રુટિ ઉપર છે: પ્રામાણિક નમૂના ભાગ્યે જ આટલા દૂર પડે છે, એટલે નમૂનાની તપાસ કરો

નમૂનાની સરેરાશો ને પ્રમાણિત ત્રુટિ સામે તોળાય છે, વસ્તીના SD સામે નહીં: (210 - 180)/10 = 3 SE દૂર, એવી ઘટના જે પ્રામાણિક નમૂનો 1% થી ઘણી ઓછી વાર બનાવે છે: પક્ષપાતી ચોકઠું કે ભૂલની શંકા કરો. વિકલ્પ B ખોટી માપપટ્ટી લગાડે છે (σ વ્યક્તિગત students માટે છે; σ/√n સરેરાશો માટે): બરાબર એ જ ગૂંચવણ મટાડવા આ વિષય છે. સરેરાશો ડોલે છે (C ખોટું છે), અને વધુ data ખામીભર્યા નમૂનાને પાછળથી માન્ય કરી શકતો નથી (D ગયા પાઠનો પડઘો છે).

Think first

વધુ ચોકસાઈ ખરીદો, વર્ગમૂળની કિંમતે

n = 36 સાથે SE 10 મિનિટ હતી. આચાર્યને SE = 5 મિનિટ જોઈએ છે. Tap કરતાં પહેલાં: કેટલા નમૂનાનું કદ જોઈએ, અને જવાબ 72 કેમ નથી?

Show the answer

SE = σ/√n → 5 = 60/√n → √n = 12 → n = 144.

ત્રુટિ અડધી કરવા ચાર ગણા students જોઈએ, બમણા નહીં, કારણ કે n વર્ગમૂળ નીચે બેસે છે. આ √n નું અર્થશાસ્ત્ર ખરેખરી આયોજનની હકીકત છે: ચોકસાઈનો દરેક વધારાનો આંકડો ઘાતાંકીય રીતે વધુ મોંઘો પડે છે, અને એટલે જ વ્યાવસાયિક survey "પૂરતું સારું" પર અટકે છે, "સંપૂર્ણ" પર નહીં.

Watch out

બે જાણીતી ગૂંચવણ

SD સામે SE: σ એ students નો ફેલાવો વર્ણવે છે; σ/√n એ નમૂનાની સરેરાશો નો ફેલાવો વર્ણવે છે. એ જ એકમ, જુદા પદાર્થ: એમને ભેળવવી એ આ પ્રકરણની સૌથી વધુ દંડાતી ભૂલ છે.

CLT શું normal બનાવે છે: સરેરાશ નું નમૂનાનું distribution: કાચો data ક્યારેય નહીં. Screen time કાયમ વિષમ રહે છે; ફક્ત survey ની સરેરાશો ઘંટ આકારની થાય છે. "મોટા નમૂના data ને normal બનાવે છે" લખવાથી marks તરત જાય છે.

Theory

Polls હજારોમાંથી કરોડોની આગાહી કરવાની હિંમત કેમ કરે છે

એક exit poll આશરે 10,000 મતદારોને પૂછે છે અને 90 કરોડ વિશે બોલે છે, જાહેર કરેલી "ત્રુટિની હદ" સાથે: એ હદ જ બે-એક પ્રમાણિત ત્રુટિ છે. CLT ખાતરી આપે છે કે poll ની સરેરાશ normal રીતે વર્તે છે; SE = σ/√n એની ડોલવાની કિંમત નક્કી કરે છે. આગલો પાઠ તમને bell curve ની માપપટ્ટી આપે છે (68-95-99.7 અને z-scores): એ જ માપપટ્ટી જે તમે બાકીના વિષયમાં નમૂનાની સરેરાશો પર મૂકશો.

Summary

Key takeaways

  • આંકડો નમૂને નમૂને બદલાય છે; સરેરાશનું નમૂનાનું distribution એ n કદના બધા નમૂનાઓમાં x̄ નું distribution છે.
  • એ μ પર કેન્દ્રિત છે (નમૂનાની સરેરાશ પક્ષપાત વગરની છે).
  • એનો ફેલાવો એ પ્રમાણિત ત્રુટિ છે: SE = σ/√n: SE અડધી કરવા n ચાર ગણું કરો.
  • CLT: n ≥ 30 માટે, નમૂનાની સરેરાશો વસ્તીના આકારને ધ્યાનમાં લીધા વગર લગભગ normal હોય છે.
  • વ્યક્તિગત મૂલ્યો σ થી તોળો; નમૂનાની સરેરાશો SE થી તોળો.
  • CLT સરેરાશોને normal બનાવે છે, કાચા data ને ક્યારેય નહીં.
  • Memory hook: હજાર ચમચી, આલેખ પર.

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Data Representation and Sampling technique

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Sampling distributions · Statistical Methods and Data Analysis (MDC-03) · Gri-Learn