Theory
Data નો આકાર
એકલી સરેરાશ ગેરમાર્ગે દોરી શકે છે. બે વર્ગોના marks ની સરેરાશ સરખી હોય તો પણ એમના આકાર સાવ જુદા હોઈ શકે: એકમાં કિંમતો સરેરાશની આસપાસ ચુસ્ત રીતે ભેગી થયેલી હોય, અને બીજામાં ઓછા ગુણ મેળવનારાઓની લાંબી પૂંછડી બધું નીચે ખેંચતી હોય. કોઈ ચલને ખરેખર સમજવો હોય તો એની કિંમતો કઈ રીતે વહેંચાયેલી છે, એટલે કે એમનો આકાર, એ જોવો પડે.
આ પાઠ મુખ્ય આકારો આવરી લે છે: સમમિત normal distribution, એક બાજુ ઢળતી skewed distributions, અને આકાર માપતી બે સંખ્યાઓ, એટલે કે skewness (એકતરફીપણું) અને kurtosis (પૂંછડીપણું). ઘંટ જેવો વળાંક તમે statistics માં જોયો હતો; અહીં તમે વિશ્લેષકની જેમ આકાર વાંચતાં શીખો છો.
Theory
Normal distribution
Normal distribution એ જાણીતો સમમિત, ઘંટ આકારનો વળાંક છે. મોટા ભાગની કિંમતો કેન્દ્રની આસપાસ ભેગી થાય છે, અને બંને બાજુ સરખી રીતે પાતળી થતી જાય છે. સંપૂર્ણ normal distribution માં સરેરાશ, મધ્યક અને બહુલક ત્રણેય એક જ મધ્ય બિંદુ પર બેસે છે.
કુદરતી માપોમાં ઘણાં (ઊંચાઈ, અને ઘણી વાર પરીક્ષાના marks) લગભગ normal હોય છે. બીજી વહેંચણીઓનું વર્ણન કરવા માટે એ સંદર્ભ આકાર છે: આપણે પૂછીએ છીએ કે ખરી વહેંચણી આ આદર્શ ઘંટથી કઈ રીતે જુદી પડે છે, અને એ જુદી પડવાની બે રીતો skewness તથા kurtosis પકડે છે.
Theory
Skewed distributions અને skewness
Skewed distribution અસમમિત હોય છે, એટલે કે એની એક પૂંછડી બીજી કરતાં લાંબી હોય છે, અને skewness એ સંખ્યા છે જે આ એકતરફીપણું માપે છે (0 એટલે સમમિત).
Right (positive) skew: લાંબી પૂંછડી જમણી બાજુ (ઊંચી કિંમતો તરફ) ખેંચાય છે, અને સરેરાશને મધ્યકથી ઉપર ખેંચે છે. દાખલો: આવક, અથવા એવા marks જ્યાં નીચેના ઝુમખાની ઉપર થોડા વિદ્યાર્થીઓ બહુ ઊંચા ગુણ મેળવે.
Left (negative) skew: લાંબી પૂંછડી ડાબી બાજુ (નીચી કિંમતો તરફ) ખેંચાય છે, અને સરેરાશને મધ્યકથી નીચે ખેંચે છે. દાખલો: સહેલી પરીક્ષા જ્યાં મોટા ભાગના ઊંચા ગુણ મેળવે પણ થોડા બહુ ખરાબ રીતે નાપાસ થાય.
કામ લાગે એવો નિયમ: right skew માં સરેરાશ > મધ્યક; left skew માં સરેરાશ < મધ્યક; સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે.
Formula
Skewness ઢળે છે; kurtosis શિખર બતાવે છે
આકારનાં આ બે માપ અલગ રાખો. Skewness એ સમમિતિ વિશે છે, એટલે કે વહેંચણી કઈ બાજુ ઢળે છે (કે ઢળે છે જ નહીં), જે કઈ પૂંછડી લાંબી છે એના પરથી અને સરેરાશ સામે મધ્યકની સરખામણી પરથી જણાય છે.
Kurtosis એ પૂંછડીપણા અને શિખરપણા વિશે છે, એટલે કે પૂંછડીઓ કેટલી ભારે છે અને શિખર કેટલું તીક્ષ્ણ છે. ઊંચું kurtosis એટલે ભારે પૂંછડીઓ અને તીક્ષ્ણ શિખર (normal વળાંક કરતાં વધુ અંતિમ કિંમતો); નીચું kurtosis એટલે હલકી પૂંછડીઓ અને વધુ સપાટ આકાર. એટલે skewness જવાબ આપે છે કે 'એ એકતરફી છે કે નહીં, અને કઈ બાજુ?' જ્યારે kurtosis જવાબ આપે છે કે 'પૂંછડીઓ કેટલી અંતિમ છે?'.
Quiz
Marks ની એક વહેંચણીમાં સરેરાશ (3.5) મધ્યક (3.0) કરતાં વધારે છે, અને થોડા બહુ ઊંચા ગુણ જમણી બાજુ ખેંચાય છે. આ કઈ વહેંચણી છે?
- Left (negative) skew, કારણ કે સરેરાશ નાની છે
- Right (positive) skew, જેમાં લાંબી જમણી પૂંછડી સરેરાશને મધ્યકથી ઉપર ખેંચે છે
- સંપૂર્ણ normal, કારણ કે એમાં સરેરાશ અને મધ્યક બંને છે
- એમાં ઊંચું kurtosis છે, skew નહીં
Show the answer
Right (positive) skew, જેમાં લાંબી જમણી પૂંછડી સરેરાશને મધ્યકથી ઉપર ખેંચે છે
જમણી બાજુ (ઊંચી કિંમતો તરફ) ખેંચાતી લાંબી પૂંછડી અને સરેરાશનું મધ્યકથી ઉપર ખેંચાવું (3.5 > 3.0) એ right (positive) skew ની ઓળખ છે. વિકલ્પ A ઊંધો છે: left skew માં પૂંછડી ડાબી બાજુ હોય છે અને સરેરાશ મધ્યકથી નીચે (સરેરાશ < મધ્યક), એટલે અહીં જે વર્ણવ્યું છે એનાથી ઊલટું. વિકલ્પ C ખોટો છે: સંપૂર્ણ normal distribution સમમિત હોય છે અને એમાં સરેરાશ = મધ્યક = બહુલક હોય, પણ અહીં સરેરાશ મધ્યક બરાબર નથી, એટલે એ normal નથી. વિકલ્પ D બે માપ ભેળવી દે છે: kurtosis પૂંછડીની ભારેપણું અને શિખરની તીક્ષ્ણતા વર્ણવે છે, જ્યારે અહીંનું એકતરફીપણું અને સરેરાશ તથા મધ્યક વચ્ચેનો ગાળો SKEWNESS ની વાત છે. યાદ રાખો: સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે, એટલે સરેરાશ > મધ્યક હોય તો પૂંછડી જમણી બાજુ, અને એ right skew.
Think first
સરેરાશ લાંબી પૂંછડી તરફ કેમ ખેંચાય છે?
Right skew વાળી વહેંચણીમાં સરેરાશ મધ્યક કરતાં ઊંચી કેમ થઈ જાય છે? વિચારીને પછી tap કરો.
Show the answer
કારણ કે સરેરાશ અંતિમ કિંમતો પ્રત્યે સંવેદનશીલ છે જ્યારે મધ્યક નથી, એટલે અંતિમ કિંમતોની લાંબી પૂંછડી સરેરાશને પોતાની તરફ ખેંચે છે, પણ મધ્યકને ભાગ્યે જ હલાવે છે. સરેરાશ એ ગાણિતિક સરાસરી છે: દરેક કિંમત પોતાના આખા કદ સાથે સરવાળામાં ફાળો આપે છે, એટલે થોડીક બહુ મોટી કિંમતો (લાંબી જમણી પૂંછડી) સરવાળામાં ઘણું ઉમેરે છે અને સરાસરીને ઉપર ખેંચે છે. બીજી બાજુ મધ્યક એટલે data ને ક્રમમાં ગોઠવ્યા પછીની વચ્ચેની કિંમત, અને એને ફક્ત સ્થાનની પડી છે, કદની નહીં. જમણી બાજુ થોડીક બહુ મોટી કિંમતો ઉમેરવાથી વચ્ચેનું સ્થાન સહેજ જ ખસે છે, કારણ કે મધ્યક data ના બિંદુઓ ગણે છે, એમનું કદ નહીં. એટલે right skew વાળી વહેંચણીમાં અંતિમ ઊંચી કિંમતો સરેરાશને મધ્યકથી ઠીક ઠીક ઉપર ફુલાવે છે, અને સરેરાશ > મધ્યક થાય છે; left skew વાળી વહેંચણીમાં અંતિમ નીચી કિંમતો સરેરાશને મધ્યકથી નીચે ખેંચે છે. આવક જેવા skewed data માટે 'સામાન્ય' કિંમત તરીકે મધ્યક જ કેમ જણાવાય છે એનું કારણ પણ આ જ છે: એ outliers થી બગડતો નથી, જ્યારે સરેરાશ ગેરમાર્ગે દોરે એટલી ઊંચી હોઈ શકે. સરેરાશ અને મધ્યકની સરખામણી skew ની આટલી ઝડપી કસોટી કેમ છે એ પણ આ જ સમજાવે છે: જો બંને નોંધપાત્ર રીતે જુદા પડે, તો data સરેરાશ જે બાજુ બેઠી હોય એ બાજુ ઢળેલો છે. સરેરાશ પૂંછડી પાછળ દોડે છે; મધ્યક વચ્ચે જ ટકી રહે છે.
Summary
Key takeaways
- વહેંચણીનો આકાર, ફક્ત એની સરેરાશ નહીં, બતાવે છે કે ચલ ખરેખર કેવો છે.
- Normal distribution એ સમમિત ઘંટ જેવો વળાંક છે, જેમાં સરેરાશ = મધ્યક = બહુલક હોય છે અને કિંમતો કેન્દ્રની આસપાસ ભેગી થાય છે.
- Skewness અસમમિતિ માપે છે: right (positive) skew માં લાંબી જમણી પૂંછડી હોય અને સરેરાશ > મધ્યક; left (negative) skew માં લાંબી ડાબી પૂંછડી હોય અને સરેરાશ < મધ્યક.
- સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે, એટલે સરેરાશ અને મધ્યકની સરખામણી એ skew ની ઝડપી કસોટી છે.
- Kurtosis પૂંછડીપણું અને શિખરપણું માપે છે: ઊંચું એટલે ભારે પૂંછડીઓ અને તીક્ષ્ણ શિખર (વધુ અંતિમ કિંમતો), નીચું એટલે હલકી પૂંછડીઓ અને વધુ સપાટ આકાર.
- Skewness જવાબ આપે છે કે 'એ કઈ બાજુ ઢળે છે?'; kurtosis જવાબ આપે છે કે 'પૂંછડીઓ કેટલી અંતિમ છે?'.
- યાદ રાખવાની કડી: normal એટલે સમતોલ ઘંટ; skew ઢળે છે (સરેરાશ પૂંછડી પાછળ દોડે); kurtosis પૂંછડીઓના વજનની વાત છે.