Spread of Data: Normal Distribution; Skewed Distribution; Skewness and Kurtosis

તમારા data નો આકાર મહત્ત્વનો છે: normal distribution એ સમમિત ઘંટ જેવો વળાંક છે, skewness માપે છે કે વહેંચણી કેટલી એકતરફી છે (એની પૂંછડી કઈ બાજુ ઢળે છે), અને kurtosis માપે છે કે એની પૂંછડીઓ કેટલી ભારે છે અને એનું શિખર કેટલું તીક્ષ્ણ છે.

11 min read · 7 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

Data નો આકાર

એકલી સરેરાશ ગેરમાર્ગે દોરી શકે છે. બે વર્ગોના marks ની સરેરાશ સરખી હોય તો પણ એમના આકાર સાવ જુદા હોઈ શકે: એકમાં કિંમતો સરેરાશની આસપાસ ચુસ્ત રીતે ભેગી થયેલી હોય, અને બીજામાં ઓછા ગુણ મેળવનારાઓની લાંબી પૂંછડી બધું નીચે ખેંચતી હોય. કોઈ ચલને ખરેખર સમજવો હોય તો એની કિંમતો કઈ રીતે વહેંચાયેલી છે, એટલે કે એમનો આકાર, એ જોવો પડે.

આ પાઠ મુખ્ય આકારો આવરી લે છે: સમમિત normal distribution, એક બાજુ ઢળતી skewed distributions, અને આકાર માપતી બે સંખ્યાઓ, એટલે કે skewness (એકતરફીપણું) અને kurtosis (પૂંછડીપણું). ઘંટ જેવો વળાંક તમે statistics માં જોયો હતો; અહીં તમે વિશ્લેષકની જેમ આકાર વાંચતાં શીખો છો.

Theory

Normal distribution

Normal distribution એ જાણીતો સમમિત, ઘંટ આકારનો વળાંક છે. મોટા ભાગની કિંમતો કેન્દ્રની આસપાસ ભેગી થાય છે, અને બંને બાજુ સરખી રીતે પાતળી થતી જાય છે. સંપૂર્ણ normal distribution માં સરેરાશ, મધ્યક અને બહુલક ત્રણેય એક જ મધ્ય બિંદુ પર બેસે છે.

કુદરતી માપોમાં ઘણાં (ઊંચાઈ, અને ઘણી વાર પરીક્ષાના marks) લગભગ normal હોય છે. બીજી વહેંચણીઓનું વર્ણન કરવા માટે એ સંદર્ભ આકાર છે: આપણે પૂછીએ છીએ કે ખરી વહેંચણી આ આદર્શ ઘંટથી કઈ રીતે જુદી પડે છે, અને એ જુદી પડવાની બે રીતો skewness તથા kurtosis પકડે છે.

Theory

Skewed distributions અને skewness

Skewed distribution અસમમિત હોય છે, એટલે કે એની એક પૂંછડી બીજી કરતાં લાંબી હોય છે, અને skewness એ સંખ્યા છે જે આ એકતરફીપણું માપે છે (0 એટલે સમમિત).

Right (positive) skew: લાંબી પૂંછડી જમણી બાજુ (ઊંચી કિંમતો તરફ) ખેંચાય છે, અને સરેરાશને મધ્યકથી ઉપર ખેંચે છે. દાખલો: આવક, અથવા એવા marks જ્યાં નીચેના ઝુમખાની ઉપર થોડા વિદ્યાર્થીઓ બહુ ઊંચા ગુણ મેળવે.

Left (negative) skew: લાંબી પૂંછડી ડાબી બાજુ (નીચી કિંમતો તરફ) ખેંચાય છે, અને સરેરાશને મધ્યકથી નીચે ખેંચે છે. દાખલો: સહેલી પરીક્ષા જ્યાં મોટા ભાગના ઊંચા ગુણ મેળવે પણ થોડા બહુ ખરાબ રીતે નાપાસ થાય.

કામ લાગે એવો નિયમ: right skew માં સરેરાશ > મધ્યક; left skew માં સરેરાશ < મધ્યક; સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે.

Formula

Skewness ઢળે છે; kurtosis શિખર બતાવે છે

આકારનાં આ બે માપ અલગ રાખો. Skewness એ સમમિતિ વિશે છે, એટલે કે વહેંચણી કઈ બાજુ ઢળે છે (કે ઢળે છે જ નહીં), જે કઈ પૂંછડી લાંબી છે એના પરથી અને સરેરાશ સામે મધ્યકની સરખામણી પરથી જણાય છે.

Kurtosis એ પૂંછડીપણા અને શિખરપણા વિશે છે, એટલે કે પૂંછડીઓ કેટલી ભારે છે અને શિખર કેટલું તીક્ષ્ણ છે. ઊંચું kurtosis એટલે ભારે પૂંછડીઓ અને તીક્ષ્ણ શિખર (normal વળાંક કરતાં વધુ અંતિમ કિંમતો); નીચું kurtosis એટલે હલકી પૂંછડીઓ અને વધુ સપાટ આકાર. એટલે skewness જવાબ આપે છે કે 'એ એકતરફી છે કે નહીં, અને કઈ બાજુ?' જ્યારે kurtosis જવાબ આપે છે કે 'પૂંછડીઓ કેટલી અંતિમ છે?'.

Quiz

Marks ની એક વહેંચણીમાં સરેરાશ (3.5) મધ્યક (3.0) કરતાં વધારે છે, અને થોડા બહુ ઊંચા ગુણ જમણી બાજુ ખેંચાય છે. આ કઈ વહેંચણી છે?

  1. Left (negative) skew, કારણ કે સરેરાશ નાની છે
  2. Right (positive) skew, જેમાં લાંબી જમણી પૂંછડી સરેરાશને મધ્યકથી ઉપર ખેંચે છે
  3. સંપૂર્ણ normal, કારણ કે એમાં સરેરાશ અને મધ્યક બંને છે
  4. એમાં ઊંચું kurtosis છે, skew નહીં
Show the answer

Right (positive) skew, જેમાં લાંબી જમણી પૂંછડી સરેરાશને મધ્યકથી ઉપર ખેંચે છે

જમણી બાજુ (ઊંચી કિંમતો તરફ) ખેંચાતી લાંબી પૂંછડી અને સરેરાશનું મધ્યકથી ઉપર ખેંચાવું (3.5 > 3.0) એ right (positive) skew ની ઓળખ છે. વિકલ્પ A ઊંધો છે: left skew માં પૂંછડી ડાબી બાજુ હોય છે અને સરેરાશ મધ્યકથી નીચે (સરેરાશ < મધ્યક), એટલે અહીં જે વર્ણવ્યું છે એનાથી ઊલટું. વિકલ્પ C ખોટો છે: સંપૂર્ણ normal distribution સમમિત હોય છે અને એમાં સરેરાશ = મધ્યક = બહુલક હોય, પણ અહીં સરેરાશ મધ્યક બરાબર નથી, એટલે એ normal નથી. વિકલ્પ D બે માપ ભેળવી દે છે: kurtosis પૂંછડીની ભારેપણું અને શિખરની તીક્ષ્ણતા વર્ણવે છે, જ્યારે અહીંનું એકતરફીપણું અને સરેરાશ તથા મધ્યક વચ્ચેનો ગાળો SKEWNESS ની વાત છે. યાદ રાખો: સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે, એટલે સરેરાશ > મધ્યક હોય તો પૂંછડી જમણી બાજુ, અને એ right skew.

Think first

સરેરાશ લાંબી પૂંછડી તરફ કેમ ખેંચાય છે?

Right skew વાળી વહેંચણીમાં સરેરાશ મધ્યક કરતાં ઊંચી કેમ થઈ જાય છે? વિચારીને પછી tap કરો.

Show the answer

કારણ કે સરેરાશ અંતિમ કિંમતો પ્રત્યે સંવેદનશીલ છે જ્યારે મધ્યક નથી, એટલે અંતિમ કિંમતોની લાંબી પૂંછડી સરેરાશને પોતાની તરફ ખેંચે છે, પણ મધ્યકને ભાગ્યે જ હલાવે છે. સરેરાશ એ ગાણિતિક સરાસરી છે: દરેક કિંમત પોતાના આખા કદ સાથે સરવાળામાં ફાળો આપે છે, એટલે થોડીક બહુ મોટી કિંમતો (લાંબી જમણી પૂંછડી) સરવાળામાં ઘણું ઉમેરે છે અને સરાસરીને ઉપર ખેંચે છે. બીજી બાજુ મધ્યક એટલે data ને ક્રમમાં ગોઠવ્યા પછીની વચ્ચેની કિંમત, અને એને ફક્ત સ્થાનની પડી છે, કદની નહીં. જમણી બાજુ થોડીક બહુ મોટી કિંમતો ઉમેરવાથી વચ્ચેનું સ્થાન સહેજ જ ખસે છે, કારણ કે મધ્યક data ના બિંદુઓ ગણે છે, એમનું કદ નહીં. એટલે right skew વાળી વહેંચણીમાં અંતિમ ઊંચી કિંમતો સરેરાશને મધ્યકથી ઠીક ઠીક ઉપર ફુલાવે છે, અને સરેરાશ > મધ્યક થાય છે; left skew વાળી વહેંચણીમાં અંતિમ નીચી કિંમતો સરેરાશને મધ્યકથી નીચે ખેંચે છે. આવક જેવા skewed data માટે 'સામાન્ય' કિંમત તરીકે મધ્યક જ કેમ જણાવાય છે એનું કારણ પણ આ જ છે: એ outliers થી બગડતો નથી, જ્યારે સરેરાશ ગેરમાર્ગે દોરે એટલી ઊંચી હોઈ શકે. સરેરાશ અને મધ્યકની સરખામણી skew ની આટલી ઝડપી કસોટી કેમ છે એ પણ આ જ સમજાવે છે: જો બંને નોંધપાત્ર રીતે જુદા પડે, તો data સરેરાશ જે બાજુ બેઠી હોય એ બાજુ ઢળેલો છે. સરેરાશ પૂંછડી પાછળ દોડે છે; મધ્યક વચ્ચે જ ટકી રહે છે.

Summary

Key takeaways

  • વહેંચણીનો આકાર, ફક્ત એની સરેરાશ નહીં, બતાવે છે કે ચલ ખરેખર કેવો છે.
  • Normal distribution એ સમમિત ઘંટ જેવો વળાંક છે, જેમાં સરેરાશ = મધ્યક = બહુલક હોય છે અને કિંમતો કેન્દ્રની આસપાસ ભેગી થાય છે.
  • Skewness અસમમિતિ માપે છે: right (positive) skew માં લાંબી જમણી પૂંછડી હોય અને સરેરાશ > મધ્યક; left (negative) skew માં લાંબી ડાબી પૂંછડી હોય અને સરેરાશ < મધ્યક.
  • સરેરાશ લાંબી પૂંછડી તરફ ખેંચાય છે, એટલે સરેરાશ અને મધ્યકની સરખામણી એ skew ની ઝડપી કસોટી છે.
  • Kurtosis પૂંછડીપણું અને શિખરપણું માપે છે: ઊંચું એટલે ભારે પૂંછડીઓ અને તીક્ષ્ણ શિખર (વધુ અંતિમ કિંમતો), નીચું એટલે હલકી પૂંછડીઓ અને વધુ સપાટ આકાર.
  • Skewness જવાબ આપે છે કે 'એ કઈ બાજુ ઢળે છે?'; kurtosis જવાબ આપે છે કે 'પૂંછડીઓ કેટલી અંતિમ છે?'.
  • યાદ રાખવાની કડી: normal એટલે સમતોલ ઘંટ; skew ઢળે છે (સરેરાશ પૂંછડી પાછળ દોડે); kurtosis પૂંછડીઓના વજનની વાત છે.

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Fundamentals of Data Analytics

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati