Understanding the Data: Quantitative Data (Discrete and Continuous); Qualitative Data (Nominal and Ordinal)

Dataset ના દરેક column નો એક data type હોય છે જે નક્કી કરે છે કે તમે એની સાથે શું કરી શકો: quantitative data એટલે માપી શકાય એવી સંખ્યાઓ (ગણી શકાય એવો discrete કે માપી શકાય એવો continuous), જ્યારે qualitative data એટલે વર્ગો (ક્રમ વગરનો nominal કે ક્રમવાળો ordinal).

10 min read · 7 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

બધાં columns એક જ જાતનાં હોતાં નથી

Placement dataset માં 'marks' એવી સંખ્યા છે જેની સરેરાશ કાઢી શકાય, 'department' એવું નામ છે જેની ન કઢાય, અને 'grade' (A, B, C) બંને વચ્ચે ક્યાંક છે, એટલે કે ક્રમવાળું છે પણ માપ નથી. ત્રણેયને એકસરખાં ગણવાથી અર્થહીન પરિણામો આવે છે, જેમ કે 'સરેરાશ department' ગણવું.

એટલે વિશ્લેષણ કરતાં પહેલાં તમારે દરેક column નો data type જાણવો પડે. આ પ્રકારો એક નાનું કુટુંબ બનાવે છે: quantitative (સંખ્યાત્મક) જે discrete અને continuous માં વહેંચાય છે, અને qualitative (વર્ગીય) જે nominal અને ordinal માં વહેંચાય છે. કયું કયું છે એ જાણવાથી ખબર પડે છે કે કયું વિશ્લેષણ માન્ય ગણાય જ.

At a glance

પ્રકારઅર્થPlacement data નો દાખલો
Quantitative, discreteગણી શકાય એવી પૂર્ણ સંખ્યાઓProjects ની સંખ્યા (0, 1, 2, 3)
Quantitative, continuousવ્યાપની અંદરની કોઈ પણ કિંમત (માપેલી)Marks ની ટકાવારી (દા.ત. 78.5)
Qualitative, nominalક્રમ વગરના વર્ગોDepartment; placement થયું કે નહીં (હા/ના)
Qualitative, ordinalઅર્થપૂર્ણ ક્રમવાળા વર્ગોGrade (A, B, C); કૌશલ્યનું સ્તર (નીચું/મધ્યમ/ઊંચું)

Theory

Quantitative: discrete સામે continuous

Quantitative data એટલે એવી સંખ્યાઓ જેને તમે અર્થપૂર્ણ રીતે માપી શકો અને જેના પર અંકગણિત કરી શકો. એ બે ભાગમાં વહેંચાય છે.

Discrete data એટલે ગણી શકાય એવી પૂર્ણ કિંમતો, એટલે કે જે વસ્તુઓ તમે ગણો છો: વિદ્યાર્થીએ કરેલા projects ની સંખ્યા 0, 1, 2, 3 હોય, 2.5 કદી નહીં. Continuous data વ્યાપની અંદરની કોઈ પણ કિંમત લઈ શકે છે, એટલે કે જે વસ્તુઓ તમે માપો છો: marks ની ટકાવારી 78, 78.5, 78.53 પણ હોઈ શકે, અને એની મર્યાદા ફક્ત માપની ચોકસાઈ છે.

ઝડપી કસોટી: શું એમાં દશાંશ અને વચ્ચેની કિંમતો સમજપૂર્વક આવી શકે? જો હા, તો એ continuous છે (marks, ઊંચાઈ, સમય); અને જો એ ફક્ત ગણી શકાય એવાં પૂરાં પગથિયાંમાં જ કૂદે, તો એ discrete છે (projects, પ્રયત્નોની સંખ્યા).

Theory

Qualitative: nominal સામે ordinal

Qualitative (વર્ગીય) data એટલે વર્ગો, માપ નહીં. એ પણ બે ભાગમાં વહેંચાય છે, અને ભેદ ક્રમ નો છે.

Nominal વર્ગોમાં કોઈ સહજ ક્રમ હોતો નથી: department નાં નામ (Computer, Commerce, Science) કે placement થયું કે નહીં એવો હા/ના વાળો સંકેત, એમાં કોઈ બીજા કરતાં 'ઊંચું' નથી. Ordinal વર્ગોમાં અર્થપૂર્ણ ક્રમ હોય છે પણ માપી શકાય એવા ગાળા હોતા નથી: A ગ્રેડ B કરતાં સારો અને B ગ્રેડ C કરતાં સારો, અને સંતોષનું નીચું/મધ્યમ/ઊંચું સ્તર પણ ક્રમમાં છે, છતાં તમે એમ ન કહી શકો કે A ઓછા B બરાબર કોઈ નિશ્ચિત આંકડો થાય.

કસોટી: શું વર્ગોમાં કુદરતી ક્રમ છે? ક્રમ હોય તો ordinal; ક્રમ ન હોય તો nominal.

Quiz

Placement dataset માં 'grade' નામનું column A, B અને C કિંમતો લે છે, જ્યાં A એ B કરતાં સારો અને B એ C કરતાં સારો છે. આ કયો data type છે?

  1. Quantitative continuous, કારણ કે grades marks જેવા જ છે
  2. Qualitative ordinal, કારણ કે વર્ગોમાં અર્થપૂર્ણ ક્રમ છે પણ એ માપેલી સંખ્યાઓ નથી
  3. Qualitative nominal, કારણ કે grades ફક્ત ક્રમ વગરનાં લેબલ છે
  4. Quantitative discrete, કારણ કે grades ત્રણ છે
Show the answer

Qualitative ordinal, કારણ કે વર્ગોમાં અર્થપૂર્ણ ક્રમ છે પણ એ માપેલી સંખ્યાઓ નથી

Grade (A, B, C) એ qualitative ordinal છે: કિંમતો સ્પષ્ટ ક્રમવાળા વર્ગો છે (A એ B કરતાં અને B એ C કરતાં સારો), પણ એ નિશ્ચિત ગાળાવાળી માપેલી સંખ્યાઓ નથી. વિકલ્પ A ખોટો છે: grades લેબલ છે, continuous માપ નહીં, અને તમે એમ ન કહી શકો કે A બરાબર 85.3; એ તો નીચે રહેલા marks થાય, જે જુદું column છે. વિકલ્પ C ક્રમને ચૂકી જાય છે: department નાં નામથી ઊલટું, grades માં અર્થપૂર્ણ ક્રમ છે જ, એટલે એ ordinal છે, nominal નહીં. વિકલ્પ D ખોટો છે: discrete quantitative એટલે ગણી શકાય એવી સંખ્યાઓ (જેમ કે projects ની સંખ્યા), જ્યારે A, B અને C એ ક્રમવાળા વર્ગો છે, ગણતરી નહીં. નિર્ણાયક પ્રશ્ન આ છે: એ ક્રમવાળા વર્ગો છે (ordinal), ક્રમ વગરના વર્ગો છે (nominal), કે ખરેખરી સંખ્યાઓ છે (quantitative)?

Think first

વિશ્લેષણ માટે data type કેમ મહત્ત્વનો છે?

દરેક column ને વર્ગમાં મૂકવાની માથાકૂટ શા માટે? Data types અવગણો તો શું ખોટું થાય? વિચારીને પછી tap કરો.

Show the answer

કારણ કે data type નક્કી કરે છે કે કઈ ક્રિયાઓ, કયા સારાંશ અને કયા આલેખ માન્ય ગણાય, અને ખોટું લગાડવાથી અર્થહીન કે ગેરમાર્ગે દોરનારાં પરિણામો આવે છે. સરેરાશનો દાખલો લો. Marks જેવા quantitative column ની સરેરાશ કાઢવી સાવ સમજદારીભરી છે ('સરેરાશ marks 72 છે'). પણ department જેવા NOMINAL column ની 'સરેરાશ' કાઢવી અર્થહીન છે, કારણ કે 'Computer, Commerce, Science' ની કોઈ સરેરાશ હોતી નથી; એ લેબલોને તમે જે આંકડા આપો તે મનસ્વી હોય છે, એટલે એમની સરેરાશનો કોઈ અર્થ નથી. Ordinal data જરા વધુ ઝીણું છે: તમે મધ્યક grade (વચ્ચેનો ક્રમ) શોધી શકો, પણ ગાળા સરખા હોય એમ માનીને A, B, C ની સરેરાશ કાઢવી શંકાસ્પદ છે. પ્રકાર સાચો આલેખ પણ નક્કી કરે છે: continuous data ને histogram બંધ બેસે, વર્ગીય data ને ગણતરીનો bar chart, અને બે quantitative ચલ ને scatter plot. એ તો એ પણ દોરે છે કે machine learning નું model એ column ને કઈ રીતે ગણે, કારણ કે સંખ્યાત્મક લક્ષણો અને વર્ગીય લક્ષણો જુદી રીતે સંભાળાય છે (વર્ગોને ઘણી વાર encoding જોઈએ). એટલે દરેક column ને વર્ગમાં મૂકવું એ નકામી માથાકૂટ નથી; એ જ તમારા વિશ્લેષણને પ્રામાણિક રાખે છે, અને ખાતરી કરે છે કે દરેક સરેરાશ, દરેક આલેખ અને model ને અપાતું દરેક input એ data ના પ્રકાર માટે ખરેખર અર્થપૂર્ણ છે. પ્રકાર જાણો, એટલે તમે જાણી ગયા કે એની સાથે તમને શું કરવાની છૂટ છે.

Summary

Key takeaways

  • દરેક column નો એક data type હોય છે જે નક્કી કરે છે કે કયાં વિશ્લેષણ અને કયા આલેખ માન્ય છે.
  • Quantitative data એટલે માપી શકાય એવી સંખ્યાઓ; qualitative data એટલે વર્ગો.
  • Quantitative discrete (ગણી શકાય એવી પૂર્ણ કિંમતો, જેમ કે projects ની સંખ્યા) અને continuous (વ્યાપની અંદરની કોઈ પણ કિંમત, જેમ કે marks) માં વહેંચાય છે.
  • Qualitative nominal (ક્રમ વગરના વર્ગો, જેમ કે department) અને ordinal (ક્રમવાળા વર્ગો, જેમ કે grade A, B, C) માં વહેંચાય છે.
  • Quantitative ની કસોટી: શું એમાં વચ્ચેની દશાંશ કિંમતો સમજપૂર્વક આવે (continuous) કે ફક્ત પૂરી ગણતરી જ (discrete)?
  • Qualitative ની કસોટી: શું વર્ગોમાં કુદરતી ક્રમ છે (ordinal) કે નહીં (nominal)?
  • યાદ રાખવાની કડી: quantitative ગણે છે કે માપે છે; qualitative લેબલ આપે છે, ક્રમ સાથે (ordinal) કે ક્રમ વગર (nominal).

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Fundamentals of Data Analytics

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati