Theory
બધાં columns એક જ જાતનાં હોતાં નથી
Placement dataset માં 'marks' એવી સંખ્યા છે જેની સરેરાશ કાઢી શકાય, 'department' એવું નામ છે જેની ન કઢાય, અને 'grade' (A, B, C) બંને વચ્ચે ક્યાંક છે, એટલે કે ક્રમવાળું છે પણ માપ નથી. ત્રણેયને એકસરખાં ગણવાથી અર્થહીન પરિણામો આવે છે, જેમ કે 'સરેરાશ department' ગણવું.
એટલે વિશ્લેષણ કરતાં પહેલાં તમારે દરેક column નો data type જાણવો પડે. આ પ્રકારો એક નાનું કુટુંબ બનાવે છે: quantitative (સંખ્યાત્મક) જે discrete અને continuous માં વહેંચાય છે, અને qualitative (વર્ગીય) જે nominal અને ordinal માં વહેંચાય છે. કયું કયું છે એ જાણવાથી ખબર પડે છે કે કયું વિશ્લેષણ માન્ય ગણાય જ.
At a glance
| પ્રકાર | અર્થ | Placement data નો દાખલો |
|---|---|---|
| Quantitative, discrete | ગણી શકાય એવી પૂર્ણ સંખ્યાઓ | Projects ની સંખ્યા (0, 1, 2, 3) |
| Quantitative, continuous | વ્યાપની અંદરની કોઈ પણ કિંમત (માપેલી) | Marks ની ટકાવારી (દા.ત. 78.5) |
| Qualitative, nominal | ક્રમ વગરના વર્ગો | Department; placement થયું કે નહીં (હા/ના) |
| Qualitative, ordinal | અર્થપૂર્ણ ક્રમવાળા વર્ગો | Grade (A, B, C); કૌશલ્યનું સ્તર (નીચું/મધ્યમ/ઊંચું) |
Theory
Quantitative: discrete સામે continuous
Quantitative data એટલે એવી સંખ્યાઓ જેને તમે અર્થપૂર્ણ રીતે માપી શકો અને જેના પર અંકગણિત કરી શકો. એ બે ભાગમાં વહેંચાય છે.
Discrete data એટલે ગણી શકાય એવી પૂર્ણ કિંમતો, એટલે કે જે વસ્તુઓ તમે ગણો છો: વિદ્યાર્થીએ કરેલા projects ની સંખ્યા 0, 1, 2, 3 હોય, 2.5 કદી નહીં. Continuous data વ્યાપની અંદરની કોઈ પણ કિંમત લઈ શકે છે, એટલે કે જે વસ્તુઓ તમે માપો છો: marks ની ટકાવારી 78, 78.5, 78.53 પણ હોઈ શકે, અને એની મર્યાદા ફક્ત માપની ચોકસાઈ છે.
ઝડપી કસોટી: શું એમાં દશાંશ અને વચ્ચેની કિંમતો સમજપૂર્વક આવી શકે? જો હા, તો એ continuous છે (marks, ઊંચાઈ, સમય); અને જો એ ફક્ત ગણી શકાય એવાં પૂરાં પગથિયાંમાં જ કૂદે, તો એ discrete છે (projects, પ્રયત્નોની સંખ્યા).
Theory
Qualitative: nominal સામે ordinal
Qualitative (વર્ગીય) data એટલે વર્ગો, માપ નહીં. એ પણ બે ભાગમાં વહેંચાય છે, અને ભેદ ક્રમ નો છે.
Nominal વર્ગોમાં કોઈ સહજ ક્રમ હોતો નથી: department નાં નામ (Computer, Commerce, Science) કે placement થયું કે નહીં એવો હા/ના વાળો સંકેત, એમાં કોઈ બીજા કરતાં 'ઊંચું' નથી. Ordinal વર્ગોમાં અર્થપૂર્ણ ક્રમ હોય છે પણ માપી શકાય એવા ગાળા હોતા નથી: A ગ્રેડ B કરતાં સારો અને B ગ્રેડ C કરતાં સારો, અને સંતોષનું નીચું/મધ્યમ/ઊંચું સ્તર પણ ક્રમમાં છે, છતાં તમે એમ ન કહી શકો કે A ઓછા B બરાબર કોઈ નિશ્ચિત આંકડો થાય.
કસોટી: શું વર્ગોમાં કુદરતી ક્રમ છે? ક્રમ હોય તો ordinal; ક્રમ ન હોય તો nominal.
Quiz
Placement dataset માં 'grade' નામનું column A, B અને C કિંમતો લે છે, જ્યાં A એ B કરતાં સારો અને B એ C કરતાં સારો છે. આ કયો data type છે?
- Quantitative continuous, કારણ કે grades marks જેવા જ છે
- Qualitative ordinal, કારણ કે વર્ગોમાં અર્થપૂર્ણ ક્રમ છે પણ એ માપેલી સંખ્યાઓ નથી
- Qualitative nominal, કારણ કે grades ફક્ત ક્રમ વગરનાં લેબલ છે
- Quantitative discrete, કારણ કે grades ત્રણ છે
Show the answer
Qualitative ordinal, કારણ કે વર્ગોમાં અર્થપૂર્ણ ક્રમ છે પણ એ માપેલી સંખ્યાઓ નથી
Grade (A, B, C) એ qualitative ordinal છે: કિંમતો સ્પષ્ટ ક્રમવાળા વર્ગો છે (A એ B કરતાં અને B એ C કરતાં સારો), પણ એ નિશ્ચિત ગાળાવાળી માપેલી સંખ્યાઓ નથી. વિકલ્પ A ખોટો છે: grades લેબલ છે, continuous માપ નહીં, અને તમે એમ ન કહી શકો કે A બરાબર 85.3; એ તો નીચે રહેલા marks થાય, જે જુદું column છે. વિકલ્પ C ક્રમને ચૂકી જાય છે: department નાં નામથી ઊલટું, grades માં અર્થપૂર્ણ ક્રમ છે જ, એટલે એ ordinal છે, nominal નહીં. વિકલ્પ D ખોટો છે: discrete quantitative એટલે ગણી શકાય એવી સંખ્યાઓ (જેમ કે projects ની સંખ્યા), જ્યારે A, B અને C એ ક્રમવાળા વર્ગો છે, ગણતરી નહીં. નિર્ણાયક પ્રશ્ન આ છે: એ ક્રમવાળા વર્ગો છે (ordinal), ક્રમ વગરના વર્ગો છે (nominal), કે ખરેખરી સંખ્યાઓ છે (quantitative)?
Think first
વિશ્લેષણ માટે data type કેમ મહત્ત્વનો છે?
દરેક column ને વર્ગમાં મૂકવાની માથાકૂટ શા માટે? Data types અવગણો તો શું ખોટું થાય? વિચારીને પછી tap કરો.
Show the answer
કારણ કે data type નક્કી કરે છે કે કઈ ક્રિયાઓ, કયા સારાંશ અને કયા આલેખ માન્ય ગણાય, અને ખોટું લગાડવાથી અર્થહીન કે ગેરમાર્ગે દોરનારાં પરિણામો આવે છે. સરેરાશનો દાખલો લો. Marks જેવા quantitative column ની સરેરાશ કાઢવી સાવ સમજદારીભરી છે ('સરેરાશ marks 72 છે'). પણ department જેવા NOMINAL column ની 'સરેરાશ' કાઢવી અર્થહીન છે, કારણ કે 'Computer, Commerce, Science' ની કોઈ સરેરાશ હોતી નથી; એ લેબલોને તમે જે આંકડા આપો તે મનસ્વી હોય છે, એટલે એમની સરેરાશનો કોઈ અર્થ નથી. Ordinal data જરા વધુ ઝીણું છે: તમે મધ્યક grade (વચ્ચેનો ક્રમ) શોધી શકો, પણ ગાળા સરખા હોય એમ માનીને A, B, C ની સરેરાશ કાઢવી શંકાસ્પદ છે. પ્રકાર સાચો આલેખ પણ નક્કી કરે છે: continuous data ને histogram બંધ બેસે, વર્ગીય data ને ગણતરીનો bar chart, અને બે quantitative ચલ ને scatter plot. એ તો એ પણ દોરે છે કે machine learning નું model એ column ને કઈ રીતે ગણે, કારણ કે સંખ્યાત્મક લક્ષણો અને વર્ગીય લક્ષણો જુદી રીતે સંભાળાય છે (વર્ગોને ઘણી વાર encoding જોઈએ). એટલે દરેક column ને વર્ગમાં મૂકવું એ નકામી માથાકૂટ નથી; એ જ તમારા વિશ્લેષણને પ્રામાણિક રાખે છે, અને ખાતરી કરે છે કે દરેક સરેરાશ, દરેક આલેખ અને model ને અપાતું દરેક input એ data ના પ્રકાર માટે ખરેખર અર્થપૂર્ણ છે. પ્રકાર જાણો, એટલે તમે જાણી ગયા કે એની સાથે તમને શું કરવાની છૂટ છે.
Summary
Key takeaways
- દરેક column નો એક data type હોય છે જે નક્કી કરે છે કે કયાં વિશ્લેષણ અને કયા આલેખ માન્ય છે.
- Quantitative data એટલે માપી શકાય એવી સંખ્યાઓ; qualitative data એટલે વર્ગો.
- Quantitative discrete (ગણી શકાય એવી પૂર્ણ કિંમતો, જેમ કે projects ની સંખ્યા) અને continuous (વ્યાપની અંદરની કોઈ પણ કિંમત, જેમ કે marks) માં વહેંચાય છે.
- Qualitative nominal (ક્રમ વગરના વર્ગો, જેમ કે department) અને ordinal (ક્રમવાળા વર્ગો, જેમ કે grade A, B, C) માં વહેંચાય છે.
- Quantitative ની કસોટી: શું એમાં વચ્ચેની દશાંશ કિંમતો સમજપૂર્વક આવે (continuous) કે ફક્ત પૂરી ગણતરી જ (discrete)?
- Qualitative ની કસોટી: શું વર્ગોમાં કુદરતી ક્રમ છે (ordinal) કે નહીં (nominal)?
- યાદ રાખવાની કડી: quantitative ગણે છે કે માપે છે; qualitative લેબલ આપે છે, ક્રમ સાથે (ordinal) કે ક્રમ વગર (nominal).