Statistical methods: Mean, Median, Mode, Standard Deviation, Variance

Statistical methods data ના અવ્યવસ્થિત વિતરણોને ચોખ્ખા metrics માં સંક્ષિપ્ત કરે છે જે numbers નું કેન્દ્રીય સંતુલન, વચલો ક્રમ, અને ફેલાવો ઉજાગર કરે છે.

11 min read · 12 cards · 3 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

કુલ સરવાળાના આંધળા ખૂણા

તમારા Semester 2 NumPy labs માં, તમે શીખ્યા કે np.sum() વાપરીને હજારો records તરત કેવી રીતે સરવાળી શકાય. પણ જો તમે તમારા campus canteen ના માસિક food spends તપાસી રહ્યા હો, તો કુલ ખર્ચેલી રકમ જાણવાથી તમને ખબર પડે છે કે તમારી રોજિંદી ખાવાની ટેવ સ્થિર છે કે તમે આખા મહિનાના pocket money ને એક જ birthday party માં ઉડાવી દીધા? એકંદર સરવાળા numbers કેવી રીતે વધઘટ થાય છે એની સાચી વાત કહેવામાં કેમ નિષ્ફળ જાય છે, અને હજારો raw rows તાક્યા વગર આપણે એક dataset નો સાચો સાર કેવી રીતે પકડીએ?

Theory

Classroom ની ઊંચાઈનું સંતુલન સામે વિખરાયેલો છંટકાવ

Descriptive statistics ને તમારા BCA section નો એક group photograph લેવા જેવું વિચારો. Mean એટલે એક ભૌતિક ત્રાજવાનું બિલકુલ કેન્દ્રબિંદુ શોધવું જ્યાં બધા સરખી રીતે ઊભા રહી શકે. Median એટલે class ને સૌથી ઠીંગણાથી સૌથી ઊંચા સુધી ગોઠવવો અને કતારની બિલકુલ વચ્ચે ઊભેલા એક જ student ને ટકોરો મારવો. પણ તમારા સહપાઠીઓ બધા લગભગ સરખી ઊંચાઈના છે કે basketball ખેલાડીઓ અને ઠીંગણા students નું અસ્તવ્યસ્ત મિશ્રણ છે એ જોવા, તમને Standard Deviation જોઈએ, જે માપે છે કે વ્યક્તિઓ એ કેન્દ્રીય સંતુલન રેખાથી કેટલી દૂર છંટાયેલી કે વિખરાયેલી છે.

Theory

Descriptive Statistics ઔપચારિક રીતે

Descriptive statistics data analytics ને બે મુખ્ય શ્રેણીઓમાં વહેંચે છે: Central Tendency (data ક્યાં ભેગો થાય છે) અને Dispersion (data કેટલો ફેલાયેલો છે). Mean અંકગણિતીય સરેરાશ દર્શાવે છે. Median એક ક્રમમાં ગોઠવેલા dataset ને બે સરખા ભાગમાં વહેંચે છે, આત્યંતિક outliers સામે એક મજબૂત માપ તરીકે કામ કરતાં. Mode સૌથી વારંવાર આવતું data point દર્શાવે છે. Dispersion માપવા, Variance mean થી સરેરાશ વર્ગ કરેલો તફાવત ગણે છે, અને Standard Deviation (SD) variance નું વર્ગમૂળ લઈને ફેલાવાના માપને data ના મૂળ scale unit પર પાછું લાવે છે.

At a glance

Table 1: આવશ્યક Python statistical tools અને mathematical લક્ષણો.

Statistical MetricPython Syntax Templateવર્તનની લાક્ષણિકતા
Arithmetic Meannp.mean(dataset)આત્યંતિક outliers કે typo entries પ્રત્યે ખૂબ સંવેદનશીલ.
Middle Mediannp.median(dataset)ભૌતિક ક્રમ પર પકડ જમાવે છે; વિકૃત કરતા spikes થી અસ્પૃશ્ય.
Peak Modestats.mode(dataset)લોકપ્રિયતા track કરે છે; categorical parameters માટે આદર્શ.
Squared Variancenp.var(dataset)વર્ગ કરેલો ફેલાવો માપે છે; બહારની વધઘટને ખૂબ મોટી કરે છે.
Standard Deviationnp.std(dataset)પ્રમાણભૂત અંતરના ફેલાવા માટેનું નિર્ણાયક માપદંડ.

Theory

Worked Example: PocketMoney ના Variance નું Auditing

ચાલો NumPy અને SciPy stats module વાપરીને student expenses ની એક સંરચિત array માટે descriptive metrics ગણીએ. આપણે ધ્યાનથી જોઈશું કે એક જ મોટો outlier mean ને median સામે કેવી અસર કરે છે, અને ફેલાવાનું બિલકુલ ચોક્કસ માપ નક્કી કરીશું.

Practical

PocketMoney Spread Auditor

import numpy as np
from scipy import stats

# Step 1: Expense logs with a major outlier spike (e.g., a 400 Rs book purchase)
spends = np.array([40, 50, 40, 60, 400, 50, 60])

# Step 2: Calculate central tendencies
mean_val   = np.mean(spends)
median_val = np.median(spends)
mode_res   = stats.mode(spends, keepdims=True)

# Step 3: Compute dispersion metrics
variance_val = np.var(spends)
std_dev_val  = np.std(spends)

print(f"Mean Spend: {mean_val:.2f}")
print(f"Median Spend: {median_val:.2f}")
print(f"Mode (Most Frequent): {mode_res.mode[0]} (Count: {mode_res.count[0]})")
print(f"Variance Score: {variance_val:.2f}")
print(f"Standard Deviation Spread: {std_dev_val:.2f}")

This example runs in Gri-Learn on the web, where you can edit it and see the output.

Think first

Outlier ની સંવેદનશીલતાનું વિશ્લેષણ કરો

spends dataset જુઓ: પાંચ items 60 Rs થી નીચે છે, પણ એક item કૂદીને 400 Rs પર જાય છે. આ એક જ spike તમારા terminal output ની અંદર mean અને median વચ્ચેનું સંતુલન કેવી રીતે બદલશે?

Show the answer

script output કરશે:

Mean Spend: 100.00

Median Spend: 50.00

Mode (Most Frequent): 40 (Count: 2)

Variance Score: 15057.14

Standard Deviation Spread: 122.71

કેમ? mean 100 Rs સુધી ઉપર ખેંચાય છે કારણ કે એ કુલ સરવાળાને 7 થી ભાગીને હિસાબ રાખે છે. પણ, median array ને [40, 40, 50, 50, 60, 60, 400] માં ગોઠવે છે અને 50 પસંદ કરે છે, એક લાક્ષણિક દિવસના ખર્ચની ઘણી વધુ સચોટ તસવીર આપતાં. 122.71 નું Standard Deviation એ 400 Rs ની ખરીદીથી થયેલી તમારા spending data માં ઊંચા સ્તરની અસ્થિરતા ઉજાગર કરે છે.

Quiz

એક university exam paper ના પ્રશ્નમાં, જો એક વિતરણનું mean 50 હોય અને variance 64 હોય, તો એનું બિલકુલ Standard Deviation માપ શું છે?

  1. 4096
  2. 8
  3. 32
  4. 6.4
Show the answer

8

Standard Deviation ને ગાણિતિક રીતે Variance ના ધન વર્ગમૂળ તરીકે વ્યાખ્યાયિત કરાય છે. 64 નું વર્ગમૂળ 8 છે. Mean કેન્દ્રનું માપ છે, તેથી એ આ રૂપાંતરની ગણતરીને અસર કરતું નથી.

Quiz

સરેરાશ consumer metrics કે salary distributions નું વિશ્લેષણ કરતી વખતે corporate database analytics systems Mean કરતાં Median પર કેમ ખૂબ આધાર રાખે છે?

  1. median ને Python loops માં ચલાવવા ઘણી ઓછી computing memory જોઈએ છે.
  2. mean આત્યંતિક ઊંચી value વાળા outliers થી ખૂબ પ્રમાણ બહાર ખેંચાઈ જાય છે, જ્યારે median સ્થિર રહે છે.
  3. mean એવી arrays process કરી શકતું નથી જેમાં floating decimal values હોય.
  4. median વિતરણમાંની બેવડી entries સંપૂર્ણપણે અવગણે છે.
Show the answer

mean આત્યંતિક ઊંચી value વાળા outliers થી ખૂબ પ્રમાણ બહાર ખેંચાઈ જાય છે, જ્યારે median સ્થિર રહે છે.

કારણ કે mean દરેક element ની બિલકુલ value ને હિસાબમાં લે છે, થોડા કરોડપતિ પગારો કે વિશાળ purchase outliers એને કૃત્રિમ રીતે ફુલાવી શકે છે. Median માત્ર ક્રમની જગ્યા પર આધાર રાખે છે, જે એને વિકૃત datasets માટે વધુ ભરોસાપાત્ર માપ બનાવે છે.

Watch out

Classic ફાંદો: Default Population Variance ની ચૂક

university lab exams માં એક વારંવારની ભૂલ એ ધારવું છે કે np.std() sample datasets માટેનાં પ્રમાણભૂત textbook સૂત્રો જેવું જ વર્તે છે. Default રીતે, NumPy population standard deviation ગણે છે (છેદમાં $N$, અથવા ddof=0). જો તમારું પ્રશ્નપત્ર સ્પષ્ટપણે sample standard deviation ($N-1$ degrees of freedom) માંગે, તો તમારે optional parameter np.std(dataset, ddof=1) આપવો પડશે, નહીંતર તમારી અંતિમ દશાંશ value marks ગુમાવશે!

Theory

Statistics ને Semester 3 સાથે જોડવા

Descriptive statistics predictive intelligence ની કરોડરજ્જુ બનાવે છે. Semester 3 Data Science (BCA302) માં, જ્યારે regression pipelines કે normalization engines બનાવશો, ત્યારે તમે inputs સાફ કરવા અને scale કરવા mean અને standard deviation matrices વાપરશો, તમારા machine learning models ને વૈવિધ્યસભર data ન્યાયી રીતે process કરવામાં મદદ કરતાં.

Summary

Key takeaways

  • Mean અંકગણિતીય સંતુલન બિંદુ તરીકે કામ કરે છે પણ outliers સામે ખૂબ નબળું છે.
  • Median ગોઠવેલા data નું સાચું કેન્દ્ર ઓળખે છે, આત્યંતિક value spikes સામે પ્રતિકાર આપતાં.
  • Mode એક dataset ની અંદરના સૌથી વધુ વારંવારના પુનરાવર્તિત parameters અલગ પાડે છે.
  • Variance વર્ગ કરેલા વિચલનો આંકે છે, તમારા records ની અંતર્ગત પરિવર્તનશીલતા track કરતાં.
  • Standard Deviation સ્પષ્ટ અર્થઘટન માટે variance ના માપને મૂળ unit scale પર પાછું લાવે છે.
  • Memory Hook: Mean બધા cells સરવાળે છે, Median ક્રમની જગ્યા track કરે છે, SD વિચલનની ત્રિજ્યા વ્યાખ્યાયિત કરે છે!

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Python Libraries

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Statistical methods: Mean, Median, Mode, Standard Deviation, Variance · Programming Skills · Gri-Learn