Theory
કુલ સરવાળાના આંધળા ખૂણા
તમારા Semester 2 NumPy labs માં, તમે શીખ્યા કે np.sum() વાપરીને હજારો records તરત કેવી રીતે સરવાળી શકાય. પણ જો તમે તમારા campus canteen ના માસિક food spends તપાસી રહ્યા હો, તો કુલ ખર્ચેલી રકમ જાણવાથી તમને ખબર પડે છે કે તમારી રોજિંદી ખાવાની ટેવ સ્થિર છે કે તમે આખા મહિનાના pocket money ને એક જ birthday party માં ઉડાવી દીધા? એકંદર સરવાળા numbers કેવી રીતે વધઘટ થાય છે એની સાચી વાત કહેવામાં કેમ નિષ્ફળ જાય છે, અને હજારો raw rows તાક્યા વગર આપણે એક dataset નો સાચો સાર કેવી રીતે પકડીએ?
Theory
Classroom ની ઊંચાઈનું સંતુલન સામે વિખરાયેલો છંટકાવ
Descriptive statistics ને તમારા BCA section નો એક group photograph લેવા જેવું વિચારો. Mean એટલે એક ભૌતિક ત્રાજવાનું બિલકુલ કેન્દ્રબિંદુ શોધવું જ્યાં બધા સરખી રીતે ઊભા રહી શકે. Median એટલે class ને સૌથી ઠીંગણાથી સૌથી ઊંચા સુધી ગોઠવવો અને કતારની બિલકુલ વચ્ચે ઊભેલા એક જ student ને ટકોરો મારવો. પણ તમારા સહપાઠીઓ બધા લગભગ સરખી ઊંચાઈના છે કે basketball ખેલાડીઓ અને ઠીંગણા students નું અસ્તવ્યસ્ત મિશ્રણ છે એ જોવા, તમને Standard Deviation જોઈએ, જે માપે છે કે વ્યક્તિઓ એ કેન્દ્રીય સંતુલન રેખાથી કેટલી દૂર છંટાયેલી કે વિખરાયેલી છે.
Theory
Descriptive Statistics ઔપચારિક રીતે
Descriptive statistics data analytics ને બે મુખ્ય શ્રેણીઓમાં વહેંચે છે: Central Tendency (data ક્યાં ભેગો થાય છે) અને Dispersion (data કેટલો ફેલાયેલો છે). Mean અંકગણિતીય સરેરાશ દર્શાવે છે. Median એક ક્રમમાં ગોઠવેલા dataset ને બે સરખા ભાગમાં વહેંચે છે, આત્યંતિક outliers સામે એક મજબૂત માપ તરીકે કામ કરતાં. Mode સૌથી વારંવાર આવતું data point દર્શાવે છે. Dispersion માપવા, Variance mean થી સરેરાશ વર્ગ કરેલો તફાવત ગણે છે, અને Standard Deviation (SD) variance નું વર્ગમૂળ લઈને ફેલાવાના માપને data ના મૂળ scale unit પર પાછું લાવે છે.
At a glance
Table 1: આવશ્યક Python statistical tools અને mathematical લક્ષણો.
| Statistical Metric | Python Syntax Template | વર્તનની લાક્ષણિકતા |
|---|---|---|
| Arithmetic Mean | np.mean(dataset) | આત્યંતિક outliers કે typo entries પ્રત્યે ખૂબ સંવેદનશીલ. |
| Middle Median | np.median(dataset) | ભૌતિક ક્રમ પર પકડ જમાવે છે; વિકૃત કરતા spikes થી અસ્પૃશ્ય. |
| Peak Mode | stats.mode(dataset) | લોકપ્રિયતા track કરે છે; categorical parameters માટે આદર્શ. |
| Squared Variance | np.var(dataset) | વર્ગ કરેલો ફેલાવો માપે છે; બહારની વધઘટને ખૂબ મોટી કરે છે. |
| Standard Deviation | np.std(dataset) | પ્રમાણભૂત અંતરના ફેલાવા માટેનું નિર્ણાયક માપદંડ. |
Theory
Worked Example: PocketMoney ના Variance નું Auditing
ચાલો NumPy અને SciPy stats module વાપરીને student expenses ની એક સંરચિત array માટે descriptive metrics ગણીએ. આપણે ધ્યાનથી જોઈશું કે એક જ મોટો outlier mean ને median સામે કેવી અસર કરે છે, અને ફેલાવાનું બિલકુલ ચોક્કસ માપ નક્કી કરીશું.
Practical
PocketMoney Spread Auditor
import numpy as np
from scipy import stats
# Step 1: Expense logs with a major outlier spike (e.g., a 400 Rs book purchase)
spends = np.array([40, 50, 40, 60, 400, 50, 60])
# Step 2: Calculate central tendencies
mean_val = np.mean(spends)
median_val = np.median(spends)
mode_res = stats.mode(spends, keepdims=True)
# Step 3: Compute dispersion metrics
variance_val = np.var(spends)
std_dev_val = np.std(spends)
print(f"Mean Spend: {mean_val:.2f}")
print(f"Median Spend: {median_val:.2f}")
print(f"Mode (Most Frequent): {mode_res.mode[0]} (Count: {mode_res.count[0]})")
print(f"Variance Score: {variance_val:.2f}")
print(f"Standard Deviation Spread: {std_dev_val:.2f}")This example runs in Gri-Learn on the web, where you can edit it and see the output.
Think first
Outlier ની સંવેદનશીલતાનું વિશ્લેષણ કરો
spends dataset જુઓ: પાંચ items 60 Rs થી નીચે છે, પણ એક item કૂદીને 400 Rs પર જાય છે. આ એક જ spike તમારા terminal output ની અંદર mean અને median વચ્ચેનું સંતુલન કેવી રીતે બદલશે?
Show the answer
script output કરશે:
Mean Spend: 100.00
Median Spend: 50.00
Mode (Most Frequent): 40 (Count: 2)
Variance Score: 15057.14
Standard Deviation Spread: 122.71
કેમ? mean 100 Rs સુધી ઉપર ખેંચાય છે કારણ કે એ કુલ સરવાળાને 7 થી ભાગીને હિસાબ રાખે છે. પણ, median array ને [40, 40, 50, 50, 60, 60, 400] માં ગોઠવે છે અને 50 પસંદ કરે છે, એક લાક્ષણિક દિવસના ખર્ચની ઘણી વધુ સચોટ તસવીર આપતાં. 122.71 નું Standard Deviation એ 400 Rs ની ખરીદીથી થયેલી તમારા spending data માં ઊંચા સ્તરની અસ્થિરતા ઉજાગર કરે છે.
Quiz
એક university exam paper ના પ્રશ્નમાં, જો એક વિતરણનું mean 50 હોય અને variance 64 હોય, તો એનું બિલકુલ Standard Deviation માપ શું છે?
- 4096
- 8
- 32
- 6.4
Show the answer
8
Standard Deviation ને ગાણિતિક રીતે Variance ના ધન વર્ગમૂળ તરીકે વ્યાખ્યાયિત કરાય છે. 64 નું વર્ગમૂળ 8 છે. Mean કેન્દ્રનું માપ છે, તેથી એ આ રૂપાંતરની ગણતરીને અસર કરતું નથી.
Quiz
સરેરાશ consumer metrics કે salary distributions નું વિશ્લેષણ કરતી વખતે corporate database analytics systems Mean કરતાં Median પર કેમ ખૂબ આધાર રાખે છે?
- median ને Python loops માં ચલાવવા ઘણી ઓછી computing memory જોઈએ છે.
- mean આત્યંતિક ઊંચી value વાળા outliers થી ખૂબ પ્રમાણ બહાર ખેંચાઈ જાય છે, જ્યારે median સ્થિર રહે છે.
- mean એવી arrays process કરી શકતું નથી જેમાં floating decimal values હોય.
- median વિતરણમાંની બેવડી entries સંપૂર્ણપણે અવગણે છે.
Show the answer
mean આત્યંતિક ઊંચી value વાળા outliers થી ખૂબ પ્રમાણ બહાર ખેંચાઈ જાય છે, જ્યારે median સ્થિર રહે છે.
કારણ કે mean દરેક element ની બિલકુલ value ને હિસાબમાં લે છે, થોડા કરોડપતિ પગારો કે વિશાળ purchase outliers એને કૃત્રિમ રીતે ફુલાવી શકે છે. Median માત્ર ક્રમની જગ્યા પર આધાર રાખે છે, જે એને વિકૃત datasets માટે વધુ ભરોસાપાત્ર માપ બનાવે છે.
Watch out
Classic ફાંદો: Default Population Variance ની ચૂક
university lab exams માં એક વારંવારની ભૂલ એ ધારવું છે કે np.std() sample datasets માટેનાં પ્રમાણભૂત textbook સૂત્રો જેવું જ વર્તે છે. Default રીતે, NumPy population standard deviation ગણે છે (છેદમાં $N$, અથવા ddof=0). જો તમારું પ્રશ્નપત્ર સ્પષ્ટપણે sample standard deviation ($N-1$ degrees of freedom) માંગે, તો તમારે optional parameter np.std(dataset, ddof=1) આપવો પડશે, નહીંતર તમારી અંતિમ દશાંશ value marks ગુમાવશે!
Theory
Statistics ને Semester 3 સાથે જોડવા
Descriptive statistics predictive intelligence ની કરોડરજ્જુ બનાવે છે. Semester 3 Data Science (BCA302) માં, જ્યારે regression pipelines કે normalization engines બનાવશો, ત્યારે તમે inputs સાફ કરવા અને scale કરવા mean અને standard deviation matrices વાપરશો, તમારા machine learning models ને વૈવિધ્યસભર data ન્યાયી રીતે process કરવામાં મદદ કરતાં.
Summary
Key takeaways
- Mean અંકગણિતીય સંતુલન બિંદુ તરીકે કામ કરે છે પણ outliers સામે ખૂબ નબળું છે.
- Median ગોઠવેલા data નું સાચું કેન્દ્ર ઓળખે છે, આત્યંતિક value spikes સામે પ્રતિકાર આપતાં.
- Mode એક dataset ની અંદરના સૌથી વધુ વારંવારના પુનરાવર્તિત parameters અલગ પાડે છે.
- Variance વર્ગ કરેલા વિચલનો આંકે છે, તમારા records ની અંતર્ગત પરિવર્તનશીલતા track કરતાં.
- Standard Deviation સ્પષ્ટ અર્થઘટન માટે variance ના માપને મૂળ unit scale પર પાછું લાવે છે.
- Memory Hook: Mean બધા cells સરવાળે છે, Median ક્રમની જગ્યા track કરે છે, SD વિચલનની ત્રિજ્યા વ્યાખ્યાયિત કરે છે!