Commands for measures of central tendency and dispersion

એક સંદર્ભનું કાર્ડ R ની આખી વર્ણનાત્મક સપાટી ધરાવે છે: કેન્દ્ર માટે mean/median અને ભેગો કરેલો બહુલક, ફેલાવા માટે range/IQR/var/sd, વિહંગાવલોકન માટે quantile અને summary, દરેકમાં na.rm સભાનપણે નક્કી કરાયેલું.

9 min read · 10 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

ચક્ર પૂરું કરવા એક કાર્ડ

એકમ 1 એ માપ હાથે શીખવ્યાં. ત્યાર પછીના છૂટાછવાયા પાઠે એમની commands શીખવી. જે પરીક્ષાનો પ્રશ્ન બાકી છે એ એકઠું કરવાનો છે: "આપેલા dataset માટે કેન્દ્રીય પ્રવૃત્તિ અને વિકિરણનાં માપ માટે R ની commands લખો."

આ પાઠ એ જ જવાબ છે, એક વાર ભેગો કરેલો: દરેક માપ, એની command, એનો ફાંદો: એ સંદર્ભનું કાર્ડ જેમાંથી તમે પુનરાવર્તન કરો છો. અહીં કશું નવું નથી; અહીંનું બધું હવે એક કાર્ડ છે.

Theory

પરીક્ષકની ખરીદીની યાદી

પૂરા marks વાળા વર્ણનાત્મક જવાબ માટે પરીક્ષકની checklist કલ્પો:

  • કેન્દ્ર ક્યાં છે? (સરેરાશ, મધ્યસ્થ, બહુલક: નિર્ણય સાથે પસંદ કરો)
  • ફેલાવો કેટલો પહોળો છે? (વ્યાપ, IQR, sd: ત્રણ પહોળાઈ, ત્રણ અર્થ)
  • તમે કાણાં સંભાળ્યાં? (na.rm નો નિર્ણય, જણાવેલો)
  • નમૂનો કે વસ્તી? (તમારો ભાજક નામ આપો)

યાદીમાં ચાર લીટી: નીચેનું કાર્ડ ચારેય ખરીદી આપે છે.

At a glance

સંદર્ભનું કાર્ડ

માપCommandધ્યાન રાખો
સરેરાશmean(x, na.rm = TRUE)Outlier થી ખેંચાય છે
મધ્યસ્થmedian(x, na.rm = TRUE)મજબૂત કેન્દ્ર
બહુલકnames(which.max(table(x)))કોઈ જડેલું નહીં; mode() એક મજાક છે
વ્યાપrange(x) પછી diff(range(x))range() લઘુતમ અને મહત્તમ આપે છે
IQRIQR(x, na.rm = TRUE)Q3 - Q1, ખાનાની પહોળાઈ
વિચરણ / SDvar(x), sd(x)નમૂનાનો ભાજક (n-1)
વિહંગાવલોકનsummary(x), quantile(x)fivenum(x) = પાંચ સંખ્યાનો સારાંશ

Practical

પૂરો વર્ણનાત્મક અહેવાલ, બાર લીટી

survey <- read.csv("survey_clean.csv")
x <- survey$screen

# centre
mean(x, na.rm = TRUE)          # 171.4
median(x, na.rm = TRUE)        # 135
get_mode <- function(v) names(which.max(table(v)))
get_mode(x)                    # "90"    (your first user function!)

# spread
diff(range(x, na.rm = TRUE))   # max - min, ONE number
IQR(x, na.rm = TRUE)           # the box plot's box width
sd(x, na.rm = TRUE)            # sample SD (divides by n-1)
var(x, na.rm = TRUE)           # sd squared

# overview + per-group spread
summary(x)
tapply(survey$screen, survey$stay, sd, na.rm = TRUE)
#   day  hostel     <- who is more CONSISTENT?
#  38.2    71.5

Theory

Commands સહેલી છે; વાક્ય એ કૌશલ્ય છે

અહેવાલનો ટુકડો સંખ્યાઓ છાપે છે; marks એમને મોટેથી વાંચવા માંથી આવે છે:

  • સરેરાશ 171 સામે મધ્યસ્થ 135: સરેરાશ ઘણી ઉપર બેસે છે: જમણી વિષમતા, સામાન્ય તરીકે મધ્યસ્થ જણાવો.
  • છાત્રાલયનું sd 71.5 સામે દિવસનું 38.2: છાત્રાલયવાસી બમણા વિખરાયેલા છે: એક જ સરેરાશ એમને ખોટી રીતે રજૂ કરે.
  • બહુલક "90": એક જ સૌથી સામાન્ય ટેવ.

દરેક સંખ્યાને એક અર્થઘટનનું વાક્ય મળે: એ ટેવ ગણતરીના જવાબને આંકડાશાસ્ત્રના જવાબમાં ફેરવે છે.

Quiz

એક student ને "વ્યાપ" એક સંખ્યા તરીકે જોઈએ છે અને range(x) લખે છે, જેમાં [1] 30 600 મળે છે. શું થયું, અને એક સંખ્યા શું આપે છે?

  1. range() લઘુતમ **અને** મહત્તમની જોડી આપે છે; ફેલાવાની એક સંખ્યા diff(range(x)) છે, અહીં 570
  2. NA મૂલ્યોને કારણે data ને બે વ્યાપ છે
  3. 100 થી લાંબા vectors માટે range() તૂટેલું છે
  4. IQR(x) વાપરો: IQR અને વ્યાપ એક જ માપ છે
Show the answer

range() લઘુતમ **અને** મહત્તમની જોડી આપે છે; ફેલાવાની એક સંખ્યા diff(range(x)) છે, અહીં 570

R નું range() તમને બે છેડા આપે છે (30 અને 600); પાઠ્યપુસ્તકનું "વ્યાપ = મહત્તમ - લઘુતમ" માટે diff(range(x)) કે max(x) - min(x) જોઈએ: 570. વિકલ્પ D એ બીજી ગૂંચવણ ઘુસાડે છે જેની આ કાર્ડ રક્ષા કરે છે: IQR એ Q3 - Q1 છે (વચલા 50% ની પહોળાઈ, outlier સામે અડગ), જે outlier સામે નાજુક પૂરા વ્યાપ કરતાં જુદું અને સામાન્ય રીતે વધુ સારું ફેલાવાનું માપ છે. બે નામ, બે માપ, એક જાણીતી ભેળસેળ.

Think first

પરીક્ષાનો જવાબ તૈયારી વગર લખો

પરીક્ષાનું કામ: "vector m માં સંઘરાયેલા marks (જેમાં NA હોઈ શકે) માટે, સરેરાશ, મધ્યસ્થ, બહુલક, પ્રમાણિત વિચલન અને IQR માટે R ની commands લખો, અને એક સાવચેતી જણાવો." Tap કરતાં પહેલાં પાંચેય લીટી અને સાવચેતી લખો.

Show the answer

mean(m, na.rm = TRUE)

median(m, na.rm = TRUE)

names(which.max(table(m))) # R has no built-in statistical mode

sd(m, na.rm = TRUE) # sample SD, divisor n-1

IQR(m, na.rm = TRUE)

સાવચેતી: દરેક call પર na.rm = TRUE (નહીં તો એક NA એ NA આપે છે), અને બહુલકના ઉપાયની નોંધ કારણ કે mode() storage નો પ્રકાર આપે છે. એ જવાબ, શબ્દશઃ, પૂરા marks છે: આ કાર્ડ એટલા માટે છે કે તમે એ અડધી ઊંઘમાં પણ લખી શકો.

Watch out

પ્રકાર ઓજારપેટી નક્કી કરે છે

આ commands numeric variables ને સેવે છે. mean() ને factor આપો અને R ચેતવણી સાથે NA આપે છે: સાચી રીતે, કારણ કે એકમ 1 નો નિયમ હજી રાજ કરે છે: શ્રેણીગત data ને table()/prop.table() મળે છે (ગયો પાઠ), આંકડાકીય data ને આ કાર્ડ. Variable ના પ્રકારનો પ્રશ્ન જે તમે સૌથી પહેલાં શીખ્યા એ ત્યાર પછી શીખેલી દરેક command નો માર્ગદર્શક છે.

Theory

તમે હમણાં જ તમારું પહેલું function લખ્યું

get_mode એ તમારી પાસે પહેલેથી હતા એ logic ની આસપાસ syntax ના ત્રણ ટુકડા છે: function(v) એક રીતને વીંટાળે છે, અને get_mode(x) બોલાવવાથી એ ફરી ચાલે છે: R માં ખરેખરા programming નો દરવાજો. બે પાઠ બાકી છે: normal distribution ની R ની commands (pnorm અને કુટુંબ), પછી આલેખનું સમાપન જ્યાં આજના કાર્ડની દરેક સંખ્યા ચિત્ર બને છે.

Summary

Key takeaways

  • કેન્દ્ર: mean, median (na.rm = TRUE), બહુલક names(which.max(table(x))) દ્વારા.
  • ફેલાવો: પૂરી પહોળાઈ માટે diff(range(x)), મજબૂત વચલા-50% ની પહોળાઈ માટે IQR(x), sd/var (નમૂનાનો ભાજક).
  • વિહંગાવલોકન: summary(x), quantile(x), fivenum(x).
  • range() લઘુતમ-મહત્તમની જોડી આપે છે, એક સંખ્યા નહીં.
  • દરેક સંખ્યાનું એક વાક્યમાં અર્થઘટન કરો: વિષમતા (સરેરાશ સામે મધ્યસ્થ), સાતત્ય (sd), સામાન્ય (બહુલક).
  • Numeric variables આ કાર્ડ વાપરે છે; શ્રેણીગત table() વાપરે છે: પ્રકાર ઓજારપેટીનો માર્ગ નક્કી કરે છે.
  • Memory hook: પરીક્ષકની ચાર લીટીની ખરીદીની યાદી.

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Working with Data in R

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati