Theory
એક column, બે તથ્ય ઠાંસેલા
Meera એક customer list import કરે છે જે એક supplier એ એને email કરી. column A માં દરેક cell Riya Shah, 9876543210 જેવો વંચાય છે, નામ અને phone એક box માં ચોંટેલા. અને ઘણા customers બે કે ત્રણ વાર આવે છે.
એ નામ થી sort કરી શકતી નથી કે કોઈ number ડાયલ કરી શકતી નથી જ્યારે એ ચોંટેલા અને દોહરાયેલા છે. વાસ્તવિક-દુનિયાનો data લગભગ હંમેશા આવો ગંદો હોય છે.
બે cleanup tools એને ઠીક કરે છે: એક ઠાંસેલા column ને વહેંચે છે, બીજો દોહરાવ કાઢે છે. આ data સાફ કરવાની બેરંગ પણ જરૂરી કળા છે.
Theory
એક ભેળસેળ drawer ને છાંટવો
એક drawer ની કલ્પના કરો જ્યાં દરેક item એક pen અને એક note નું rubber-band વાળું bundle છે જે ચોંટેલા છે, અને કેટલાક bundles બિલકુલ duplicate છે. કંઈ પણ વાપરવા, તમે પહેલા bands તોડીને pens ને notes થી અલગ કરો છો (Text to Columns), પછી એકસરખા દોહરાયેલા bundles ફેંકી દો છો (Remove Duplicates). ત્યારે જ drawer વાપરવા લાયક બને છે. ગંદા data ને સાચું કામ શરૂ થાય એ પહેલા હંમેશા આ તોડો-અને-dedupe વાળો pass જોઈએ.
Follow along
'name, phone' ને બે columns માં વહેંચો
- પાક્કું કરો કે જમણી બાજુના columns ખાલી છે વહેંચણી એમાં ફેલાય છે; જો એમાં data હોય તો એ overwrite થઈ જાય છે.
- ઠાંસેલો column select કરો, Data > Text to Columns wizard ખૂલે છે.
- Delimited પસંદ કરો, પછી delimiter (comma) પસંદ કરો preview દરેક comma પર વહેંચણી બતાવે છે; space અને tab બીજા options છે.
- Finish નામ એક column માં આવે છે, phone આગળના માં. હવે sortable અને વાપરવા લાયક.
Theory
Remove Duplicates
Data > Remove Duplicates એ rows ને delete કરે છે જે બિલકુલ દોહરાવ છે. તમે પસંદ કરો છો કયા columns એક duplicate ને વ્યાખ્યાયિત કરે છે:
- ફક્ત 'Phone' tick કરો અને એક જ number વાળી બે rows એક જ customer મનાય છે, ભલે નામ અલગ રીતે લખેલું હોય.
- 'Name' અને 'Phone' બંને tick કરો અને એક row ને duplicate ગણાવા બંને પર match કરવું પડે.
Excel પહેલી ઘટના રાખે છે અને બાકી કાઢી નાખે છે. સાચા વ્યાખ્યાયિત કરતા columns પસંદ કરવા એ જ આખી કળા છે, બહુ ઓછા પસંદ કરો અને તમે સાચી અલગ rows delete કરી નાખો છો.
Quiz
Meera column A પર Text to Columns ચલાવે છે, પણ column B માં પહેલેથી એના stock notes હતા. એ notes નું શું થાય છે?
- એ column A થી ફેલાતા split data દ્વારા overwrite થઈ જાય છે
- Excel એમને બચાવવા આપોઆપ જમણી બાજુ ખસેડી દે છે
- કંઈ નહીં, notes સલામત રહે છે
- વહેંચણી એક error સાથે નિષ્ફળ જાય છે
Show the answer
એ column A થી ફેલાતા split data દ્વારા overwrite થઈ જાય છે
Text to Columns વહેંચેલા ટુકડાઓ ને જમણી બાજુના columns માં ફેલાવે છે, જે પણ ત્યાં હોય એને overwrite કરતાં. Meera એ પહેલા ખાલી columns મૂકવા જોઈએ, કે column B ના notes ને ખસેડવા જોઈએ. આ 'જમણી બાજુ જગ્યા સાફ કરો' વાળી જરૂરિયાત ક્લાસિક Text to Columns gotcha છે, અને આકસ્મિક data loss નું એક સાચું કારણ.
Think first
કયા columns એક duplicate વ્યાખ્યાયિત કરે છે?
Meera પાસે customers છે જ્યાં એક જ વ્યક્તિ પોતાના નામની બે spellings સાથે પણ એક જ phone number સાથે આવે છે. જો એ એમને એક customer માનવા માંગે, તો Remove Duplicates માં કયા column(s) tick કરવા જોઈએ, અને name અને phone બંને કેમ નહીં?
Show the answer
ફક્ત Phone tick કરો. જો એ Name અને Phone બંને tick કરે, તો બે અલગ-spelt rows match નહીં થાય (નામ અલગ છે), તો બંને બચી જાય, બરાબર ઉલટું જે એ ઇચ્છે છે. એકલો Phone tick કરવો કોઈ પણ દોહરાયેલા number ને એક જ customer માને છે, ખોટા-spelt duplicates પકડતાં. બોધ: તમે જે columns tick કરો છો એ વ્યાખ્યાયિત કરે છે 'duplicate' નો શું અર્થ છે, એમને સાચી ઓળખ માટે પસંદ કરો.
Watch out
Marks ક્યાં કપાય છે
એ ભૂલવું કે Text to Columns ને જમણી બાજુ ખાલી જગ્યા જોઈએ (એ overwrite કરે છે). એ ન સમજવું કે Remove Duplicates કાયમ માટે delete કરે છે (ફક્ત પહેલી રાખે છે), પાક્કું ન હોય તો એક copy પર કરો. અને એ ખોટું સમજવું કે પસંદ કરેલા columns એક duplicate વ્યાખ્યાયિત કરે છે, બહુ વધારે tick કરો અને સાચા duplicates બચી જાય, બહુ ઓછા અને અલગ rows ગાયબ થઈ જાય. Exams એને 'શું નક્કી કરે છે કે બે rows duplicate છે?' તરીકે પૂછે છે (જવાબ: પસંદ કરેલા columns).
Theory
એટલે જ databases મોજૂદ છે
ધ્યાન આપો આ ગડબડ કેમ થઈ: એક column માં બે તથ્ય હતા (name અને phone), અને એક જ customer ઘણી વાર store થયો. Unit 3 નું normalization બરાબર એ વિજ્ઞાન છે જે data ને એવી રીતે design કરે છે કે આ ક્યારેય ન થાય, એક column માં એક તથ્ય, દરેક customer એક વાર store. ગંદી spreadsheets સાફ કરવી એ પીડા છે જેને રોકવા માટે databases બન્યા. આગળનો lesson Unit 2 ને બંધ કરે છે: ઘણી sheets ને એક summary માં consolidate કરવી.
Summary
Key takeaways
- Text to Columns એક column ને એક delimiter (comma, space, tab) કે fixed width થી ઘણા માં વહેંચે છે.
- એ જમણી બાજુના columns overwrite કરે છે, એટલે પહેલા જગ્યા સાફ કરો.
- Remove Duplicates દોહરાયેલી rows delete કરે છે, પહેલી ઘટના રાખતાં.
- તમે જે columns select કરો છો એ વ્યાખ્યાયિત કરે છે કે duplicate શું ગણાય, એમને સાચી ઓળખ માટે પસંદ કરો.
- બંને tools સાચા analysis પહેલા ગંદા imported data ને સાફ કરે છે.
- યાદ રાખવાની યુક્તિ: bundles ને તોડીને અલગ કરો (split), દોહરાવ ફેંકી દો (dedupe).