Text to columns, Remove Duplicates

Text to Columns એક ભરેલા column ને એક delimiter (જેમ કે comma કે space) થી ઘણા columns માં વહેંચે છે, અને Remove Duplicates દોહરાયેલી rows delete કરે છે, બે cleanup tools જે ગંદા imported data ને એક સાફ-સુથરી table માં બદલી નાખે છે.

9 min read · 9 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

એક column, બે તથ્ય ઠાંસેલા

Meera એક customer list import કરે છે જે એક supplier એ એને email કરી. column A માં દરેક cell Riya Shah, 9876543210 જેવો વંચાય છે, નામ અને phone એક box માં ચોંટેલા. અને ઘણા customers બે કે ત્રણ વાર આવે છે.

એ નામ થી sort કરી શકતી નથી કે કોઈ number ડાયલ કરી શકતી નથી જ્યારે એ ચોંટેલા અને દોહરાયેલા છે. વાસ્તવિક-દુનિયાનો data લગભગ હંમેશા આવો ગંદો હોય છે.

બે cleanup tools એને ઠીક કરે છે: એક ઠાંસેલા column ને વહેંચે છે, બીજો દોહરાવ કાઢે છે. આ data સાફ કરવાની બેરંગ પણ જરૂરી કળા છે.

Theory

એક ભેળસેળ drawer ને છાંટવો

એક drawer ની કલ્પના કરો જ્યાં દરેક item એક pen અને એક note નું rubber-band વાળું bundle છે જે ચોંટેલા છે, અને કેટલાક bundles બિલકુલ duplicate છે. કંઈ પણ વાપરવા, તમે પહેલા bands તોડીને pens ને notes થી અલગ કરો છો (Text to Columns), પછી એકસરખા દોહરાયેલા bundles ફેંકી દો છો (Remove Duplicates). ત્યારે જ drawer વાપરવા લાયક બને છે. ગંદા data ને સાચું કામ શરૂ થાય એ પહેલા હંમેશા આ તોડો-અને-dedupe વાળો pass જોઈએ.

Follow along

'name, phone' ને બે columns માં વહેંચો

  1. પાક્કું કરો કે જમણી બાજુના columns ખાલી છે વહેંચણી એમાં ફેલાય છે; જો એમાં data હોય તો એ overwrite થઈ જાય છે.
  2. ઠાંસેલો column select કરો, Data > Text to Columns wizard ખૂલે છે.
  3. Delimited પસંદ કરો, પછી delimiter (comma) પસંદ કરો preview દરેક comma પર વહેંચણી બતાવે છે; space અને tab બીજા options છે.
  4. Finish નામ એક column માં આવે છે, phone આગળના માં. હવે sortable અને વાપરવા લાયક.

Theory

Remove Duplicates

Data > Remove Duplicates એ rows ને delete કરે છે જે બિલકુલ દોહરાવ છે. તમે પસંદ કરો છો કયા columns એક duplicate ને વ્યાખ્યાયિત કરે છે:

  • ફક્ત 'Phone' tick કરો અને એક જ number વાળી બે rows એક જ customer મનાય છે, ભલે નામ અલગ રીતે લખેલું હોય.
  • 'Name' અને 'Phone' બંને tick કરો અને એક row ને duplicate ગણાવા બંને પર match કરવું પડે.

Excel પહેલી ઘટના રાખે છે અને બાકી કાઢી નાખે છે. સાચા વ્યાખ્યાયિત કરતા columns પસંદ કરવા એ જ આખી કળા છે, બહુ ઓછા પસંદ કરો અને તમે સાચી અલગ rows delete કરી નાખો છો.

Quiz

Meera column A પર Text to Columns ચલાવે છે, પણ column B માં પહેલેથી એના stock notes હતા. એ notes નું શું થાય છે?

  1. એ column A થી ફેલાતા split data દ્વારા overwrite થઈ જાય છે
  2. Excel એમને બચાવવા આપોઆપ જમણી બાજુ ખસેડી દે છે
  3. કંઈ નહીં, notes સલામત રહે છે
  4. વહેંચણી એક error સાથે નિષ્ફળ જાય છે
Show the answer

એ column A થી ફેલાતા split data દ્વારા overwrite થઈ જાય છે

Text to Columns વહેંચેલા ટુકડાઓ ને જમણી બાજુના columns માં ફેલાવે છે, જે પણ ત્યાં હોય એને overwrite કરતાં. Meera એ પહેલા ખાલી columns મૂકવા જોઈએ, કે column B ના notes ને ખસેડવા જોઈએ. આ 'જમણી બાજુ જગ્યા સાફ કરો' વાળી જરૂરિયાત ક્લાસિક Text to Columns gotcha છે, અને આકસ્મિક data loss નું એક સાચું કારણ.

Think first

કયા columns એક duplicate વ્યાખ્યાયિત કરે છે?

Meera પાસે customers છે જ્યાં એક જ વ્યક્તિ પોતાના નામની બે spellings સાથે પણ એક જ phone number સાથે આવે છે. જો એ એમને એક customer માનવા માંગે, તો Remove Duplicates માં કયા column(s) tick કરવા જોઈએ, અને name અને phone બંને કેમ નહીં?

Show the answer

ફક્ત Phone tick કરો. જો એ Name અને Phone બંને tick કરે, તો બે અલગ-spelt rows match નહીં થાય (નામ અલગ છે), તો બંને બચી જાય, બરાબર ઉલટું જે એ ઇચ્છે છે. એકલો Phone tick કરવો કોઈ પણ દોહરાયેલા number ને એક જ customer માને છે, ખોટા-spelt duplicates પકડતાં. બોધ: તમે જે columns tick કરો છો એ વ્યાખ્યાયિત કરે છે 'duplicate' નો શું અર્થ છે, એમને સાચી ઓળખ માટે પસંદ કરો.

Watch out

Marks ક્યાં કપાય છે

એ ભૂલવું કે Text to Columns ને જમણી બાજુ ખાલી જગ્યા જોઈએ (એ overwrite કરે છે). એ ન સમજવું કે Remove Duplicates કાયમ માટે delete કરે છે (ફક્ત પહેલી રાખે છે), પાક્કું ન હોય તો એક copy પર કરો. અને એ ખોટું સમજવું કે પસંદ કરેલા columns એક duplicate વ્યાખ્યાયિત કરે છે, બહુ વધારે tick કરો અને સાચા duplicates બચી જાય, બહુ ઓછા અને અલગ rows ગાયબ થઈ જાય. Exams એને 'શું નક્કી કરે છે કે બે rows duplicate છે?' તરીકે પૂછે છે (જવાબ: પસંદ કરેલા columns).

Theory

એટલે જ databases મોજૂદ છે

ધ્યાન આપો આ ગડબડ કેમ થઈ: એક column માં બે તથ્ય હતા (name અને phone), અને એક જ customer ઘણી વાર store થયો. Unit 3 નું normalization બરાબર એ વિજ્ઞાન છે જે data ને એવી રીતે design કરે છે કે આ ક્યારેય ન થાય, એક column માં એક તથ્ય, દરેક customer એક વાર store. ગંદી spreadsheets સાફ કરવી એ પીડા છે જેને રોકવા માટે databases બન્યા. આગળનો lesson Unit 2 ને બંધ કરે છે: ઘણી sheets ને એક summary માં consolidate કરવી.

Summary

Key takeaways

  • Text to Columns એક column ને એક delimiter (comma, space, tab) કે fixed width થી ઘણા માં વહેંચે છે.
  • એ જમણી બાજુના columns overwrite કરે છે, એટલે પહેલા જગ્યા સાફ કરો.
  • Remove Duplicates દોહરાયેલી rows delete કરે છે, પહેલી ઘટના રાખતાં.
  • તમે જે columns select કરો છો એ વ્યાખ્યાયિત કરે છે કે duplicate શું ગણાય, એમને સાચી ઓળખ માટે પસંદ કરો.
  • બંને tools સાચા analysis પહેલા ગંદા imported data ને સાફ કરે છે.
  • યાદ રાખવાની યુક્તિ: bundles ને તોડીને અલગ કરો (split), દોહરાવ ફેંકી દો (dedupe).

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Formulas, Chart and Data

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati

Text to columns, Remove Duplicates · Data Processing and Analysis (DPA) · Gri-Learn