Text to columns, Remove Duplicates

Text to Columns एक भरे-भरे column को एक delimiter (जैसे comma या space) से कई columns में बाँटता है, और Remove Duplicates दोहराई गई rows delete करता है, दो cleanup tools जो गंदे imported data को एक साफ़-सुथरी table में बदल देते हैं।

9 min read · 9 cards · 2 checks

Read in: English · हिन्दी · ગુજરાતી


Theory

एक column, दो तथ्य ठूँसे हुए

Meera एक customer list import करती है जो एक supplier ने उसे email की। column A में हर cell Riya Shah, 9876543210 जैसा पढ़ा जाता है, नाम और phone एक box में चिपके हुए। और कई customers दो या तीन बार आते हैं।

वह नाम से sort नहीं कर सकती या कोई number नहीं मिला सकती जब वे चिपके और दोहराए हुए हैं। असल-दुनिया का data लगभग हमेशा ऐसा गंदा होता है।

दो cleanup tools इसे ठीक करते हैं: एक ठूँसे column को बाँटता है, दूसरा दोहराव हटाता है। यह data साफ़ करने का बेरंग पर ज़रूरी हुनर है।

Theory

एक मिले-जुले drawer को छाँटना

एक drawer की कल्पना कीजिए जहाँ हर item एक pen और एक note का rubber-band वाला bundle है जो चिपके हुए हैं, और कुछ bundles बिलकुल duplicate हैं। कुछ भी इस्तेमाल करने को, आप पहले bands तोड़कर pens को notes से अलग करते हैं (Text to Columns), फिर एक जैसे दोहराए bundles फेंक देते हैं (Remove Duplicates)। तभी drawer इस्तेमाल लायक होता है। गंदे data को असली काम शुरू होने से पहले हमेशा यह तोड़ो-और-dedupe वाला pass चाहिए।

Follow along

'name, phone' को दो columns में बाँटिए

  1. पक्का कीजिए कि दाईं तरफ के columns खाली हैं बँटवारा उनमें फैलता है; अगर उनमें data हो तो वह overwrite हो जाता है।
  2. ठूँसा column select कीजिए, Data > Text to Columns wizard खुलता है।
  3. Delimited चुनिए, फिर delimiter (comma) चुनिए preview हर comma पर बँटवारा दिखाता है; space और tab दूसरे options हैं।
  4. Finish नाम एक column में आता है, phone अगले में। अब sortable और इस्तेमाल लायक।

Theory

Remove Duplicates

Data > Remove Duplicates उन rows को delete करता है जो बिलकुल दोहराव हैं। आप चुनते हैं कौन से columns एक duplicate को परिभाषित करते हैं:

  • सिर्फ 'Phone' tick कीजिए और एक ही number वाली दो rows एक ही customer मानी जाती हैं, भले ही नाम अलग तरह से लिखा हो।
  • 'Name' और 'Phone' दोनों tick कीजिए और एक row को duplicate गिने जाने के लिए दोनों पर match करना होगा।

Excel पहली घटना रखता है और बाकी हटा देता है। सही परिभाषित करने वाले columns चुनना ही पूरा हुनर है, बहुत कम चुनिए और आप असली अलग rows delete कर देते हैं।

Quiz

Meera column A पर Text to Columns चलाती है, पर column B में पहले से उसके stock notes थे। उन notes का क्या होता है?

  1. वे column A से फैलते split data द्वारा overwrite हो जाते हैं
  2. Excel उन्हें बचाने को अपने-आप दाईं तरफ खिसका देता है
  3. कुछ नहीं, notes सुरक्षित रहते हैं
  4. बँटवारा एक error के साथ नाकाम होता है
Show the answer

वे column A से फैलते split data द्वारा overwrite हो जाते हैं

Text to Columns बँटे टुकड़ों को दाईं तरफ के columns में फैलाता है, जो भी वहाँ हो उसे overwrite करते हुए। Meera को पहले खाली columns डालने चाहिए, या column B के notes को हटाना चाहिए। यह 'दाईं तरफ जगह साफ़ करो' वाली ज़रूरत क्लासिक Text to Columns gotcha है, और आकस्मिक data loss का एक असली कारण।

Think first

कौन से columns एक duplicate परिभाषित करते हैं?

Meera के पास customers हैं जहाँ एक ही व्यक्ति अपने नाम की दो spellings के साथ पर एक ही phone number के साथ आता है। अगर वह उन्हें एक customer मानना चाहती है, तो Remove Duplicates में कौन से column(s) tick करने चाहिए, और name और phone दोनों क्यों नहीं?

Show the answer

सिर्फ Phone tick कीजिए। अगर वह Name और Phone दोनों tick करे, तो दो अलग-spelt rows match नहीं होंगी (नाम अलग हैं), तो दोनों बच जाती हैं, ठीक उल्टा जो वह चाहती है। अकेला Phone tick करना किसी भी दोहराए number को एक ही customer मानता है, गलत-spelt duplicates पकड़ते हुए। सबक: आप जो columns tick करते हैं वे परिभाषित करते हैं 'duplicate' का क्या मतलब है, उन्हें असली पहचान के लिए चुनिए।

Watch out

Marks कहाँ कटते हैं

यह भूलना कि Text to Columns को दाईं तरफ खाली जगह चाहिए (यह overwrite करता है)। यह न समझना कि Remove Duplicates स्थायी रूप से delete करता है (सिर्फ पहली रखता है), पक्का न हो तो एक copy पर कीजिए। और यह गलत समझना कि चुने columns एक duplicate परिभाषित करते हैं, बहुत ज़्यादा tick कीजिए और असली duplicates बच जाते हैं, बहुत कम और अलग rows गायब हो जाती हैं। Exams इसे 'क्या तय करता है कि दो rows duplicate हैं?' के रूप में पूछते हैं (जवाब: चुने गए columns)।

Theory

इसीलिए databases मौजूद हैं

ध्यान दीजिए यह गड़बड़ी क्यों हुई: एक column में दो तथ्य थे (name और phone), और एक ही customer कई बार store हुआ। Unit 3 का normalization ठीक वह विज्ञान है जो data को ऐसे design करता है कि यह कभी न हो, एक column में एक तथ्य, हर customer एक बार store। गंदी spreadsheets साफ़ करना वह दर्द है जिसे रोकने के लिए databases बनाए गए। अगला lesson Unit 2 को बंद करता है: कई sheets को एक summary में consolidate करना।

Summary

Key takeaways

  • Text to Columns एक column को एक delimiter (comma, space, tab) या fixed width से कई में बाँटता है।
  • यह दाईं तरफ के columns overwrite करता है, इसलिए पहले जगह साफ़ कीजिए।
  • Remove Duplicates दोहराई rows delete करता है, पहली घटना रखते हुए।
  • आप जो columns select करते हैं वे परिभाषित करते हैं कि duplicate क्या गिना जाए, उन्हें असली पहचान के लिए चुनिए।
  • दोनों tools असली analysis से पहले गंदे imported data को साफ़ करते हैं।
  • याद रखने का hook: bundles को तोड़कर अलग कीजिए (split), दोहराव फेंक दीजिए (dedupe)।

Study this properly

This page is the lesson to read. In Gri-Learn the same topic is a graded deck: the self-checks are scored and your weak topics are tracked. Free to start.

Start this topic

Already have an account? Sign in

More from Formulas, Chart and Data

Gri-Learn · syllabus-mapped B.C.A. lessons in English, Hindi and Gujarati