Theory
एक column, दो तथ्य ठूँसे हुए
Meera एक customer list import करती है जो एक supplier ने उसे email की। column A में हर cell Riya Shah, 9876543210 जैसा पढ़ा जाता है, नाम और phone एक box में चिपके हुए। और कई customers दो या तीन बार आते हैं।
वह नाम से sort नहीं कर सकती या कोई number नहीं मिला सकती जब वे चिपके और दोहराए हुए हैं। असल-दुनिया का data लगभग हमेशा ऐसा गंदा होता है।
दो cleanup tools इसे ठीक करते हैं: एक ठूँसे column को बाँटता है, दूसरा दोहराव हटाता है। यह data साफ़ करने का बेरंग पर ज़रूरी हुनर है।
Theory
एक मिले-जुले drawer को छाँटना
एक drawer की कल्पना कीजिए जहाँ हर item एक pen और एक note का rubber-band वाला bundle है जो चिपके हुए हैं, और कुछ bundles बिलकुल duplicate हैं। कुछ भी इस्तेमाल करने को, आप पहले bands तोड़कर pens को notes से अलग करते हैं (Text to Columns), फिर एक जैसे दोहराए bundles फेंक देते हैं (Remove Duplicates)। तभी drawer इस्तेमाल लायक होता है। गंदे data को असली काम शुरू होने से पहले हमेशा यह तोड़ो-और-dedupe वाला pass चाहिए।
Follow along
'name, phone' को दो columns में बाँटिए
- पक्का कीजिए कि दाईं तरफ के columns खाली हैं बँटवारा उनमें फैलता है; अगर उनमें data हो तो वह overwrite हो जाता है।
- ठूँसा column select कीजिए, Data > Text to Columns wizard खुलता है।
- Delimited चुनिए, फिर delimiter (comma) चुनिए preview हर comma पर बँटवारा दिखाता है; space और tab दूसरे options हैं।
- Finish नाम एक column में आता है, phone अगले में। अब sortable और इस्तेमाल लायक।
Theory
Remove Duplicates
Data > Remove Duplicates उन rows को delete करता है जो बिलकुल दोहराव हैं। आप चुनते हैं कौन से columns एक duplicate को परिभाषित करते हैं:
- सिर्फ 'Phone' tick कीजिए और एक ही number वाली दो rows एक ही customer मानी जाती हैं, भले ही नाम अलग तरह से लिखा हो।
- 'Name' और 'Phone' दोनों tick कीजिए और एक row को duplicate गिने जाने के लिए दोनों पर match करना होगा।
Excel पहली घटना रखता है और बाकी हटा देता है। सही परिभाषित करने वाले columns चुनना ही पूरा हुनर है, बहुत कम चुनिए और आप असली अलग rows delete कर देते हैं।
Quiz
Meera column A पर Text to Columns चलाती है, पर column B में पहले से उसके stock notes थे। उन notes का क्या होता है?
- वे column A से फैलते split data द्वारा overwrite हो जाते हैं
- Excel उन्हें बचाने को अपने-आप दाईं तरफ खिसका देता है
- कुछ नहीं, notes सुरक्षित रहते हैं
- बँटवारा एक error के साथ नाकाम होता है
Show the answer
वे column A से फैलते split data द्वारा overwrite हो जाते हैं
Text to Columns बँटे टुकड़ों को दाईं तरफ के columns में फैलाता है, जो भी वहाँ हो उसे overwrite करते हुए। Meera को पहले खाली columns डालने चाहिए, या column B के notes को हटाना चाहिए। यह 'दाईं तरफ जगह साफ़ करो' वाली ज़रूरत क्लासिक Text to Columns gotcha है, और आकस्मिक data loss का एक असली कारण।
Think first
कौन से columns एक duplicate परिभाषित करते हैं?
Meera के पास customers हैं जहाँ एक ही व्यक्ति अपने नाम की दो spellings के साथ पर एक ही phone number के साथ आता है। अगर वह उन्हें एक customer मानना चाहती है, तो Remove Duplicates में कौन से column(s) tick करने चाहिए, और name और phone दोनों क्यों नहीं?
Show the answer
सिर्फ Phone tick कीजिए। अगर वह Name और Phone दोनों tick करे, तो दो अलग-spelt rows match नहीं होंगी (नाम अलग हैं), तो दोनों बच जाती हैं, ठीक उल्टा जो वह चाहती है। अकेला Phone tick करना किसी भी दोहराए number को एक ही customer मानता है, गलत-spelt duplicates पकड़ते हुए। सबक: आप जो columns tick करते हैं वे परिभाषित करते हैं 'duplicate' का क्या मतलब है, उन्हें असली पहचान के लिए चुनिए।
Watch out
Marks कहाँ कटते हैं
यह भूलना कि Text to Columns को दाईं तरफ खाली जगह चाहिए (यह overwrite करता है)। यह न समझना कि Remove Duplicates स्थायी रूप से delete करता है (सिर्फ पहली रखता है), पक्का न हो तो एक copy पर कीजिए। और यह गलत समझना कि चुने columns एक duplicate परिभाषित करते हैं, बहुत ज़्यादा tick कीजिए और असली duplicates बच जाते हैं, बहुत कम और अलग rows गायब हो जाती हैं। Exams इसे 'क्या तय करता है कि दो rows duplicate हैं?' के रूप में पूछते हैं (जवाब: चुने गए columns)।
Theory
इसीलिए databases मौजूद हैं
ध्यान दीजिए यह गड़बड़ी क्यों हुई: एक column में दो तथ्य थे (name और phone), और एक ही customer कई बार store हुआ। Unit 3 का normalization ठीक वह विज्ञान है जो data को ऐसे design करता है कि यह कभी न हो, एक column में एक तथ्य, हर customer एक बार store। गंदी spreadsheets साफ़ करना वह दर्द है जिसे रोकने के लिए databases बनाए गए। अगला lesson Unit 2 को बंद करता है: कई sheets को एक summary में consolidate करना।
Summary
Key takeaways
- Text to Columns एक column को एक delimiter (comma, space, tab) या fixed width से कई में बाँटता है।
- यह दाईं तरफ के columns overwrite करता है, इसलिए पहले जगह साफ़ कीजिए।
- Remove Duplicates दोहराई rows delete करता है, पहली घटना रखते हुए।
- आप जो columns select करते हैं वे परिभाषित करते हैं कि duplicate क्या गिना जाए, उन्हें असली पहचान के लिए चुनिए।
- दोनों tools असली analysis से पहले गंदे imported data को साफ़ करते हैं।
- याद रखने का hook: bundles को तोड़कर अलग कीजिए (split), दोहराव फेंक दीजिए (dedupe)।