Theory
તમારો ચહેરો, ગણિત રૂપે
Shop પર online class ના demo વખતે Chirag laptop screen ઉપરની નાની આંખ તરફ આંગળી ચીંધે છે: "અત્યારે આ વસ્તુ તમારા ચહેરાને આંકડામાં ફેરવે છે, દર સેકન્ડે 30 વાર, અને એ Ahmedabad મોકલી રહી છે."
મજાક જેવું લાગે છે. પણ આ એકદમ ચોક્કસ technical વર્ણન છે.
પ્રકાશ આંકડા કેવી રીતે બને છે, અને દર સેકન્ડે કેટલા આંકડાની વાત ચાલે છે, એ જ આ lesson છે. અને એ binary, pixels અને bandwidth ત્રણેયને એક દોરે બાંધી આપે છે.
Theory
નાનાં light meters નું આખું stadium
કલ્પના કરો કે cricket stadium માં દરેક seat પર એક માણસ light meter લઈને બેઠો છે, બધા એક જ દ્રશ્ય તરફ જુએ છે. Whistle વાગતાં જ દરેક જણ પોતાના meter નું reading લખી નાખે છે. Seat ના ક્રમમાં એ લાખો readings ભેગાં કરો એટલે આખું દ્રશ્ય ફરી દોરી શકાય. Camera નું sensor એ જ stadium છે, નખ જેટલું નાનું કરેલું: દરેક seat એટલે એક pixel, દરેક whistle એટલે એક frame.
Theory
Webcam ની ચોખ્ખી વ્યાખ્યા
Web camera એ live image અને video ઝીલતું input device છે:
- lens પ્રકાશને image sensor ઉપર focus કરે છે;
- sensor એ લાખો light-sensitive cells ની grid છે, જેને pixels (picture elements) કહે છે;
- દરેક pixel પોતાના પર પડતા પ્રકાશને આંકડા રૂપે માપે છે (brightness, અને filters વડે colour);
- megapixels = grid માં કેટલા million cells છે (2 MP webcam 1920×1080 ની grid ઝીલે છે);
- આ કામ સેકન્ડે 30 વાર કરો (30 fps) એટલે સ્થિર frames માંથી video બની જાય.
Quiz
Camera sensor નો એક pixel ખરેખર શું નોંધે છે?
- પ્રકાશની brightness અને colour ને આંકડા રૂપે
- આખા દ્રશ્યનો એક નાનકડો photograph
- એની સામે રહેલી વસ્તુનું નામ
- અવાજ અને પ્રકાશ બંને ભેગાં
Show the answer
પ્રકાશની brightness અને colour ને આંકડા રૂપે
એક pixel ફક્ત પોતાના નાનકડા cell પર પડતો પ્રકાશ જ જુએ છે અને એને આંકડા રૂપે નોંધે છે, બસ એટલું જ. ચિત્ર તો ત્યારે જ બને જ્યારે આવાં લાખો readings grid માં એકબીજાની બાજુમાં ગોઠવાય. કોઈ pixel ને ખબર નથી કે એ "શું" જોઈ રહ્યો છે; ઓળખવાનું કામ software નું છે, pipeline માં ઘણું આગળ જઈને.
Think first
પૂરની ગણતરી કરો
એક 1080p frame એટલે 1920 × 1080 pixels, દરેકને colour data ના આશરે 3 bytes જોઈએ, અને સેકન્ડે 30 frames. અંદાજ લગાવો કે તમારા online class ની એક સેકન્ડ કેટલો raw data બનાવે છે. પછી વિચારો કે તો પણ તમારો video તમારા data pack માં કેમ સમાઈ જાય છે.
Show the answer
1920 × 1080 ≈ 20 લાખ pixels × 3 bytes ≈ frame દીઠ 6 MB, × 30 fps ≈ raw ગણો તો સેકન્ડે 180 MB. તમારો data pack બચી જાય છે compression ના કારણે: software પુનરાવર્તન ફેંકી દે છે (frames વચ્ચે ન બદલાતું background) અને એવી ઝીણવટ પણ, જે આંખને ભાગ્યે જ દેખાય. Stream 100 ગણાથી પણ વધુ સંકોચાય છે. Video calls શક્ય જ compression ના લીધે છે.
Watch out
Marks ક્યાં કપાય છે
Webcam ને output device કહેવું: એ ઝીલે છે (input); તમને દેખાડતી screen એ output વાળો અડધો ભાગ છે. "વધુ megapixels = વધુ સારો camera" ને નિયમ તરીકે લખવું: grid નું કદ એક જ પરિબળ છે; lens ની quality અને sensor નું કદ નક્કી કરે છે કે દરેક pixel નું reading કેટલું ચોખ્ખું છે. એટલે જ સારો 12 MP phone camera સસ્તા 48 MP કરતાં આગળ નીકળી જાય છે. અને fps નો સંબંધ video ની smoothness સાથે છે, sharpness સાથે નહીં.
Theory
વર્તુળ પૂરું થાય છે
આખી સફર જુઓ: પ્રકાશ → pixel ના આંકડા → binary (તમારા Unit 2 ના lessons) → compressed stream → internet (Unit 4 આગળ આવે છે) → સામેની વ્યક્તિની screen આંકડાને પાછા પ્રકાશમાં ફેરવે છે. Input અને output devices અરીસા જેવા સામસામા અનુવાદકો છે. હવે પછીનો lesson એ અરીસાની મુલાકાત લે છે: monitors, જ્યાં આંકડા પાછા ચિત્ર બને છે.
Summary
Key takeaways
- Webcam એ input device છે: lens પ્રકાશને sensor grid પર focus કરે છે.
- દરેક pixel પોતાનો પ્રકાશ આંકડા રૂપે માપે છે; megapixels = grid નું કદ millions માં.
- Video = સેકન્ડ દીઠ frames, સામાન્ય રીતે 30 fps.
- Raw video જંગી હોય છે (1080p પર ~180 MB/s); compression જ એને મુસાફરી કરાવે છે.
- એકલા megapixels quality નક્કી કરતા નથી; lens અને sensor નું કદ પણ ગણાય.
- યાદ રાખવાની યુક્તિ: નાનાં light meters નું stadium, સેકન્ડે 30 વાર whistle.