رؤية مجسمة حاسوبية

الرؤية المجسمة الحاسوبية هي استخلاص المعلومات ثلاثية الأبعاد من الصور الرقمية، مثل تلك التي تلتقطها كاميرا CCD . من خلال مقارنة المعلومات المتعلقة بمشهد ما من زاويتين مختلفتين، يمكن استخلاص المعلومات ثلاثية الأبعاد بفحص المواضع النسبية للأجسام في اللوحتين. وهذا يشبه عملية الرؤية المجسمة البيولوجية .

مخطط تفصيلي

في الرؤية المجسمة التقليدية، تُستخدم كاميرتان، متباعدتان أفقيًا، للحصول على رؤيتين مختلفتين للمشهد، بطريقة مشابهة للرؤية الثنائية لدى الإنسان . وبمقارنة هاتين الصورتين، يمكن الحصول على معلومات العمق النسبي على شكل خريطة تباين ، تُشفّر الفرق في الإحداثيات الأفقية لنقاط الصورة المتناظرة . وتتناسب قيم خريطة التباين هذه عكسيًا مع عمق المشهد عند موقع البكسل المقابل.

لكي يتمكن الإنسان من مقارنة الصورتين، يجب أن يتم وضعهما فوق بعضهما البعض في جهاز مجسم، حيث يتم عرض الصورة من الكاميرا اليمنى على العين اليمنى للمشاهد والصورة من الكاميرا اليسرى على العين اليسرى.

يتطلب نظام رؤية الحاسوب عدة خطوات معالجة مسبقة. [ 1 ]

  1. يجب أولاً تصحيح الصورة وإزالة التشوهات الناتجة عن العدسة، مثل تشوه البرميل والتشوه المماسي . وهذا يضمن تطابق الصورة المرصودة مع إسقاط كاميرا ذات ثقب مثالي .
  2. يجب إسقاط الصورة مرة أخرى على مستوى مشترك للسماح بمقارنة أزواج الصور، وهو ما يُعرف بتصحيح الصورة .
  3. يتم تقليل مقياس المعلومات الذي يقارن بين الصورتين. وهذا يعطي أفضل تقدير لموقع الميزات في الصورتين، وينشئ خريطة تباين.
  4. يمكن، اختيارياً، إسقاط خريطة التباين المستلمة إلى سحابة نقاط ثلاثية الأبعاد . وباستخدام معلمات الإسقاط الخاصة بالكاميرات، يمكن حساب سحابة النقاط بحيث توفر قياسات بمقياس معروف.

الرؤية المجسمة النشطة

الرؤية المجسمة النشطة هي شكل من أشكال الرؤية المجسمة التي تستخدم الضوء بشكل فعال، مثل الليزر أو الضوء المنظم، لتبسيط عملية مطابقة الصور المجسمة. أما المصطلح المقابل فهو الرؤية المجسمة السلبية.

  • تستخدم تقنية الرؤية الضوئية المهيكلة التقليدية ضوءًا مهيكلًا أو ليزرًا، وتجد توافقات بين جهاز العرض والكاميرا. [ 2 ] [ 3 ]
  • تستخدم الرؤية المجسمة النشطة التقليدية ضوءًا منظمًا أو ليزرًا، ومع ذلك، يتم إجراء مطابقة المجسم فقط لتطابقات الكاميرات، بنفس طريقة الرؤية المجسمة السلبية.
  • تقنية التصوير المجسم بالضوء المنظم (SLS) هي تقنية هجينة تستخدم كلاً من التوافق بين الكاميرات والتوافق بين جهاز العرض والكاميرا. [ 4 ]

التطبيقات

تُستخدم شاشات العرض المجسمة ثلاثية الأبعاد على نطاق واسع في مجالات الترفيه ونقل المعلومات والأنظمة الآلية. وتُعدّ الرؤية المجسمة بالغة الأهمية في مجالات مثل الروبوتات لاستخلاص معلومات حول الموقع النسبي للأجسام ثلاثية الأبعاد في محيط الأنظمة المستقلة. ومن التطبيقات الأخرى في مجال الروبوتات التعرف على الأجسام ، [ 5 ] حيث تُمكّن معلومات العمق النظام من فصل مكونات الصورة المتداخلة، مثل كرسي أمام آخر، والتي قد لا يتمكن الروبوت من تمييزها كجسم منفصل باستخدام أي معايير أخرى.

تشمل التطبيقات العلمية للرؤية المجسمة الرقمية استخراج المعلومات من المسوحات الجوية ، لحساب خرائط الكنتور أو حتى استخراج الهندسة لرسم خرائط المباني ثلاثية الأبعاد، ورسم الخرائط التصويرية الفضائية، أو حساب المعلومات الهيليوغرافية ثلاثية الأبعاد مثل تلك التي تم الحصول عليها من خلال مشروع STEREO التابع لناسا .

تعريف مفصل

رسم بياني يوضح العلاقة بين إزاحة الصورة والعمق في الصور المجسمة، بافتراض صور مستوية متوازية.

يسجل البكسل اللون في موضع معين. ويتم تحديد هذا الموضع من خلال موقعه في شبكة البكسلات (x، y) وعمقه بالنسبة للبكسل ( z).

تُتيح الرؤية المجسمة الحصول على صورتين للمشهد نفسه، من موقعين مختلفين. في الرسم التوضيحي المجاور، ينتقل الضوء من النقطة A عبر فتحات كاميرات الثقب عند B و D ، إلى شاشات العرض عند E و H.

في الرسم التوضيحي المرفق، المسافة بين مركزي عدستي الكاميرا هي BD = BC + CD . المثلثان متشابهان.

  • ACB و BFE
  • ACD و DGH

وبالتالي الإزاحة د=هـF+جيح=بF(هـFبF+جيحبF)=بF(هـFبF+جيحدجي)=بF(بج+جدأج)=بFبدأج=كz، أين{\displaystyle {\begin{aligned}{\text{لذلك الإزاحة }}d&=EF+GH\\&=BF({\frac {EF}{BF}}+{\frac {GH}{BF}})\\&=BF({\frac {EF}{BF}}+{\frac {GH}{DG}})\\&=BF({\frac {BC+CD}{AC}})\\&=BF{\frac {BD}{AC}}\\&={\frac {k}{z}}{\text{، حيث}}\\\end{aligned}}}

  • k = BD BF
  • z = AC هي المسافة من مستوى الكاميرا إلى الجسم.

بافتراض أن الكاميرات مستوية، وأن مستويات الصورة مسطحة على نفس المستوى، فإن الإزاحة على المحور y بين نفس البكسل في الصورتين هي:

د=كz{\displaystyle d={\frac {k}{z}}}

حيث k هي المسافة بين الكاميرتين مضروبة في المسافة من العدسة إلى الصورة.

مكون العمق في الصورتين هوz1{\displaystyle z_{1}}وz2{\displaystyle z_{2}}، مقدمة من،

z2(x،y)=مين{v:v=z1(x،y-كz1(x،y))}{\displaystyle z_{2}(x,y)=\min \left\{v:v=z_{1}(x,y-{\frac {k}{z_{1}(x,y)}})\right\}}
z1(x،y)=مين{v:v=z2(x،y+كz2(x،y))}{\displaystyle z_{1}(x,y)=\min \left\{v:v=z_{2}(x,y+{\frac {k}{z_{2}(x,y)}})\right\}}

تسمح هذه الصيغ بحجب وحدات البكسل ، التي تظهر في صورة واحدة على سطح الجسم، بواسطة وحدات البكسل الأقرب التي تظهر في الصورة الأخرى، على سطح الجسم.

تصحيح الصورة

عندما لا تكون مستويات الصورة متحدة المستوى، يلزم تصحيح الصورة لضبطها كما لو كانت متحدة المستوى. ويمكن تحقيق ذلك عن طريق تحويل خطي.

قد تحتاج الصور أيضًا إلى تصحيح لجعل كل صورة مكافئة للصورة الملتقطة من كاميرا ذات ثقب صغير تسقط على مستوى مسطح.

نعومة

النعومة هي مقياس لتشابه الألوان. وبافتراض أن لكل جسم عدد قليل من الألوان، فإن البكسلات ذات الألوان المتشابهة من المرجح أن تنتمي إلى جسم واحد أكثر من انتمائها إلى عدة أجسام.

تعتمد الطريقة المذكورة أعلاه لتقييم السلاسة على نظرية المعلومات، وعلى افتراض أن لون عنصر الصورة يؤثر على لون عناصر الصورة المجاورة له وفقًا للتوزيع الطبيعي للمسافة بين النقاط. ويستند النموذج إلى افتراضات تقريبية حول العالم.

هناك طريقة أخرى تعتمد على افتراضات مسبقة حول السلاسة وهي الارتباط الذاتي.

النعومة خاصية للعالم وليست خاصية جوهرية للصورة. فالصورة المكونة من نقاط عشوائية تفتقر إلى النعومة، وبالتالي فإن الاستدلالات حول النقاط المجاورة ستكون عديمة الجدوى.

من حيث المبدأ، ينبغي تعلم خاصية النعومة، كما هو الحال مع خصائص أخرى للعالم. ويبدو أن هذا ما يفعله نظام الرؤية البشري.

قياس المعلومات

مقياس معلومات المربعات الصغرى

التوزيع الطبيعي هو

P(x،μ،σ)=1σ2πهـ-(x-μ)22σ2{\displaystyle P(x,\mu ,\sigma )={\frac {1}{\sigma {\sqrt {2\pi }}}}e^{-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}}}

يرتبط الاحتمال بمحتوى المعلومات الموصوف بطول الرسالة L ،

P(x)=2-ل(x){\displaystyle P(x)=2^{-L(x)}}
ل(x)=-سجل2P(x){\displaystyle L(x)=-\log _{2}{P(x)}}

لذا،

ل(x،μ،σ)=سجل2(σ2π)+(x-μ)22σ2سجل2هـ{\displaystyle L(x,\mu ,\sigma )=\log _{2}(\sigma {\sqrt {2\pi }})+{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\log _{2}e}

لأغراض مقارنة الصور المجسمة، لا يهم سوى طول الرسالة النسبي. وبناءً على ذلك، فإن مقياس المعلومات I ، المسمى مجموع مربعات الفروق (SSD)، هو:

أنا(x،μ،σ)=(x-μ)2σ2{\displaystyle I(x,\mu ,\sigma )={\frac {(x-\mu )^{2}}{\sigma ^{2}}}}

أين،

ل(x،μ،σ)=سجل2(σ2π)+أنا(x،μ،σ)سجل2هـ2{\displaystyle L(x,\mu ,\sigma )=\log _{2}(\sigma {\sqrt {2\pi }})+I(x,\mu ,\sigma ){\frac {\log _{2}e}{2}}}

نظراً لتكلفة وقت المعالجة اللازمة لتربيع الأرقام في SSD، تستخدم العديد من التطبيقات مجموع الفروق المطلقة (SAD) كأساس لحساب مقياس المعلومات. بينما تستخدم طرق أخرى الارتباط المتقاطع المعياري (NCC).

مقياس المعلومات للصور المجسمة

يمكن استخدام مقياس المربعات الصغرى لقياس محتوى المعلومات في الصور المجسمة، [ 6 ] بالنظر إلى الأعماق عند كل نقطةz(x،y){\displaystyle z(x,y)}أولاً، يتم استخلاص المعلومات اللازمة للتعبير عن صورة ما بدلالة صورة أخرى. وهذا ما يسمىأنام{\displaystyle I_{m}}.

يجب استخدام دالة فرق اللون لقياس الفرق بين الألوان بدقة. تُكتب دالة فرق اللون كما يلي. ويُقاس مقدار المعلومات اللازمة لتسجيل تطابق الألوان بين الصورتين كما يلي:

أنام(z1،z2)=1σم2x،yقرص مضغوط(لون1(x،y+كz1(x،y))،لون2(x،y))2{\displaystyle I_{m}(z_{1},z_{2})={\frac {1}{\sigma _{m}^{2}}}\sum _{x,y}\operatorname {cd} (\operatorname {color} _{1}(x,y+{\frac {k}{z_{1}(x,y)}}),\operatorname {color} _{2}(x,y))^{2}}

يُفترض هنا افتراضٌ حول سلاسة الصورة. يُفترض أن احتمالية تشابه لون بكسلين تزداد كلما تقاربت وحدات البكسل التي يمثلانها. يهدف هذا المقياس إلى تفضيل تجميع الألوان المتشابهة في نفس العمق. على سبيل المثال، إذا حجب جسمٌ أمامي مساحةً من السماء خلفه، فإن مقياس السلاسة يُرجّح تجميع البكسلات الزرقاء معًا في نفس العمق.

يستخدم المقياس الكلي للنعومة المسافة بين وحدات البكسل ثلاثية الأبعاد كتقدير للانحراف المعياري المتوقع لاختلاف اللون.

أناs(z1،z2)=12σح2أنا:{1،2}x1،y1x2،y2قرص مضغوط(لونأنا(x1،y1)،لونأنا(x2،y2))2(x1-x2)2+(y1-y2)2+(zأنا(x1،y1)-zأنا(x2،y2))2{\displaystyle I_{s}(z_{1},z_{2})={\frac {1}{2\sigma _{h}^{2}}}\sum _{i:\{1,2\}}\sum _{x_{1},y_{1}}\sum _{x_{2},y_{2}}{\frac {\operatorname {cd} (\operatorname {color} _{i}(x_{1},y_{1}),\operatorname {color} _{i}(x_{2},y_{2}))^{2}}{(x_{1}-x_{2})^{2}+(y_{1}-y_{2})^{2}+(z_{i}(x_{1},y_{1})-z_{i}(x_{2},y_{2}))^{2}}}}

إذن، يكون إجمالي محتوى المعلومات هو المجموع،

أنات(z1،z2)=أنام(z1،z2)+أناs(z1،z2){\displaystyle I_{t}(z_{1},z_{2})=I_{m}(z_{1},z_{2})+I_{s}(z_{1},z_{2})}

يجب اختيار قيمة المكون z لكل بكسل بحيث تعطي أقل قيمة ممكنة لمحتوى المعلومات. وهذا سيعطي أكثر الأعماق احتمالاً عند كل بكسل. الحد الأدنى لإجمالي مقياس المعلومات هو:

أنامين=مين{أنا:أنا=أنات(z1،z2)}{\displaystyle I_{\operatorname {min} }=\min {\{i:i=I_{t}(z_{1},z_{2})\}}}

دوال العمق للصورتين اليسرى واليمنى هي الزوج،

(z1،z2){(z1،z2):أنات(z1،z2)=أنامين}{\displaystyle (z_{1},z_{2})\in \{(z_{1},z_{2}):I_{t}(z_{1},z_{2})=I_{\operatorname {min} }\}}

أساليب التنفيذ

تُعدّ مسألة التصغير مسألةً معقدةً من فئة NP-complete ، ما يعني أن التوصل إلى حل عام لها سيستغرق وقتًا طويلًا. مع ذلك، توجد طرق حاسوبية تعتمد على الاستدلالات التقريبية تُقارب النتيجة في وقت معقول. كما توجد طرق أخرى تعتمد على الشبكات العصبية . [ 7 ] ويُعدّ التنفيذ الفعال للرؤية المجسمة مجالًا بحثيًا نشطًا.

انظر أيضاً

مراجع

  1. برادسكي، غاري؛ كاهلر، أدريان. تعلم OpenCV: رؤية الحاسوب باستخدام مكتبة OpenCV . أورايلي.
  2. جي، تشانغسو؛ لي، سانغ ووك؛ بارك، راي هونغ (2004). "نمط شريطي ملون عالي التباين للتصوير السريع للمدى باستخدام الضوء المهيكل". رؤية الحاسوب - المؤتمر الأوروبي لرؤية الحاسوب 2004. سلسلة محاضرات في علوم الحاسوب. المجلد 3021. الصفحات 95-107 . arXiv : 1508.04981 . doi : 10.1007/978-3-540-24670-1_8 . ISBN   978-3-540-21984-2. S2CID 13277591 . 
  3. جي، تشانغسو؛ لي، سانغ ووك؛ بارك، راي هونغ (2012). "نمط تبديل الشرائط الملونة للتصوير السريع للمدى باستخدام الضوء المهيكل" . اتصالات البصريات . 285 (9): 2320-2331 . Bibcode : 2012OptCo.285.2320J . doi : 10.1016/j.optcom.2012.01.025 .
  4. جانغ، وونكوي؛ جي، تشانغسو؛ سيو، يونغدويك؛ لي، سانغ ووك (2013). "التصوير المجسم بالضوء المهيكل: تحليل مقارن وتكامل بين التصوير المجسم بالضوء المهيكل والتصوير المجسم النشط لقياس الشكل الديناميكي" . البصريات والليزر في الهندسة . 51 (11): 1255-1264 . Bibcode : 2013OptLE..51.1255J . doi : 10.1016/j.optlaseng.2013.05.001 .
  5. سومي، ياسوشي؛ كاواي، يوشيهيرو؛ يوشيمي، تاكاشي؛ توميتا، فومياكي (2002). "التعرف على الأجسام ثلاثية الأبعاد في البيئات المزدحمة باستخدام الرؤية المجسمة القائمة على القطاعات" . المجلة الدولية لرؤية الحاسوب . 46 (1): 5-23 . doi : 10.1023/A:1013240031067 . S2CID 22926546 . 
  6. ^ لازاروس، نالبانتيديس. سيراكوليس، جورجيوس كريستو؛ جاستيراتوس 1، أنطونيوس (2008). "مراجعة خوارزميات الرؤية المجسمة: من البرامج إلى الأجهزة" . المجلة الدولية للبصريات . 2 (4): 435-462 . دوى : 10.1080/15599610802438680 . S2CID 18115413 . {{cite journal}}: صيانة CS1: الأسماء الرقمية: قائمة المؤلفين ( رابط )
  7. وانغ، جونغ هوا؛ شياو، تشي بينغ (1999). "حول مطابقة التباين في الرؤية المجسمة عبر إطار عمل الشبكة العصبية". وقائع المجلس الوطني للعلوم، جمهورية الصين ، 23 (5): 665-678 . CiteSeerX 10.1.1.105.9067 .