بینایی ماشین

از ایران پدیا
نسخهٔ تاریخ ‏۱۰ اکتبر ۲۰۲۶، ساعت ۰۸:۳۴ توسط Alireza k h (بحث | مشارکت‌ها)
(تفاوت) → نسخهٔ قدیمی‌تر | نمایش نسخهٔ فعلی (تفاوت) | نسخهٔ جدیدتر ← (تفاوت)
پرش به ناوبری پرش به جستجو
بینایی ماشین
شناسنامه
نام‌های دیگربینایی رایانه‌ای، بینایی کامپیوتری
حوزههوش مصنوعی، علوم رایانه، یادگیری ماشین، یادگیری عمیق، پردازش تصویر
خاستگاهعلوم رایانه، پردازش سیگنال، هندسه، عکاسی، رباتیک و پژوهش‌های هوش مصنوعی
اندیشه و تاریخ
مفاهیم کلیدیپیکسل، استخراج ویژگی، طبقه‌بندی تصویر، تشخیص شیء، بخش‌بندی تصویر، ردیابی، جریان نوری، بازسازی سه‌بعدی، تخمین عمق، تشخیص چهره
جریان‌های مرتبطبینایی محاسباتی، پردازش تصویر، تشخیص الگو، شبکه عصبی مصنوعی، یادگیری عمیق، ترنسفورمر، رباتیک
تأثیرپذیرفته ازعلوم اعصاب بینایی، روان‌شناسی ادراک، هندسه، آمار، یادگیری ماشین و پردازش سیگنال
تأثیرگذار برخودروهای خودران، رباتیک، تصویربرداری پزشکی، واقعیت افزوده، سامانه‌های نظارتی، هوش مصنوعی مولد و مدل‌های چندوجهی
نقد و ارزیابی

بینایی ماشین (به انگلیسی: Computer Vision)، که با نام‌های بینایی رایانه‌ای و بینایی کامپیوتری نیز شناخته می‌شود، شاخه‌ای از هوش مصنوعی و علوم رایانه است که به توسعهٔ روش‌ها و سامانه‌هایی برای استخراج، پردازش و تفسیر اطلاعات از تصاویر و ویدئوها می‌پردازد. هدف این حوزه آن است که رایانه بتواند از داده‌های بصری، اطلاعاتی دربارهٔ اشیا، ویژگی‌ها، روابط مکانی، حرکت و ساختار محیط به دست آورد و از آنها در انجام وظایف مشخص استفاده کند.[۱]

بینایی ماشین از مبانی ریاضی، هندسه، آمار، پردازش تصویر و یادگیری ماشین بهره می‌گیرد. این حوزه در دهه‌های نخست شکل‌گیری خود عمدتاً بر روش‌های هندسی و الگوریتم‌های طراحی‌شده توسط پژوهشگران استوار بود، اما از دههٔ ۲۰۱۰، استفاده از شبکه‌های عصبی مصنوعی و یادگیری عمیق موجب تحول گسترده‌ای در بسیاری از کاربردهای آن شد.[۲]

امروزه بینایی ماشین در تشخیص اشیا، تحلیل تصاویر پزشکی، هدایت ربات‌ها، خودروهای خودران، کنترل کیفیت صنعتی، کشاورزی هوشمند، تحلیل تصاویر ماهواره‌ای، واقعیت افزوده و سامانه‌های چندوجهی هوش مصنوعی کاربرد دارد. در کنار این قابلیت‌ها، استفاده از آن در شناسایی چهره و نظارت تصویری، پرسش‌های مهمی دربارهٔ حریم خصوصی، حقوق شهروندی، سوگیری الگوریتمی و پاسخگویی ایجاد کرده است.

تعریف و ماهیت بینایی ماشین

بینایی ماشین مجموعه‌ای از نظریه‌ها، الگوریتم‌ها و سامانه‌های محاسباتی است که برای استخراج اطلاعات معنادار از داده‌های بصری توسعه یافته‌اند.

این داده‌ها ممکن است از دوربین‌های معمولی، دوربین‌های عمق‌سنج، سامانه‌های تصویربرداری پزشکی، ماهواره‌ها، میکروسکوپ‌ها یا حسگرهای تخصصی به دست آمده باشند.

برای مثال، یک سامانهٔ بینایی ماشین ممکن است تصویری از یک خیابان را دریافت کند و وظیفه داشته باشد خودروها، عابران پیاده، علائم راهنمایی و خطوط مسیر را شناسایی کند.

سامانه‌ای دیگر ممکن است تصویر پزشکی را بررسی و ناحیه‌ای را که احتمال وجود یک ضایعه در آن بیشتر است مشخص کند.

در هر دو نمونه، هدف تبدیل دادهٔ تصویری به اطلاعات قابل استفاده برای یک وظیفهٔ مشخص است.

با این حال، تشخیص یک الگو در تصویر لزوماً به معنای فهم کامل صحنه به شیوهٔ انسانی نیست.

تفاوت بینایی ماشین و بینایی انسان

بینایی انسان فرایندی زیستی و شناختی است که از تعامل چشم، دستگاه عصبی و مغز شکل می‌گیرد.

انسان هنگام مشاهدهٔ یک صحنه، اطلاعات بصری را با حافظه، تجربه، دانش پیشین و دیگر حواس خود ترکیب می‌کند.

در مقابل، سامانه‌های بینایی ماشین از حسگرها، داده‌های دیجیتال، مدل‌های ریاضی و الگوریتم‌های محاسباتی استفاده می‌کنند.

یک سامانه ممکن است در تشخیص نوع مشخصی از الگو عملکرد بسیار دقیقی داشته باشد، اما در برابر تغییر نور، زاویهٔ دید، شرایط محیط یا داده‌های ناآشنا دچار خطا شود.

بنابراین، توانایی یک سامانه در تشخیص تصویر را نباید معادل برخورداری از ادراک یا آگاهی انسانی دانست.

تاریخچهٔ بینایی ماشین

پژوهش‌های اولیه

ریشه‌های بینایی ماشین به پژوهش‌های مرتبط با پردازش تصویر، هندسهٔ تصویری، تشخیص الگو و هوش مصنوعی در میانهٔ سدهٔ بیستم بازمی‌گردد.

در دهه‌های ۱۹۵۰ و ۱۹۶۰، پژوهشگران تلاش کردند روش‌هایی برای تشخیص اشکال هندسی، استخراج خطوط و بازسازی ساختار اشیا از تصاویر توسعه دهند.

لارنس رابرتس از پژوهشگران اثرگذار اولیه در تحلیل رایانه‌ای تصاویر سه‌بعدی بود.

در این دوره، یکی از پرسش‌های بنیادی آن بود که چگونه می‌توان از یک تصویر دوبعدی، اطلاعاتی دربارهٔ ساختار سه‌بعدی جهان به دست آورد.

گسترش پژوهش‌ها در دههٔ ۱۹۷۰

در دههٔ ۱۹۷۰، پژوهش‌های بینایی ماشین به موضوعاتی مانند تشخیص لبه، بازسازی سه‌بعدی، تحلیل حرکت و بازنمایی هندسی صحنه گسترش یافت.

پژوهشگران تلاش کردند میان ویژگی‌های تصویر و ساختار فیزیکی اشیای موجود در جهان ارتباط برقرار کنند.

در این دوره، هندسه و مدل‌سازی ریاضی نقش مهمی در توسعهٔ الگوریتم‌های بینایی ماشین داشتند.

دیدگاه محاسباتی دیوید مار

دیوید مار، پژوهشگر علوم اعصاب و بینایی محاسباتی، در کتاب Vision: A Computational Investigation into the Human Representation and Processing of Visual Information که در سال ۱۹۸۲ منتشر شد، چارچوبی اثرگذار برای مطالعهٔ بینایی ارائه کرد.

او بر ضرورت بررسی مسئلهٔ بینایی در سطوح مختلف، از هدف محاسباتی گرفته تا بازنمایی و پیاده‌سازی، تأکید داشت.

این دیدگاه در شکل‌گیری مباحث نظری بینایی محاسباتی و علوم شناختی تأثیرگذار بود.

توسعهٔ روش‌های هندسی

در دهه‌های ۱۹۸۰ و ۱۹۹۰، روش‌های هندسی و آماری بینایی ماشین پیشرفت کردند.

موضوعاتی مانند تطبیق نقاط میان تصاویر، تخمین حرکت دوربین، بازسازی سه‌بعدی و تحلیل تصاویر چنددوربینی از محورهای مهم پژوهش بودند.

کتاب Multiple View Geometry in Computer Vision نوشتهٔ ریچارد هارتلی و اندرو زیسرمن از منابع مهم این حوزه است.[۳]

ظهور مجموعه‌داده‌های بزرگ

با افزایش ظرفیت ذخیره‌سازی و توان محاسباتی، مجموعه‌داده‌های تصویری بزرگ‌تری برای آموزش و ارزیابی الگوریتم‌ها ایجاد شدند.

یکی از مهم‌ترین آنها ImageNet بود که در سال ۲۰۰۹ در مقاله‌ای از جیا دنگ و همکاران معرفی شد.

ImageNet مجموعه‌ای گسترده از تصاویر سازمان‌دهی‌شده بر اساس مفاهیم و دسته‌های معنایی است و در توسعهٔ پژوهش‌های تشخیص تصویر نقش مهمی داشته است.[۴]

تحول یادگیری عمیق در سال ۲۰۱۲

یکی از نقاط عطف مهم بینایی ماشین در سال ۲۰۱۲ رخ داد.

الکس کریژفسکی، ایلیا سوتسکِوِر و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقه‌بندی تصاویر ImageNet معرفی کردند.

این مدل که بعدها با نام AlexNet شناخته شد، در رقابت ImageNet سال ۲۰۱۲ عملکرد برجسته‌ای داشت و به گسترش استفاده از یادگیری عمیق در بینایی ماشین کمک کرد.[۵]

پس از آن، شبکه‌های عصبی پیچشی در بسیاری از وظایف تشخیص و تحلیل تصویر به روش‌های اصلی تبدیل شدند.

شبکه‌های عمیق‌تر و ResNet

در سال ۲۰۱۵، کایمینگ هه و همکاران معماری ResNet را معرفی کردند.

این معماری از اتصالات باقیمانده برای تسهیل آموزش شبکه‌های عمیق‌تر استفاده می‌کرد.

ResNet در توسعهٔ شبکه‌های پیچشی عمیق و کاربردهای تشخیص تصویر تأثیرگذار بود.[۶]

ورود ترنسفورمرها به بینایی ماشین

در سال ۲۰۲۰، پژوهشگران مدل Vision Transformer یا ViT را معرفی کردند.

این مدل از معماری ترنسفورمر برای پردازش تصویر استفاده می‌کند.

در این روش، تصویر به قطعه‌هایی تقسیم می‌شود و هر قطعه به بازنمایی عددی تبدیل می‌شود.

سپس روابط میان این قطعه‌ها با استفاده از سازوکار توجه پردازش می‌شود.[۷]

این تحول نشان داد که ترنسفورمرها می‌توانند در کنار شبکه‌های پیچشی، نقش مهمی در تحلیل تصاویر ایفا کنند.

مبانی علمی بینایی ماشین

بینایی ماشین بر مجموعه‌ای از مبانی علمی و فنی استوار است.

این مبانی شامل تشکیل تصویر، پردازش سیگنال، هندسه، آمار، بهینه‌سازی و یادگیری ماشین هستند.

در بسیاری از مسائل، شناخت نحوهٔ تشکیل تصویر به اندازهٔ انتخاب الگوریتم اهمیت دارد.

برای مثال، یک شیء ممکن است به دلیل تغییر نور، فاصله، زاویهٔ دوربین یا انسداد جزئی، ظاهر متفاوتی در تصاویر داشته باشد.

تصویر دیجیتال

تصویر دیجیتال بازنمایی عددی یک تصویر است که معمولاً از آرایه‌ای از پیکسل‌ها تشکیل می‌شود.

در تصاویر خاکستری، هر پیکسل معمولاً مقداری مرتبط با شدت روشنایی دارد.

در تصاویر رنگی، هر پیکسل می‌تواند دارای چند مؤلفهٔ رنگی باشد.

یکی از نمایش‌های رایج تصویر رنگی، مدل RGB است که از سه مؤلفهٔ قرمز، سبز و آبی استفاده می‌کند.

الگوریتم‌های بینایی ماشین این داده‌های عددی را برای استخراج ویژگی‌ها و اطلاعات پردازش می‌کنند.

پیکسل و وضوح تصویر

پیکسل کوچک‌ترین عنصر نمونه‌برداری‌شده در بسیاری از تصاویر دیجیتال است.

وضوح مکانی تصویر معمولاً با تعداد پیکسل‌ها در عرض و ارتفاع بیان می‌شود.

برای مثال، تصویری با ابعاد ۱۹۲۰ در ۱۰۸۰ پیکسل دارای بیش از دو میلیون پیکسل است.

با این حال، وضوح بالاتر لزوماً به معنای کیفیت بهتر همهٔ وظایف بینایی ماشین نیست.

نورپردازی، وضوح اپتیکی، نویز، فشرده‌سازی و کیفیت داده نیز اهمیت دارند.

پردازش تصویر

پردازش تصویر به مجموعه‌ای از روش‌ها برای تغییر، بهبود یا تحلیل داده‌های تصویری گفته می‌شود.

این روش‌ها می‌توانند شامل کاهش نویز، تنظیم روشنایی، افزایش کنتراست، فیلترگذاری و تبدیل هندسی باشند.

پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند، اما مترادف نیستند.

پردازش تصویر ممکن است صرفاً برای بهبود ظاهر تصویر انجام شود.

در مقابل، بینایی ماشین معمولاً به استخراج اطلاعات و انجام وظایف ادراکی یا تحلیلی از تصویر می‌پردازد.

استخراج ویژگی

استخراج ویژگی (Feature Extraction) فرایند شناسایی و بازنمایی اطلاعاتی از تصویر است که برای یک وظیفه مفید هستند.

در روش‌های کلاسیک، ویژگی‌ها ممکن است شامل لبه‌ها، گوشه‌ها، بافت‌ها یا توصیفگرهای محلی باشند.

در روش‌های مبتنی بر یادگیری عمیق، شبکه می‌تواند بازنمایی‌های مورد نیاز را در فرایند آموزش بیاموزد.

این تفاوت یکی از ویژگی‌های مهم تحول بینایی ماشین در دههٔ ۲۰۱۰ بود.

تشخیص لبه

تشخیص لبه (Edge Detection) یکی از روش‌های بنیادی پردازش تصویر است.

لبه‌ها معمولاً با تغییرات قابل توجه شدت روشنایی یا رنگ در تصویر ارتباط دارند.

تشخیص لبه می‌تواند برای شناسایی مرز اشیا، تحلیل شکل‌ها و آماده‌سازی داده برای مراحل بعدی استفاده شود.

الگوریتم Canny از روش‌های شناخته‌شدهٔ تشخیص لبه است.

تشخیص گوشه و نقاط کلیدی

در برخی مسائل، لازم است نقاط شاخص تصویر شناسایی شوند.

این نقاط ممکن است شامل گوشه‌ها یا نواحی دارای الگوی محلی متمایز باشند.

نقاط کلیدی در تطبیق تصاویر، ردیابی، بازسازی سه‌بعدی و تخمین حرکت دوربین کاربرد دارند.

روش‌هایی مانند Harris و SIFT از روش‌های شناخته‌شدهٔ این حوزه هستند.

طبقه‌بندی تصویر

طبقه‌بندی تصویر (Image Classification) یکی از وظایف اصلی بینایی ماشین است.

در این مسئله، سامانه یک تصویر را دریافت و آن را به یک یا چند دستهٔ مشخص نسبت می‌دهد.

برای مثال، مدل ممکن است تشخیص دهد که تصویر مربوط به گربه، سگ، خودرو یا هواپیماست.

طبقه‌بندی تصویر با تشخیص محل دقیق اشیا تفاوت دارد.

یک تصویر ممکن است دارای چندین شیء باشد، در حالی که مدل طبقه‌بندی ساده فقط یک برچسب کلی تولید کند.

تشخیص اشیا

تشخیص اشیا (Object Detection) به شناسایی اشیای موجود در تصویر و تعیین موقعیت آنها گفته می‌شود.

خروجی سامانه معمولاً شامل نوع شیء، میزان اطمینان مدل و مختصات ناحیهٔ مربوط به آن است.

برای مثال، یک سامانه ممکن است در تصویر خیابان چند خودرو و عابر پیاده را تشخیص دهد و برای هرکدام کادر مشخصی رسم کند.

این فناوری در رباتیک، کنترل ترافیک، تحلیل ویدئو و سامانه‌های کمک‌راننده کاربرد دارد.

بخش‌بندی تصویر

بخش‌بندی تصویر (Image Segmentation) فرایندی است که در آن پیکسل‌های تصویر بر اساس ویژگی یا تعلق به نواحی مختلف دسته‌بندی می‌شوند.

بخش‌بندی در پزشکی، تحلیل تصاویر ماهواره‌ای، رباتیک و صنعت کاربرد دارد.

دو نوع مهم آن عبارت‌اند از:

  • بخش‌بندی معنایی؛
  • بخش‌بندی نمونه‌ای.

بخش‌بندی معنایی

در بخش‌بندی معنایی (Semantic Segmentation)، برای هر پیکسل یک دستهٔ معنایی تعیین می‌شود.

برای مثال، در تصویر خیابان، پیکسل‌ها ممکن است به دسته‌هایی مانند جاده، ساختمان، آسمان، خودرو و عابر پیاده تقسیم شوند.

در این روش، اشیای جداگانه‌ای که به یک دسته تعلق دارند لزوماً از یکدیگر متمایز نمی‌شوند.

بخش‌بندی نمونه‌ای

در بخش‌بندی نمونه‌ای (Instance Segmentation)، سامانه علاوه بر شناسایی دستهٔ اشیا، نمونه‌های جداگانهٔ هر دسته را نیز تفکیک می‌کند.

برای مثال، اگر سه خودرو در تصویر وجود داشته باشد، مدل می‌تواند ناحیهٔ هر خودرو را به‌طور مستقل مشخص کند.

این قابلیت در تحلیل صحنه‌های پیچیده اهمیت دارد.

معماری U-Net

U-Net یکی از معماری‌های شناخته‌شدهٔ شبکهٔ عصبی برای بخش‌بندی تصویر است.

این معماری در سال ۲۰۱۵ توسط اولاف رونبرگر، فیلیپ فیشر و توماس بروکس برای بخش‌بندی تصاویر زیست‌پزشکی معرفی شد.

U-Net از مسیر فشرده‌سازی و مسیر گسترش بازنمایی‌ها استفاده می‌کند و برای تعیین موقعیت دقیق ساختارهای موجود در تصویر طراحی شده است.[۸]

این معماری و گونه‌های بعدی آن در بسیاری از مسائل بخش‌بندی تصویر استفاده شده‌اند.

تشخیص چهره

تشخیص چهره اصطلاحی است که در کاربرد عمومی ممکن است به چند وظیفهٔ متفاوت اشاره کند.

یکی از آنها یافتن محل چهره در تصویر است.

وظیفهٔ دیگر، شناسایی یا تأیید هویت فرد بر اساس ویژگی‌های چهره است.

این دو کاربرد از نظر فنی و حقوقی یکسان نیستند.

سامانه‌های شناسایی چهره می‌توانند در احراز هویت و مدیریت دسترسی استفاده شوند، اما کاربرد آنها در نظارت عمومی می‌تواند خطرهایی برای حریم خصوصی و آزادی‌های مدنی ایجاد کند.

تشخیص و تحلیل حرکت

بینایی ماشین می‌تواند برای تحلیل تغییرات تصویر در طول زمان استفاده شود.

این حوزه شامل تشخیص حرکت، ردیابی اشیا و تخمین جهت یا سرعت حرکت است.

برای مثال، یک سامانهٔ نظارت بر ترافیک می‌تواند حرکت خودروها را در چندین فریم متوالی بررسی کند.

در رباتیک نیز تحلیل حرکت به درک تغییر موقعیت اشیا و دوربین کمک می‌کند.

جریان نوری

جریان نوری (Optical Flow) به الگوی حرکت ظاهری نقاط یا ساختارهای تصویری میان فریم‌های متوالی اشاره دارد.

روش‌های تخمین جریان نوری برای تحلیل حرکت، ردیابی و برخی کاربردهای ناوبری استفاده می‌شوند.

با این حال، حرکت ظاهری در تصویر همیشه معادل حرکت واقعی یک شیء در فضای سه‌بعدی نیست.

حرکت دوربین، تغییر نور و دیگر عوامل نیز می‌توانند بر آن اثر بگذارند.

ردیابی اشیا

ردیابی اشیا (Object Tracking) فرایندی است که در آن سامانه تلاش می‌کند موقعیت یک یا چند شیء را در طول زمان دنبال کند.

برای مثال، پس از تشخیص یک خودرو در نخستین فریم ویدئو، سامانه می‌تواند موقعیت آن را در فریم‌های بعدی تخمین بزند.

ردیابی در تحلیل ترافیک، ورزش، رباتیک و پردازش ویدئو کاربرد دارد.

تخمین وضعیت بدن انسان

تخمین وضعیت بدن (Human Pose Estimation) به شناسایی موقعیت نقاط یا مفاصل اصلی بدن در تصویر یا ویدئو گفته می‌شود.

این فناوری در تحلیل حرکت، ورزش، توان‌بخشی، تعامل انسان و رایانه و تولید انیمیشن کاربرد دارد.

عملکرد آن می‌تواند تحت تأثیر زاویهٔ دوربین، پوشش بدن، انسداد و کیفیت تصویر قرار گیرد.

بینایی سه‌بعدی

بینایی سه‌بعدی به روش‌هایی گفته می‌شود که برای استخراج اطلاعات مربوط به عمق، شکل و ساختار فضایی محیط از داده‌های بصری استفاده می‌کنند.

این روش‌ها می‌توانند از تصاویر چنددوربینی، حرکت دوربین، حسگرهای عمق یا ترکیب چند منبع داده بهره بگیرند.

بینایی سه‌بعدی در رباتیک، نقشه‌برداری، واقعیت افزوده و بازسازی دیجیتال اشیا کاربرد دارد.

تخمین عمق

تخمین عمق (Depth Estimation) فرایندی است که در آن فاصلهٔ نقاط یا اشیای صحنه نسبت به دوربین برآورد می‌شود.

این کار می‌تواند با استفاده از دو دوربین، حسگرهای تخصصی یا مدل‌های یادگیری ماشین انجام شود.

تخمین عمق در ناوبری ربات‌ها، خودروهای خودران و بازسازی سه‌بعدی اهمیت دارد.

بینایی استریو

بینایی استریو (Stereo Vision) از تصاویر ثبت‌شده از دو دیدگاه متفاوت برای تخمین ساختار سه‌بعدی استفاده می‌کند.

اختلاف موقعیت ظاهری نقاط متناظر در دو تصویر می‌تواند برای محاسبهٔ عمق به کار رود.

این روش از اصول هندسهٔ تصویری و روابط میان دوربین‌ها استفاده می‌کند.

بازسازی سه‌بعدی

بازسازی سه‌بعدی (3D Reconstruction) فرایند ایجاد مدلی از ساختار سه‌بعدی یک شیء یا صحنه بر اساس داده‌های تصویری است.

این فناوری در معماری، میراث فرهنگی، نقشه‌برداری، پزشکی، صنعت و تولید محتوای دیجیتال کاربرد دارد.

کیفیت بازسازی به عواملی مانند تعداد تصاویر، زاویه‌های دید، بافت سطح و دقت کالیبراسیون وابسته است.

ساختار از حرکت

ساختار از حرکت (Structure from Motion یا SfM) مجموعه‌ای از روش‌هاست که با استفاده از تصاویر ثبت‌شده از موقعیت‌های متفاوت، ساختار سه‌بعدی صحنه و موقعیت نسبی دوربین‌ها را تخمین می‌زند.

این روش در فتوگرامتری، نقشه‌برداری و بازسازی سه‌بعدی کاربرد دارد.

مکان‌یابی و نقشه‌سازی هم‌زمان

مکان‌یابی و نقشه‌سازی هم‌زمان (Simultaneous Localization and Mapping یا SLAM) به مسئلهٔ تخمین موقعیت یک سامانه در محیط و ساخت نقشه‌ای از همان محیط اشاره دارد.

در نوع بصری آن، اطلاعات دوربین برای تخمین حرکت و ساخت نقشه استفاده می‌شود.

این فناوری در رباتیک، پهپادها و واقعیت افزوده اهمیت دارد.

یادگیری ماشین در بینایی ماشین

یادگیری ماشین امکان می‌دهد مدل‌ها برخی روابط و الگوهای تصویری را از داده بیاموزند.

در روش‌های کلاسیک، پژوهشگر ممکن است ابتدا ویژگی‌هایی مانند لبه‌ها یا بافت‌ها را استخراج کند و سپس یک مدل طبقه‌بندی را آموزش دهد.

در روش‌های مبتنی بر یادگیری عمیق، بخش بزرگی از استخراج ویژگی و تصمیم‌گیری می‌تواند در یک معماری قابل آموزش انجام شود.

انتخاب روش مناسب به نوع مسئله، مقدار داده، منابع محاسباتی و نیاز به توضیح‌پذیری وابسته است.

شبکه‌های عصبی پیچشی

شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) یکی از معماری‌های مهم در بینایی ماشین است.

این شبکه از عملیات پیچش برای پردازش الگوهای محلی تصویر استفاده می‌کند.

شبکه‌های پیچشی می‌توانند بازنمایی‌هایی از ویژگی‌های ساده تا ساختارهای پیچیده‌تر بیاموزند.

موفقیت AlexNet در سال ۲۰۱۲ و توسعهٔ معماری‌های بعدی مانند ResNet از مراحل مهم گسترش این روش بودند.[۵][۶]

ترنسفورمر بینایی

ترنسفورمر بینایی (Vision Transformer یا ViT) معماری‌ای است که از سازوکار توجه برای پردازش تصاویر استفاده می‌کند.

در ساختار متعارف آن، تصویر به قطعه‌هایی تقسیم و هر قطعه به یک بازنمایی برداری تبدیل می‌شود.

این بازنمایی‌ها همراه با اطلاعات موقعیتی به لایه‌های ترنسفورمر داده می‌شوند.

مدل می‌تواند روابط میان بخش‌های مختلف تصویر را در فرایند یادگیری محاسبه کند.[۷]

ترنسفورمرهای بینایی در طبقه‌بندی تصویر و دیگر وظایف بینایی ماشین به کار گرفته شده‌اند.

بینایی ماشین و مدل‌های چندوجهی

مدل چندوجهی مدلی است که می‌تواند چند نوع داده مانند متن، تصویر یا صوت را پردازش کند.

بینایی ماشین یکی از اجزای مهم بسیاری از سامانه‌های چندوجهی است.

برای مثال، سامانه‌ای که تصویری را دریافت و دربارهٔ محتوای آن به پرسش‌های متنی پاسخ می‌دهد، باید اطلاعات بصری را با پردازش زبان ترکیب کند.

چنین سامانه‌هایی می‌توانند برای توصیف تصویر، جست‌وجوی بصری و تحلیل اسناد تصویری استفاده شوند.

با این حال، پاسخ متنی آنها ممکن است حاوی خطا یا توهم هوش مصنوعی باشد.

بینایی ماشین و هوش مصنوعی مولد

هوش مصنوعی مولد و بینایی ماشین حوزه‌هایی مرتبط اما متفاوت‌اند.

بینایی ماشین عمدتاً بر استخراج و تحلیل اطلاعات از داده‌های بصری تمرکز دارد.

در مقابل، مدل‌های مولد برای تولید داده یا محتوای جدید آموزش داده می‌شوند.

با این حال، بسیاری از سامانه‌های جدید هر دو قابلیت را ترکیب می‌کنند.

برای مثال، یک سامانه ممکن است ابتدا اجزای تصویر را شناسایی و سپس بر اساس دستور متنی، تصویر تازه‌ای تولید یا تصویر موجود را ویرایش کند.

بینایی ماشین در پزشکی

یکی از کاربردهای مهم بینایی ماشین، تحلیل تصاویر پزشکی است.

این تصاویر می‌توانند شامل رادیوگرافی، سی‌تی‌اسکن، ام‌آر‌آی، سونوگرافی و تصاویر میکروسکوپی باشند.

سامانه‌های بینایی ماشین ممکن است برای شناسایی الگوهای غیرعادی، بخش‌بندی اندام‌ها یا اندازه‌گیری ساختارهای تصویری آموزش داده شوند.

معماری U-Net از نمونه‌های اثرگذار در بخش‌بندی تصاویر زیست‌پزشکی است.[۸]

با این حال، عملکرد یک مدل در محیط آزمایشگاهی لزوماً به معنای اعتبار بالینی آن نیست.

کاربرد پزشکی نیازمند اعتبارسنجی، ارزیابی ایمنی و نظارت متخصصان است.

بینایی ماشین در خودروهای خودران

خودروهای خودران و سامانه‌های کمک‌راننده می‌توانند از بینایی ماشین برای تحلیل محیط اطراف استفاده کنند.

وظایف آنها ممکن است شامل تشخیص خودروها، عابران پیاده، دوچرخه‌سواران، علائم راهنمایی و خطوط جاده باشد.

این سامانه‌ها گاهی داده‌های دوربین را با اطلاعات رادار، لیدار و دیگر حسگرها ترکیب می‌کنند.

با این حال، عملکرد بینایی ماشین ممکن است تحت تأثیر باران، مه، تاریکی، انعکاس نور یا انسداد دید قرار گیرد.

به همین دلیل، ایمنی سامانه‌های خودران به مجموعه‌ای از اجزای فنی، آزمون‌ها و سازوکارهای کنترلی وابسته است.

بینایی ماشین در رباتیک

ربات‌ها می‌توانند از بینایی ماشین برای شناسایی اشیا، تخمین فاصله، تشخیص موانع و هدایت حرکت استفاده کنند.

برای مثال، یک ربات صنعتی ممکن است قطعات موجود روی خط تولید را شناسایی و موقعیت آنها را برای بازوی مکانیکی تعیین کند.

در ربات‌های متحرک، بینایی ماشین می‌تواند در کنار حسگرهای دیگر به ناوبری و نقشه‌سازی کمک کند.

بینایی صنعتی

بینایی صنعتی (Machine Vision) به کاربرد سامانه‌های تصویربرداری و تحلیل تصویر در محیط‌های صنعتی، به‌ویژه تولید و کنترل کیفیت، گفته می‌شود.

بینایی صنعتی با بینایی ماشین ارتباط نزدیک دارد، اما معمولاً بر کاربردهای عملی در خطوط تولید، اندازه‌گیری، بازرسی و هدایت تجهیزات تمرکز می‌کند.

برای مثال، یک سامانهٔ بینایی صنعتی می‌تواند قطعات معیوب را روی نوار نقاله شناسایی کند.

بنابراین بینایی صنعتی را می‌توان یکی از حوزه‌های کاربردی مرتبط با بینایی ماشین دانست، نه مترادف کامل آن.

کنترل کیفیت صنعتی

در خطوط تولید، سامانه‌های بینایی ماشین می‌توانند برای بررسی ظاهر محصولات استفاده شوند.

این بررسی ممکن است شامل تشخیص ترک، خراش، تغییر شکل، نقص مونتاژ یا اشتباه در بسته‌بندی باشد.

کارایی چنین سامانه‌هایی به کیفیت تصویربرداری، نورپردازی و شرایط محیط وابسته است.

بینایی ماشین در کشاورزی

بینایی ماشین در کشاورزی برای تحلیل وضعیت گیاهان، شناسایی برخی آفات و بیماری‌ها، ارزیابی رشد محصول و مدیریت ماشین‌آلات کشاورزی استفاده می‌شود.

تصاویر ممکن است از دوربین‌های زمینی، پهپادها یا ماهواره‌ها به دست آمده باشند.

این سامانه‌ها می‌توانند به کشاورزان در پایش زمین و تصمیم‌گیری کمک کنند.

اما عملکرد مدل باید با شرایط اقلیمی، نوع محصول و داده‌های محلی سازگار باشد.

بینایی ماشین در تصاویر ماهواره‌ای

تحلیل تصاویر ماهواره‌ای یکی از کاربردهای مهم بینایی ماشین و سنجش از دور است.

الگوریتم‌ها می‌توانند برای شناسایی تغییرات پوشش زمین، گسترش مناطق شهری، بررسی جنگل‌ها و پایش برخی رخدادهای محیطی استفاده شوند.

داده‌های ماهواره‌ای ممکن است علاوه بر نور مرئی، شامل باندهای طیفی دیگری باشند.

بنابراین تحلیل آنها گاهی به روش‌های تخصصی پردازش داده‌های چندطیفی نیاز دارد.

بینایی ماشین و محیط زیست

بینایی ماشین می‌تواند در پایش حیات وحش، بررسی پوشش گیاهی، تحلیل تصاویر جنگل‌ها و شناسایی تغییرات محیطی کاربرد داشته باشد.

برای مثال، تصاویر دوربین‌های تله‌ای حیات وحش می‌توانند با استفاده از مدل‌های تشخیص تصویر بررسی شوند.

این فناوری می‌تواند حجم کار تحلیل تصاویر را کاهش دهد، اما نتایج آن باید از نظر خطاهای شناسایی ارزیابی شوند.

بینایی ماشین در میراث فرهنگی

در پژوهش‌های میراث فرهنگی، بینایی ماشین می‌تواند برای بازسازی سه‌بعدی بناها، تحلیل تصاویر آثار تاریخی و تطبیق تصاویر قدیمی و جدید استفاده شود.

روش‌های فتوگرامتری و بازسازی سه‌بعدی در مستندسازی بناها و اشیای تاریخی اهمیت دارند.

این فناوری همچنین می‌تواند به ثبت دیجیتال وضعیت آثار و بررسی تغییرات آنها در طول زمان کمک کند.

بینایی ماشین و اسناد تاریخی

بینایی ماشین در دیجیتال‌سازی و تحلیل اسناد تاریخی کاربرد دارد.

از جمله وظایف مرتبط می‌توان به شناسایی ساختار صفحه، تشخیص نواحی متن، جداسازی تصاویر و آماده‌سازی داده برای تشخیص نویسه‌ها اشاره کرد.

تشخیص نوری نویسه‌ها (OCR) یکی از فناوری‌های مرتبط است که متن موجود در تصویر را به دادهٔ متنی تبدیل می‌کند.

در اسناد تاریخی، کیفیت کاغذ، فرسودگی، نوع خط و وضوح تصویر می‌توانند بر نتیجه تأثیر بگذارند.

بینایی ماشین و زبان فارسی

بینایی ماشین در پردازش اسناد فارسی و شناسایی نوشته‌های فارسی نیز کاربرد دارد.

یکی از مسائل مهم، تشخیص متن در تصاویر و اسناد اسکن‌شده است.

ویژگی‌هایی مانند پیوستگی حروف، شکل‌های متفاوت نویسه‌ها و وجود نقطه‌ها می‌توانند بر طراحی سامانه‌های تشخیص متن تأثیر بگذارند.

در متون تاریخی، تفاوت خط، کیفیت چاپ و آسیب‌دیدگی اسناد دشواری بیشتری ایجاد می‌کند.

سامانه‌های پردازش اسناد فارسی می‌توانند از ترکیب بینایی ماشین و پردازش زبان طبیعی استفاده کنند.

بینایی ماشین در آموزش

بینایی ماشین در ابزارهای آموزشی، تحلیل تصاویر علمی و سامانه‌های کمک‌آموزشی کاربرد دارد.

برای مثال، یک برنامهٔ آموزشی می‌تواند تصویر یک نمودار یا شکل هندسی را دریافت و اجزای آن را شناسایی کند.

در ابزارهای دسترس‌پذیری نیز سامانه‌های توصیف تصویر می‌توانند به کاربران نابینا یا کم‌بینا کمک کنند.

با این حال، اطلاعات تولیدشده توسط این سامانه‌ها باید از نظر دقت و محدودیت‌های کاربرد بررسی شود.

بینایی ماشین در ورزش

در ورزش، بینایی ماشین برای تحلیل حرکت بازیکنان، ردیابی توپ، بررسی وضعیت بدن و تحلیل ویدئو استفاده می‌شود.

این فناوری می‌تواند در آموزش ورزشکاران، تحلیل مسابقات و برخی سامانه‌های داوری کمکی کاربرد داشته باشد.

دقت نتیجه به کیفیت دوربین‌ها، زاویهٔ دید و روش پردازش داده وابسته است.

بینایی ماشین و واقعیت افزوده

واقعیت افزوده (Augmented Reality) فناوری‌ای است که اطلاعات یا عناصر دیجیتال را با نمای محیط واقعی ترکیب می‌کند.

بینایی ماشین می‌تواند برای شناسایی سطوح، تخمین حرکت دوربین و تعیین موقعیت عناصر مجازی استفاده شود.

این فناوری در آموزش، طراحی، بازی و کاربردهای صنعتی مورد استفاده قرار می‌گیرد.

مجموعه‌داده‌های بینایی ماشین

توسعه و ارزیابی مدل‌های بینایی ماشین به مجموعه‌داده‌های مناسب نیاز دارد.

این مجموعه‌ها ممکن است شامل تصاویر، برچسب‌های طبقه‌بندی، کادرهای اشیا یا نقشه‌های بخش‌بندی باشند.

از مجموعه‌داده‌های شناخته‌شده می‌توان به ImageNet، COCO و MNIST اشاره کرد.

هر مجموعه‌داده برای هدف مشخصی طراحی شده و محدودیت‌های خاص خود را دارد.

برای مثال، عملکرد مناسب یک مدل روی یک مجموعه‌دادهٔ معیار لزوماً نشان‌دهندهٔ عملکرد مشابه در همهٔ محیط‌های واقعی نیست.

آموزش مدل‌های بینایی ماشین

در روش‌های مبتنی بر یادگیری نظارت‌شده، مدل با استفاده از نمونه‌های دارای برچسب آموزش داده می‌شود.

برای مثال، تصاویر ممکن است با نام اشیای موجود در آنها برچسب‌گذاری شوند.

مدل با مقایسهٔ خروجی خود و برچسب هدف، پارامترهایش را تنظیم می‌کند.

در روش‌های خودنظارت‌شده، بخشی از اطلاعات آموزشی از ساختار خود داده به دست می‌آید.

انتخاب روش آموزش به نوع وظیفه، داده و منابع محاسباتی بستگی دارد.

افزایش داده

افزایش داده (Data Augmentation) به ایجاد تغییرات کنترل‌شده در نمونه‌های آموزشی گفته می‌شود.

برای مثال، ممکن است تصویر چرخانده، برش داده یا روشنایی آن تغییر داده شود.

هدف این است که مدل با تنوع بیشتری از نمونه‌ها روبه‌رو شود و در شرایط متفاوت عملکرد مناسب‌تری داشته باشد.

البته همهٔ تغییرات برای همهٔ وظایف مجاز یا مفید نیستند.

برای مثال، در برخی کاربردهای پزشکی، تغییر نامناسب تصویر ممکن است اطلاعات مهمی را مخدوش کند.

ارزیابی مدل‌های بینایی ماشین

ارزیابی مدل‌های بینایی ماشین باید بر اساس وظیفهٔ مورد نظر انجام شود.

در طبقه‌بندی، معیارهایی مانند دقت، بازخوانی و امتیاز F1 استفاده می‌شوند.

در تشخیص اشیا، معیارهایی مانند میانگین دقت متوسط (mAP) رایج هستند.

در بخش‌بندی تصویر، معیارهایی مانند اشتراک بر اجتماع (IoU) و ضریب Dice کاربرد دارند.

انتخاب معیار باید با هدف عملی سامانه هماهنگ باشد.

دقت و خطا

یکی از مسائل مهم در ارزیابی بینایی ماشین، تفاوت میان دقت آزمایشگاهی و عملکرد واقعی است.

مدلی که در مجموعه‌داده‌ای مشخص عملکرد بالایی دارد، ممکن است در محیطی با نور، زاویه یا کیفیت تصویر متفاوت دچار خطا شود.

به همین دلیل، ارزیابی باید تا حد امکان شامل داده‌هایی نزدیک به شرایط واقعی استفاده باشد.

محدودیت‌های بینایی ماشین

بینایی ماشین با وجود پیشرفت‌های گسترده محدودیت‌هایی دارد.

یکی از این محدودیت‌ها وابستگی عملکرد به کیفیت تصویر است.

نور نامناسب، تاری، انسداد، زاویهٔ دید غیرمعمول و نویز می‌توانند تشخیص را دشوار کنند.

محدودیت دیگر، وابستگی بسیاری از مدل‌ها به داده‌های آموزشی است.

اگر شرایط واقعی با داده‌های آموزش تفاوت زیادی داشته باشد، عملکرد مدل ممکن است کاهش یابد.

تغییر توزیع داده

تغییر توزیع داده (Distribution Shift) زمانی رخ می‌دهد که داده‌های زمان استفاده با داده‌های آموزش یا ارزیابی تفاوت معناداری داشته باشند.

برای مثال، مدلی که با تصاویر روز آموزش دیده ممکن است در تصاویر شب عملکرد ضعیف‌تری داشته باشد.

این مسئله در سامانه‌های صنعتی، پزشکی و حمل‌ونقل اهمیت ویژه‌ای دارد.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم بینایی ماشین است.

اگر داده‌های آموزشی پوشش نامتوازنی از شرایط، گروه‌ها یا محیط‌های مختلف داشته باشند، عملکرد مدل ممکن است برای برخی گروه‌ها یا شرایط ضعیف‌تر باشد.

این مسئله در سامانه‌های تشخیص چهره و تصمیم‌گیری مبتنی بر تصویر اهمیت ویژه‌ای دارد.

ارزیابی منصفانه باید تفاوت نرخ خطا میان گروه‌ها و شرایط مختلف را نیز بررسی کند.

حریم خصوصی و نظارت تصویری

بینایی ماشین می‌تواند در سامانه‌های نظارتی برای شناسایی اشیا، ردیابی افراد یا تحلیل رفتارهای تصویری استفاده شود.

این کاربردها می‌توانند مسائل مهمی دربارهٔ حریم خصوصی، رضایت، نگهداری داده و نظارت عمومی ایجاد کنند.

استفاده از تشخیص چهره برای شناسایی افراد در فضاهای عمومی، به‌ویژه در صورت نبود شفافیت و نظارت مستقل، می‌تواند خطرهایی برای آزادی‌های مدنی به همراه داشته باشد.

ارزیابی این خطرها باید با توجه به کاربرد مشخص، قوانین مربوط و آثار واقعی سامانه انجام شود.

بینایی ماشین و حقوق بشر

کاربرد بینایی ماشین در شناسایی افراد، نظارت عمومی و تحلیل رفتار می‌تواند با حقوق بنیادین شهروندان ارتباط پیدا کند.

از جمله مسائل مهم می‌توان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و حق برخورداری از رفتار برابر اشاره کرد.

استفاده از سامانه‌های تشخیص چهره در محیط‌های عمومی ممکن است به شناسایی و ردیابی افراد بدون اطلاع یا رضایت آنان منجر شود.

در چنین مواردی، ضرورت قانونی‌بودن، تناسب، شفافیت و پاسخگویی از موضوعات مهم ارزیابی حقوق بشری است.

بینایی ماشین و امنیت

سامانه‌های بینایی ماشین ممکن است در معرض حملات فنی قرار گیرند.

یکی از نمونه‌ها، حملات خصمانه است که در آن تغییرات طراحی‌شده در تصویر می‌تواند مدل را به تشخیص نادرست سوق دهد.

این مسئله در سامانه‌های امنیتی و کاربردهای حساس اهمیت دارد.

همچنین دست‌کاری داده‌های آموزشی یا تصاویر ورودی می‌تواند بر عملکرد سامانه اثر بگذارد.

تصاویر ساختگی و دیپ‌فیک

پیشرفت هوش مصنوعی مولد موجب گسترش امکان تولید تصاویر و ویدئوهای مصنوعی شده است.

اصطلاح دیپ‌فیک معمولاً به محتوای مصنوعی یا دست‌کاری‌شده‌ای اشاره دارد که می‌تواند چهره، صدا یا رفتار فردی را به‌صورت گمراه‌کننده بازنمایی کند.

بینایی ماشین می‌تواند در پژوهش‌های تشخیص دست‌کاری تصویر و تحلیل اصالت محتوا به کار رود.

با این حال، هیچ روش تشخیص خودکاری را نباید برای همهٔ انواع تصاویر و ویدئوهای مصنوعی بی‌خطا فرض کرد.

بینایی ماشین و توهم هوش مصنوعی

در سامانه‌هایی که بینایی ماشین را با مدل‌های زبانی ترکیب می‌کنند، امکان تولید توصیف‌های نادرست از تصویر وجود دارد.

برای مثال، مدل ممکن است شیئی را در تصویر توصیف کند که واقعاً وجود ندارد یا رابطهٔ میان اشیا را اشتباه تشخیص دهد.

این مسئله با توهم هوش مصنوعی ارتباط دارد.

در کاربردهای پژوهشی و دانشنامه‌ای، توصیف تولیدشده توسط مدل باید با تصویر اصلی و منابع مستقل تطبیق داده شود.

تفسیرپذیری بینایی ماشین

بسیاری از مدل‌های عمیق بینایی ماشین دارای تعداد زیادی پارامتر هستند.

در چنین مدل‌هایی، توضیح دقیق اینکه چرا تصویر به یک دستهٔ مشخص نسبت داده شده ممکن است دشوار باشد.

پژوهشگران روش‌هایی مانند نقشه‌های برجستگی و تحلیل حساسیت را برای بررسی عوامل مؤثر بر پیش‌بینی توسعه داده‌اند.

با این حال، نمایش نواحی مورد توجه مدل لزوماً توضیح کامل و قطعی تصمیم آن نیست.

مصرف انرژی و منابع محاسباتی

آموزش برخی مدل‌های بزرگ بینایی ماشین می‌تواند به سخت‌افزار و انرژی قابل توجهی نیاز داشته باشد.

هزینهٔ محاسباتی به اندازهٔ مدل، وضوح تصویر، حجم داده، تعداد مراحل آموزش و نوع سخت‌افزار بستگی دارد.

در کاربردهای عملی، بهینه‌سازی مدل برای اجرا روی دستگاه‌های کم‌مصرف نیز اهمیت دارد.

بینایی ماشین و تمرکز قدرت فناوری

توسعهٔ مدل‌های بزرگ و مجموعه‌داده‌های گسترده ممکن است به سرمایه و زیرساخت محاسباتی قابل توجه نیاز داشته باشد.

این مسئله می‌تواند مشارکت مؤسسات دارای منابع محدود را دشوار کند.

در مقابل، انتشار کدهای پژوهشی، مجموعه‌داده‌های مجاز و مدل‌های قابل استفادهٔ عمومی می‌تواند دسترسی پژوهشگران بیشتری را فراهم سازد.

البته انتشار داده‌های تصویری باید با رعایت حقوق افراد و الزامات حریم خصوصی انجام شود.

بینایی ماشین و دانشنامه‌نویسی

بینایی ماشین می‌تواند در گردآوری، سامان‌دهی و تحلیل منابع تصویری دانشنامه‌ها کاربرد داشته باشد.

برای مثال، این فناوری ممکن است برای شناسایی متن در اسناد اسکن‌شده، طبقه‌بندی تصاویر، تشخیص تصاویر مشابه یا بررسی کیفیت فایل‌های تصویری استفاده شود.

در دانشنامه‌نویسی تاریخی، بینایی ماشین می‌تواند به آماده‌سازی اسناد و تصاویر برای بررسی پژوهشگران کمک کند.

با این حال، خروجی سامانه نباید جایگزین بررسی منبع اصلی شود.

تشخیص خودکار چهره، مکان یا تاریخ یک عکس ممکن است اشتباه باشد.

بنابراین اطلاعات مربوط به هویت اشخاص، زمان ثبت تصاویر و اصالت اسناد باید با منابع معتبر راستی‌آزمایی شود.

آیندهٔ بینایی ماشین

پژوهش دربارهٔ بینایی ماشین در زمینه‌های متعددی ادامه دارد.

از جمله موضوعات مهم می‌توان به توسعهٔ مدل‌های چندوجهی، بهبود تحلیل ویدئو، پردازش سه‌بعدی، کاهش نیاز به داده‌های برچسب‌دار، افزایش کارایی محاسباتی و بهبود قابلیت اعتماد اشاره کرد.

یکی از جهت‌گیری‌های مهم، توسعهٔ سامانه‌هایی است که بتوانند اطلاعات بصری را با زبان، صوت و دیگر انواع داده ترکیب کنند.

همچنین افزایش شفافیت، کاهش سوگیری و حفاظت از حریم خصوصی از مسائل مهم آیندهٔ این حوزه خواهند بود.

تفاوت بینایی ماشین و پردازش تصویر

پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند.

پردازش تصویر معمولاً بر تبدیل یا بهبود داده‌های تصویری تمرکز دارد.

در مقابل، بینایی ماشین به استخراج اطلاعات و استنتاج دربارهٔ محتوای تصویر می‌پردازد.

برای مثال، کاهش نویز یک عکس نمونه‌ای از پردازش تصویر است.

تشخیص اینکه در همان عکس چه اشیایی وجود دارند، نمونه‌ای از وظایف بینایی ماشین است.

البته در بسیاری از سامانه‌ها، این دو حوزه با یکدیگر ترکیب می‌شوند.

تفاوت بینایی ماشین و یادگیری عمیق

یادگیری عمیق حوزه‌ای از یادگیری ماشین است که عمدتاً از شبکه‌های عصبی چندلایه استفاده می‌کند.

بینایی ماشین حوزه‌ای کاربردی و پژوهشی برای تحلیل داده‌های بصری است.

بسیاری از روش‌های جدید بینایی ماشین از یادگیری عمیق بهره می‌گیرند، اما همهٔ روش‌های بینایی ماشین مبتنی بر یادگیری عمیق نیستند.

روش‌های هندسی، پردازش تصویر و الگوریتم‌های کلاسیک نیز بخش مهمی از این حوزه را تشکیل می‌دهند.

تفاوت بینایی ماشین و هوش مصنوعی مولد

بینایی ماشین عمدتاً به تحلیل و استخراج اطلاعات از تصاویر و ویدئوها می‌پردازد.

هوش مصنوعی مولد بر تولید داده یا محتوای جدید تمرکز دارد.

یک سامانهٔ تشخیص اشیا نمونه‌ای از کاربرد بینایی ماشین است.

یک سامانهٔ تولید تصویر از متن نمونه‌ای از هوش مصنوعی مولد محسوب می‌شود.

با این حال، سامانه‌های جدید ممکن است هر دو قابلیت را در یک معماری ترکیب کنند.

جمع‌بندی

بینایی ماشین یکی از حوزه‌های بنیادی هوش مصنوعی است که به توسعهٔ روش‌های محاسباتی برای استخراج و تحلیل اطلاعات از تصاویر و ویدئوها می‌پردازد.

این حوزه از پژوهش‌های اولیهٔ پردازش تصویر و هندسهٔ تصویری در میانهٔ سدهٔ بیستم شکل گرفت و به‌تدریج به موضوعاتی مانند تشخیص اشیا، تحلیل حرکت، بازسازی سه‌بعدی و درک صحنه گسترش یافت.

از دههٔ ۲۰۱۰، پیشرفت شبکه‌های عصبی مصنوعی و یادگیری عمیق موجب تحول مهمی در بسیاری از وظایف بینایی ماشین شد. توسعهٔ AlexNet، ResNet، U-Net و ترنسفورمرهای بینایی از مراحل اثرگذار این تحول بودند.[۵][۶][۸][۷]

امروزه بینایی ماشین در پزشکی، صنعت، رباتیک، حمل‌ونقل، کشاورزی، پژوهش و تحلیل اسناد کاربرد دارد.

با این حال، محدودیت‌های فنی، وابستگی به کیفیت داده، سوگیری الگوریتمی، خطر خطا در شرایط واقعی و مسائل مربوط به حریم خصوصی و نظارت تصویری از چالش‌های مهم آن به شمار می‌روند.

اهمیت بینایی ماشین در آن است که یکی از ابزارهای اصلی تبدیل داده‌های بصری به اطلاعات قابل استفاده برای سامانه‌های محاسباتی را فراهم می‌کند؛ ابزاری که با گسترش هوش مصنوعی چندوجهی، نقش آن در فناوری و جامعه افزایش یافته است.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” IEEE Conference on Computer Vision and Pattern Recognition, 2009. متن مقاله
  • Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” International Conference on Learning Representations, 2021. متن مقاله
  • Hartley, Richard, and Andrew Zisserman. Multiple View Geometry in Computer Vision. 2nd ed. Cambridge: Cambridge University Press, 2004.
  • He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016. متن مقاله
  • Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012). متن مقاله
  • LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444. متن مقاله
  • Marr, David. Vision: A Computational Investigation into the Human Representation and Processing of Visual Information. San Francisco: W. H. Freeman, 1982.
  • Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” Medical Image Computing and Computer-Assisted Intervention, 2015. متن مقاله


```