بینایی ماشین: تفاوت میان نسخهها
Alireza k h (بحث | مشارکتها) صفحهای تازه حاوی «```wiki {{جعبه اطلاعات مفهوم | نام = شبکهٔ عصبی مصنوعی | نام اصلی = Artificial Neural Network | نامهای دیگر = شبکهٔ عصبی، شبکهٔ نورونی مصنوعی، ANN | تصویر = | اندازه تصویر = | توضیح تصویر = | حوزه = هوش مصنوعی، یادگیری ماش...» ایجاد کرد |
Alireza k h (بحث | مشارکتها) بدون خلاصۀ ویرایش |
||
| (یک نسخهٔ میانیِ ایجادشده توسط همین کاربر نشان داده نشد) | |||
| خط ۱: | خط ۱: | ||
{{جعبه اطلاعات مفهوم | {{جعبه اطلاعات مفهوم | ||
| نام = | | نام = بینایی ماشین | ||
| نام اصلی = | | نام اصلی = Computer Vision | ||
| نامهای دیگر = | | نامهای دیگر = بینایی رایانهای، بینایی کامپیوتری | ||
| تصویر = | | تصویر = | ||
| اندازه تصویر = | | اندازه تصویر = | ||
| توضیح تصویر = | | توضیح تصویر = | ||
| حوزه = [[هوش مصنوعی]]، [[ | | حوزه = [[هوش مصنوعی]]، [[علوم رایانه]]، [[یادگیری ماشین]]، [[یادگیری عمیق]]، پردازش تصویر | ||
| دوره = از دههٔ | | دوره = شکلگیری پژوهشهای اولیه در دهههای ۱۹۵۰ و ۱۹۶۰ میلادی؛ گسترش گسترده از دههٔ ۱۹۷۰ تاکنون | ||
| خاستگاه = | | خاستگاه = علوم رایانه، پردازش سیگنال، هندسه، عکاسی، رباتیک و پژوهشهای هوش مصنوعی | ||
| تاریخ شکلگیری = | | تاریخ شکلگیری = فاقد تاریخ تأسیس واحد؛ توسعه بهعنوان حوزهای پژوهشی از دههٔ ۱۹۶۰ میلادی | ||
| بنیانگذاران = فاقد بنیانگذار | | بنیانگذاران = فاقد بنیانگذار واحد | ||
| چهرههای شاخص = | | چهرههای شاخص = لارنس رابرتس، دیوید مار، برتولد هورن، توماسو پوجو، ریچارد هارتلی، اندرو زیسرمن، یان لکون، فِیفِی لی، ریچارد سزلیسکی | ||
| پیشگامان فکری = پژوهشگران | | پیشگامان فکری = پژوهشگران ادراک بصری، هندسهٔ تصویری، پردازش سیگنال، علوم شناختی و هوش مصنوعی | ||
| جریانهای مرتبط = | | جریانهای مرتبط = بینایی محاسباتی، پردازش تصویر، تشخیص الگو، [[شبکه عصبی مصنوعی]]، [[یادگیری عمیق]]، [[ترنسفورمر]]، رباتیک | ||
| در واکنش به = | | در واکنش به = مسئلهٔ استخراج اطلاعات و بازنمایی ساختار جهان از تصاویر و دادههای بصری | ||
| مفاهیم کلیدی = | | مفاهیم کلیدی = پیکسل، استخراج ویژگی، طبقهبندی تصویر، تشخیص شیء، بخشبندی تصویر، ردیابی، جریان نوری، بازسازی سهبعدی، تخمین عمق، تشخیص چهره | ||
| دیدگاه معرفتشناختی = | | دیدگاه معرفتشناختی = استنتاج اطلاعات دربارهٔ اشیا، صحنهها، حرکت و ساختار محیط از دادههای بصری و مدلهای محاسباتی | ||
| دیدگاه اجتماعی = کاربرد در پزشکی، صنعت، | | دیدگاه اجتماعی = کاربرد در پزشکی، صنعت، حملونقل، کشاورزی، پژوهش و فناوریهای نظارتی؛ همراه با مسائل حریم خصوصی، تبعیض، امنیت و پاسخگویی | ||
| تأثیرپذیرفته از = | | تأثیرپذیرفته از = علوم اعصاب بینایی، روانشناسی ادراک، هندسه، آمار، یادگیری ماشین و پردازش سیگنال | ||
| تأثیرگذار بر = | | تأثیرگذار بر = خودروهای خودران، رباتیک، تصویربرداری پزشکی، واقعیت افزوده، سامانههای نظارتی، [[هوش مصنوعی مولد]] و مدلهای چندوجهی | ||
| منتقدان شاخص = | | منتقدان شاخص = پژوهشگران اخلاق هوش مصنوعی، حقوق دیجیتال، حریم خصوصی و عدالت الگوریتمی | ||
| آثار شاخص = ''A | | آثار شاخص = ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information''؛ ''Multiple View Geometry in Computer Vision''؛ ''Computer Vision: Algorithms and Applications''؛ ''ImageNet Classification with Deep Convolutional Neural Networks'' | ||
}} | }} | ||
''' | '''بینایی ماشین''' (به انگلیسی: ''Computer Vision'')، که با نامهای '''بینایی رایانهای''' و '''بینایی کامپیوتری''' نیز شناخته میشود، شاخهای از [[هوش مصنوعی]] و [[علوم رایانه]] است که به توسعهٔ روشها و سامانههایی برای استخراج، پردازش و تفسیر اطلاعات از تصاویر و ویدئوها میپردازد. هدف این حوزه آن است که رایانه بتواند از دادههای بصری، اطلاعاتی دربارهٔ اشیا، ویژگیها، روابط مکانی، حرکت و ساختار محیط به دست آورد و از آنها در انجام وظایف مشخص استفاده کند.<ref name="szeliski">[https://link.springer.com/book/10.1007/978-3-030-34372-9 Szeliski, Richard. ''Computer Vision: Algorithms and Applications''. 2nd ed. Springer, 2022.]</ref> | ||
بینایی ماشین از مبانی ریاضی، هندسه، آمار، پردازش تصویر و [[یادگیری ماشین]] بهره میگیرد. این حوزه در دهههای نخست شکلگیری خود عمدتاً بر روشهای هندسی و الگوریتمهای طراحیشده توسط پژوهشگران استوار بود، اما از دههٔ ۲۰۱۰، استفاده از [[شبکه عصبی مصنوعی|شبکههای عصبی مصنوعی]] و [[یادگیری عمیق]] موجب تحول گستردهای در بسیاری از کاربردهای آن شد.<ref name="lecun">[https://doi.org/10.1038/nature14539 LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444.]</ref> | |||
امروزه بینایی ماشین در تشخیص اشیا، تحلیل تصاویر پزشکی، هدایت رباتها، خودروهای خودران، کنترل کیفیت صنعتی، کشاورزی هوشمند، تحلیل تصاویر ماهوارهای، واقعیت افزوده و سامانههای چندوجهی هوش مصنوعی کاربرد دارد. در کنار این قابلیتها، استفاده از آن در شناسایی چهره و نظارت تصویری، پرسشهای مهمی دربارهٔ حریم خصوصی، حقوق شهروندی، [[سوگیری الگوریتمی]] و پاسخگویی ایجاد کرده است. | |||
== تعریف و ماهیت بینایی ماشین == | |||
بینایی ماشین مجموعهای از نظریهها، الگوریتمها و سامانههای محاسباتی است که برای استخراج اطلاعات معنادار از دادههای بصری توسعه یافتهاند. | |||
این دادهها ممکن است از دوربینهای معمولی، دوربینهای عمقسنج، سامانههای تصویربرداری پزشکی، ماهوارهها، میکروسکوپها یا حسگرهای تخصصی به دست آمده باشند. | |||
برای مثال، یک سامانهٔ بینایی ماشین ممکن است تصویری از یک خیابان را دریافت کند و وظیفه داشته باشد خودروها، عابران پیاده، علائم راهنمایی و خطوط مسیر را شناسایی کند. | |||
در | سامانهای دیگر ممکن است تصویر پزشکی را بررسی و ناحیهای را که احتمال وجود یک ضایعه در آن بیشتر است مشخص کند. | ||
برای | در هر دو نمونه، هدف تبدیل دادهٔ تصویری به اطلاعات قابل استفاده برای یک وظیفهٔ مشخص است. | ||
این | با این حال، تشخیص یک الگو در تصویر لزوماً به معنای فهم کامل صحنه به شیوهٔ انسانی نیست. | ||
== | == تفاوت بینایی ماشین و بینایی انسان == | ||
بینایی انسان فرایندی زیستی و شناختی است که از تعامل چشم، دستگاه عصبی و مغز شکل میگیرد. | |||
انسان هنگام مشاهدهٔ یک صحنه، اطلاعات بصری را با حافظه، تجربه، دانش پیشین و دیگر حواس خود ترکیب میکند. | |||
در مقابل، سامانههای بینایی ماشین از حسگرها، دادههای دیجیتال، مدلهای ریاضی و الگوریتمهای محاسباتی استفاده میکنند. | |||
یک سامانه ممکن است در تشخیص نوع مشخصی از الگو عملکرد بسیار دقیقی داشته باشد، اما در برابر تغییر نور، زاویهٔ دید، شرایط محیط یا دادههای ناآشنا دچار خطا شود. | |||
بنابراین، توانایی یک سامانه در تشخیص تصویر را نباید معادل برخورداری از ادراک یا آگاهی انسانی دانست. | |||
== | == تاریخچهٔ بینایی ماشین == | ||
=== | === پژوهشهای اولیه === | ||
در | ریشههای بینایی ماشین به پژوهشهای مرتبط با پردازش تصویر، هندسهٔ تصویری، تشخیص الگو و هوش مصنوعی در میانهٔ سدهٔ بیستم بازمیگردد. | ||
در دهههای ۱۹۵۰ و ۱۹۶۰، پژوهشگران تلاش کردند روشهایی برای تشخیص اشکال هندسی، استخراج خطوط و بازسازی ساختار اشیا از تصاویر توسعه دهند. | |||
لارنس رابرتس از پژوهشگران اثرگذار اولیه در تحلیل رایانهای تصاویر سهبعدی بود. | |||
در این | در این دوره، یکی از پرسشهای بنیادی آن بود که چگونه میتوان از یک تصویر دوبعدی، اطلاعاتی دربارهٔ ساختار سهبعدی جهان به دست آورد. | ||
=== گسترش پژوهشها در دههٔ ۱۹۷۰ === | |||
در دههٔ ۱۹۷۰، پژوهشهای بینایی ماشین به موضوعاتی مانند تشخیص لبه، بازسازی سهبعدی، تحلیل حرکت و بازنمایی هندسی صحنه گسترش یافت. | |||
پژوهشگران تلاش کردند میان ویژگیهای تصویر و ساختار فیزیکی اشیای موجود در جهان ارتباط برقرار کنند. | |||
در این دوره، هندسه و مدلسازی ریاضی نقش مهمی در توسعهٔ الگوریتمهای بینایی ماشین داشتند. | |||
=== دیدگاه محاسباتی دیوید مار === | |||
دیوید مار، پژوهشگر علوم اعصاب و بینایی محاسباتی، در کتاب ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information'' که در سال ۱۹۸۲ منتشر شد، چارچوبی اثرگذار برای مطالعهٔ بینایی ارائه کرد. | |||
او بر ضرورت بررسی مسئلهٔ بینایی در سطوح مختلف، از هدف محاسباتی گرفته تا بازنمایی و پیادهسازی، تأکید داشت. | |||
این دیدگاه در شکلگیری مباحث نظری بینایی محاسباتی و علوم شناختی تأثیرگذار بود. | |||
=== توسعهٔ روشهای هندسی === | |||
در دهههای ۱۹۸۰ و ۱۹۹۰، روشهای هندسی و آماری بینایی ماشین پیشرفت کردند. | |||
موضوعاتی مانند تطبیق نقاط میان تصاویر، تخمین حرکت دوربین، بازسازی سهبعدی و تحلیل تصاویر چنددوربینی از محورهای مهم پژوهش بودند. | |||
کتاب ''Multiple View Geometry in Computer Vision'' نوشتهٔ ریچارد هارتلی و اندرو زیسرمن از منابع مهم این حوزه است.<ref name="hartley">[https://www.cambridge.org/core/books/multiple-view-geometry-in-computer-vision/0B6F289C78B2B23FDE7A1F5D6C9B4F2B Hartley, Richard, and Andrew Zisserman. ''Multiple View Geometry in Computer Vision''. 2nd ed. Cambridge University Press, 2004.]</ref> | |||
=== ظهور مجموعهدادههای بزرگ === | |||
با افزایش ظرفیت ذخیرهسازی و توان محاسباتی، مجموعهدادههای تصویری بزرگتری برای آموزش و ارزیابی الگوریتمها ایجاد شدند. | |||
یکی از مهمترین آنها ImageNet بود که در سال ۲۰۰۹ در مقالهای از جیا دنگ و همکاران معرفی شد. | |||
ImageNet مجموعهای گسترده از تصاویر سازماندهیشده بر اساس مفاهیم و دستههای معنایی است و در توسعهٔ پژوهشهای تشخیص تصویر نقش مهمی داشته است.<ref name="imagenet">[https://www.image-net.org/static_files/papers/imagenet_cvpr09.pdf Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” ''IEEE Conference on Computer Vision and Pattern Recognition'', 2009.]</ref> | |||
=== تحول یادگیری عمیق در سال ۲۰۱۲ === | |||
یکی از نقاط عطف مهم بینایی ماشین در سال ۲۰۱۲ رخ داد. | |||
الکس کریژفسکی، ایلیا سوتسکِوِر و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقهبندی تصاویر ImageNet معرفی کردند. | |||
این مدل که بعدها با نام AlexNet شناخته شد، در رقابت ImageNet سال ۲۰۱۲ عملکرد برجستهای داشت و به گسترش استفاده از یادگیری عمیق در بینایی ماشین کمک کرد.<ref name="alexnet">[https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” ''Advances in Neural Information Processing Systems'' 25 (2012).]</ref> | |||
شبکههای | پس از آن، شبکههای عصبی پیچشی در بسیاری از وظایف تشخیص و تحلیل تصویر به روشهای اصلی تبدیل شدند. | ||
=== شبکههای عمیقتر و ResNet === | |||
در سال ۲۰۱۵، کایمینگ هه و همکاران معماری ResNet را معرفی کردند. | |||
این | این معماری از اتصالات باقیمانده برای تسهیل آموزش شبکههای عمیقتر استفاده میکرد. | ||
= | ResNet در توسعهٔ شبکههای پیچشی عمیق و کاربردهای تشخیص تصویر تأثیرگذار بود.<ref name="resnet">[https://arxiv.org/abs/1512.03385 He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” 2015.]</ref> | ||
=== ورود ترنسفورمرها به بینایی ماشین === | |||
در سال ۲۰۲۰، پژوهشگران مدل Vision Transformer یا ViT را معرفی کردند. | |||
این مدل از معماری [[ترنسفورمر]] برای پردازش تصویر استفاده میکند. | |||
در این روش، تصویر به قطعههایی تقسیم میشود و هر قطعه به بازنمایی عددی تبدیل میشود. | |||
سپس روابط میان این قطعهها با استفاده از سازوکار توجه پردازش میشود.<ref name="vit">[https://arxiv.org/abs/2010.11929 Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” 2020.]</ref> | |||
این تحول نشان داد که ترنسفورمرها میتوانند در کنار شبکههای پیچشی، نقش مهمی در تحلیل تصاویر ایفا کنند. | |||
== مبانی علمی بینایی ماشین == | |||
بینایی ماشین بر مجموعهای از مبانی علمی و فنی استوار است. | |||
این مبانی شامل تشکیل تصویر، پردازش سیگنال، هندسه، آمار، بهینهسازی و یادگیری ماشین هستند. | |||
در بسیاری از مسائل، شناخت نحوهٔ تشکیل تصویر به اندازهٔ انتخاب الگوریتم اهمیت دارد. | |||
برای مثال، یک شیء ممکن است به دلیل تغییر نور، فاصله، زاویهٔ دوربین یا انسداد جزئی، ظاهر متفاوتی در تصاویر داشته باشد. | |||
== | == تصویر دیجیتال == | ||
'''تصویر دیجیتال''' بازنمایی عددی یک تصویر است که معمولاً از آرایهای از پیکسلها تشکیل میشود. | |||
در تصاویر خاکستری، هر پیکسل معمولاً مقداری مرتبط با شدت روشنایی دارد. | |||
در تصاویر رنگی، هر پیکسل میتواند دارای چند مؤلفهٔ رنگی باشد. | |||
یکی از نمایشهای رایج تصویر رنگی، مدل RGB است که از سه مؤلفهٔ قرمز، سبز و آبی استفاده میکند. | |||
الگوریتمهای بینایی ماشین این دادههای عددی را برای استخراج ویژگیها و اطلاعات پردازش میکنند. | |||
== پیکسل و وضوح تصویر == | |||
'''پیکسل''' کوچکترین عنصر نمونهبرداریشده در بسیاری از تصاویر دیجیتال است. | |||
وضوح مکانی تصویر معمولاً با تعداد پیکسلها در عرض و ارتفاع بیان میشود. | |||
برای مثال، تصویری با ابعاد ۱۹۲۰ در ۱۰۸۰ پیکسل دارای بیش از دو میلیون پیکسل است. | |||
با این حال، وضوح بالاتر لزوماً به معنای کیفیت بهتر همهٔ وظایف بینایی ماشین نیست. | |||
نورپردازی، وضوح اپتیکی، نویز، فشردهسازی و کیفیت داده نیز اهمیت دارند. | |||
== پردازش تصویر == | |||
'''پردازش تصویر''' به مجموعهای از روشها برای تغییر، بهبود یا تحلیل دادههای تصویری گفته میشود. | |||
این روشها میتوانند شامل کاهش نویز، تنظیم روشنایی، افزایش کنتراست، فیلترگذاری و تبدیل هندسی باشند. | |||
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند، اما مترادف نیستند. | |||
پردازش تصویر ممکن است صرفاً برای بهبود ظاهر تصویر انجام شود. | |||
در | در مقابل، بینایی ماشین معمولاً به استخراج اطلاعات و انجام وظایف ادراکی یا تحلیلی از تصویر میپردازد. | ||
== استخراج ویژگی == | |||
'''استخراج ویژگی''' (Feature Extraction) فرایند شناسایی و بازنمایی اطلاعاتی از تصویر است که برای یک وظیفه مفید هستند. | |||
در روشهای کلاسیک، ویژگیها ممکن است شامل لبهها، گوشهها، بافتها یا توصیفگرهای محلی باشند. | |||
در روشهای مبتنی بر یادگیری عمیق، شبکه میتواند بازنماییهای مورد نیاز را در فرایند آموزش بیاموزد. | |||
در | این تفاوت یکی از ویژگیهای مهم تحول بینایی ماشین در دههٔ ۲۰۱۰ بود. | ||
== تشخیص لبه == | |||
'''تشخیص لبه''' (Edge Detection) یکی از روشهای بنیادی پردازش تصویر است. | |||
لبهها معمولاً با تغییرات قابل توجه شدت روشنایی یا رنگ در تصویر ارتباط دارند. | |||
تشخیص لبه میتواند برای شناسایی مرز اشیا، تحلیل شکلها و آمادهسازی داده برای مراحل بعدی استفاده شود. | |||
الگوریتم Canny از روشهای شناختهشدهٔ تشخیص لبه است. | |||
== تشخیص گوشه و نقاط کلیدی == | |||
در برخی مسائل، لازم است نقاط شاخص تصویر شناسایی شوند. | |||
این نقاط ممکن است شامل گوشهها یا نواحی دارای الگوی محلی متمایز باشند. | |||
نقاط کلیدی در تطبیق تصاویر، ردیابی، بازسازی سهبعدی و تخمین حرکت دوربین کاربرد دارند. | |||
روشهایی مانند Harris و SIFT از روشهای شناختهشدهٔ این حوزه هستند. | |||
== طبقهبندی تصویر == | |||
'''طبقهبندی تصویر''' (Image Classification) یکی از وظایف اصلی بینایی ماشین است. | |||
در این مسئله، سامانه یک تصویر را دریافت و آن را به یک یا چند دستهٔ مشخص نسبت میدهد. | |||
برای مثال، مدل ممکن است تشخیص دهد که تصویر مربوط به گربه، سگ، خودرو یا هواپیماست. | |||
طبقهبندی تصویر با تشخیص محل دقیق اشیا تفاوت دارد. | |||
یک تصویر ممکن است دارای چندین شیء باشد، در حالی که مدل طبقهبندی ساده فقط یک برچسب کلی تولید کند. | |||
== تشخیص اشیا == | |||
'''تشخیص اشیا''' (Object Detection) به شناسایی اشیای موجود در تصویر و تعیین موقعیت آنها گفته میشود. | |||
خروجی سامانه معمولاً شامل نوع شیء، میزان اطمینان مدل و مختصات ناحیهٔ مربوط به آن است. | |||
برای مثال، یک سامانه ممکن است در تصویر خیابان چند خودرو و عابر پیاده را تشخیص دهد و برای هرکدام کادر مشخصی رسم کند. | |||
این فناوری در رباتیک، کنترل ترافیک، تحلیل ویدئو و سامانههای کمکراننده کاربرد دارد. | |||
== | == بخشبندی تصویر == | ||
''' | '''بخشبندی تصویر''' (Image Segmentation) فرایندی است که در آن پیکسلهای تصویر بر اساس ویژگی یا تعلق به نواحی مختلف دستهبندی میشوند. | ||
بخشبندی در پزشکی، تحلیل تصاویر ماهوارهای، رباتیک و صنعت کاربرد دارد. | |||
دو نوع مهم آن عبارتاند از: | |||
* بخشبندی معنایی؛ | |||
* بخشبندی نمونهای. | |||
== | == بخشبندی معنایی == | ||
''' | در '''بخشبندی معنایی''' (Semantic Segmentation)، برای هر پیکسل یک دستهٔ معنایی تعیین میشود. | ||
برای مثال، در تصویر خیابان، پیکسلها ممکن است به دستههایی مانند جاده، ساختمان، آسمان، خودرو و عابر پیاده تقسیم شوند. | |||
در | در این روش، اشیای جداگانهای که به یک دسته تعلق دارند لزوماً از یکدیگر متمایز نمیشوند. | ||
== بخشبندی نمونهای == | |||
در '''بخشبندی نمونهای''' (Instance Segmentation)، سامانه علاوه بر شناسایی دستهٔ اشیا، نمونههای جداگانهٔ هر دسته را نیز تفکیک میکند. | |||
برای مثال، اگر سه خودرو در تصویر وجود داشته باشد، مدل میتواند ناحیهٔ هر خودرو را بهطور مستقل مشخص کند. | |||
این قابلیت در تحلیل صحنههای پیچیده اهمیت دارد. | |||
== معماری U-Net == | |||
'''U-Net''' یکی از معماریهای شناختهشدهٔ شبکهٔ عصبی برای بخشبندی تصویر است. | |||
در | این معماری در سال ۲۰۱۵ توسط اولاف رونبرگر، فیلیپ فیشر و توماس بروکس برای بخشبندی تصاویر زیستپزشکی معرفی شد. | ||
= | U-Net از مسیر فشردهسازی و مسیر گسترش بازنماییها استفاده میکند و برای تعیین موقعیت دقیق ساختارهای موجود در تصویر طراحی شده است.<ref name="unet">[https://arxiv.org/abs/1505.04597 Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” 2015.]</ref> | ||
این معماری و گونههای بعدی آن در بسیاری از مسائل بخشبندی تصویر استفاده شدهاند. | |||
== تشخیص چهره == | |||
'''تشخیص چهره''' اصطلاحی است که در کاربرد عمومی ممکن است به چند وظیفهٔ متفاوت اشاره کند. | |||
یکی از آنها یافتن محل چهره در تصویر است. | |||
وظیفهٔ دیگر، شناسایی یا تأیید هویت فرد بر اساس ویژگیهای چهره است. | |||
این دو کاربرد از نظر فنی و حقوقی یکسان نیستند. | |||
سامانههای شناسایی چهره میتوانند در احراز هویت و مدیریت دسترسی استفاده شوند، اما کاربرد آنها در نظارت عمومی میتواند خطرهایی برای حریم خصوصی و آزادیهای مدنی ایجاد کند. | |||
== تشخیص و تحلیل حرکت == | |||
بینایی ماشین میتواند برای تحلیل تغییرات تصویر در طول زمان استفاده شود. | |||
این حوزه شامل تشخیص حرکت، ردیابی اشیا و تخمین جهت یا سرعت حرکت است. | |||
برای مثال، یک سامانهٔ نظارت بر ترافیک میتواند حرکت خودروها را در چندین فریم متوالی بررسی کند. | |||
در رباتیک نیز تحلیل حرکت به درک تغییر موقعیت اشیا و دوربین کمک میکند. | |||
== جریان نوری == | |||
'''جریان نوری''' (Optical Flow) به الگوی حرکت ظاهری نقاط یا ساختارهای تصویری میان فریمهای متوالی اشاره دارد. | |||
روشهای تخمین جریان نوری برای تحلیل حرکت، ردیابی و برخی کاربردهای ناوبری استفاده میشوند. | |||
با این حال، حرکت ظاهری در تصویر همیشه معادل حرکت واقعی یک شیء در فضای سهبعدی نیست. | |||
حرکت دوربین، تغییر نور و دیگر عوامل نیز میتوانند بر آن اثر بگذارند. | |||
== ردیابی اشیا == | |||
'''ردیابی اشیا''' (Object Tracking) فرایندی است که در آن سامانه تلاش میکند موقعیت یک یا چند شیء را در طول زمان دنبال کند. | |||
برای مثال، پس از تشخیص یک خودرو در نخستین فریم ویدئو، سامانه میتواند موقعیت آن را در فریمهای بعدی تخمین بزند. | |||
ردیابی در تحلیل ترافیک، ورزش، رباتیک و پردازش ویدئو کاربرد دارد. | |||
== تخمین وضعیت بدن انسان == | |||
'''تخمین وضعیت بدن''' (Human Pose Estimation) به شناسایی موقعیت نقاط یا مفاصل اصلی بدن در تصویر یا ویدئو گفته میشود. | |||
این فناوری در تحلیل حرکت، ورزش، توانبخشی، تعامل انسان و رایانه و تولید انیمیشن کاربرد دارد. | |||
عملکرد آن میتواند تحت تأثیر زاویهٔ دوربین، پوشش بدن، انسداد و کیفیت تصویر قرار گیرد. | |||
== | == بینایی سهبعدی == | ||
''' | '''بینایی سهبعدی''' به روشهایی گفته میشود که برای استخراج اطلاعات مربوط به عمق، شکل و ساختار فضایی محیط از دادههای بصری استفاده میکنند. | ||
این | این روشها میتوانند از تصاویر چنددوربینی، حرکت دوربین، حسگرهای عمق یا ترکیب چند منبع داده بهره بگیرند. | ||
بینایی سهبعدی در رباتیک، نقشهبرداری، واقعیت افزوده و بازسازی دیجیتال اشیا کاربرد دارد. | |||
== تخمین عمق == | |||
'''تخمین عمق''' (Depth Estimation) فرایندی است که در آن فاصلهٔ نقاط یا اشیای صحنه نسبت به دوربین برآورد میشود. | |||
این کار میتواند با استفاده از دو دوربین، حسگرهای تخصصی یا مدلهای یادگیری ماشین انجام شود. | |||
تخمین عمق در ناوبری رباتها، خودروهای خودران و بازسازی سهبعدی اهمیت دارد. | |||
== بینایی استریو == | |||
'''بینایی استریو''' (Stereo Vision) از تصاویر ثبتشده از دو دیدگاه متفاوت برای تخمین ساختار سهبعدی استفاده میکند. | |||
اختلاف موقعیت ظاهری نقاط متناظر در دو تصویر میتواند برای محاسبهٔ عمق به کار رود. | |||
این روش از اصول هندسهٔ تصویری و روابط میان دوربینها استفاده میکند. | |||
== بازسازی سهبعدی == | |||
'''بازسازی سهبعدی''' (3D Reconstruction) فرایند ایجاد مدلی از ساختار سهبعدی یک شیء یا صحنه بر اساس دادههای تصویری است. | |||
این فناوری در معماری، میراث فرهنگی، نقشهبرداری، پزشکی، صنعت و تولید محتوای دیجیتال کاربرد دارد. | |||
کیفیت بازسازی به عواملی مانند تعداد تصاویر، زاویههای دید، بافت سطح و دقت کالیبراسیون وابسته است. | |||
== ساختار از حرکت == | |||
'''ساختار از حرکت''' (Structure from Motion یا SfM) مجموعهای از روشهاست که با استفاده از تصاویر ثبتشده از موقعیتهای متفاوت، ساختار سهبعدی صحنه و موقعیت نسبی دوربینها را تخمین میزند. | |||
این روش در فتوگرامتری، نقشهبرداری و بازسازی سهبعدی کاربرد دارد. | |||
== | == مکانیابی و نقشهسازی همزمان == | ||
''' | '''مکانیابی و نقشهسازی همزمان''' (Simultaneous Localization and Mapping یا SLAM) به مسئلهٔ تخمین موقعیت یک سامانه در محیط و ساخت نقشهای از همان محیط اشاره دارد. | ||
در | در نوع بصری آن، اطلاعات دوربین برای تخمین حرکت و ساخت نقشه استفاده میشود. | ||
این فناوری در رباتیک، پهپادها و واقعیت افزوده اهمیت دارد. | |||
== | == یادگیری ماشین در بینایی ماشین == | ||
[[یادگیری ماشین]] امکان میدهد مدلها برخی روابط و الگوهای تصویری را از داده بیاموزند. | |||
در روشهای کلاسیک، پژوهشگر ممکن است ابتدا ویژگیهایی مانند لبهها یا بافتها را استخراج کند و سپس یک مدل طبقهبندی را آموزش دهد. | |||
در | در روشهای مبتنی بر یادگیری عمیق، بخش بزرگی از استخراج ویژگی و تصمیمگیری میتواند در یک معماری قابل آموزش انجام شود. | ||
انتخاب روش مناسب به نوع مسئله، مقدار داده، منابع محاسباتی و نیاز به توضیحپذیری وابسته است. | |||
== شبکههای عصبی پیچشی == | |||
'''شبکهٔ عصبی پیچشی''' (Convolutional Neural Network یا CNN) یکی از معماریهای مهم در بینایی ماشین است. | |||
این شبکه از عملیات پیچش برای پردازش الگوهای محلی تصویر استفاده میکند. | |||
شبکههای پیچشی میتوانند بازنماییهایی از ویژگیهای ساده تا ساختارهای پیچیدهتر بیاموزند. | |||
موفقیت AlexNet در سال ۲۰۱۲ و توسعهٔ معماریهای بعدی مانند ResNet از مراحل مهم گسترش این روش بودند.<ref name="alexnet" /><ref name="resnet" /> | |||
== ترنسفورمر بینایی == | |||
'''ترنسفورمر بینایی''' (Vision Transformer یا ViT) معماریای است که از سازوکار توجه برای پردازش تصاویر استفاده میکند. | |||
در ساختار متعارف آن، تصویر به قطعههایی تقسیم و هر قطعه به یک بازنمایی برداری تبدیل میشود. | |||
این بازنماییها همراه با اطلاعات موقعیتی به لایههای ترنسفورمر داده میشوند. | |||
مدل میتواند روابط میان بخشهای مختلف تصویر را در فرایند یادگیری محاسبه کند.<ref name="vit" /> | |||
ترنسفورمرهای بینایی در طبقهبندی تصویر و دیگر وظایف بینایی ماشین به کار گرفته شدهاند. | |||
== بینایی ماشین و مدلهای چندوجهی == | |||
'''مدل چندوجهی''' مدلی است که میتواند چند نوع داده مانند متن، تصویر یا صوت را پردازش کند. | |||
بینایی ماشین یکی از اجزای مهم بسیاری از سامانههای چندوجهی است. | |||
برای مثال، سامانهای که تصویری را دریافت و دربارهٔ محتوای آن به پرسشهای متنی پاسخ میدهد، باید اطلاعات بصری را با پردازش زبان ترکیب کند. | |||
چنین سامانههایی میتوانند برای توصیف تصویر، جستوجوی بصری و تحلیل اسناد تصویری استفاده شوند. | |||
با این حال، پاسخ متنی آنها ممکن است حاوی خطا یا [[توهم هوش مصنوعی]] باشد. | |||
== | == بینایی ماشین و هوش مصنوعی مولد == | ||
[[هوش مصنوعی مولد]] و بینایی ماشین حوزههایی مرتبط اما متفاوتاند. | |||
بینایی ماشین عمدتاً بر استخراج و تحلیل اطلاعات از دادههای بصری تمرکز دارد. | |||
در مقابل، مدلهای مولد برای تولید داده یا محتوای جدید آموزش داده میشوند. | |||
با این حال، بسیاری از سامانههای جدید هر دو قابلیت را ترکیب میکنند. | |||
برای مثال، یک سامانه ممکن است ابتدا اجزای تصویر را شناسایی و سپس بر اساس دستور متنی، تصویر تازهای تولید یا تصویر موجود را ویرایش کند. | |||
== بینایی ماشین در پزشکی == | |||
یکی از کاربردهای مهم بینایی ماشین، تحلیل تصاویر پزشکی است. | |||
این تصاویر میتوانند شامل رادیوگرافی، سیتیاسکن، امآرآی، سونوگرافی و تصاویر میکروسکوپی باشند. | |||
سامانههای بینایی ماشین ممکن است برای شناسایی الگوهای غیرعادی، بخشبندی اندامها یا اندازهگیری ساختارهای تصویری آموزش داده شوند. | |||
معماری U-Net از نمونههای اثرگذار در بخشبندی تصاویر زیستپزشکی است.<ref name="unet" /> | |||
در | با این حال، عملکرد یک مدل در محیط آزمایشگاهی لزوماً به معنای اعتبار بالینی آن نیست. | ||
کاربرد پزشکی نیازمند اعتبارسنجی، ارزیابی ایمنی و نظارت متخصصان است. | |||
== بینایی ماشین در خودروهای خودران == | |||
خودروهای خودران و سامانههای کمکراننده میتوانند از بینایی ماشین برای تحلیل محیط اطراف استفاده کنند. | |||
وظایف آنها ممکن است شامل تشخیص خودروها، عابران پیاده، دوچرخهسواران، علائم راهنمایی و خطوط جاده باشد. | |||
این سامانهها گاهی دادههای دوربین را با اطلاعات رادار، لیدار و دیگر حسگرها ترکیب میکنند. | |||
با این حال، عملکرد بینایی ماشین ممکن است تحت تأثیر باران، مه، تاریکی، انعکاس نور یا انسداد دید قرار گیرد. | |||
به همین دلیل، ایمنی سامانههای خودران به مجموعهای از اجزای فنی، آزمونها و سازوکارهای کنترلی وابسته است. | |||
== بینایی ماشین در رباتیک == | |||
رباتها میتوانند از بینایی ماشین برای شناسایی اشیا، تخمین فاصله، تشخیص موانع و هدایت حرکت استفاده کنند. | |||
برای مثال، یک ربات صنعتی ممکن است قطعات موجود روی خط تولید را شناسایی و موقعیت آنها را برای بازوی مکانیکی تعیین کند. | |||
در رباتهای متحرک، بینایی ماشین میتواند در کنار حسگرهای دیگر به ناوبری و نقشهسازی کمک کند. | |||
== | == بینایی صنعتی == | ||
''' | '''بینایی صنعتی''' (Machine Vision) به کاربرد سامانههای تصویربرداری و تحلیل تصویر در محیطهای صنعتی، بهویژه تولید و کنترل کیفیت، گفته میشود. | ||
در | بینایی صنعتی با بینایی ماشین ارتباط نزدیک دارد، اما معمولاً بر کاربردهای عملی در خطوط تولید، اندازهگیری، بازرسی و هدایت تجهیزات تمرکز میکند. | ||
برای مثال، | برای مثال، یک سامانهٔ بینایی صنعتی میتواند قطعات معیوب را روی نوار نقاله شناسایی کند. | ||
بنابراین بینایی صنعتی را میتوان یکی از حوزههای کاربردی مرتبط با بینایی ماشین دانست، نه مترادف کامل آن. | |||
== | == کنترل کیفیت صنعتی == | ||
در خطوط تولید، سامانههای بینایی ماشین میتوانند برای بررسی ظاهر محصولات استفاده شوند. | |||
این | این بررسی ممکن است شامل تشخیص ترک، خراش، تغییر شکل، نقص مونتاژ یا اشتباه در بستهبندی باشد. | ||
کارایی چنین سامانههایی به کیفیت تصویربرداری، نورپردازی و شرایط محیط وابسته است. | |||
== بینایی ماشین در کشاورزی == | |||
بینایی ماشین در کشاورزی برای تحلیل وضعیت گیاهان، شناسایی برخی آفات و بیماریها، ارزیابی رشد محصول و مدیریت ماشینآلات کشاورزی استفاده میشود. | |||
تصاویر ممکن است از دوربینهای زمینی، پهپادها یا ماهوارهها به دست آمده باشند. | |||
در | این سامانهها میتوانند به کشاورزان در پایش زمین و تصمیمگیری کمک کنند. | ||
اما عملکرد مدل باید با شرایط اقلیمی، نوع محصول و دادههای محلی سازگار باشد. | |||
== بینایی ماشین در تصاویر ماهوارهای == | |||
تحلیل تصاویر ماهوارهای یکی از کاربردهای مهم بینایی ماشین و سنجش از دور است. | |||
الگوریتمها میتوانند برای شناسایی تغییرات پوشش زمین، گسترش مناطق شهری، بررسی جنگلها و پایش برخی رخدادهای محیطی استفاده شوند. | |||
دادههای ماهوارهای ممکن است علاوه بر نور مرئی، شامل باندهای طیفی دیگری باشند. | |||
بنابراین تحلیل آنها گاهی به روشهای تخصصی پردازش دادههای چندطیفی نیاز دارد. | |||
== بینایی ماشین و محیط زیست == | |||
بینایی ماشین میتواند در پایش حیات وحش، بررسی پوشش گیاهی، تحلیل تصاویر جنگلها و شناسایی تغییرات محیطی کاربرد داشته باشد. | |||
برای مثال، تصاویر دوربینهای تلهای حیات وحش میتوانند با استفاده از مدلهای تشخیص تصویر بررسی شوند. | |||
این فناوری میتواند حجم کار تحلیل تصاویر را کاهش دهد، اما نتایج آن باید از نظر خطاهای شناسایی ارزیابی شوند. | |||
== بینایی ماشین در میراث فرهنگی == | |||
در پژوهشهای میراث فرهنگی، بینایی ماشین میتواند برای بازسازی سهبعدی بناها، تحلیل تصاویر آثار تاریخی و تطبیق تصاویر قدیمی و جدید استفاده شود. | |||
روشهای فتوگرامتری و بازسازی سهبعدی در مستندسازی بناها و اشیای تاریخی اهمیت دارند. | |||
این فناوری همچنین میتواند به ثبت دیجیتال وضعیت آثار و بررسی تغییرات آنها در طول زمان کمک کند. | |||
== بینایی ماشین و اسناد تاریخی == | |||
بینایی ماشین در دیجیتالسازی و تحلیل اسناد تاریخی کاربرد دارد. | |||
از جمله وظایف مرتبط میتوان به شناسایی ساختار صفحه، تشخیص نواحی متن، جداسازی تصاویر و آمادهسازی داده برای تشخیص نویسهها اشاره کرد. | |||
'''تشخیص نوری نویسهها''' (OCR) یکی از فناوریهای مرتبط است که متن موجود در تصویر را به دادهٔ متنی تبدیل میکند. | |||
در اسناد تاریخی، کیفیت کاغذ، فرسودگی، نوع خط و وضوح تصویر میتوانند بر نتیجه تأثیر بگذارند. | |||
== بینایی ماشین و زبان فارسی == | |||
بینایی ماشین در پردازش اسناد فارسی و شناسایی نوشتههای فارسی نیز کاربرد دارد. | |||
یکی از مسائل مهم، تشخیص متن در تصاویر و اسناد اسکنشده است. | |||
ویژگیهایی مانند پیوستگی حروف، شکلهای متفاوت نویسهها و وجود نقطهها میتوانند بر طراحی سامانههای تشخیص متن تأثیر بگذارند. | |||
در متون تاریخی، تفاوت خط، کیفیت چاپ و آسیبدیدگی اسناد دشواری بیشتری ایجاد میکند. | |||
سامانههای پردازش اسناد فارسی میتوانند از ترکیب بینایی ماشین و [[پردازش زبان طبیعی]] استفاده کنند. | |||
== | == بینایی ماشین در آموزش == | ||
بینایی ماشین در ابزارهای آموزشی، تحلیل تصاویر علمی و سامانههای کمکآموزشی کاربرد دارد. | |||
برای مثال، یک برنامهٔ آموزشی میتواند تصویر یک نمودار یا شکل هندسی را دریافت و اجزای آن را شناسایی کند. | |||
در ابزارهای دسترسپذیری نیز سامانههای توصیف تصویر میتوانند به کاربران نابینا یا کمبینا کمک کنند. | |||
با این حال، اطلاعات تولیدشده توسط این سامانهها باید از نظر دقت و محدودیتهای کاربرد بررسی شود. | |||
== | == بینایی ماشین در ورزش == | ||
در ورزش، بینایی ماشین برای تحلیل حرکت بازیکنان، ردیابی توپ، بررسی وضعیت بدن و تحلیل ویدئو استفاده میشود. | |||
این فناوری در | این فناوری میتواند در آموزش ورزشکاران، تحلیل مسابقات و برخی سامانههای داوری کمکی کاربرد داشته باشد. | ||
دقت نتیجه به کیفیت دوربینها، زاویهٔ دید و روش پردازش داده وابسته است. | |||
== | == بینایی ماشین و واقعیت افزوده == | ||
'''واقعیت افزوده''' (Augmented Reality) فناوریای است که اطلاعات یا عناصر دیجیتال را با نمای محیط واقعی ترکیب میکند. | |||
بینایی ماشین میتواند برای شناسایی سطوح، تخمین حرکت دوربین و تعیین موقعیت عناصر مجازی استفاده شود. | |||
این فناوری در آموزش، طراحی، بازی و کاربردهای صنعتی مورد استفاده قرار میگیرد. | |||
== مجموعهدادههای بینایی ماشین == | |||
توسعه و ارزیابی مدلهای بینایی ماشین به مجموعهدادههای مناسب نیاز دارد. | |||
این مجموعهها ممکن است شامل تصاویر، برچسبهای طبقهبندی، کادرهای اشیا یا نقشههای بخشبندی باشند. | |||
از مجموعهدادههای شناختهشده میتوان به ImageNet، COCO و MNIST اشاره کرد. | |||
برای | هر مجموعهداده برای هدف مشخصی طراحی شده و محدودیتهای خاص خود را دارد. | ||
برای مثال، عملکرد مناسب یک مدل روی یک مجموعهدادهٔ معیار لزوماً نشاندهندهٔ عملکرد مشابه در همهٔ محیطهای واقعی نیست. | |||
== | == آموزش مدلهای بینایی ماشین == | ||
در روشهای مبتنی بر یادگیری نظارتشده، مدل با استفاده از نمونههای دارای برچسب آموزش داده میشود. | |||
با | برای مثال، تصاویر ممکن است با نام اشیای موجود در آنها برچسبگذاری شوند. | ||
مدل با مقایسهٔ خروجی خود و برچسب هدف، پارامترهایش را تنظیم میکند. | |||
در روشهای خودنظارتشده، بخشی از اطلاعات آموزشی از ساختار خود داده به دست میآید. | |||
انتخاب روش آموزش به نوع وظیفه، داده و منابع محاسباتی بستگی دارد. | |||
== افزایش داده == | |||
'''افزایش داده''' (Data Augmentation) به ایجاد تغییرات کنترلشده در نمونههای آموزشی گفته میشود. | |||
برای مثال، ممکن است تصویر چرخانده، برش داده یا روشنایی آن تغییر داده شود. | |||
هدف این است که مدل با تنوع بیشتری از نمونهها روبهرو شود و در شرایط متفاوت عملکرد مناسبتری داشته باشد. | |||
البته همهٔ تغییرات برای همهٔ وظایف مجاز یا مفید نیستند. | |||
برای مثال، در برخی کاربردهای پزشکی، تغییر نامناسب تصویر ممکن است اطلاعات مهمی را مخدوش کند. | |||
== ارزیابی مدلهای بینایی ماشین == | |||
ارزیابی مدلهای بینایی ماشین باید بر اساس وظیفهٔ مورد نظر انجام شود. | |||
در طبقهبندی، معیارهایی مانند دقت، بازخوانی و امتیاز F1 استفاده میشوند. | |||
در تشخیص اشیا، معیارهایی مانند میانگین دقت متوسط (mAP) رایج هستند. | |||
در بخشبندی تصویر، معیارهایی مانند اشتراک بر اجتماع (IoU) و ضریب Dice کاربرد دارند. | |||
انتخاب معیار باید با هدف عملی سامانه هماهنگ باشد. | |||
== دقت و خطا == | |||
یکی از مسائل مهم در ارزیابی بینایی ماشین، تفاوت میان دقت آزمایشگاهی و عملکرد واقعی است. | |||
در | مدلی که در مجموعهدادهای مشخص عملکرد بالایی دارد، ممکن است در محیطی با نور، زاویه یا کیفیت تصویر متفاوت دچار خطا شود. | ||
به همین دلیل، ارزیابی باید تا حد امکان شامل دادههایی نزدیک به شرایط واقعی استفاده باشد. | |||
== محدودیتهای بینایی ماشین == | |||
بینایی ماشین با وجود پیشرفتهای گسترده محدودیتهایی دارد. | |||
یکی از این محدودیتها وابستگی عملکرد به کیفیت تصویر است. | |||
نور نامناسب، تاری، انسداد، زاویهٔ دید غیرمعمول و نویز میتوانند تشخیص را دشوار کنند. | |||
محدودیت دیگر، وابستگی بسیاری از مدلها به دادههای آموزشی است. | |||
اگر شرایط واقعی با دادههای آموزش تفاوت زیادی داشته باشد، عملکرد مدل ممکن است کاهش یابد. | |||
== تغییر توزیع داده == | |||
'''تغییر توزیع داده''' (Distribution Shift) زمانی رخ میدهد که دادههای زمان استفاده با دادههای آموزش یا ارزیابی تفاوت معناداری داشته باشند. | |||
با | برای مثال، مدلی که با تصاویر روز آموزش دیده ممکن است در تصاویر شب عملکرد ضعیفتری داشته باشد. | ||
این مسئله در سامانههای صنعتی، پزشکی و حملونقل اهمیت ویژهای دارد. | |||
== سوگیری الگوریتمی == | == سوگیری الگوریتمی == | ||
[[سوگیری الگوریتمی]] یکی از مسائل مهم | [[سوگیری الگوریتمی]] یکی از مسائل مهم بینایی ماشین است. | ||
اگر دادههای آموزشی پوشش نامتوازنی از شرایط، گروهها یا محیطهای مختلف داشته باشند، عملکرد مدل ممکن است برای برخی گروهها یا شرایط ضعیفتر باشد. | |||
این مسئله در سامانههای تشخیص چهره و تصمیمگیری مبتنی بر تصویر اهمیت ویژهای دارد. | |||
ارزیابی منصفانه باید تفاوت نرخ خطا میان گروهها و شرایط مختلف را نیز بررسی کند. | |||
== حریم خصوصی و نظارت تصویری == | |||
در | بینایی ماشین میتواند در سامانههای نظارتی برای شناسایی اشیا، ردیابی افراد یا تحلیل رفتارهای تصویری استفاده شود. | ||
این کاربردها میتوانند مسائل مهمی دربارهٔ حریم خصوصی، رضایت، نگهداری داده و نظارت عمومی ایجاد کنند. | |||
استفاده از تشخیص چهره برای شناسایی افراد در فضاهای عمومی، بهویژه در صورت نبود شفافیت و نظارت مستقل، میتواند خطرهایی برای آزادیهای مدنی به همراه داشته باشد. | |||
ارزیابی این خطرها باید با توجه به کاربرد مشخص، قوانین مربوط و آثار واقعی سامانه انجام شود. | |||
== بینایی ماشین و حقوق بشر == | |||
در | کاربرد بینایی ماشین در شناسایی افراد، نظارت عمومی و تحلیل رفتار میتواند با حقوق بنیادین شهروندان ارتباط پیدا کند. | ||
از جمله مسائل مهم میتوان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و حق برخورداری از رفتار برابر اشاره کرد. | |||
استفاده از سامانههای تشخیص چهره در محیطهای عمومی ممکن است به شناسایی و ردیابی افراد بدون اطلاع یا رضایت آنان منجر شود. | |||
در چنین مواردی، ضرورت قانونیبودن، تناسب، شفافیت و پاسخگویی از موضوعات مهم ارزیابی حقوق بشری است. | |||
== بینایی ماشین و امنیت == | |||
سامانههای بینایی ماشین ممکن است در معرض حملات فنی قرار گیرند. | |||
یکی از نمونهها، حملات خصمانه است که در آن تغییرات طراحیشده در تصویر میتواند مدل را به تشخیص نادرست سوق دهد. | |||
این مسئله در سامانههای امنیتی و کاربردهای حساس اهمیت دارد. | |||
همچنین دستکاری دادههای آموزشی یا تصاویر ورودی میتواند بر عملکرد سامانه اثر بگذارد. | |||
== تصاویر ساختگی و دیپفیک == | |||
پیشرفت هوش مصنوعی مولد موجب گسترش امکان تولید تصاویر و ویدئوهای مصنوعی شده است. | |||
اصطلاح '''دیپفیک''' معمولاً به محتوای مصنوعی یا دستکاریشدهای اشاره دارد که میتواند چهره، صدا یا رفتار فردی را بهصورت گمراهکننده بازنمایی کند. | |||
بینایی ماشین میتواند در پژوهشهای تشخیص دستکاری تصویر و تحلیل اصالت محتوا به کار رود. | |||
با این حال، هیچ روش تشخیص خودکاری را نباید برای همهٔ انواع تصاویر و ویدئوهای مصنوعی بیخطا فرض کرد. | |||
== بینایی ماشین و توهم هوش مصنوعی == | |||
در سامانههایی که بینایی ماشین را با مدلهای زبانی ترکیب میکنند، امکان تولید توصیفهای نادرست از تصویر وجود دارد. | |||
برای مثال، مدل ممکن است شیئی را در تصویر توصیف کند که واقعاً وجود ندارد یا رابطهٔ میان اشیا را اشتباه تشخیص دهد. | |||
این مسئله با [[توهم هوش مصنوعی]] ارتباط دارد. | |||
در کاربردهای پژوهشی و دانشنامهای، توصیف تولیدشده توسط مدل باید با تصویر اصلی و منابع مستقل تطبیق داده شود. | |||
== تفسیرپذیری بینایی ماشین == | |||
بسیاری از مدلهای عمیق بینایی ماشین دارای تعداد زیادی پارامتر هستند. | |||
در چنین مدلهایی، توضیح دقیق اینکه چرا تصویر به یک دستهٔ مشخص نسبت داده شده ممکن است دشوار باشد. | |||
پژوهشگران روشهایی مانند نقشههای برجستگی و تحلیل حساسیت را برای بررسی عوامل مؤثر بر پیشبینی توسعه دادهاند. | |||
با این حال، نمایش نواحی مورد توجه مدل لزوماً توضیح کامل و قطعی تصمیم آن نیست. | |||
== مصرف انرژی و منابع محاسباتی == | |||
آموزش برخی مدلهای بزرگ بینایی ماشین میتواند به سختافزار و انرژی قابل توجهی نیاز داشته باشد. | |||
هزینهٔ محاسباتی به اندازهٔ مدل، وضوح تصویر، حجم داده، تعداد مراحل آموزش و نوع سختافزار بستگی دارد. | |||
در کاربردهای عملی، بهینهسازی مدل برای اجرا روی دستگاههای کممصرف نیز اهمیت دارد. | |||
== بینایی ماشین و تمرکز قدرت فناوری == | |||
توسعهٔ مدلهای بزرگ و مجموعهدادههای گسترده ممکن است به سرمایه و زیرساخت محاسباتی قابل توجه نیاز داشته باشد. | |||
این مسئله میتواند مشارکت مؤسسات دارای منابع محدود را دشوار کند. | |||
در مقابل، انتشار کدهای پژوهشی، مجموعهدادههای مجاز و مدلهای قابل استفادهٔ عمومی میتواند دسترسی پژوهشگران بیشتری را فراهم سازد. | |||
البته انتشار دادههای تصویری باید با رعایت حقوق افراد و الزامات حریم خصوصی انجام شود. | |||
== بینایی ماشین و دانشنامهنویسی == | |||
بینایی ماشین میتواند در گردآوری، ساماندهی و تحلیل منابع تصویری دانشنامهها کاربرد داشته باشد. | |||
در | برای مثال، این فناوری ممکن است برای شناسایی متن در اسناد اسکنشده، طبقهبندی تصاویر، تشخیص تصاویر مشابه یا بررسی کیفیت فایلهای تصویری استفاده شود. | ||
در دانشنامهنویسی تاریخی، بینایی ماشین میتواند به آمادهسازی اسناد و تصاویر برای بررسی پژوهشگران کمک کند. | |||
با این حال، خروجی سامانه نباید جایگزین بررسی منبع اصلی شود. | |||
تشخیص خودکار چهره، مکان یا تاریخ یک عکس ممکن است اشتباه باشد. | |||
بنابراین اطلاعات مربوط به هویت اشخاص، زمان ثبت تصاویر و اصالت اسناد باید با منابع معتبر راستیآزمایی شود. | |||
== آیندهٔ بینایی ماشین == | |||
پژوهش دربارهٔ بینایی ماشین در زمینههای متعددی ادامه دارد. | |||
از جمله موضوعات مهم میتوان به توسعهٔ مدلهای چندوجهی، بهبود تحلیل ویدئو، پردازش سهبعدی، کاهش نیاز به دادههای برچسبدار، افزایش کارایی محاسباتی و بهبود قابلیت اعتماد اشاره کرد. | |||
یکی از جهتگیریهای مهم، توسعهٔ سامانههایی است که بتوانند اطلاعات بصری را با زبان، صوت و دیگر انواع داده ترکیب کنند. | |||
از | همچنین افزایش شفافیت، کاهش سوگیری و حفاظت از حریم خصوصی از مسائل مهم آیندهٔ این حوزه خواهند بود. | ||
== تفاوت بینایی ماشین و پردازش تصویر == | |||
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند. | |||
پردازش تصویر معمولاً بر تبدیل یا بهبود دادههای تصویری تمرکز دارد. | |||
در مقابل، بینایی ماشین به استخراج اطلاعات و استنتاج دربارهٔ محتوای تصویر میپردازد. | |||
برای مثال، کاهش نویز یک عکس نمونهای از پردازش تصویر است. | |||
تشخیص اینکه در همان عکس چه اشیایی وجود دارند، نمونهای از وظایف بینایی ماشین است. | |||
البته در بسیاری از سامانهها، این دو حوزه با یکدیگر ترکیب میشوند. | |||
== تفاوت بینایی ماشین و یادگیری عمیق == | |||
[[یادگیری عمیق]] حوزهای از یادگیری ماشین است که عمدتاً از شبکههای عصبی چندلایه استفاده میکند. | |||
بینایی ماشین حوزهای کاربردی و پژوهشی برای تحلیل دادههای بصری است. | |||
از | بسیاری از روشهای جدید بینایی ماشین از یادگیری عمیق بهره میگیرند، اما همهٔ روشهای بینایی ماشین مبتنی بر یادگیری عمیق نیستند. | ||
روشهای هندسی، پردازش تصویر و الگوریتمهای کلاسیک نیز بخش مهمی از این حوزه را تشکیل میدهند. | |||
== تفاوت بینایی ماشین و هوش مصنوعی مولد == | |||
بینایی ماشین عمدتاً به تحلیل و استخراج اطلاعات از تصاویر و ویدئوها میپردازد. | |||
[[هوش مصنوعی مولد]] بر تولید داده یا محتوای جدید تمرکز دارد. | |||
یک سامانهٔ تشخیص اشیا نمونهای از کاربرد بینایی ماشین است. | |||
یک سامانهٔ تولید تصویر از متن نمونهای از هوش مصنوعی مولد محسوب میشود. | |||
با این حال، سامانههای جدید ممکن است هر دو قابلیت را در یک معماری ترکیب کنند. | |||
یک | |||
== جمعبندی == | == جمعبندی == | ||
''' | '''بینایی ماشین''' یکی از حوزههای بنیادی [[هوش مصنوعی]] است که به توسعهٔ روشهای محاسباتی برای استخراج و تحلیل اطلاعات از تصاویر و ویدئوها میپردازد. | ||
این حوزه از پژوهشهای اولیهٔ پردازش تصویر و هندسهٔ تصویری در میانهٔ سدهٔ بیستم شکل گرفت و بهتدریج به موضوعاتی مانند تشخیص اشیا، تحلیل حرکت، بازسازی سهبعدی و درک صحنه گسترش یافت. | |||
از دههٔ ۲۰۱۰، پیشرفت | از دههٔ ۲۰۱۰، پیشرفت [[شبکه عصبی مصنوعی|شبکههای عصبی مصنوعی]] و [[یادگیری عمیق]] موجب تحول مهمی در بسیاری از وظایف بینایی ماشین شد. توسعهٔ AlexNet، ResNet، U-Net و ترنسفورمرهای بینایی از مراحل اثرگذار این تحول بودند.<ref name="alexnet" /><ref name="resnet" /><ref name="unet" /><ref name="vit" /> | ||
امروزه | امروزه بینایی ماشین در پزشکی، صنعت، رباتیک، حملونقل، کشاورزی، پژوهش و تحلیل اسناد کاربرد دارد. | ||
با این حال، | با این حال، محدودیتهای فنی، وابستگی به کیفیت داده، [[سوگیری الگوریتمی]]، خطر خطا در شرایط واقعی و مسائل مربوط به حریم خصوصی و نظارت تصویری از چالشهای مهم آن به شمار میروند. | ||
از | اهمیت بینایی ماشین در آن است که یکی از ابزارهای اصلی تبدیل دادههای بصری به اطلاعات قابل استفاده برای سامانههای محاسباتی را فراهم میکند؛ ابزاری که با گسترش هوش مصنوعی چندوجهی، نقش آن در فناوری و جامعه افزایش یافته است. | ||
== جستارهای وابسته == | == جستارهای وابسته == | ||
| خط ۸۵۳: | خط ۷۹۴: | ||
* [[یادگیری ماشین]] | * [[یادگیری ماشین]] | ||
* [[یادگیری عمیق]] | * [[یادگیری عمیق]] | ||
* [[شبکه عصبی مصنوعی]] | |||
* [[ترنسفورمر]] | * [[ترنسفورمر]] | ||
* [[مدل زبانی بزرگ]] | * [[مدل زبانی بزرگ]] | ||
* [[هوش مصنوعی مولد]] | * [[هوش مصنوعی مولد]] | ||
* [[پردازش زبان طبیعی]] | * [[پردازش زبان طبیعی]] | ||
* [[توهم هوش مصنوعی]] | * [[توهم هوش مصنوعی]] | ||
* [[سوگیری الگوریتمی]] | * [[سوگیری الگوریتمی]] | ||
* [[علم داده]] | * [[علم داده]] | ||
* [[الگوریتم]] | * [[الگوریتم]] | ||
* [[علوم رایانه]] | * [[علوم رایانه]] | ||
* [[رباتیک]] | |||
* [[واقعیت افزوده]] | |||
* [[تشخیص چهره]] | |||
* [[پردازش تصویر]] | |||
== منابع == | == منابع == | ||
| خط ۸۷۱: | خط ۸۱۴: | ||
== کتابشناسی == | == کتابشناسی == | ||
* | * Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” ''IEEE Conference on Computer Vision and Pattern Recognition'', 2009. [https://www.image-net.org/static_files/papers/imagenet_cvpr09.pdf متن مقاله] | ||
* | * Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” ''International Conference on Learning Representations'', 2021. [https://arxiv.org/abs/2010.11929 متن مقاله] | ||
* | * Hartley, Richard, and Andrew Zisserman. ''Multiple View Geometry in Computer Vision''. 2nd ed. Cambridge: Cambridge University Press, 2004. | ||
* | * He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” ''Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition'', 2016. [https://arxiv.org/abs/1512.03385 متن مقاله] | ||
* Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” ''Advances in Neural Information Processing Systems'' 25 (2012). [https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html متن مقاله] | |||
* LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444. [https://doi.org/10.1038/nature14539 متن مقاله] | * LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444. [https://doi.org/10.1038/nature14539 متن مقاله] | ||
* | * Marr, David. ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information''. San Francisco: W. H. Freeman, 1982. | ||
* | * Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” ''Medical Image Computing and Computer-Assisted Intervention'', 2015. [https://arxiv.org/abs/1505.04597 متن مقاله] | ||
* | * Szeliski, Richard. ''Computer Vision: Algorithms and Applications''. 2nd ed. Cham: Springer, 2022. [https://link.springer.com/book/10.1007/978-3-030-34372-9 معرفی کتاب و مشخصات ناشر] | ||
[[رده:هوش مصنوعی]] | [[رده:هوش مصنوعی]] | ||
[[رده:یادگیری ماشین]] | [[رده:یادگیری ماشین]] | ||
[[رده:یادگیری عمیق]] | [[رده:یادگیری عمیق]] | ||
[[رده: | [[رده:بینایی ماشین]] | ||
[[رده:پردازش تصویر]] | |||
[[رده:علوم رایانه]] | [[رده:علوم رایانه]] | ||
[[رده:فناوری اطلاعات]] | [[رده:فناوری اطلاعات]] | ||
[[رده:مفاهیم هوش مصنوعی]] | [[رده:مفاهیم هوش مصنوعی]] | ||
{{DEFAULTSORT: | {{DEFAULTSORT:بینایی ماشین}} | ||
``` | ``` | ||
نسخهٔ کنونی تا ۱۰ اکتبر ۲۰۲۶، ساعت ۰۸:۳۴
| شناسنامه | |
|---|---|
| نامهای دیگر | بینایی رایانهای، بینایی کامپیوتری |
| حوزه | هوش مصنوعی، علوم رایانه، یادگیری ماشین، یادگیری عمیق، پردازش تصویر |
| خاستگاه | علوم رایانه، پردازش سیگنال، هندسه، عکاسی، رباتیک و پژوهشهای هوش مصنوعی |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | پیکسل، استخراج ویژگی، طبقهبندی تصویر، تشخیص شیء، بخشبندی تصویر، ردیابی، جریان نوری، بازسازی سهبعدی، تخمین عمق، تشخیص چهره |
| جریانهای مرتبط | بینایی محاسباتی، پردازش تصویر، تشخیص الگو، شبکه عصبی مصنوعی، یادگیری عمیق، ترنسفورمر، رباتیک |
| تأثیرپذیرفته از | علوم اعصاب بینایی، روانشناسی ادراک، هندسه، آمار، یادگیری ماشین و پردازش سیگنال |
| تأثیرگذار بر | خودروهای خودران، رباتیک، تصویربرداری پزشکی، واقعیت افزوده، سامانههای نظارتی، هوش مصنوعی مولد و مدلهای چندوجهی |
| نقد و ارزیابی | |
بینایی ماشین (به انگلیسی: Computer Vision)، که با نامهای بینایی رایانهای و بینایی کامپیوتری نیز شناخته میشود، شاخهای از هوش مصنوعی و علوم رایانه است که به توسعهٔ روشها و سامانههایی برای استخراج، پردازش و تفسیر اطلاعات از تصاویر و ویدئوها میپردازد. هدف این حوزه آن است که رایانه بتواند از دادههای بصری، اطلاعاتی دربارهٔ اشیا، ویژگیها، روابط مکانی، حرکت و ساختار محیط به دست آورد و از آنها در انجام وظایف مشخص استفاده کند.[۱]
بینایی ماشین از مبانی ریاضی، هندسه، آمار، پردازش تصویر و یادگیری ماشین بهره میگیرد. این حوزه در دهههای نخست شکلگیری خود عمدتاً بر روشهای هندسی و الگوریتمهای طراحیشده توسط پژوهشگران استوار بود، اما از دههٔ ۲۰۱۰، استفاده از شبکههای عصبی مصنوعی و یادگیری عمیق موجب تحول گستردهای در بسیاری از کاربردهای آن شد.[۲]
امروزه بینایی ماشین در تشخیص اشیا، تحلیل تصاویر پزشکی، هدایت رباتها، خودروهای خودران، کنترل کیفیت صنعتی، کشاورزی هوشمند، تحلیل تصاویر ماهوارهای، واقعیت افزوده و سامانههای چندوجهی هوش مصنوعی کاربرد دارد. در کنار این قابلیتها، استفاده از آن در شناسایی چهره و نظارت تصویری، پرسشهای مهمی دربارهٔ حریم خصوصی، حقوق شهروندی، سوگیری الگوریتمی و پاسخگویی ایجاد کرده است.
تعریف و ماهیت بینایی ماشین
بینایی ماشین مجموعهای از نظریهها، الگوریتمها و سامانههای محاسباتی است که برای استخراج اطلاعات معنادار از دادههای بصری توسعه یافتهاند.
این دادهها ممکن است از دوربینهای معمولی، دوربینهای عمقسنج، سامانههای تصویربرداری پزشکی، ماهوارهها، میکروسکوپها یا حسگرهای تخصصی به دست آمده باشند.
برای مثال، یک سامانهٔ بینایی ماشین ممکن است تصویری از یک خیابان را دریافت کند و وظیفه داشته باشد خودروها، عابران پیاده، علائم راهنمایی و خطوط مسیر را شناسایی کند.
سامانهای دیگر ممکن است تصویر پزشکی را بررسی و ناحیهای را که احتمال وجود یک ضایعه در آن بیشتر است مشخص کند.
در هر دو نمونه، هدف تبدیل دادهٔ تصویری به اطلاعات قابل استفاده برای یک وظیفهٔ مشخص است.
با این حال، تشخیص یک الگو در تصویر لزوماً به معنای فهم کامل صحنه به شیوهٔ انسانی نیست.
تفاوت بینایی ماشین و بینایی انسان
بینایی انسان فرایندی زیستی و شناختی است که از تعامل چشم، دستگاه عصبی و مغز شکل میگیرد.
انسان هنگام مشاهدهٔ یک صحنه، اطلاعات بصری را با حافظه، تجربه، دانش پیشین و دیگر حواس خود ترکیب میکند.
در مقابل، سامانههای بینایی ماشین از حسگرها، دادههای دیجیتال، مدلهای ریاضی و الگوریتمهای محاسباتی استفاده میکنند.
یک سامانه ممکن است در تشخیص نوع مشخصی از الگو عملکرد بسیار دقیقی داشته باشد، اما در برابر تغییر نور، زاویهٔ دید، شرایط محیط یا دادههای ناآشنا دچار خطا شود.
بنابراین، توانایی یک سامانه در تشخیص تصویر را نباید معادل برخورداری از ادراک یا آگاهی انسانی دانست.
تاریخچهٔ بینایی ماشین
پژوهشهای اولیه
ریشههای بینایی ماشین به پژوهشهای مرتبط با پردازش تصویر، هندسهٔ تصویری، تشخیص الگو و هوش مصنوعی در میانهٔ سدهٔ بیستم بازمیگردد.
در دهههای ۱۹۵۰ و ۱۹۶۰، پژوهشگران تلاش کردند روشهایی برای تشخیص اشکال هندسی، استخراج خطوط و بازسازی ساختار اشیا از تصاویر توسعه دهند.
لارنس رابرتس از پژوهشگران اثرگذار اولیه در تحلیل رایانهای تصاویر سهبعدی بود.
در این دوره، یکی از پرسشهای بنیادی آن بود که چگونه میتوان از یک تصویر دوبعدی، اطلاعاتی دربارهٔ ساختار سهبعدی جهان به دست آورد.
گسترش پژوهشها در دههٔ ۱۹۷۰
در دههٔ ۱۹۷۰، پژوهشهای بینایی ماشین به موضوعاتی مانند تشخیص لبه، بازسازی سهبعدی، تحلیل حرکت و بازنمایی هندسی صحنه گسترش یافت.
پژوهشگران تلاش کردند میان ویژگیهای تصویر و ساختار فیزیکی اشیای موجود در جهان ارتباط برقرار کنند.
در این دوره، هندسه و مدلسازی ریاضی نقش مهمی در توسعهٔ الگوریتمهای بینایی ماشین داشتند.
دیدگاه محاسباتی دیوید مار
دیوید مار، پژوهشگر علوم اعصاب و بینایی محاسباتی، در کتاب Vision: A Computational Investigation into the Human Representation and Processing of Visual Information که در سال ۱۹۸۲ منتشر شد، چارچوبی اثرگذار برای مطالعهٔ بینایی ارائه کرد.
او بر ضرورت بررسی مسئلهٔ بینایی در سطوح مختلف، از هدف محاسباتی گرفته تا بازنمایی و پیادهسازی، تأکید داشت.
این دیدگاه در شکلگیری مباحث نظری بینایی محاسباتی و علوم شناختی تأثیرگذار بود.
توسعهٔ روشهای هندسی
در دهههای ۱۹۸۰ و ۱۹۹۰، روشهای هندسی و آماری بینایی ماشین پیشرفت کردند.
موضوعاتی مانند تطبیق نقاط میان تصاویر، تخمین حرکت دوربین، بازسازی سهبعدی و تحلیل تصاویر چنددوربینی از محورهای مهم پژوهش بودند.
کتاب Multiple View Geometry in Computer Vision نوشتهٔ ریچارد هارتلی و اندرو زیسرمن از منابع مهم این حوزه است.[۳]
ظهور مجموعهدادههای بزرگ
با افزایش ظرفیت ذخیرهسازی و توان محاسباتی، مجموعهدادههای تصویری بزرگتری برای آموزش و ارزیابی الگوریتمها ایجاد شدند.
یکی از مهمترین آنها ImageNet بود که در سال ۲۰۰۹ در مقالهای از جیا دنگ و همکاران معرفی شد.
ImageNet مجموعهای گسترده از تصاویر سازماندهیشده بر اساس مفاهیم و دستههای معنایی است و در توسعهٔ پژوهشهای تشخیص تصویر نقش مهمی داشته است.[۴]
تحول یادگیری عمیق در سال ۲۰۱۲
یکی از نقاط عطف مهم بینایی ماشین در سال ۲۰۱۲ رخ داد.
الکس کریژفسکی، ایلیا سوتسکِوِر و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقهبندی تصاویر ImageNet معرفی کردند.
این مدل که بعدها با نام AlexNet شناخته شد، در رقابت ImageNet سال ۲۰۱۲ عملکرد برجستهای داشت و به گسترش استفاده از یادگیری عمیق در بینایی ماشین کمک کرد.[۵]
پس از آن، شبکههای عصبی پیچشی در بسیاری از وظایف تشخیص و تحلیل تصویر به روشهای اصلی تبدیل شدند.
شبکههای عمیقتر و ResNet
در سال ۲۰۱۵، کایمینگ هه و همکاران معماری ResNet را معرفی کردند.
این معماری از اتصالات باقیمانده برای تسهیل آموزش شبکههای عمیقتر استفاده میکرد.
ResNet در توسعهٔ شبکههای پیچشی عمیق و کاربردهای تشخیص تصویر تأثیرگذار بود.[۶]
ورود ترنسفورمرها به بینایی ماشین
در سال ۲۰۲۰، پژوهشگران مدل Vision Transformer یا ViT را معرفی کردند.
این مدل از معماری ترنسفورمر برای پردازش تصویر استفاده میکند.
در این روش، تصویر به قطعههایی تقسیم میشود و هر قطعه به بازنمایی عددی تبدیل میشود.
سپس روابط میان این قطعهها با استفاده از سازوکار توجه پردازش میشود.[۷]
این تحول نشان داد که ترنسفورمرها میتوانند در کنار شبکههای پیچشی، نقش مهمی در تحلیل تصاویر ایفا کنند.
مبانی علمی بینایی ماشین
بینایی ماشین بر مجموعهای از مبانی علمی و فنی استوار است.
این مبانی شامل تشکیل تصویر، پردازش سیگنال، هندسه، آمار، بهینهسازی و یادگیری ماشین هستند.
در بسیاری از مسائل، شناخت نحوهٔ تشکیل تصویر به اندازهٔ انتخاب الگوریتم اهمیت دارد.
برای مثال، یک شیء ممکن است به دلیل تغییر نور، فاصله، زاویهٔ دوربین یا انسداد جزئی، ظاهر متفاوتی در تصاویر داشته باشد.
تصویر دیجیتال
تصویر دیجیتال بازنمایی عددی یک تصویر است که معمولاً از آرایهای از پیکسلها تشکیل میشود.
در تصاویر خاکستری، هر پیکسل معمولاً مقداری مرتبط با شدت روشنایی دارد.
در تصاویر رنگی، هر پیکسل میتواند دارای چند مؤلفهٔ رنگی باشد.
یکی از نمایشهای رایج تصویر رنگی، مدل RGB است که از سه مؤلفهٔ قرمز، سبز و آبی استفاده میکند.
الگوریتمهای بینایی ماشین این دادههای عددی را برای استخراج ویژگیها و اطلاعات پردازش میکنند.
پیکسل و وضوح تصویر
پیکسل کوچکترین عنصر نمونهبرداریشده در بسیاری از تصاویر دیجیتال است.
وضوح مکانی تصویر معمولاً با تعداد پیکسلها در عرض و ارتفاع بیان میشود.
برای مثال، تصویری با ابعاد ۱۹۲۰ در ۱۰۸۰ پیکسل دارای بیش از دو میلیون پیکسل است.
با این حال، وضوح بالاتر لزوماً به معنای کیفیت بهتر همهٔ وظایف بینایی ماشین نیست.
نورپردازی، وضوح اپتیکی، نویز، فشردهسازی و کیفیت داده نیز اهمیت دارند.
پردازش تصویر
پردازش تصویر به مجموعهای از روشها برای تغییر، بهبود یا تحلیل دادههای تصویری گفته میشود.
این روشها میتوانند شامل کاهش نویز، تنظیم روشنایی، افزایش کنتراست، فیلترگذاری و تبدیل هندسی باشند.
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند، اما مترادف نیستند.
پردازش تصویر ممکن است صرفاً برای بهبود ظاهر تصویر انجام شود.
در مقابل، بینایی ماشین معمولاً به استخراج اطلاعات و انجام وظایف ادراکی یا تحلیلی از تصویر میپردازد.
استخراج ویژگی
استخراج ویژگی (Feature Extraction) فرایند شناسایی و بازنمایی اطلاعاتی از تصویر است که برای یک وظیفه مفید هستند.
در روشهای کلاسیک، ویژگیها ممکن است شامل لبهها، گوشهها، بافتها یا توصیفگرهای محلی باشند.
در روشهای مبتنی بر یادگیری عمیق، شبکه میتواند بازنماییهای مورد نیاز را در فرایند آموزش بیاموزد.
این تفاوت یکی از ویژگیهای مهم تحول بینایی ماشین در دههٔ ۲۰۱۰ بود.
تشخیص لبه
تشخیص لبه (Edge Detection) یکی از روشهای بنیادی پردازش تصویر است.
لبهها معمولاً با تغییرات قابل توجه شدت روشنایی یا رنگ در تصویر ارتباط دارند.
تشخیص لبه میتواند برای شناسایی مرز اشیا، تحلیل شکلها و آمادهسازی داده برای مراحل بعدی استفاده شود.
الگوریتم Canny از روشهای شناختهشدهٔ تشخیص لبه است.
تشخیص گوشه و نقاط کلیدی
در برخی مسائل، لازم است نقاط شاخص تصویر شناسایی شوند.
این نقاط ممکن است شامل گوشهها یا نواحی دارای الگوی محلی متمایز باشند.
نقاط کلیدی در تطبیق تصاویر، ردیابی، بازسازی سهبعدی و تخمین حرکت دوربین کاربرد دارند.
روشهایی مانند Harris و SIFT از روشهای شناختهشدهٔ این حوزه هستند.
طبقهبندی تصویر
طبقهبندی تصویر (Image Classification) یکی از وظایف اصلی بینایی ماشین است.
در این مسئله، سامانه یک تصویر را دریافت و آن را به یک یا چند دستهٔ مشخص نسبت میدهد.
برای مثال، مدل ممکن است تشخیص دهد که تصویر مربوط به گربه، سگ، خودرو یا هواپیماست.
طبقهبندی تصویر با تشخیص محل دقیق اشیا تفاوت دارد.
یک تصویر ممکن است دارای چندین شیء باشد، در حالی که مدل طبقهبندی ساده فقط یک برچسب کلی تولید کند.
تشخیص اشیا
تشخیص اشیا (Object Detection) به شناسایی اشیای موجود در تصویر و تعیین موقعیت آنها گفته میشود.
خروجی سامانه معمولاً شامل نوع شیء، میزان اطمینان مدل و مختصات ناحیهٔ مربوط به آن است.
برای مثال، یک سامانه ممکن است در تصویر خیابان چند خودرو و عابر پیاده را تشخیص دهد و برای هرکدام کادر مشخصی رسم کند.
این فناوری در رباتیک، کنترل ترافیک، تحلیل ویدئو و سامانههای کمکراننده کاربرد دارد.
بخشبندی تصویر
بخشبندی تصویر (Image Segmentation) فرایندی است که در آن پیکسلهای تصویر بر اساس ویژگی یا تعلق به نواحی مختلف دستهبندی میشوند.
بخشبندی در پزشکی، تحلیل تصاویر ماهوارهای، رباتیک و صنعت کاربرد دارد.
دو نوع مهم آن عبارتاند از:
- بخشبندی معنایی؛
- بخشبندی نمونهای.
بخشبندی معنایی
در بخشبندی معنایی (Semantic Segmentation)، برای هر پیکسل یک دستهٔ معنایی تعیین میشود.
برای مثال، در تصویر خیابان، پیکسلها ممکن است به دستههایی مانند جاده، ساختمان، آسمان، خودرو و عابر پیاده تقسیم شوند.
در این روش، اشیای جداگانهای که به یک دسته تعلق دارند لزوماً از یکدیگر متمایز نمیشوند.
بخشبندی نمونهای
در بخشبندی نمونهای (Instance Segmentation)، سامانه علاوه بر شناسایی دستهٔ اشیا، نمونههای جداگانهٔ هر دسته را نیز تفکیک میکند.
برای مثال، اگر سه خودرو در تصویر وجود داشته باشد، مدل میتواند ناحیهٔ هر خودرو را بهطور مستقل مشخص کند.
این قابلیت در تحلیل صحنههای پیچیده اهمیت دارد.
معماری U-Net
U-Net یکی از معماریهای شناختهشدهٔ شبکهٔ عصبی برای بخشبندی تصویر است.
این معماری در سال ۲۰۱۵ توسط اولاف رونبرگر، فیلیپ فیشر و توماس بروکس برای بخشبندی تصاویر زیستپزشکی معرفی شد.
U-Net از مسیر فشردهسازی و مسیر گسترش بازنماییها استفاده میکند و برای تعیین موقعیت دقیق ساختارهای موجود در تصویر طراحی شده است.[۸]
این معماری و گونههای بعدی آن در بسیاری از مسائل بخشبندی تصویر استفاده شدهاند.
تشخیص چهره
تشخیص چهره اصطلاحی است که در کاربرد عمومی ممکن است به چند وظیفهٔ متفاوت اشاره کند.
یکی از آنها یافتن محل چهره در تصویر است.
وظیفهٔ دیگر، شناسایی یا تأیید هویت فرد بر اساس ویژگیهای چهره است.
این دو کاربرد از نظر فنی و حقوقی یکسان نیستند.
سامانههای شناسایی چهره میتوانند در احراز هویت و مدیریت دسترسی استفاده شوند، اما کاربرد آنها در نظارت عمومی میتواند خطرهایی برای حریم خصوصی و آزادیهای مدنی ایجاد کند.
تشخیص و تحلیل حرکت
بینایی ماشین میتواند برای تحلیل تغییرات تصویر در طول زمان استفاده شود.
این حوزه شامل تشخیص حرکت، ردیابی اشیا و تخمین جهت یا سرعت حرکت است.
برای مثال، یک سامانهٔ نظارت بر ترافیک میتواند حرکت خودروها را در چندین فریم متوالی بررسی کند.
در رباتیک نیز تحلیل حرکت به درک تغییر موقعیت اشیا و دوربین کمک میکند.
جریان نوری
جریان نوری (Optical Flow) به الگوی حرکت ظاهری نقاط یا ساختارهای تصویری میان فریمهای متوالی اشاره دارد.
روشهای تخمین جریان نوری برای تحلیل حرکت، ردیابی و برخی کاربردهای ناوبری استفاده میشوند.
با این حال، حرکت ظاهری در تصویر همیشه معادل حرکت واقعی یک شیء در فضای سهبعدی نیست.
حرکت دوربین، تغییر نور و دیگر عوامل نیز میتوانند بر آن اثر بگذارند.
ردیابی اشیا
ردیابی اشیا (Object Tracking) فرایندی است که در آن سامانه تلاش میکند موقعیت یک یا چند شیء را در طول زمان دنبال کند.
برای مثال، پس از تشخیص یک خودرو در نخستین فریم ویدئو، سامانه میتواند موقعیت آن را در فریمهای بعدی تخمین بزند.
ردیابی در تحلیل ترافیک، ورزش، رباتیک و پردازش ویدئو کاربرد دارد.
تخمین وضعیت بدن انسان
تخمین وضعیت بدن (Human Pose Estimation) به شناسایی موقعیت نقاط یا مفاصل اصلی بدن در تصویر یا ویدئو گفته میشود.
این فناوری در تحلیل حرکت، ورزش، توانبخشی، تعامل انسان و رایانه و تولید انیمیشن کاربرد دارد.
عملکرد آن میتواند تحت تأثیر زاویهٔ دوربین، پوشش بدن، انسداد و کیفیت تصویر قرار گیرد.
بینایی سهبعدی
بینایی سهبعدی به روشهایی گفته میشود که برای استخراج اطلاعات مربوط به عمق، شکل و ساختار فضایی محیط از دادههای بصری استفاده میکنند.
این روشها میتوانند از تصاویر چنددوربینی، حرکت دوربین، حسگرهای عمق یا ترکیب چند منبع داده بهره بگیرند.
بینایی سهبعدی در رباتیک، نقشهبرداری، واقعیت افزوده و بازسازی دیجیتال اشیا کاربرد دارد.
تخمین عمق
تخمین عمق (Depth Estimation) فرایندی است که در آن فاصلهٔ نقاط یا اشیای صحنه نسبت به دوربین برآورد میشود.
این کار میتواند با استفاده از دو دوربین، حسگرهای تخصصی یا مدلهای یادگیری ماشین انجام شود.
تخمین عمق در ناوبری رباتها، خودروهای خودران و بازسازی سهبعدی اهمیت دارد.
بینایی استریو
بینایی استریو (Stereo Vision) از تصاویر ثبتشده از دو دیدگاه متفاوت برای تخمین ساختار سهبعدی استفاده میکند.
اختلاف موقعیت ظاهری نقاط متناظر در دو تصویر میتواند برای محاسبهٔ عمق به کار رود.
این روش از اصول هندسهٔ تصویری و روابط میان دوربینها استفاده میکند.
بازسازی سهبعدی
بازسازی سهبعدی (3D Reconstruction) فرایند ایجاد مدلی از ساختار سهبعدی یک شیء یا صحنه بر اساس دادههای تصویری است.
این فناوری در معماری، میراث فرهنگی، نقشهبرداری، پزشکی، صنعت و تولید محتوای دیجیتال کاربرد دارد.
کیفیت بازسازی به عواملی مانند تعداد تصاویر، زاویههای دید، بافت سطح و دقت کالیبراسیون وابسته است.
ساختار از حرکت
ساختار از حرکت (Structure from Motion یا SfM) مجموعهای از روشهاست که با استفاده از تصاویر ثبتشده از موقعیتهای متفاوت، ساختار سهبعدی صحنه و موقعیت نسبی دوربینها را تخمین میزند.
این روش در فتوگرامتری، نقشهبرداری و بازسازی سهبعدی کاربرد دارد.
مکانیابی و نقشهسازی همزمان
مکانیابی و نقشهسازی همزمان (Simultaneous Localization and Mapping یا SLAM) به مسئلهٔ تخمین موقعیت یک سامانه در محیط و ساخت نقشهای از همان محیط اشاره دارد.
در نوع بصری آن، اطلاعات دوربین برای تخمین حرکت و ساخت نقشه استفاده میشود.
این فناوری در رباتیک، پهپادها و واقعیت افزوده اهمیت دارد.
یادگیری ماشین در بینایی ماشین
یادگیری ماشین امکان میدهد مدلها برخی روابط و الگوهای تصویری را از داده بیاموزند.
در روشهای کلاسیک، پژوهشگر ممکن است ابتدا ویژگیهایی مانند لبهها یا بافتها را استخراج کند و سپس یک مدل طبقهبندی را آموزش دهد.
در روشهای مبتنی بر یادگیری عمیق، بخش بزرگی از استخراج ویژگی و تصمیمگیری میتواند در یک معماری قابل آموزش انجام شود.
انتخاب روش مناسب به نوع مسئله، مقدار داده، منابع محاسباتی و نیاز به توضیحپذیری وابسته است.
شبکههای عصبی پیچشی
شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) یکی از معماریهای مهم در بینایی ماشین است.
این شبکه از عملیات پیچش برای پردازش الگوهای محلی تصویر استفاده میکند.
شبکههای پیچشی میتوانند بازنماییهایی از ویژگیهای ساده تا ساختارهای پیچیدهتر بیاموزند.
موفقیت AlexNet در سال ۲۰۱۲ و توسعهٔ معماریهای بعدی مانند ResNet از مراحل مهم گسترش این روش بودند.[۵][۶]
ترنسفورمر بینایی
ترنسفورمر بینایی (Vision Transformer یا ViT) معماریای است که از سازوکار توجه برای پردازش تصاویر استفاده میکند.
در ساختار متعارف آن، تصویر به قطعههایی تقسیم و هر قطعه به یک بازنمایی برداری تبدیل میشود.
این بازنماییها همراه با اطلاعات موقعیتی به لایههای ترنسفورمر داده میشوند.
مدل میتواند روابط میان بخشهای مختلف تصویر را در فرایند یادگیری محاسبه کند.[۷]
ترنسفورمرهای بینایی در طبقهبندی تصویر و دیگر وظایف بینایی ماشین به کار گرفته شدهاند.
بینایی ماشین و مدلهای چندوجهی
مدل چندوجهی مدلی است که میتواند چند نوع داده مانند متن، تصویر یا صوت را پردازش کند.
بینایی ماشین یکی از اجزای مهم بسیاری از سامانههای چندوجهی است.
برای مثال، سامانهای که تصویری را دریافت و دربارهٔ محتوای آن به پرسشهای متنی پاسخ میدهد، باید اطلاعات بصری را با پردازش زبان ترکیب کند.
چنین سامانههایی میتوانند برای توصیف تصویر، جستوجوی بصری و تحلیل اسناد تصویری استفاده شوند.
با این حال، پاسخ متنی آنها ممکن است حاوی خطا یا توهم هوش مصنوعی باشد.
بینایی ماشین و هوش مصنوعی مولد
هوش مصنوعی مولد و بینایی ماشین حوزههایی مرتبط اما متفاوتاند.
بینایی ماشین عمدتاً بر استخراج و تحلیل اطلاعات از دادههای بصری تمرکز دارد.
در مقابل، مدلهای مولد برای تولید داده یا محتوای جدید آموزش داده میشوند.
با این حال، بسیاری از سامانههای جدید هر دو قابلیت را ترکیب میکنند.
برای مثال، یک سامانه ممکن است ابتدا اجزای تصویر را شناسایی و سپس بر اساس دستور متنی، تصویر تازهای تولید یا تصویر موجود را ویرایش کند.
بینایی ماشین در پزشکی
یکی از کاربردهای مهم بینایی ماشین، تحلیل تصاویر پزشکی است.
این تصاویر میتوانند شامل رادیوگرافی، سیتیاسکن، امآرآی، سونوگرافی و تصاویر میکروسکوپی باشند.
سامانههای بینایی ماشین ممکن است برای شناسایی الگوهای غیرعادی، بخشبندی اندامها یا اندازهگیری ساختارهای تصویری آموزش داده شوند.
معماری U-Net از نمونههای اثرگذار در بخشبندی تصاویر زیستپزشکی است.[۸]
با این حال، عملکرد یک مدل در محیط آزمایشگاهی لزوماً به معنای اعتبار بالینی آن نیست.
کاربرد پزشکی نیازمند اعتبارسنجی، ارزیابی ایمنی و نظارت متخصصان است.
بینایی ماشین در خودروهای خودران
خودروهای خودران و سامانههای کمکراننده میتوانند از بینایی ماشین برای تحلیل محیط اطراف استفاده کنند.
وظایف آنها ممکن است شامل تشخیص خودروها، عابران پیاده، دوچرخهسواران، علائم راهنمایی و خطوط جاده باشد.
این سامانهها گاهی دادههای دوربین را با اطلاعات رادار، لیدار و دیگر حسگرها ترکیب میکنند.
با این حال، عملکرد بینایی ماشین ممکن است تحت تأثیر باران، مه، تاریکی، انعکاس نور یا انسداد دید قرار گیرد.
به همین دلیل، ایمنی سامانههای خودران به مجموعهای از اجزای فنی، آزمونها و سازوکارهای کنترلی وابسته است.
بینایی ماشین در رباتیک
رباتها میتوانند از بینایی ماشین برای شناسایی اشیا، تخمین فاصله، تشخیص موانع و هدایت حرکت استفاده کنند.
برای مثال، یک ربات صنعتی ممکن است قطعات موجود روی خط تولید را شناسایی و موقعیت آنها را برای بازوی مکانیکی تعیین کند.
در رباتهای متحرک، بینایی ماشین میتواند در کنار حسگرهای دیگر به ناوبری و نقشهسازی کمک کند.
بینایی صنعتی
بینایی صنعتی (Machine Vision) به کاربرد سامانههای تصویربرداری و تحلیل تصویر در محیطهای صنعتی، بهویژه تولید و کنترل کیفیت، گفته میشود.
بینایی صنعتی با بینایی ماشین ارتباط نزدیک دارد، اما معمولاً بر کاربردهای عملی در خطوط تولید، اندازهگیری، بازرسی و هدایت تجهیزات تمرکز میکند.
برای مثال، یک سامانهٔ بینایی صنعتی میتواند قطعات معیوب را روی نوار نقاله شناسایی کند.
بنابراین بینایی صنعتی را میتوان یکی از حوزههای کاربردی مرتبط با بینایی ماشین دانست، نه مترادف کامل آن.
کنترل کیفیت صنعتی
در خطوط تولید، سامانههای بینایی ماشین میتوانند برای بررسی ظاهر محصولات استفاده شوند.
این بررسی ممکن است شامل تشخیص ترک، خراش، تغییر شکل، نقص مونتاژ یا اشتباه در بستهبندی باشد.
کارایی چنین سامانههایی به کیفیت تصویربرداری، نورپردازی و شرایط محیط وابسته است.
بینایی ماشین در کشاورزی
بینایی ماشین در کشاورزی برای تحلیل وضعیت گیاهان، شناسایی برخی آفات و بیماریها، ارزیابی رشد محصول و مدیریت ماشینآلات کشاورزی استفاده میشود.
تصاویر ممکن است از دوربینهای زمینی، پهپادها یا ماهوارهها به دست آمده باشند.
این سامانهها میتوانند به کشاورزان در پایش زمین و تصمیمگیری کمک کنند.
اما عملکرد مدل باید با شرایط اقلیمی، نوع محصول و دادههای محلی سازگار باشد.
بینایی ماشین در تصاویر ماهوارهای
تحلیل تصاویر ماهوارهای یکی از کاربردهای مهم بینایی ماشین و سنجش از دور است.
الگوریتمها میتوانند برای شناسایی تغییرات پوشش زمین، گسترش مناطق شهری، بررسی جنگلها و پایش برخی رخدادهای محیطی استفاده شوند.
دادههای ماهوارهای ممکن است علاوه بر نور مرئی، شامل باندهای طیفی دیگری باشند.
بنابراین تحلیل آنها گاهی به روشهای تخصصی پردازش دادههای چندطیفی نیاز دارد.
بینایی ماشین و محیط زیست
بینایی ماشین میتواند در پایش حیات وحش، بررسی پوشش گیاهی، تحلیل تصاویر جنگلها و شناسایی تغییرات محیطی کاربرد داشته باشد.
برای مثال، تصاویر دوربینهای تلهای حیات وحش میتوانند با استفاده از مدلهای تشخیص تصویر بررسی شوند.
این فناوری میتواند حجم کار تحلیل تصاویر را کاهش دهد، اما نتایج آن باید از نظر خطاهای شناسایی ارزیابی شوند.
بینایی ماشین در میراث فرهنگی
در پژوهشهای میراث فرهنگی، بینایی ماشین میتواند برای بازسازی سهبعدی بناها، تحلیل تصاویر آثار تاریخی و تطبیق تصاویر قدیمی و جدید استفاده شود.
روشهای فتوگرامتری و بازسازی سهبعدی در مستندسازی بناها و اشیای تاریخی اهمیت دارند.
این فناوری همچنین میتواند به ثبت دیجیتال وضعیت آثار و بررسی تغییرات آنها در طول زمان کمک کند.
بینایی ماشین و اسناد تاریخی
بینایی ماشین در دیجیتالسازی و تحلیل اسناد تاریخی کاربرد دارد.
از جمله وظایف مرتبط میتوان به شناسایی ساختار صفحه، تشخیص نواحی متن، جداسازی تصاویر و آمادهسازی داده برای تشخیص نویسهها اشاره کرد.
تشخیص نوری نویسهها (OCR) یکی از فناوریهای مرتبط است که متن موجود در تصویر را به دادهٔ متنی تبدیل میکند.
در اسناد تاریخی، کیفیت کاغذ، فرسودگی، نوع خط و وضوح تصویر میتوانند بر نتیجه تأثیر بگذارند.
بینایی ماشین و زبان فارسی
بینایی ماشین در پردازش اسناد فارسی و شناسایی نوشتههای فارسی نیز کاربرد دارد.
یکی از مسائل مهم، تشخیص متن در تصاویر و اسناد اسکنشده است.
ویژگیهایی مانند پیوستگی حروف، شکلهای متفاوت نویسهها و وجود نقطهها میتوانند بر طراحی سامانههای تشخیص متن تأثیر بگذارند.
در متون تاریخی، تفاوت خط، کیفیت چاپ و آسیبدیدگی اسناد دشواری بیشتری ایجاد میکند.
سامانههای پردازش اسناد فارسی میتوانند از ترکیب بینایی ماشین و پردازش زبان طبیعی استفاده کنند.
بینایی ماشین در آموزش
بینایی ماشین در ابزارهای آموزشی، تحلیل تصاویر علمی و سامانههای کمکآموزشی کاربرد دارد.
برای مثال، یک برنامهٔ آموزشی میتواند تصویر یک نمودار یا شکل هندسی را دریافت و اجزای آن را شناسایی کند.
در ابزارهای دسترسپذیری نیز سامانههای توصیف تصویر میتوانند به کاربران نابینا یا کمبینا کمک کنند.
با این حال، اطلاعات تولیدشده توسط این سامانهها باید از نظر دقت و محدودیتهای کاربرد بررسی شود.
بینایی ماشین در ورزش
در ورزش، بینایی ماشین برای تحلیل حرکت بازیکنان، ردیابی توپ، بررسی وضعیت بدن و تحلیل ویدئو استفاده میشود.
این فناوری میتواند در آموزش ورزشکاران، تحلیل مسابقات و برخی سامانههای داوری کمکی کاربرد داشته باشد.
دقت نتیجه به کیفیت دوربینها، زاویهٔ دید و روش پردازش داده وابسته است.
بینایی ماشین و واقعیت افزوده
واقعیت افزوده (Augmented Reality) فناوریای است که اطلاعات یا عناصر دیجیتال را با نمای محیط واقعی ترکیب میکند.
بینایی ماشین میتواند برای شناسایی سطوح، تخمین حرکت دوربین و تعیین موقعیت عناصر مجازی استفاده شود.
این فناوری در آموزش، طراحی، بازی و کاربردهای صنعتی مورد استفاده قرار میگیرد.
مجموعهدادههای بینایی ماشین
توسعه و ارزیابی مدلهای بینایی ماشین به مجموعهدادههای مناسب نیاز دارد.
این مجموعهها ممکن است شامل تصاویر، برچسبهای طبقهبندی، کادرهای اشیا یا نقشههای بخشبندی باشند.
از مجموعهدادههای شناختهشده میتوان به ImageNet، COCO و MNIST اشاره کرد.
هر مجموعهداده برای هدف مشخصی طراحی شده و محدودیتهای خاص خود را دارد.
برای مثال، عملکرد مناسب یک مدل روی یک مجموعهدادهٔ معیار لزوماً نشاندهندهٔ عملکرد مشابه در همهٔ محیطهای واقعی نیست.
آموزش مدلهای بینایی ماشین
در روشهای مبتنی بر یادگیری نظارتشده، مدل با استفاده از نمونههای دارای برچسب آموزش داده میشود.
برای مثال، تصاویر ممکن است با نام اشیای موجود در آنها برچسبگذاری شوند.
مدل با مقایسهٔ خروجی خود و برچسب هدف، پارامترهایش را تنظیم میکند.
در روشهای خودنظارتشده، بخشی از اطلاعات آموزشی از ساختار خود داده به دست میآید.
انتخاب روش آموزش به نوع وظیفه، داده و منابع محاسباتی بستگی دارد.
افزایش داده
افزایش داده (Data Augmentation) به ایجاد تغییرات کنترلشده در نمونههای آموزشی گفته میشود.
برای مثال، ممکن است تصویر چرخانده، برش داده یا روشنایی آن تغییر داده شود.
هدف این است که مدل با تنوع بیشتری از نمونهها روبهرو شود و در شرایط متفاوت عملکرد مناسبتری داشته باشد.
البته همهٔ تغییرات برای همهٔ وظایف مجاز یا مفید نیستند.
برای مثال، در برخی کاربردهای پزشکی، تغییر نامناسب تصویر ممکن است اطلاعات مهمی را مخدوش کند.
ارزیابی مدلهای بینایی ماشین
ارزیابی مدلهای بینایی ماشین باید بر اساس وظیفهٔ مورد نظر انجام شود.
در طبقهبندی، معیارهایی مانند دقت، بازخوانی و امتیاز F1 استفاده میشوند.
در تشخیص اشیا، معیارهایی مانند میانگین دقت متوسط (mAP) رایج هستند.
در بخشبندی تصویر، معیارهایی مانند اشتراک بر اجتماع (IoU) و ضریب Dice کاربرد دارند.
انتخاب معیار باید با هدف عملی سامانه هماهنگ باشد.
دقت و خطا
یکی از مسائل مهم در ارزیابی بینایی ماشین، تفاوت میان دقت آزمایشگاهی و عملکرد واقعی است.
مدلی که در مجموعهدادهای مشخص عملکرد بالایی دارد، ممکن است در محیطی با نور، زاویه یا کیفیت تصویر متفاوت دچار خطا شود.
به همین دلیل، ارزیابی باید تا حد امکان شامل دادههایی نزدیک به شرایط واقعی استفاده باشد.
محدودیتهای بینایی ماشین
بینایی ماشین با وجود پیشرفتهای گسترده محدودیتهایی دارد.
یکی از این محدودیتها وابستگی عملکرد به کیفیت تصویر است.
نور نامناسب، تاری، انسداد، زاویهٔ دید غیرمعمول و نویز میتوانند تشخیص را دشوار کنند.
محدودیت دیگر، وابستگی بسیاری از مدلها به دادههای آموزشی است.
اگر شرایط واقعی با دادههای آموزش تفاوت زیادی داشته باشد، عملکرد مدل ممکن است کاهش یابد.
تغییر توزیع داده
تغییر توزیع داده (Distribution Shift) زمانی رخ میدهد که دادههای زمان استفاده با دادههای آموزش یا ارزیابی تفاوت معناداری داشته باشند.
برای مثال، مدلی که با تصاویر روز آموزش دیده ممکن است در تصاویر شب عملکرد ضعیفتری داشته باشد.
این مسئله در سامانههای صنعتی، پزشکی و حملونقل اهمیت ویژهای دارد.
سوگیری الگوریتمی
سوگیری الگوریتمی یکی از مسائل مهم بینایی ماشین است.
اگر دادههای آموزشی پوشش نامتوازنی از شرایط، گروهها یا محیطهای مختلف داشته باشند، عملکرد مدل ممکن است برای برخی گروهها یا شرایط ضعیفتر باشد.
این مسئله در سامانههای تشخیص چهره و تصمیمگیری مبتنی بر تصویر اهمیت ویژهای دارد.
ارزیابی منصفانه باید تفاوت نرخ خطا میان گروهها و شرایط مختلف را نیز بررسی کند.
حریم خصوصی و نظارت تصویری
بینایی ماشین میتواند در سامانههای نظارتی برای شناسایی اشیا، ردیابی افراد یا تحلیل رفتارهای تصویری استفاده شود.
این کاربردها میتوانند مسائل مهمی دربارهٔ حریم خصوصی، رضایت، نگهداری داده و نظارت عمومی ایجاد کنند.
استفاده از تشخیص چهره برای شناسایی افراد در فضاهای عمومی، بهویژه در صورت نبود شفافیت و نظارت مستقل، میتواند خطرهایی برای آزادیهای مدنی به همراه داشته باشد.
ارزیابی این خطرها باید با توجه به کاربرد مشخص، قوانین مربوط و آثار واقعی سامانه انجام شود.
بینایی ماشین و حقوق بشر
کاربرد بینایی ماشین در شناسایی افراد، نظارت عمومی و تحلیل رفتار میتواند با حقوق بنیادین شهروندان ارتباط پیدا کند.
از جمله مسائل مهم میتوان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و حق برخورداری از رفتار برابر اشاره کرد.
استفاده از سامانههای تشخیص چهره در محیطهای عمومی ممکن است به شناسایی و ردیابی افراد بدون اطلاع یا رضایت آنان منجر شود.
در چنین مواردی، ضرورت قانونیبودن، تناسب، شفافیت و پاسخگویی از موضوعات مهم ارزیابی حقوق بشری است.
بینایی ماشین و امنیت
سامانههای بینایی ماشین ممکن است در معرض حملات فنی قرار گیرند.
یکی از نمونهها، حملات خصمانه است که در آن تغییرات طراحیشده در تصویر میتواند مدل را به تشخیص نادرست سوق دهد.
این مسئله در سامانههای امنیتی و کاربردهای حساس اهمیت دارد.
همچنین دستکاری دادههای آموزشی یا تصاویر ورودی میتواند بر عملکرد سامانه اثر بگذارد.
تصاویر ساختگی و دیپفیک
پیشرفت هوش مصنوعی مولد موجب گسترش امکان تولید تصاویر و ویدئوهای مصنوعی شده است.
اصطلاح دیپفیک معمولاً به محتوای مصنوعی یا دستکاریشدهای اشاره دارد که میتواند چهره، صدا یا رفتار فردی را بهصورت گمراهکننده بازنمایی کند.
بینایی ماشین میتواند در پژوهشهای تشخیص دستکاری تصویر و تحلیل اصالت محتوا به کار رود.
با این حال، هیچ روش تشخیص خودکاری را نباید برای همهٔ انواع تصاویر و ویدئوهای مصنوعی بیخطا فرض کرد.
بینایی ماشین و توهم هوش مصنوعی
در سامانههایی که بینایی ماشین را با مدلهای زبانی ترکیب میکنند، امکان تولید توصیفهای نادرست از تصویر وجود دارد.
برای مثال، مدل ممکن است شیئی را در تصویر توصیف کند که واقعاً وجود ندارد یا رابطهٔ میان اشیا را اشتباه تشخیص دهد.
این مسئله با توهم هوش مصنوعی ارتباط دارد.
در کاربردهای پژوهشی و دانشنامهای، توصیف تولیدشده توسط مدل باید با تصویر اصلی و منابع مستقل تطبیق داده شود.
تفسیرپذیری بینایی ماشین
بسیاری از مدلهای عمیق بینایی ماشین دارای تعداد زیادی پارامتر هستند.
در چنین مدلهایی، توضیح دقیق اینکه چرا تصویر به یک دستهٔ مشخص نسبت داده شده ممکن است دشوار باشد.
پژوهشگران روشهایی مانند نقشههای برجستگی و تحلیل حساسیت را برای بررسی عوامل مؤثر بر پیشبینی توسعه دادهاند.
با این حال، نمایش نواحی مورد توجه مدل لزوماً توضیح کامل و قطعی تصمیم آن نیست.
مصرف انرژی و منابع محاسباتی
آموزش برخی مدلهای بزرگ بینایی ماشین میتواند به سختافزار و انرژی قابل توجهی نیاز داشته باشد.
هزینهٔ محاسباتی به اندازهٔ مدل، وضوح تصویر، حجم داده، تعداد مراحل آموزش و نوع سختافزار بستگی دارد.
در کاربردهای عملی، بهینهسازی مدل برای اجرا روی دستگاههای کممصرف نیز اهمیت دارد.
بینایی ماشین و تمرکز قدرت فناوری
توسعهٔ مدلهای بزرگ و مجموعهدادههای گسترده ممکن است به سرمایه و زیرساخت محاسباتی قابل توجه نیاز داشته باشد.
این مسئله میتواند مشارکت مؤسسات دارای منابع محدود را دشوار کند.
در مقابل، انتشار کدهای پژوهشی، مجموعهدادههای مجاز و مدلهای قابل استفادهٔ عمومی میتواند دسترسی پژوهشگران بیشتری را فراهم سازد.
البته انتشار دادههای تصویری باید با رعایت حقوق افراد و الزامات حریم خصوصی انجام شود.
بینایی ماشین و دانشنامهنویسی
بینایی ماشین میتواند در گردآوری، ساماندهی و تحلیل منابع تصویری دانشنامهها کاربرد داشته باشد.
برای مثال، این فناوری ممکن است برای شناسایی متن در اسناد اسکنشده، طبقهبندی تصاویر، تشخیص تصاویر مشابه یا بررسی کیفیت فایلهای تصویری استفاده شود.
در دانشنامهنویسی تاریخی، بینایی ماشین میتواند به آمادهسازی اسناد و تصاویر برای بررسی پژوهشگران کمک کند.
با این حال، خروجی سامانه نباید جایگزین بررسی منبع اصلی شود.
تشخیص خودکار چهره، مکان یا تاریخ یک عکس ممکن است اشتباه باشد.
بنابراین اطلاعات مربوط به هویت اشخاص، زمان ثبت تصاویر و اصالت اسناد باید با منابع معتبر راستیآزمایی شود.
آیندهٔ بینایی ماشین
پژوهش دربارهٔ بینایی ماشین در زمینههای متعددی ادامه دارد.
از جمله موضوعات مهم میتوان به توسعهٔ مدلهای چندوجهی، بهبود تحلیل ویدئو، پردازش سهبعدی، کاهش نیاز به دادههای برچسبدار، افزایش کارایی محاسباتی و بهبود قابلیت اعتماد اشاره کرد.
یکی از جهتگیریهای مهم، توسعهٔ سامانههایی است که بتوانند اطلاعات بصری را با زبان، صوت و دیگر انواع داده ترکیب کنند.
همچنین افزایش شفافیت، کاهش سوگیری و حفاظت از حریم خصوصی از مسائل مهم آیندهٔ این حوزه خواهند بود.
تفاوت بینایی ماشین و پردازش تصویر
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند.
پردازش تصویر معمولاً بر تبدیل یا بهبود دادههای تصویری تمرکز دارد.
در مقابل، بینایی ماشین به استخراج اطلاعات و استنتاج دربارهٔ محتوای تصویر میپردازد.
برای مثال، کاهش نویز یک عکس نمونهای از پردازش تصویر است.
تشخیص اینکه در همان عکس چه اشیایی وجود دارند، نمونهای از وظایف بینایی ماشین است.
البته در بسیاری از سامانهها، این دو حوزه با یکدیگر ترکیب میشوند.
تفاوت بینایی ماشین و یادگیری عمیق
یادگیری عمیق حوزهای از یادگیری ماشین است که عمدتاً از شبکههای عصبی چندلایه استفاده میکند.
بینایی ماشین حوزهای کاربردی و پژوهشی برای تحلیل دادههای بصری است.
بسیاری از روشهای جدید بینایی ماشین از یادگیری عمیق بهره میگیرند، اما همهٔ روشهای بینایی ماشین مبتنی بر یادگیری عمیق نیستند.
روشهای هندسی، پردازش تصویر و الگوریتمهای کلاسیک نیز بخش مهمی از این حوزه را تشکیل میدهند.
تفاوت بینایی ماشین و هوش مصنوعی مولد
بینایی ماشین عمدتاً به تحلیل و استخراج اطلاعات از تصاویر و ویدئوها میپردازد.
هوش مصنوعی مولد بر تولید داده یا محتوای جدید تمرکز دارد.
یک سامانهٔ تشخیص اشیا نمونهای از کاربرد بینایی ماشین است.
یک سامانهٔ تولید تصویر از متن نمونهای از هوش مصنوعی مولد محسوب میشود.
با این حال، سامانههای جدید ممکن است هر دو قابلیت را در یک معماری ترکیب کنند.
جمعبندی
بینایی ماشین یکی از حوزههای بنیادی هوش مصنوعی است که به توسعهٔ روشهای محاسباتی برای استخراج و تحلیل اطلاعات از تصاویر و ویدئوها میپردازد.
این حوزه از پژوهشهای اولیهٔ پردازش تصویر و هندسهٔ تصویری در میانهٔ سدهٔ بیستم شکل گرفت و بهتدریج به موضوعاتی مانند تشخیص اشیا، تحلیل حرکت، بازسازی سهبعدی و درک صحنه گسترش یافت.
از دههٔ ۲۰۱۰، پیشرفت شبکههای عصبی مصنوعی و یادگیری عمیق موجب تحول مهمی در بسیاری از وظایف بینایی ماشین شد. توسعهٔ AlexNet، ResNet، U-Net و ترنسفورمرهای بینایی از مراحل اثرگذار این تحول بودند.[۵][۶][۸][۷]
امروزه بینایی ماشین در پزشکی، صنعت، رباتیک، حملونقل، کشاورزی، پژوهش و تحلیل اسناد کاربرد دارد.
با این حال، محدودیتهای فنی، وابستگی به کیفیت داده، سوگیری الگوریتمی، خطر خطا در شرایط واقعی و مسائل مربوط به حریم خصوصی و نظارت تصویری از چالشهای مهم آن به شمار میروند.
اهمیت بینایی ماشین در آن است که یکی از ابزارهای اصلی تبدیل دادههای بصری به اطلاعات قابل استفاده برای سامانههای محاسباتی را فراهم میکند؛ ابزاری که با گسترش هوش مصنوعی چندوجهی، نقش آن در فناوری و جامعه افزایش یافته است.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- یادگیری عمیق
- شبکه عصبی مصنوعی
- ترنسفورمر
- مدل زبانی بزرگ
- هوش مصنوعی مولد
- پردازش زبان طبیعی
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- علم داده
- الگوریتم
- علوم رایانه
- رباتیک
- واقعیت افزوده
- تشخیص چهره
- پردازش تصویر
منابع
- ↑ Szeliski, Richard. Computer Vision: Algorithms and Applications. 2nd ed. Springer, 2022.
- ↑ LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444.
- ↑ Hartley, Richard, and Andrew Zisserman. Multiple View Geometry in Computer Vision. 2nd ed. Cambridge University Press, 2004.
- ↑ Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” IEEE Conference on Computer Vision and Pattern Recognition, 2009.
- ↑ ۵٫۰ ۵٫۱ ۵٫۲ Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012).
- ↑ ۶٫۰ ۶٫۱ ۶٫۲ He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” 2015.
- ↑ ۷٫۰ ۷٫۱ ۷٫۲ Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” 2020.
- ↑ ۸٫۰ ۸٫۱ ۸٫۲ Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” 2015.
کتابشناسی
- Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” IEEE Conference on Computer Vision and Pattern Recognition, 2009. متن مقاله
- Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” International Conference on Learning Representations, 2021. متن مقاله
- Hartley, Richard, and Andrew Zisserman. Multiple View Geometry in Computer Vision. 2nd ed. Cambridge: Cambridge University Press, 2004.
- He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016. متن مقاله
- Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012). متن مقاله
- LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444. متن مقاله
- Marr, David. Vision: A Computational Investigation into the Human Representation and Processing of Visual Information. San Francisco: W. H. Freeman, 1982.
- Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” Medical Image Computing and Computer-Assisted Intervention, 2015. متن مقاله
- Szeliski, Richard. Computer Vision: Algorithms and Applications. 2nd ed. Cham: Springer, 2022. معرفی کتاب و مشخصات ناشر
```