بینایی ماشین: تفاوت میان نسخه‌ها

از ایران پدیا
پرش به ناوبری پرش به جستجو
نوشتن یک مقاله جدید
بدون خلاصۀ ویرایش
 
خط ۱: خط ۱:
{{جعبه اطلاعات مفهوم
{{جعبه اطلاعات مفهوم
| نام                = شبکهٔ عصبی مصنوعی
| نام                = بینایی ماشین
| نام اصلی            = Artificial Neural Network
| نام اصلی            = Computer Vision
| نام‌های دیگر        = شبکهٔ عصبی، شبکهٔ نورونی مصنوعی، ANN
| نام‌های دیگر        = بینایی رایانه‌ای، بینایی کامپیوتری
| تصویر              =
| تصویر              =
| اندازه تصویر        =
| اندازه تصویر        =
| توضیح تصویر        =
| توضیح تصویر        =
| حوزه                = [[هوش مصنوعی]]، [[یادگیری ماشین]]، [[یادگیری عمیق]]، [[علوم رایانه]]، علوم شناختی
| حوزه                = [[هوش مصنوعی]]، [[علوم رایانه]]، [[یادگیری ماشین]]، [[یادگیری عمیق]]، پردازش تصویر
| دوره                = از دههٔ ۱۹۴۰ میلادی تاکنون
| دوره                = شکل‌گیری پژوهش‌های اولیه در دهه‌های ۱۹۵۰ و ۱۹۶۰ میلادی؛ گسترش گسترده از دههٔ ۱۹۷۰ تاکنون
| خاستگاه            = منطق ریاضی، علوم اعصاب، علوم رایانه، آمار و پژوهش‌های اولیهٔ هوش مصنوعی
| خاستگاه            = علوم رایانه، پردازش سیگنال، هندسه، عکاسی، رباتیک و پژوهش‌های هوش مصنوعی
| تاریخ شکل‌گیری      = ۱۹۴۳ میلادی؛ معرفی مدل منطقی مک‌کالاک و پیتس
| تاریخ شکل‌گیری      = فاقد تاریخ تأسیس واحد؛ توسعه به‌عنوان حوزه‌ای پژوهشی از دههٔ ۱۹۶۰ میلادی
| بنیان‌گذاران        = فاقد بنیان‌گذار واحد؛ وارن مک‌کالاک و والتر پیتس از پیشگامان نظری
| بنیان‌گذاران        = فاقد بنیان‌گذار واحد
| چهره‌های شاخص      = وارن مک‌کالاک، والتر پیتس، دونالد هب، فرانک روزنبلات، برنارد ویدرو، دیوید روملهارت، جفری هینتون، یان لکون، یوشوا بنجیو
| چهره‌های شاخص      = لارنس رابرتس، دیوید مار، برتولد هورن، توماسو پوجو، ریچارد هارتلی، اندرو زیسرمن، یان لکون، فِی‌فِی لی، ریچارد سزلیسکی
| پیشگامان فکری      = پژوهشگران عصب‌شناسی محاسباتی، منطق ریاضی، یادگیری آماری و علوم شناختی
| پیشگامان فکری      = پژوهشگران ادراک بصری، هندسهٔ تصویری، پردازش سیگنال، علوم شناختی و هوش مصنوعی
| جریان‌های مرتبط    = اتصال‌گرایی، یادگیری بازنمایی، [[یادگیری عمیق]]، یادگیری نظارت‌شده، یادگیری خودنظارت‌شده، [[هوش مصنوعی مولد]]
| جریان‌های مرتبط    = بینایی محاسباتی، پردازش تصویر، تشخیص الگو، [[شبکه عصبی مصنوعی]]، [[یادگیری عمیق]]، [[ترنسفورمر]]، رباتیک
| در واکنش به        = تلاش برای مدل‌سازی محاسباتی برخی ویژگی‌های پردازش اطلاعات و یادگیری در شبکه‌های عصبی زیستی
| در واکنش به        = مسئلهٔ استخراج اطلاعات و بازنمایی ساختار جهان از تصاویر و داده‌های بصری
| مفاهیم کلیدی        = نورون مصنوعی، وزن، سوگیری، تابع فعال‌سازی، لایهٔ ورودی، لایهٔ پنهان، لایهٔ خروجی، تابع زیان، گرادیان نزولی، پس‌انتشار، تعمیم
| مفاهیم کلیدی        = پیکسل، استخراج ویژگی، طبقه‌بندی تصویر، تشخیص شیء، بخش‌بندی تصویر، ردیابی، جریان نوری، بازسازی سه‌بعدی، تخمین عمق، تشخیص چهره
| دیدگاه معرفت‌شناختی = یادگیری بازنمایی‌ها و روابط آماری از داده از طریق تنظیم پارامترهای یک شبکهٔ محاسباتی
| دیدگاه معرفت‌شناختی = استنتاج اطلاعات دربارهٔ اشیا، صحنه‌ها، حرکت و ساختار محیط از داده‌های بصری و مدل‌های محاسباتی
| دیدگاه اجتماعی      = کاربرد در پزشکی، صنعت، ارتباطات، آموزش، پژوهش و تولید محتوا؛ همراه با مسائل مربوط به شفافیت، سوگیری، حریم خصوصی و پاسخگویی
| دیدگاه اجتماعی      = کاربرد در پزشکی، صنعت، حمل‌ونقل، کشاورزی، پژوهش و فناوری‌های نظارتی؛ همراه با مسائل حریم خصوصی، تبعیض، امنیت و پاسخگویی
| تأثیرپذیرفته از    = عصب‌شناسی، منطق، آمار، نظریهٔ یادگیری، بهینه‌سازی و علوم شناختی
| تأثیرپذیرفته از    = علوم اعصاب بینایی، روان‌شناسی ادراک، هندسه، آمار، یادگیری ماشین و پردازش سیگنال
| تأثیرگذار بر        = [[یادگیری عمیق]]، [[ترنسفورمر]]، [[مدل زبانی بزرگ]]، [[هوش مصنوعی مولد]]، بینایی ماشین، تشخیص گفتار و رباتیک
| تأثیرگذار بر        = خودروهای خودران، رباتیک، تصویربرداری پزشکی، واقعیت افزوده، سامانه‌های نظارتی، [[هوش مصنوعی مولد]] و مدل‌های چندوجهی
| منتقدان شاخص        = ماروین مینسکی و سیمور پیپرت در نقد محدودیت‌های پرسپترون‌های اولیه؛ پژوهشگران تفسیرپذیری، ایمنی و عدالت الگوریتمی
| منتقدان شاخص        = پژوهشگران اخلاق هوش مصنوعی، حقوق دیجیتال، حریم خصوصی و عدالت الگوریتمی
| آثار شاخص          = ''A Logical Calculus of the Ideas Immanent in Nervous Activity''؛ ''The Perceptron''؛ ''Perceptrons''؛ ''Learning Representations by Back-Propagating Errors''؛ ''Deep Learning''
| آثار شاخص          = ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information''؛ ''Multiple View Geometry in Computer Vision''؛ ''Computer Vision: Algorithms and Applications''؛ ''ImageNet Classification with Deep Convolutional Neural Networks''
}}
}}


'''شبکهٔ عصبی مصنوعی''' (به انگلیسی: ''Artificial Neural Network'' و به اختصار ''ANN'') نوعی مدل محاسباتی در حوزهٔ [[هوش مصنوعی]] و [[یادگیری ماشین]] است که از مجموعه‌ای از واحدهای پردازشی به‌هم‌پیوسته، موسوم به '''نورون‌های مصنوعی'''، تشکیل می‌شود. این واحدها با استفاده از روابط ریاضی، داده‌های ورودی را پردازش می‌کنند و در بسیاری از انواع شبکه‌های عصبی، با تنظیم پارامترهایی مانند وزن‌ها و سوگیری‌ها، الگوهای موجود در داده را می‌آموزند.
'''بینایی ماشین''' (به انگلیسی: ''Computer Vision'')، که با نام‌های '''بینایی رایانه‌ای''' و '''بینایی کامپیوتری''' نیز شناخته می‌شود، شاخه‌ای از [[هوش مصنوعی]] و [[علوم رایانه]] است که به توسعهٔ روش‌ها و سامانه‌هایی برای استخراج، پردازش و تفسیر اطلاعات از تصاویر و ویدئوها می‌پردازد. هدف این حوزه آن است که رایانه بتواند از داده‌های بصری، اطلاعاتی دربارهٔ اشیا، ویژگی‌ها، روابط مکانی، حرکت و ساختار محیط به دست آورد و از آنها در انجام وظایف مشخص استفاده کند.<ref name="szeliski">[https://link.springer.com/book/10.1007/978-3-030-34372-9 Szeliski, Richard. ''Computer Vision: Algorithms and Applications''. 2nd ed. Springer, 2022.]</ref>


شبکه‌های عصبی مصنوعی در آغاز با الهام از برخی ویژگی‌های دستگاه عصبی موجودات زنده توسعه یافتند؛ با این حال، شبکهٔ عصبی مصنوعی بازسازی دقیق مغز انسان نیست، بلکه مدلی ریاضی و محاسباتی است که می‌تواند برای پیش‌بینی، طبقه‌بندی، تشخیص الگو، پردازش زبان، تحلیل تصویر و تولید داده استفاده شود.<ref name="mcculloch">[https://doi.org/10.1007/BF02478259 McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” ''The Bulletin of Mathematical Biophysics'' 5 (1943): 115–133.]</ref>
بینایی ماشین از مبانی ریاضی، هندسه، آمار، پردازش تصویر و [[یادگیری ماشین]] بهره می‌گیرد. این حوزه در دهه‌های نخست شکل‌گیری خود عمدتاً بر روش‌های هندسی و الگوریتم‌های طراحی‌شده توسط پژوهشگران استوار بود، اما از دههٔ ۲۰۱۰، استفاده از [[شبکه عصبی مصنوعی|شبکه‌های عصبی مصنوعی]] و [[یادگیری عمیق]] موجب تحول گسترده‌ای در بسیاری از کاربردهای آن شد.<ref name="lecun">[https://doi.org/10.1038/nature14539 LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444.]</ref>


تاریخ شبکه‌های عصبی مصنوعی به پژوهش‌های میانهٔ سدهٔ بیستم بازمی‌گردد. مدل منطقی وارن مک‌کالاک و والتر پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در دههٔ ۱۹۵۰ و گسترش روش‌های آموزش شبکه‌های چندلایه در دههٔ ۱۹۸۰ از نقاط عطف این حوزه به شمار می‌روند.
امروزه بینایی ماشین در تشخیص اشیا، تحلیل تصاویر پزشکی، هدایت ربات‌ها، خودروهای خودران، کنترل کیفیت صنعتی، کشاورزی هوشمند، تحلیل تصاویر ماهواره‌ای، واقعیت افزوده و سامانه‌های چندوجهی هوش مصنوعی کاربرد دارد. در کنار این قابلیت‌ها، استفاده از آن در شناسایی چهره و نظارت تصویری، پرسش‌های مهمی دربارهٔ حریم خصوصی، حقوق شهروندی، [[سوگیری الگوریتمی]] و پاسخگویی ایجاد کرده است.


از دههٔ ۲۰۱۰، پیشرفت در قدرت محاسباتی، دسترسی به داده‌های بزرگ و توسعهٔ روش‌های آموزش، شبکه‌های عصبی را به یکی از فناوری‌های بنیادی هوش مصنوعی معاصر تبدیل کرد. بسیاری از سامانه‌های [[یادگیری عمیق]]، [[ترنسفورمر|ترنسفورمری]] و [[هوش مصنوعی مولد]] بر انواع شبکه‌های عصبی مصنوعی استوارند.<ref name="lecun">[https://doi.org/10.1038/nature14539 LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444.]</ref>
== تعریف و ماهیت بینایی ماشین ==


== تعریف شبکهٔ عصبی مصنوعی ==
بینایی ماشین مجموعه‌ای از نظریه‌ها، الگوریتم‌ها و سامانه‌های محاسباتی است که برای استخراج اطلاعات معنادار از داده‌های بصری توسعه یافته‌اند.


شبکهٔ عصبی مصنوعی را می‌توان مجموعه‌ای از واحدهای محاسباتی تعریف کرد که از طریق ارتباطات دارای وزن، اطلاعات را دریافت، تبدیل و منتقل می‌کنند.
این داده‌ها ممکن است از دوربین‌های معمولی، دوربین‌های عمق‌سنج، سامانه‌های تصویربرداری پزشکی، ماهواره‌ها، میکروسکوپ‌ها یا حسگرهای تخصصی به دست آمده باشند.


در یک شبکهٔ معمولی، داده وارد لایهٔ نخست می‌شود و پس از عبور از یک یا چند لایهٔ پردازشی، خروجی تولید می‌شود.
برای مثال، یک سامانهٔ بینایی ماشین ممکن است تصویری از یک خیابان را دریافت کند و وظیفه داشته باشد خودروها، عابران پیاده، علائم راهنمایی و خطوط مسیر را شناسایی کند.


در جریان آموزش، پارامترهای شبکه به‌گونه‌ای تنظیم می‌شوند که عملکرد آن در یک وظیفهٔ مشخص بهبود یابد.
سامانه‌ای دیگر ممکن است تصویر پزشکی را بررسی و ناحیه‌ای را که احتمال وجود یک ضایعه در آن بیشتر است مشخص کند.


برای مثال، اگر شبکه برای تشخیص تصاویر گربه و سگ آموزش داده شود، ابتدا نمونه‌هایی از تصاویر را دریافت می‌کند. سپس بر اساس خروجی‌های خود و اطلاعات آموزشی، پارامترهایش تنظیم می‌شوند تا احتمال تشخیص صحیح تصاویر جدید افزایش یابد.
در هر دو نمونه، هدف تبدیل دادهٔ تصویری به اطلاعات قابل استفاده برای یک وظیفهٔ مشخص است.


این فرایند به معنای آگاهی یا فهم انسانی شبکه نیست؛ بلکه نوعی یادگیری محاسباتی است.
با این حال، تشخیص یک الگو در تصویر لزوماً به معنای فهم کامل صحنه به شیوهٔ انسانی نیست.


== خاستگاه نظری ==
== تفاوت بینایی ماشین و بینایی انسان ==


شبکه‌های عصبی مصنوعی از پیوند چند حوزهٔ علمی پدید آمدند.
بینایی انسان فرایندی زیستی و شناختی است که از تعامل چشم، دستگاه عصبی و مغز شکل می‌گیرد.


یکی از این حوزه‌ها عصب‌شناسی بود که ساختار و عملکرد نورون‌های زیستی را بررسی می‌کرد.
انسان هنگام مشاهدهٔ یک صحنه، اطلاعات بصری را با حافظه، تجربه، دانش پیشین و دیگر حواس خود ترکیب می‌کند.


حوزهٔ دیگر منطق ریاضی بود که امکان توصیف روابط و عملیات منطقی را فراهم می‌ساخت.
در مقابل، سامانه‌های بینایی ماشین از حسگرها، داده‌های دیجیتال، مدل‌های ریاضی و الگوریتم‌های محاسباتی استفاده می‌کنند.


همچنین آمار، نظریهٔ احتمال، علوم شناختی و علوم رایانه در توسعهٔ این مدل‌ها نقش داشتند.
یک سامانه ممکن است در تشخیص نوع مشخصی از الگو عملکرد بسیار دقیقی داشته باشد، اما در برابر تغییر نور، زاویهٔ دید، شرایط محیط یا داده‌های ناآشنا دچار خطا شود.


پژوهشگران اولیه تلاش کردند نشان دهند که شبکه‌هایی از واحدهای ساده می‌توانند در ترکیب با یکدیگر رفتارهای محاسباتی پیچیده‌تری ایجاد کنند.
بنابراین، توانایی یک سامانه در تشخیص تصویر را نباید معادل برخورداری از ادراک یا آگاهی انسانی دانست.


== تاریخچه ==
== تاریخچهٔ بینایی ماشین ==


=== مدل مک‌کالاک و پیتس؛ ۱۹۴۳ ===
=== پژوهش‌های اولیه ===


در سال ۱۹۴۳، وارن مک‌کالاک، عصب‌شناس آمریکایی، و والتر پیتس، منطق‌دان، مقاله‌ای با عنوان ''A Logical Calculus of the Ideas Immanent in Nervous Activity'' منتشر کردند.
ریشه‌های بینایی ماشین به پژوهش‌های مرتبط با پردازش تصویر، هندسهٔ تصویری، تشخیص الگو و هوش مصنوعی در میانهٔ سدهٔ بیستم بازمی‌گردد.


این مقاله یکی از آثار بنیادی در تاریخ مدل‌سازی ریاضی شبکه‌های عصبی محسوب می‌شود.
در دهه‌های ۱۹۵۰ و ۱۹۶۰، پژوهشگران تلاش کردند روش‌هایی برای تشخیص اشکال هندسی، استخراج خطوط و بازسازی ساختار اشیا از تصاویر توسعه دهند.


مک‌کالاک و پیتس مدلی از واحدهای عصبی ارائه کردند که رفتار آنها را می‌شد با منطق گزاره‌ای توصیف کرد.
لارنس رابرتس از پژوهشگران اثرگذار اولیه در تحلیل رایانه‌ای تصاویر سه‌بعدی بود.


در این مدل، واحدهای عصبی بر اساس شرایط ورودی و آستانهٔ فعال‌سازی، خروجی‌هایی از نوع فعال یا غیرفعال تولید می‌کردند.
در این دوره، یکی از پرسش‌های بنیادی آن بود که چگونه می‌توان از یک تصویر دوبعدی، اطلاعاتی دربارهٔ ساختار سه‌بعدی جهان به دست آورد.


پژوهش آنها نشان داد که شبکه‌هایی از واحدهای ساده می‌توانند برخی عملیات منطقی را بازنمایی کنند.<ref name="mcculloch" />
=== گسترش پژوهش‌ها در دههٔ ۱۹۷۰ ===


این مدل هنوز از بسیاری از قابلیت‌های یادگیری شبکه‌های عصبی جدید برخوردار نبود، اما مبنایی نظری برای پژوهش‌های بعدی فراهم کرد.
در دههٔ ۱۹۷۰، پژوهش‌های بینایی ماشین به موضوعاتی مانند تشخیص لبه، بازسازی سه‌بعدی، تحلیل حرکت و بازنمایی هندسی صحنه گسترش یافت.


=== نظریهٔ یادگیری هب؛ ۱۹۴۹ ===
پژوهشگران تلاش کردند میان ویژگی‌های تصویر و ساختار فیزیکی اشیای موجود در جهان ارتباط برقرار کنند.


دونالد هب، روان‌شناس کانادایی، در کتاب ''The Organization of Behavior'' که در سال ۱۹۴۹ منتشر شد، نظریه‌ای دربارهٔ تغییر قدرت ارتباطات عصبی در فرایند یادگیری مطرح کرد.
در این دوره، هندسه و مدل‌سازی ریاضی نقش مهمی در توسعهٔ الگوریتم‌های بینایی ماشین داشتند.


ایدهٔ بنیادی یادگیری هبی آن است که فعالیت مرتبط واحدهای عصبی می‌تواند با تقویت ارتباط میان آنها همراه باشد.
=== دیدگاه محاسباتی دیوید مار ===


این دیدگاه بر پژوهش‌های بعدی دربارهٔ یادگیری در شبکه‌های عصبی و مدل‌های اتصال‌گرا تأثیر گذاشت.
دیوید مار، پژوهشگر علوم اعصاب و بینایی محاسباتی، در کتاب ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information'' که در سال ۱۹۸۲ منتشر شد، چارچوبی اثرگذار برای مطالعهٔ بینایی ارائه کرد.


البته روش‌های آموزش شبکه‌های عصبی معاصر لزوماً بر قواعد یادگیری هبی استوار نیستند.
او بر ضرورت بررسی مسئلهٔ بینایی در سطوح مختلف، از هدف محاسباتی گرفته تا بازنمایی و پیاده‌سازی، تأکید داشت.


=== پرسپترون فرانک روزنبلات؛ ۱۹۵۸ ===
این دیدگاه در شکل‌گیری مباحث نظری بینایی محاسباتی و علوم شناختی تأثیرگذار بود.


فرانک روزنبلات در سال ۱۹۵۸ مقالهٔ ''The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain'' را منتشر کرد.
=== توسعهٔ روش‌های هندسی ===


پرسپترون یکی از مدل‌های مهم اولیهٔ یادگیری در شبکه‌های عصبی بود.<ref name="rosenblatt">[https://doi.org/10.1037/h0042519 Rosenblatt, Frank. “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.” ''Psychological Review'' 65, no. 6 (1958): 386–408.]</ref>
در دهه‌های ۱۹۸۰ و ۱۹۹۰، روش‌های هندسی و آماری بینایی ماشین پیشرفت کردند.


پرسپترون می‌توانست با تنظیم وزن‌های خود برخی مسائل طبقه‌بندی را یاد بگیرد.
موضوعاتی مانند تطبیق نقاط میان تصاویر، تخمین حرکت دوربین، بازسازی سه‌بعدی و تحلیل تصاویر چنددوربینی از محورهای مهم پژوهش بودند.


برای مثال، یک پرسپترون ساده می‌تواند یاد بگیرد که نمونه‌ها را بر اساس ترکیبی خطی از ویژگی‌های ورودی به دو گروه تقسیم کند.
کتاب ''Multiple View Geometry in Computer Vision'' نوشتهٔ ریچارد هارتلی و اندرو زیسرمن از منابع مهم این حوزه است.<ref name="hartley">[https://www.cambridge.org/core/books/multiple-view-geometry-in-computer-vision/0B6F289C78B2B23FDE7A1F5D6C9B4F2B Hartley, Richard, and Andrew Zisserman. ''Multiple View Geometry in Computer Vision''. 2nd ed. Cambridge University Press, 2004.]</ref>


این مدل در تاریخ هوش مصنوعی اهمیت زیادی داشت، زیرا نشان می‌داد می‌توان بخشی از رفتار یک سامانهٔ محاسباتی را از طریق تجربه و تنظیم پارامترها شکل داد.
=== ظهور مجموعه‌داده‌های بزرگ ===


=== محدودیت‌های پرسپترون ===
با افزایش ظرفیت ذخیره‌سازی و توان محاسباتی، مجموعه‌داده‌های تصویری بزرگ‌تری برای آموزش و ارزیابی الگوریتم‌ها ایجاد شدند.


پرسپترون تک‌لایه دارای محدودیت‌های ریاضی مشخصی بود.
یکی از مهم‌ترین آنها ImageNet بود که در سال ۲۰۰۹ در مقاله‌ای از جیا دنگ و همکاران معرفی شد.


این مدل نمی‌توانست مسائلی را که از نظر خطی جدایی‌پذیر نیستند، مانند مسئلهٔ XOR، به‌درستی حل کند.
ImageNet مجموعه‌ای گسترده از تصاویر سازمان‌دهی‌شده بر اساس مفاهیم و دسته‌های معنایی است و در توسعهٔ پژوهش‌های تشخیص تصویر نقش مهمی داشته است.<ref name="imagenet">[https://www.image-net.org/static_files/papers/imagenet_cvpr09.pdf Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” ''IEEE Conference on Computer Vision and Pattern Recognition'', 2009.]</ref>


ماروین مینسکی و سیمور پیپرت در کتاب ''Perceptrons'' که در سال ۱۹۶۹ منتشر شد، محدودیت‌های ریاضی برخی از شبکه‌های پرسپترونی را بررسی کردند.
=== تحول یادگیری عمیق در سال ۲۰۱۲ ===


این نقدها بر مسیر پژوهش شبکه‌های عصبی تأثیر گذاشتند.
یکی از نقاط عطف مهم بینایی ماشین در سال ۲۰۱۲ رخ داد.


با این حال، محدودیت پرسپترون تک‌لایه را نباید به همهٔ شبکه‌های عصبی چندلایه تعمیم داد.
الکس کریژفسکی، ایلیا سوتسکِوِر و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقه‌بندی تصاویر ImageNet معرفی کردند.


=== گسترش شبکه‌های چندلایه ===
این مدل که بعدها با نام AlexNet شناخته شد، در رقابت ImageNet سال ۲۰۱۲ عملکرد برجسته‌ای داشت و به گسترش استفاده از یادگیری عمیق در بینایی ماشین کمک کرد.<ref name="alexnet">[https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” ''Advances in Neural Information Processing Systems'' 25 (2012).]</ref>


شبکه‌های چندلایه امکان ترکیب تبدیل‌های غیرخطی را فراهم کردند.
پس از آن، شبکه‌های عصبی پیچشی در بسیاری از وظایف تشخیص و تحلیل تصویر به روش‌های اصلی تبدیل شدند.


برخلاف پرسپترون تک‌لایه، یک شبکهٔ چندلایه با ساختار و پارامترهای مناسب می‌تواند روابط پیچیده‌تری را بازنمایی کند.
=== شبکه‌های عمیق‌تر و ResNet ===


اما آموزش مؤثر این شبکه‌ها به روش‌هایی نیاز داشت که بتوانند سهم پارامترهای مختلف را در خطای خروجی محاسبه کنند.
در سال ۲۰۱۵، کایمینگ هه و همکاران معماری ResNet را معرفی کردند.


این مسئله یکی از موضوعات مهم پژوهش در دهه‌های ۱۹۷۰ و ۱۹۸۰ بود.
این معماری از اتصالات باقیمانده برای تسهیل آموزش شبکه‌های عمیق‌تر استفاده می‌کرد.


=== پس‌انتشار خطا؛ ۱۹۸۶ ===
ResNet در توسعهٔ شبکه‌های پیچشی عمیق و کاربردهای تشخیص تصویر تأثیرگذار بود.<ref name="resnet">[https://arxiv.org/abs/1512.03385 He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” 2015.]</ref>


در سال ۱۹۸۶، دیوید روملهارت، جفری هینتون و رونالد ویلیامز مقالهٔ ''Learning Representations by Back-Propagating Errors'' را در نشریهٔ ''Nature'' منتشر کردند.
=== ورود ترنسفورمرها به بینایی ماشین ===


این مقاله روش آموزش شبکه‌های چندلایه از طریق محاسبهٔ گرادیان و اصلاح وزن‌ها را توضیح داد و به گسترش استفاده از پس‌انتشار در شبکه‌های عصبی کمک کرد.<ref name="rumelhart">[https://doi.org/10.1038/323533a0 Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” ''Nature'' 323 (1986): 533–536.]</ref>
در سال ۲۰۲۰، پژوهشگران مدل Vision Transformer یا ViT را معرفی کردند.


البته ریشه‌های ریاضی و کاربردهای پیشین روش‌های مرتبط با پس‌انتشار به قبل از سال ۱۹۸۶ بازمی‌گردد. اهمیت مقالهٔ روملهارت و همکاران در معرفی اثرگذار این روش برای یادگیری بازنمایی‌ها در شبکه‌های چندلایه بود.
این مدل از معماری [[ترنسفورمر]] برای پردازش تصویر استفاده می‌کند.


=== گسترش شبکه‌های عصبی در دههٔ ۱۹۹۰ ===
در این روش، تصویر به قطعه‌هایی تقسیم می‌شود و هر قطعه به بازنمایی عددی تبدیل می‌شود.


در دههٔ ۱۹۹۰، پژوهش دربارهٔ شبکه‌های عصبی در حوزه‌هایی مانند تشخیص دست‌خط، پردازش تصویر و تشخیص گفتار ادامه یافت.
سپس روابط میان این قطعه‌ها با استفاده از سازوکار توجه پردازش می‌شود.<ref name="vit">[https://arxiv.org/abs/2010.11929 Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” 2020.]</ref>


یان لکون و همکاران از شبکه‌های عصبی پیچشی برای شناسایی نویسه‌ها و ارقام دست‌نویس استفاده کردند.
این تحول نشان داد که ترنسفورمرها می‌توانند در کنار شبکه‌های پیچشی، نقش مهمی در تحلیل تصاویر ایفا کنند.


این پژوهش‌ها نشان دادند که شبکه‌های عصبی می‌توانند در مسائل واقعی تشخیص الگو کاربرد داشته باشند.
== مبانی علمی بینایی ماشین ==


=== تحول یادگیری عمیق در دههٔ ۲۰۱۰ ===
بینایی ماشین بر مجموعه‌ای از مبانی علمی و فنی استوار است.


از دههٔ ۲۰۱۰، شبکه‌های عصبی عمیق در بسیاری از وظایف پردازش تصویر، گفتار و زبان پیشرفت چشمگیری نشان دادند.
این مبانی شامل تشکیل تصویر، پردازش سیگنال، هندسه، آمار، بهینه‌سازی و یادگیری ماشین هستند.


افزایش توان پردازنده‌های گرافیکی، دسترسی به داده‌های بزرگ و بهبود روش‌های آموزش از عوامل مهم این تحول بودند.
در بسیاری از مسائل، شناخت نحوهٔ تشکیل تصویر به اندازهٔ انتخاب الگوریتم اهمیت دارد.


مقالهٔ مروری یان لکون، یوشوا بنجیو و جفری هینتون در سال ۲۰۱۵، نقش شبکه‌های چندلایه را در یادگیری بازنمایی‌های پیچیده و پیشرفت یادگیری عمیق توضیح داد.<ref name="lecun" />
برای مثال، یک شیء ممکن است به دلیل تغییر نور، فاصله، زاویهٔ دوربین یا انسداد جزئی، ظاهر متفاوتی در تصاویر داشته باشد.


=== ظهور ترنسفورمر؛ ۲۰۱۷ ===
== تصویر دیجیتال ==


در سال ۲۰۱۷، معماری [[ترنسفورمر]] در مقالهٔ ''Attention Is All You Need'' معرفی شد.
'''تصویر دیجیتال''' بازنمایی عددی یک تصویر است که معمولاً از آرایه‌ای از پیکسل‌ها تشکیل می‌شود.


این معماری از سازوکار توجه برای پردازش روابط میان عناصر دنباله استفاده می‌کند.
در تصاویر خاکستری، هر پیکسل معمولاً مقداری مرتبط با شدت روشنایی دارد.


ترنسفورمر یکی از انواع معماری شبکهٔ عصبی مصنوعی است و بعدها پایهٔ بسیاری از مدل‌های زبانی بزرگ شد.<ref name="vaswani">[https://arxiv.org/abs/1706.03762 Vaswani, Ashish, et al. “Attention Is All You Need.” ''Advances in Neural Information Processing Systems'' 30 (2017).]</ref>
در تصاویر رنگی، هر پیکسل می‌تواند دارای چند مؤلفهٔ رنگی باشد.


== ساختار شبکهٔ عصبی مصنوعی ==
یکی از نمایش‌های رایج تصویر رنگی، مدل RGB است که از سه مؤلفهٔ قرمز، سبز و آبی استفاده می‌کند.


شبکه‌های عصبی معمولاً از واحدهای محاسباتی و ارتباطات میان آنها تشکیل می‌شوند.
الگوریتم‌های بینایی ماشین این داده‌های عددی را برای استخراج ویژگی‌ها و اطلاعات پردازش می‌کنند.


در شبکه‌های پیش‌خور ساده، این واحدها در لایه‌هایی سازمان‌دهی می‌شوند.
== پیکسل و وضوح تصویر ==


سه نوع اصلی لایه عبارت‌اند از:
'''پیکسل''' کوچک‌ترین عنصر نمونه‌برداری‌شده در بسیاری از تصاویر دیجیتال است.


* لایهٔ ورودی
وضوح مکانی تصویر معمولاً با تعداد پیکسل‌ها در عرض و ارتفاع بیان می‌شود.
* لایه‌های پنهان
* لایهٔ خروجی


البته همهٔ معماری‌های شبکهٔ عصبی به این ساختار ساده محدود نیستند.
برای مثال، تصویری با ابعاد ۱۹۲۰ در ۱۰۸۰ پیکسل دارای بیش از دو میلیون پیکسل است.


شبکه‌های بازگشتی، پیچشی، ترنسفورمری و گرافی ساختارهای متفاوتی دارند.
با این حال، وضوح بالاتر لزوماً به معنای کیفیت بهتر همهٔ وظایف بینایی ماشین نیست.


== نورون مصنوعی ==
نورپردازی، وضوح اپتیکی، نویز، فشرده‌سازی و کیفیت داده نیز اهمیت دارند.


'''نورون مصنوعی''' واحدی محاسباتی است که مجموعه‌ای از ورودی‌ها را دریافت می‌کند و بر اساس وزن‌ها، سوگیری و تابع فعال‌سازی، خروجی تولید می‌کند.
== پردازش تصویر ==


در یک نورون ساده، ورودی‌ها با وزن‌های مربوط به خود ضرب می‌شوند.
'''پردازش تصویر''' به مجموعه‌ای از روش‌ها برای تغییر، بهبود یا تحلیل داده‌های تصویری گفته می‌شود.


سپس حاصل‌جمع آنها با مقدار سوگیری ترکیب و به تابع فعال‌سازی داده می‌شود.
این روش‌ها می‌توانند شامل کاهش نویز، تنظیم روشنایی، افزایش کنتراست، فیلترگذاری و تبدیل هندسی باشند.


رابطهٔ ریاضی یک نورون مصنوعی را می‌توان چنین نوشت:
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند، اما مترادف نیستند.


y = f(w₁x₁ + w₂x₂ + ... + wₙxₙ + b)
پردازش تصویر ممکن است صرفاً برای بهبود ظاهر تصویر انجام شود.


در این رابطه:
در مقابل، بینایی ماشین معمولاً به استخراج اطلاعات و انجام وظایف ادراکی یا تحلیلی از تصویر می‌پردازد.


* x نشان‌دهندهٔ ورودی‌هاست.
== استخراج ویژگی ==
* w نشان‌دهندهٔ وزن‌هاست.
* b مقدار سوگیری است.
* f تابع فعال‌سازی است.
* y خروجی نورون است.


در جریان آموزش، وزن‌ها و سوگیری‌ها می‌توانند تغییر کنند.
'''استخراج ویژگی''' (Feature Extraction) فرایند شناسایی و بازنمایی اطلاعاتی از تصویر است که برای یک وظیفه مفید هستند.


== وزن در شبکهٔ عصبی ==
در روش‌های کلاسیک، ویژگی‌ها ممکن است شامل لبه‌ها، گوشه‌ها، بافت‌ها یا توصیفگرهای محلی باشند.


'''وزن''' (''Weight'') پارامتری عددی است که در محاسبهٔ تأثیر یک ورودی بر خروجی استفاده می‌شود.
در روش‌های مبتنی بر یادگیری عمیق، شبکه می‌تواند بازنمایی‌های مورد نیاز را در فرایند آموزش بیاموزد.


در یک شبکهٔ عصبی، ارتباطات مختلف می‌توانند وزن‌های متفاوتی داشته باشند.
این تفاوت یکی از ویژگی‌های مهم تحول بینایی ماشین در دههٔ ۲۰۱۰ بود.


وزن‌ها معمولاً در فرایند آموزش تنظیم می‌شوند.
== تشخیص لبه ==


در نتیجه، رفتار مدل پس از آموزش به مقادیر آموخته‌شدهٔ این پارامترها وابسته است.
'''تشخیص لبه''' (Edge Detection) یکی از روش‌های بنیادی پردازش تصویر است.


== سوگیری در نورون مصنوعی ==
لبه‌ها معمولاً با تغییرات قابل توجه شدت روشنایی یا رنگ در تصویر ارتباط دارند.


'''سوگیری''' (''Bias'') در تعریف ریاضی نورون مصنوعی، پارامتری افزوده‌شونده است که به مدل انعطاف بیشتری می‌دهد.
تشخیص لبه می‌تواند برای شناسایی مرز اشیا، تحلیل شکل‌ها و آماده‌سازی داده برای مراحل بعدی استفاده شود.


سوگیری به مدل امکان می‌دهد مقدار خروجی تبدیل خطی را مستقل از ورودی‌ها جابه‌جا کند.
الگوریتم Canny از روش‌های شناخته‌شدهٔ تشخیص لبه است.


این مفهوم با [[سوگیری الگوریتمی]] به معنای تبعیض یا عدم توازن در خروجی سامانه متفاوت است.
== تشخیص گوشه و نقاط کلیدی ==


اشتراک نام این دو اصطلاح نباید موجب یکسان‌انگاری آنها شود.
در برخی مسائل، لازم است نقاط شاخص تصویر شناسایی شوند.


== تابع فعال‌سازی ==
این نقاط ممکن است شامل گوشه‌ها یا نواحی دارای الگوی محلی متمایز باشند.


'''تابع فعال‌سازی''' (''Activation Function'') تابعی است که خروجی محاسبات یک نورون یا لایه را تبدیل می‌کند.
نقاط کلیدی در تطبیق تصاویر، ردیابی، بازسازی سه‌بعدی و تخمین حرکت دوربین کاربرد دارند.


در بسیاری از شبکه‌ها، تابع فعال‌سازی غیرخطی است.
روش‌هایی مانند Harris و SIFT از روش‌های شناخته‌شدهٔ این حوزه هستند.


غیرخطی‌بودن اهمیت زیادی دارد، زیرا ترکیب چندین تبدیل خطی بدون تابع غیرخطی همچنان معادل یک تبدیل خطی خواهد بود.
== طبقه‌بندی تصویر ==


توابع فعال‌سازی شناخته‌شده عبارت‌اند از:
'''طبقه‌بندی تصویر''' (Image Classification) یکی از وظایف اصلی بینایی ماشین است.


* Sigmoid
در این مسئله، سامانه یک تصویر را دریافت و آن را به یک یا چند دستهٔ مشخص نسبت می‌دهد.
* Tanh
* ReLU
* GELU
* Softmax


البته Softmax معمولاً برای تبدیل مجموعه‌ای از امتیازها به توزیع احتمال، به‌ویژه در خروجی برخی مدل‌های طبقه‌بندی، استفاده می‌شود.
برای مثال، مدل ممکن است تشخیص دهد که تصویر مربوط به گربه، سگ، خودرو یا هواپیماست.


== تابع ReLU ==
طبقه‌بندی تصویر با تشخیص محل دقیق اشیا تفاوت دارد.


تابع ReLU یا ''Rectified Linear Unit'' یکی از توابع فعال‌سازی پرکاربرد در شبکه‌های عصبی است.
یک تصویر ممکن است دارای چندین شیء باشد، در حالی که مدل طبقه‌بندی ساده فقط یک برچسب کلی تولید کند.


فرمول آن چنین است:
== تشخیص اشیا ==


f(x) = max(0, x)
'''تشخیص اشیا''' (Object Detection) به شناسایی اشیای موجود در تصویر و تعیین موقعیت آنها گفته می‌شود.


اگر مقدار ورودی منفی باشد، خروجی صفر است.
خروجی سامانه معمولاً شامل نوع شیء، میزان اطمینان مدل و مختصات ناحیهٔ مربوط به آن است.


اگر مقدار ورودی مثبت باشد، خروجی همان مقدار ورودی خواهد بود.
برای مثال، یک سامانه ممکن است در تصویر خیابان چند خودرو و عابر پیاده را تشخیص دهد و برای هرکدام کادر مشخصی رسم کند.


سادگی محاسباتی و برخی ویژگی‌های مناسب در فرایند آموزش از دلایل استفادهٔ گسترده از این تابع بوده‌اند.
این فناوری در رباتیک، کنترل ترافیک، تحلیل ویدئو و سامانه‌های کمک‌راننده کاربرد دارد.


== لایهٔ ورودی ==
== بخش‌بندی تصویر ==


'''لایهٔ ورودی''' بخشی از شبکه است که داده‌های اولیه را دریافت می‌کند.
'''بخش‌بندی تصویر''' (Image Segmentation) فرایندی است که در آن پیکسل‌های تصویر بر اساس ویژگی یا تعلق به نواحی مختلف دسته‌بندی می‌شوند.


برای مثال، در یک مدل سادهٔ پیش‌بینی قیمت خانه، ورودی‌ها ممکن است شامل مساحت، تعداد اتاق‌ها و سن ساختمان باشند.
بخش‌بندی در پزشکی، تحلیل تصاویر ماهواره‌ای، رباتیک و صنعت کاربرد دارد.


در شبکه‌های پردازش تصویر، ورودی ممکن است آرایه‌ای از مقادیر پیکسل‌ها باشد.
دو نوع مهم آن عبارت‌اند از:


در مدل‌های زبانی، ورودی معمولاً پس از توکن‌سازی به بازنمایی‌های عددی تبدیل می‌شود.
* بخش‌بندی معنایی؛
* بخش‌بندی نمونه‌ای.


== لایهٔ پنهان ==
== بخش‌بندی معنایی ==


'''لایهٔ پنهان''' بخشی از شبکه است که میان ورودی و خروجی قرار می‌گیرد.
در '''بخش‌بندی معنایی''' (Semantic Segmentation)، برای هر پیکسل یک دستهٔ معنایی تعیین می‌شود.


این لایه‌ها داده را به بازنمایی‌های میانی تبدیل می‌کنند.
برای مثال، در تصویر خیابان، پیکسل‌ها ممکن است به دسته‌هایی مانند جاده، ساختمان، آسمان، خودرو و عابر پیاده تقسیم شوند.


در شبکه‌های عمیق، چندین لایهٔ پنهان می‌توانند تبدیل‌های پیچیده و سلسله‌مراتبی را انجام دهند.
در این روش، اشیای جداگانه‌ای که به یک دسته تعلق دارند لزوماً از یکدیگر متمایز نمی‌شوند.


برای مثال، در پردازش تصویر، لایه‌های مختلف ممکن است الگوهای ساده و سپس ساختارهای پیچیده‌تر را بازنمایی کنند.
== بخش‌بندی نمونه‌ای ==


== لایهٔ خروجی ==
در '''بخش‌بندی نمونه‌ای''' (Instance Segmentation)، سامانه علاوه بر شناسایی دستهٔ اشیا، نمونه‌های جداگانهٔ هر دسته را نیز تفکیک می‌کند.


'''لایهٔ خروجی''' نتیجهٔ نهایی محاسبات شبکه را تولید می‌کند.
برای مثال، اگر سه خودرو در تصویر وجود داشته باشد، مدل می‌تواند ناحیهٔ هر خودرو را به‌طور مستقل مشخص کند.


نوع خروجی به وظیفهٔ شبکه بستگی دارد.
این قابلیت در تحلیل صحنه‌های پیچیده اهمیت دارد.


در طبقه‌بندی، خروجی ممکن است مجموعه‌ای از امتیازها یا احتمال‌های مربوط به دسته‌های مختلف باشد.
== معماری U-Net ==


در رگرسیون، خروجی ممکن است یک مقدار عددی باشد.
'''U-Net''' یکی از معماری‌های شناخته‌شدهٔ شبکهٔ عصبی برای بخش‌بندی تصویر است.


در مدل‌های مولد، خروجی می‌تواند توزیع احتمال توکن بعدی یا نوع دیگری از بازنمایی مورد نیاز برای تولید داده باشد.
این معماری در سال ۲۰۱۵ توسط اولاف رونبرگر، فیلیپ فیشر و توماس بروکس برای بخش‌بندی تصاویر زیست‌پزشکی معرفی شد.


== شبکهٔ پیش‌خور ==
U-Net از مسیر فشرده‌سازی و مسیر گسترش بازنمایی‌ها استفاده می‌کند و برای تعیین موقعیت دقیق ساختارهای موجود در تصویر طراحی شده است.<ref name="unet">[https://arxiv.org/abs/1505.04597 Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” 2015.]</ref>


'''شبکهٔ عصبی پیش‌خور''' (''Feedforward Neural Network'') یکی از ساده‌ترین خانواده‌های شبکه‌های عصبی است.
این معماری و گونه‌های بعدی آن در بسیاری از مسائل بخش‌بندی تصویر استفاده شده‌اند.


در این شبکه، اطلاعات در مسیر محاسباتی از ورودی به خروجی حرکت می‌کند و حلقهٔ بازگشتی وجود ندارد.
== تشخیص چهره ==


پرسپترون چندلایه یا MLP یکی از نمونه‌های شناخته‌شدهٔ این خانواده است.
'''تشخیص چهره''' اصطلاحی است که در کاربرد عمومی ممکن است به چند وظیفهٔ متفاوت اشاره کند.


شبکه‌های پیش‌خور در طبقه‌بندی، رگرسیون و به‌عنوان اجزای معماری‌های بزرگ‌تر استفاده می‌شوند.
یکی از آنها یافتن محل چهره در تصویر است.


== پرسپترون چندلایه ==
وظیفهٔ دیگر، شناسایی یا تأیید هویت فرد بر اساس ویژگی‌های چهره است.


'''پرسپترون چندلایه''' (''Multilayer Perceptron'' یا MLP) شبکه‌ای پیش‌خور است که معمولاً از چندین لایهٔ دارای پارامترهای آموختنی و توابع فعال‌سازی تشکیل می‌شود.
این دو کاربرد از نظر فنی و حقوقی یکسان نیستند.


این شبکه می‌تواند روابط غیرخطی میان ورودی و خروجی را مدل‌سازی کند.
سامانه‌های شناسایی چهره می‌توانند در احراز هویت و مدیریت دسترسی استفاده شوند، اما کاربرد آنها در نظارت عمومی می‌تواند خطرهایی برای حریم خصوصی و آزادی‌های مدنی ایجاد کند.


MLPها از ساختارهای بنیادی یادگیری ماشین هستند و در بسیاری از معماری‌های پیچیده‌تر نیز به‌عنوان جزء داخلی استفاده می‌شوند.
== تشخیص و تحلیل حرکت ==


== آموزش شبکهٔ عصبی ==
بینایی ماشین می‌تواند برای تحلیل تغییرات تصویر در طول زمان استفاده شود.


'''آموزش''' فرایندی است که طی آن پارامترهای شبکه بر اساس داده و هدف یادگیری تنظیم می‌شوند.
این حوزه شامل تشخیص حرکت، ردیابی اشیا و تخمین جهت یا سرعت حرکت است.


در یک مسئلهٔ یادگیری نظارت‌شده، مدل ورودی را دریافت می‌کند و خروجی تولید می‌کند.
برای مثال، یک سامانهٔ نظارت بر ترافیک می‌تواند حرکت خودروها را در چندین فریم متوالی بررسی کند.


سپس خروجی مدل با مقدار هدف مقایسه می‌شود.
در رباتیک نیز تحلیل حرکت به درک تغییر موقعیت اشیا و دوربین کمک می‌کند.


اختلاف میان آنها با تابع زیان اندازه‌گیری می‌شود.
== جریان نوری ==


الگوریتم بهینه‌سازی تلاش می‌کند پارامترهای مدل را به‌گونه‌ای تغییر دهد که زیان کاهش یابد.
'''جریان نوری''' (Optical Flow) به الگوی حرکت ظاهری نقاط یا ساختارهای تصویری میان فریم‌های متوالی اشاره دارد.


== تابع زیان ==
روش‌های تخمین جریان نوری برای تحلیل حرکت، ردیابی و برخی کاربردهای ناوبری استفاده می‌شوند.


'''تابع زیان''' (''Loss Function'') معیاری ریاضی برای سنجش اختلاف میان خروجی مدل و هدف آموزشی است.
با این حال، حرکت ظاهری در تصویر همیشه معادل حرکت واقعی یک شیء در فضای سه‌بعدی نیست.


برای مثال، در پیش‌بینی قیمت خانه، تابع زیان می‌تواند اختلاف میان قیمت پیش‌بینی‌شده و قیمت واقعی را اندازه‌گیری کند.
حرکت دوربین، تغییر نور و دیگر عوامل نیز می‌توانند بر آن اثر بگذارند.


در مسائل طبقه‌بندی، تابع زیان آنتروپی متقاطع از گزینه‌های رایج است.
== ردیابی اشیا ==


انتخاب تابع زیان بر رفتار مدل در فرایند آموزش تأثیر دارد.
'''ردیابی اشیا''' (Object Tracking) فرایندی است که در آن سامانه تلاش می‌کند موقعیت یک یا چند شیء را در طول زمان دنبال کند.


== گرادیان نزولی ==
برای مثال، پس از تشخیص یک خودرو در نخستین فریم ویدئو، سامانه می‌تواند موقعیت آن را در فریم‌های بعدی تخمین بزند.


'''گرادیان نزولی''' (''Gradient Descent'') یکی از روش‌های بهینه‌سازی مورد استفاده در آموزش شبکه‌های عصبی است.
ردیابی در تحلیل ترافیک، ورزش، رباتیک و پردازش ویدئو کاربرد دارد.


این روش بر محاسبهٔ مشتق تابع زیان نسبت به پارامترها استوار است.
== تخمین وضعیت بدن انسان ==


گرادیان نشان می‌دهد تغییر پارامترها در جهت‌های مختلف چه اثری بر مقدار زیان دارد.
'''تخمین وضعیت بدن''' (Human Pose Estimation) به شناسایی موقعیت نقاط یا مفاصل اصلی بدن در تصویر یا ویدئو گفته می‌شود.


الگوریتم با استفاده از این اطلاعات، پارامترها را در جهت کاهش زیان تغییر می‌دهد.
این فناوری در تحلیل حرکت، ورزش، توان‌بخشی، تعامل انسان و رایانه و تولید انیمیشن کاربرد دارد.


نسخه‌های مختلفی از این روش، از جمله گرادیان نزولی تصادفی و بهینه‌ساز Adam، در آموزش شبکه‌های عصبی کاربرد دارند.
عملکرد آن می‌تواند تحت تأثیر زاویهٔ دوربین، پوشش بدن، انسداد و کیفیت تصویر قرار گیرد.


== پس‌انتشار خطا ==
== بینایی سه‌بعدی ==


'''پس‌انتشار''' (''Backpropagation'') روشی برای محاسبهٔ گرادیان‌های تابع زیان نسبت به پارامترهای شبکه است.
'''بینایی سه‌بعدی''' به روش‌هایی گفته می‌شود که برای استخراج اطلاعات مربوط به عمق، شکل و ساختار فضایی محیط از داده‌های بصری استفاده می‌کنند.


این روش با استفاده از قاعدهٔ زنجیره‌ای مشتق‌گیری، تأثیر پارامترهای لایه‌های مختلف را بر خروجی محاسبه می‌کند.
این روش‌ها می‌توانند از تصاویر چنددوربینی، حرکت دوربین، حسگرهای عمق یا ترکیب چند منبع داده بهره بگیرند.


پس‌انتشار به‌تنهایی الگوریتم بهینه‌سازی نیست؛ بلکه گرادیان‌های لازم برای روش‌هایی مانند گرادیان نزولی را فراهم می‌کند.
بینایی سه‌بعدی در رباتیک، نقشه‌برداری، واقعیت افزوده و بازسازی دیجیتال اشیا کاربرد دارد.


این تمایز در توضیح سازوکار آموزش شبکه‌های عصبی اهمیت دارد.<ref name="rumelhart" />
== تخمین عمق ==


== نرخ یادگیری ==
'''تخمین عمق''' (Depth Estimation) فرایندی است که در آن فاصلهٔ نقاط یا اشیای صحنه نسبت به دوربین برآورد می‌شود.


'''نرخ یادگیری''' (''Learning Rate'') ابرپارامتری است که اندازهٔ گام تغییر پارامترها را در بسیاری از روش‌های بهینه‌سازی تعیین می‌کند.
این کار می‌تواند با استفاده از دو دوربین، حسگرهای تخصصی یا مدل‌های یادگیری ماشین انجام شود.


اگر نرخ یادگیری بیش از اندازه بزرگ باشد، آموزش ممکن است ناپایدار شود.
تخمین عمق در ناوبری ربات‌ها، خودروهای خودران و بازسازی سه‌بعدی اهمیت دارد.


اگر بیش از اندازه کوچک باشد، آموزش ممکن است بسیار کند پیش برود.
== بینایی استریو ==


انتخاب نرخ یادگیری مناسب یکی از مسائل مهم در آموزش شبکه‌های عصبی است.
'''بینایی استریو''' (Stereo Vision) از تصاویر ثبت‌شده از دو دیدگاه متفاوت برای تخمین ساختار سه‌بعدی استفاده می‌کند.


== دورهٔ آموزش و دستهٔ داده ==
اختلاف موقعیت ظاهری نقاط متناظر در دو تصویر می‌تواند برای محاسبهٔ عمق به کار رود.


'''دورهٔ آموزش''' (''Epoch'') معمولاً به یک بار عبور کامل الگوریتم آموزش از مجموعهٔ دادهٔ آموزشی اشاره دارد.
این روش از اصول هندسهٔ تصویری و روابط میان دوربین‌ها استفاده می‌کند.


'''دسته''' (''Batch'') زیرمجموعه‌ای از نمونه‌های آموزشی است که در یک مرحلهٔ محاسباتی پردازش می‌شود.
== بازسازی سه‌بعدی ==


اندازهٔ دسته می‌تواند بر مصرف حافظه، سرعت آموزش و رفتار بهینه‌سازی تأثیر بگذارد.
'''بازسازی سه‌بعدی''' (3D Reconstruction) فرایند ایجاد مدلی از ساختار سه‌بعدی یک شیء یا صحنه بر اساس داده‌های تصویری است.


== تعمیم ==
این فناوری در معماری، میراث فرهنگی، نقشه‌برداری، پزشکی، صنعت و تولید محتوای دیجیتال کاربرد دارد.


یکی از اهداف اصلی آموزش شبکهٔ عصبی '''تعمیم''' (''Generalization'') است.
کیفیت بازسازی به عواملی مانند تعداد تصاویر، زاویه‌های دید، بافت سطح و دقت کالیبراسیون وابسته است.


مدل مطلوب باید بتواند الگوهایی را بیاموزد که در داده‌های جدید نیز کاربرد داشته باشند.
== ساختار از حرکت ==


عملکرد مناسب روی داده‌های آموزشی به‌تنهایی کافی نیست.
'''ساختار از حرکت''' (Structure from Motion یا SfM) مجموعه‌ای از روش‌هاست که با استفاده از تصاویر ثبت‌شده از موقعیت‌های متفاوت، ساختار سه‌بعدی صحنه و موقعیت نسبی دوربین‌ها را تخمین می‌زند.


به همین دلیل، ارزیابی مدل معمولاً با استفاده از داده‌هایی انجام می‌شود که در آموزش مستقیم آن استفاده نشده‌اند.
این روش در فتوگرامتری، نقشه‌برداری و بازسازی سه‌بعدی کاربرد دارد.


== بیش‌برازش ==
== مکان‌یابی و نقشه‌سازی هم‌زمان ==


'''بیش‌برازش''' (''Overfitting'') زمانی رخ می‌دهد که مدل بیش از اندازه با داده‌های آموزشی، از جمله نویز یا ویژگی‌های اتفاقی آنها، تطبیق پیدا کند.
'''مکان‌یابی و نقشه‌سازی هم‌زمان''' (Simultaneous Localization and Mapping یا SLAM) به مسئلهٔ تخمین موقعیت یک سامانه در محیط و ساخت نقشه‌ای از همان محیط اشاره دارد.


در این وضعیت، مدل ممکن است روی داده‌های آموزشی عملکرد بسیار خوبی داشته باشد اما روی داده‌های جدید دچار خطا شود.
در نوع بصری آن، اطلاعات دوربین برای تخمین حرکت و ساخت نقشه استفاده می‌شود.


روش‌هایی مانند منظم‌سازی، افزایش داده، توقف زودهنگام و Dropout برای کاهش خطر بیش‌برازش استفاده می‌شوند.
این فناوری در رباتیک، پهپادها و واقعیت افزوده اهمیت دارد.


== کم‌برازش ==
== یادگیری ماشین در بینایی ماشین ==


'''کم‌برازش''' (''Underfitting'') زمانی رخ می‌دهد که مدل نتواند ساختار اصلی داده را به اندازهٔ کافی بیاموزد.
[[یادگیری ماشین]] امکان می‌دهد مدل‌ها برخی روابط و الگوهای تصویری را از داده بیاموزند.


این وضعیت ممکن است ناشی از ظرفیت ناکافی مدل، آموزش نامناسب یا انتخاب ویژگی‌های نامناسب باشد.
در روش‌های کلاسیک، پژوهشگر ممکن است ابتدا ویژگی‌هایی مانند لبه‌ها یا بافت‌ها را استخراج کند و سپس یک مدل طبقه‌بندی را آموزش دهد.


در کم‌برازش، مدل حتی روی داده‌های آموزشی نیز ممکن است عملکرد ضعیفی داشته باشد.
در روش‌های مبتنی بر یادگیری عمیق، بخش بزرگی از استخراج ویژگی و تصمیم‌گیری می‌تواند در یک معماری قابل آموزش انجام شود.


== منظم‌سازی ==
انتخاب روش مناسب به نوع مسئله، مقدار داده، منابع محاسباتی و نیاز به توضیح‌پذیری وابسته است.


'''منظم‌سازی''' (''Regularization'') به مجموعه‌ای از روش‌ها گفته می‌شود که برای کنترل پیچیدگی مؤثر مدل و بهبود تعمیم استفاده می‌شوند.
== شبکه‌های عصبی پیچشی ==


این روش‌ها می‌توانند شامل جریمه‌کردن اندازهٔ وزن‌ها، حذف تصادفی برخی فعال‌سازی‌ها در زمان آموزش یا توقف آموزش بر اساس عملکرد اعتبارسنجی باشند.
'''شبکهٔ عصبی پیچشی''' (Convolutional Neural Network یا CNN) یکی از معماری‌های مهم در بینایی ماشین است.


هدف منظم‌سازی جلوگیری از وابستگی نامناسب مدل به جزئیات داده‌های آموزشی است.
این شبکه از عملیات پیچش برای پردازش الگوهای محلی تصویر استفاده می‌کند.


== انواع شبکه‌های عصبی مصنوعی ==
شبکه‌های پیچشی می‌توانند بازنمایی‌هایی از ویژگی‌های ساده تا ساختارهای پیچیده‌تر بیاموزند.


شبکه‌های عصبی مصنوعی دارای معماری‌های متنوعی هستند.
موفقیت AlexNet در سال ۲۰۱۲ و توسعهٔ معماری‌های بعدی مانند ResNet از مراحل مهم گسترش این روش بودند.<ref name="alexnet" /><ref name="resnet" />


مهم‌ترین خانواده‌ها شامل شبکه‌های پیش‌خور، پیچشی، بازگشتی، خودرمزگذار، مولد تخاصمی، گرافی و ترنسفورمری هستند.
== ترنسفورمر بینایی ==


هر معماری برای نوع خاصی از داده یا وظیفه مناسب‌تر است.
'''ترنسفورمر بینایی''' (Vision Transformer یا ViT) معماری‌ای است که از سازوکار توجه برای پردازش تصاویر استفاده می‌کند.


== شبکهٔ عصبی پیچشی ==
در ساختار متعارف آن، تصویر به قطعه‌هایی تقسیم و هر قطعه به یک بازنمایی برداری تبدیل می‌شود.


'''شبکهٔ عصبی پیچشی''' (''Convolutional Neural Network'' یا CNN) یکی از معماری‌های مهم در پردازش تصویر است.
این بازنمایی‌ها همراه با اطلاعات موقعیتی به لایه‌های ترنسفورمر داده می‌شوند.


این شبکه از عملیات پیچش برای استخراج ویژگی‌های محلی استفاده می‌کند.
مدل می‌تواند روابط میان بخش‌های مختلف تصویر را در فرایند یادگیری محاسبه کند.<ref name="vit" />


شبکه‌های پیچشی در طبقه‌بندی تصاویر، تشخیص اشیا، تحلیل تصاویر پزشکی و پردازش ویدئو کاربرد داشته‌اند.
ترنسفورمرهای بینایی در طبقه‌بندی تصویر و دیگر وظایف بینایی ماشین به کار گرفته شده‌اند.


پژوهش‌های یان لکون و همکاران در توسعهٔ این معماری نقش مهمی داشتند.
== بینایی ماشین و مدل‌های چندوجهی ==


== شبکهٔ عصبی بازگشتی ==
'''مدل چندوجهی''' مدلی است که می‌تواند چند نوع داده مانند متن، تصویر یا صوت را پردازش کند.


'''شبکهٔ عصبی بازگشتی''' (''Recurrent Neural Network'' یا RNN) برای پردازش داده‌های دنباله‌ای طراحی شده است.
بینایی ماشین یکی از اجزای مهم بسیاری از سامانه‌های چندوجهی است.


در این معماری، وضعیت محاسباتی مراحل پیشین می‌تواند بر پردازش مرحلهٔ بعد تأثیر بگذارد.
برای مثال، سامانه‌ای که تصویری را دریافت و دربارهٔ محتوای آن به پرسش‌های متنی پاسخ می‌دهد، باید اطلاعات بصری را با پردازش زبان ترکیب کند.


شبکه‌های بازگشتی در مدل‌سازی زبان، تشخیص گفتار و تحلیل سری‌های زمانی استفاده شده‌اند.
چنین سامانه‌هایی می‌توانند برای توصیف تصویر، جست‌وجوی بصری و تحلیل اسناد تصویری استفاده شوند.


یکی از محدودیت‌های آنها دشواری یادگیری برخی وابستگی‌های بلندمدت است.
با این حال، پاسخ متنی آنها ممکن است حاوی خطا یا [[توهم هوش مصنوعی]] باشد.


== شبکهٔ LSTM ==
== بینایی ماشین و هوش مصنوعی مولد ==


'''حافظهٔ طولانی کوتاه‌مدت''' (''Long Short-Term Memory'' یا LSTM) نوعی شبکهٔ بازگشتی است.
[[هوش مصنوعی مولد]] و بینایی ماشین حوزه‌هایی مرتبط اما متفاوت‌اند.


این معماری برای بهبود یادگیری وابستگی‌های بلندمدت در داده‌های دنباله‌ای توسعه یافت.
بینایی ماشین عمدتاً بر استخراج و تحلیل اطلاعات از داده‌های بصری تمرکز دارد.


LSTM از سازوکارهای دروازه‌ای برای کنترل جریان اطلاعات استفاده می‌کند.
در مقابل، مدل‌های مولد برای تولید داده یا محتوای جدید آموزش داده می‌شوند.


پیش از گسترش ترنسفورمرها، شبکه‌های LSTM در بسیاری از کاربردهای پردازش زبان و گفتار نقش مهمی داشتند.
با این حال، بسیاری از سامانه‌های جدید هر دو قابلیت را ترکیب می‌کنند.


== شبکهٔ GRU ==
برای مثال، یک سامانه ممکن است ابتدا اجزای تصویر را شناسایی و سپس بر اساس دستور متنی، تصویر تازه‌ای تولید یا تصویر موجود را ویرایش کند.


'''واحد بازگشتی دروازه‌دار''' (''Gated Recurrent Unit'' یا GRU) یکی دیگر از گونه‌های شبکه‌های بازگشتی است.
== بینایی ماشین در پزشکی ==


این معماری از سازوکارهای دروازه‌ای برای کنترل جریان اطلاعات استفاده می‌کند.
یکی از کاربردهای مهم بینایی ماشین، تحلیل تصاویر پزشکی است.


GRU در برخی کاربردها می‌تواند با ساختاری ساده‌تر از LSTM عملکرد مناسبی ارائه کند.
این تصاویر می‌توانند شامل رادیوگرافی، سی‌تی‌اسکن، ام‌آر‌آی، سونوگرافی و تصاویر میکروسکوپی باشند.


== خودرمزگذار ==
سامانه‌های بینایی ماشین ممکن است برای شناسایی الگوهای غیرعادی، بخش‌بندی اندام‌ها یا اندازه‌گیری ساختارهای تصویری آموزش داده شوند.


'''خودرمزگذار''' (''Autoencoder'') نوعی شبکهٔ عصبی است که معمولاً برای یادگیری بازنمایی فشردهٔ داده آموزش داده می‌شود.
معماری U-Net از نمونه‌های اثرگذار در بخش‌بندی تصاویر زیست‌پزشکی است.<ref name="unet" />


در ساختار رایج، شبکه از دو بخش تشکیل می‌شود:
با این حال، عملکرد یک مدل در محیط آزمایشگاهی لزوماً به معنای اعتبار بالینی آن نیست.


* رمزگذار؛
کاربرد پزشکی نیازمند اعتبارسنجی، ارزیابی ایمنی و نظارت متخصصان است.
* رمزگشا.


رمزگذار داده را به بازنمایی میانی تبدیل می‌کند.
== بینایی ماشین در خودروهای خودران ==


رمزگشا تلاش می‌کند دادهٔ اولیه را از آن بازنمایی بازسازی کند.
خودروهای خودران و سامانه‌های کمک‌راننده می‌توانند از بینایی ماشین برای تحلیل محیط اطراف استفاده کنند.


خودرمزگذارها در کاهش ابعاد، یادگیری بازنمایی و برخی کاربردهای تشخیص ناهنجاری استفاده می‌شوند.
وظایف آنها ممکن است شامل تشخیص خودروها، عابران پیاده، دوچرخه‌سواران، علائم راهنمایی و خطوط جاده باشد.


== شبکهٔ مولد تخاصمی ==
این سامانه‌ها گاهی داده‌های دوربین را با اطلاعات رادار، لیدار و دیگر حسگرها ترکیب می‌کنند.


'''شبکهٔ مولد تخاصمی''' (''Generative Adversarial Network'' یا GAN) خانواده‌ای از مدل‌های مولد است.
با این حال، عملکرد بینایی ماشین ممکن است تحت تأثیر باران، مه، تاریکی، انعکاس نور یا انسداد دید قرار گیرد.


در ساختار کلاسیک GAN، دو شبکه با یکدیگر در فرایندی رقابتی آموزش می‌بینند.
به همین دلیل، ایمنی سامانه‌های خودران به مجموعه‌ای از اجزای فنی، آزمون‌ها و سازوکارهای کنترلی وابسته است.


شبکهٔ مولد تلاش می‌کند نمونه‌های مصنوعی تولید کند.
== بینایی ماشین در رباتیک ==


شبکهٔ تمایزدهنده تلاش می‌کند نمونه‌های واقعی را از نمونه‌های تولیدشده تشخیص دهد.
ربات‌ها می‌توانند از بینایی ماشین برای شناسایی اشیا، تخمین فاصله، تشخیص موانع و هدایت حرکت استفاده کنند.


این معماری در سال ۲۰۱۴ توسط ایان گودفلو و همکاران معرفی شد.<ref name="gan">[https://arxiv.org/abs/1406.2661 Goodfellow, Ian, et al. “Generative Adversarial Nets.” ''Advances in Neural Information Processing Systems'' 27 (2014).]</ref>
برای مثال، یک ربات صنعتی ممکن است قطعات موجود روی خط تولید را شناسایی و موقعیت آنها را برای بازوی مکانیکی تعیین کند.


GANها در تولید و ویرایش تصویر و برخی دیگر از کاربردهای مولد نقش داشته‌اند.
در ربات‌های متحرک، بینایی ماشین می‌تواند در کنار حسگرهای دیگر به ناوبری و نقشه‌سازی کمک کند.


== شبکهٔ عصبی گرافی ==
== بینایی صنعتی ==


'''شبکهٔ عصبی گرافی''' (''Graph Neural Network'' یا GNN) خانواده‌ای از شبکه‌هاست که برای پردازش داده‌های دارای ساختار گراف استفاده می‌شود.
'''بینایی صنعتی''' (Machine Vision) به کاربرد سامانه‌های تصویربرداری و تحلیل تصویر در محیط‌های صنعتی، به‌ویژه تولید و کنترل کیفیت، گفته می‌شود.


در یک گراف، داده از گره‌ها و ارتباطات میان آنها تشکیل شده است.
بینایی صنعتی با بینایی ماشین ارتباط نزدیک دارد، اما معمولاً بر کاربردهای عملی در خطوط تولید، اندازه‌گیری، بازرسی و هدایت تجهیزات تمرکز می‌کند.


برای مثال، شبکه‌های اجتماعی، ساختار مولکول‌ها و برخی شبکه‌های حمل‌ونقل را می‌توان به‌صورت گراف نمایش داد.
برای مثال، یک سامانهٔ بینایی صنعتی می‌تواند قطعات معیوب را روی نوار نقاله شناسایی کند.


شبکه‌های عصبی گرافی می‌توانند اطلاعات گره‌ها و ارتباطات آنها را در فرایند یادگیری ترکیب کنند.
بنابراین بینایی صنعتی را می‌توان یکی از حوزه‌های کاربردی مرتبط با بینایی ماشین دانست، نه مترادف کامل آن.


== شبکهٔ عصبی ترنسفورمری ==
== کنترل کیفیت صنعتی ==


[[ترنسفورمر]] یکی از معماری‌های اثرگذار شبکهٔ عصبی مصنوعی است.
در خطوط تولید، سامانه‌های بینایی ماشین می‌توانند برای بررسی ظاهر محصولات استفاده شوند.


این معماری از سازوکار توجه برای مدل‌سازی روابط میان عناصر داده استفاده می‌کند.
این بررسی ممکن است شامل تشخیص ترک، خراش، تغییر شکل، نقص مونتاژ یا اشتباه در بسته‌بندی باشد.


برخلاف شبکه‌های بازگشتی سنتی، ترنسفورمر می‌تواند بخش بزرگی از محاسبات مربوط به موقعیت‌های مختلف دنباله را در زمان آموزش به‌صورت موازی انجام دهد.
کارایی چنین سامانه‌هایی به کیفیت تصویربرداری، نورپردازی و شرایط محیط وابسته است.


ترنسفورمرها پایهٔ بسیاری از [[مدل زبانی بزرگ|مدل‌های زبانی بزرگ]] و سامانه‌های [[هوش مصنوعی مولد]] معاصر هستند.<ref name="vaswani" />
== بینایی ماشین در کشاورزی ==


== شبکه‌های عصبی و یادگیری عمیق ==
بینایی ماشین در کشاورزی برای تحلیل وضعیت گیاهان، شناسایی برخی آفات و بیماری‌ها، ارزیابی رشد محصول و مدیریت ماشین‌آلات کشاورزی استفاده می‌شود.


[[یادگیری عمیق]] عمدتاً بر شبکه‌های عصبی دارای چندین لایهٔ پردازشی استوار است.
تصاویر ممکن است از دوربین‌های زمینی، پهپادها یا ماهواره‌ها به دست آمده باشند.


در شبکه‌های عمیق، لایه‌های مختلف می‌توانند بازنمایی‌هایی با سطوح متفاوت انتزاع را بیاموزند.
این سامانه‌ها می‌توانند به کشاورزان در پایش زمین و تصمیم‌گیری کمک کنند.


برای مثال، در پردازش تصویر، شبکه ممکن است از ویژگی‌های ساده مانند لبه‌ها به بازنمایی‌های پیچیده‌تر برسد.
اما عملکرد مدل باید با شرایط اقلیمی، نوع محصول و داده‌های محلی سازگار باشد.


با این حال، همهٔ شبکه‌های عصبی لزوماً عمیق نیستند.
== بینایی ماشین در تصاویر ماهواره‌ای ==


یک پرسپترون ساده نیز نوعی مدل شبکهٔ عصبی است، اما معمولاً در دستهٔ شبکه‌های عمیق قرار نمی‌گیرد.
تحلیل تصاویر ماهواره‌ای یکی از کاربردهای مهم بینایی ماشین و سنجش از دور است.


== شبکه‌های عصبی و یادگیری ماشین ==
الگوریتم‌ها می‌توانند برای شناسایی تغییرات پوشش زمین، گسترش مناطق شهری، بررسی جنگل‌ها و پایش برخی رخدادهای محیطی استفاده شوند.


[[یادگیری ماشین]] حوزه‌ای گسترده‌تر از شبکه‌های عصبی مصنوعی است.
داده‌های ماهواره‌ای ممکن است علاوه بر نور مرئی، شامل باندهای طیفی دیگری باشند.


الگوریتم‌های یادگیری ماشین شامل روش‌هایی مانند رگرسیون، درخت تصمیم، جنگل تصادفی، ماشین بردار پشتیبان و خوشه‌بندی نیز می‌شوند.
بنابراین تحلیل آنها گاهی به روش‌های تخصصی پردازش داده‌های چندطیفی نیاز دارد.


شبکه‌های عصبی یکی از خانواده‌های مهم مدل‌های یادگیری ماشین هستند.
== بینایی ماشین و محیط زیست ==


بنابراین همهٔ روش‌های یادگیری ماشین مبتنی بر شبکهٔ عصبی نیستند.
بینایی ماشین می‌تواند در پایش حیات وحش، بررسی پوشش گیاهی، تحلیل تصاویر جنگل‌ها و شناسایی تغییرات محیطی کاربرد داشته باشد.


== شبکه‌های عصبی و هوش مصنوعی مولد ==
برای مثال، تصاویر دوربین‌های تله‌ای حیات وحش می‌توانند با استفاده از مدل‌های تشخیص تصویر بررسی شوند.


[[هوش مصنوعی مولد]] به سامانه‌هایی اشاره دارد که می‌توانند داده یا محتوای جدید تولید کنند.
این فناوری می‌تواند حجم کار تحلیل تصاویر را کاهش دهد، اما نتایج آن باید از نظر خطاهای شناسایی ارزیابی شوند.


بسیاری از مدل‌های مولد معاصر از شبکه‌های عصبی مصنوعی استفاده می‌کنند.
== بینایی ماشین در میراث فرهنگی ==


این مدل‌ها می‌توانند برای تولید متن، تصویر، صوت، موسیقی، ویدئو یا کد آموزش داده شوند.
در پژوهش‌های میراث فرهنگی، بینایی ماشین می‌تواند برای بازسازی سه‌بعدی بناها، تحلیل تصاویر آثار تاریخی و تطبیق تصاویر قدیمی و جدید استفاده شود.


شبکه‌های مولد تخاصمی، خودرمزگذارهای متغیر، مدل‌های انتشار و مدل‌های زبانی ترنسفورمری از نمونه‌های مهم رویکردهای مولد هستند.
روش‌های فتوگرامتری و بازسازی سه‌بعدی در مستندسازی بناها و اشیای تاریخی اهمیت دارند.


البته همهٔ شبکه‌های عصبی مولد نیستند.
این فناوری همچنین می‌تواند به ثبت دیجیتال وضعیت آثار و بررسی تغییرات آنها در طول زمان کمک کند.


شبکه‌ای که فقط تصاویر را طبقه‌بندی می‌کند، ممکن است هیچ محتوای جدیدی تولید نکند.
== بینایی ماشین و اسناد تاریخی ==


== شبکه‌های عصبی و مدل‌های زبانی بزرگ ==
بینایی ماشین در دیجیتال‌سازی و تحلیل اسناد تاریخی کاربرد دارد.


[[مدل زبانی بزرگ|مدل‌های زبانی بزرگ]] از مهم‌ترین کاربردهای شبکه‌های عصبی معاصر هستند.
از جمله وظایف مرتبط می‌توان به شناسایی ساختار صفحه، تشخیص نواحی متن، جداسازی تصاویر و آماده‌سازی داده برای تشخیص نویسه‌ها اشاره کرد.


بسیاری از این مدل‌ها از معماری ترنسفورمر استفاده می‌کنند.
'''تشخیص نوری نویسه‌ها''' (OCR) یکی از فناوری‌های مرتبط است که متن موجود در تصویر را به دادهٔ متنی تبدیل می‌کند.


مدل زبانی در فرایند آموزش، روابط آماری و ساختارهای موجود در داده‌های زبانی را می‌آموزد.
در اسناد تاریخی، کیفیت کاغذ، فرسودگی، نوع خط و وضوح تصویر می‌توانند بر نتیجه تأثیر بگذارند.


در مدل‌های خودرگرسیو، یکی از وظایف اصلی پیش‌بینی توکن بعدی بر اساس توکن‌های پیشین است.
== بینایی ماشین و زبان فارسی ==


این فرایند به مدل امکان می‌دهد متن تولید کند، به پرسش‌ها پاسخ دهد یا در وظایف مختلف پردازش زبان به کار رود.
بینایی ماشین در پردازش اسناد فارسی و شناسایی نوشته‌های فارسی نیز کاربرد دارد.


== شبکه‌های عصبی و پردازش زبان طبیعی ==
یکی از مسائل مهم، تشخیص متن در تصاویر و اسناد اسکن‌شده است.


شبکه‌های عصبی در [[پردازش زبان طبیعی]] کاربرد گسترده دارند.
ویژگی‌هایی مانند پیوستگی حروف، شکل‌های متفاوت نویسه‌ها و وجود نقطه‌ها می‌توانند بر طراحی سامانه‌های تشخیص متن تأثیر بگذارند.


از جمله کاربردهای آنها می‌توان به ترجمهٔ ماشینی، تحلیل احساسات، طبقه‌بندی متن، خلاصه‌سازی، پاسخ به پرسش و تولید زبان اشاره کرد.
در متون تاریخی، تفاوت خط، کیفیت چاپ و آسیب‌دیدگی اسناد دشواری بیشتری ایجاد می‌کند.


شبکه‌های بازگشتی و سپس ترنسفورمرها در تحول این حوزه نقش مهمی داشته‌اند.
سامانه‌های پردازش اسناد فارسی می‌توانند از ترکیب بینایی ماشین و [[پردازش زبان طبیعی]] استفاده کنند.


== شبکه‌های عصبی در بینایی ماشین ==
== بینایی ماشین در آموزش ==


شبکه‌های عصبی در [[بینایی ماشین]] برای تحلیل تصاویر و ویدئو استفاده می‌شوند.
بینایی ماشین در ابزارهای آموزشی، تحلیل تصاویر علمی و سامانه‌های کمک‌آموزشی کاربرد دارد.


کاربردهای مهم آنها عبارت‌اند از:
برای مثال، یک برنامهٔ آموزشی می‌تواند تصویر یک نمودار یا شکل هندسی را دریافت و اجزای آن را شناسایی کند.


* طبقه‌بندی تصویر؛
در ابزارهای دسترس‌پذیری نیز سامانه‌های توصیف تصویر می‌توانند به کاربران نابینا یا کم‌بینا کمک کنند.
* تشخیص اشیا؛
* تقسیم‌بندی تصویر؛
* تشخیص چهره؛
* تحلیل تصاویر پزشکی؛
* و پردازش تصاویر ماهواره‌ای.


شبکه‌های پیچشی و ترنسفورمرهای بینایی از معماری‌های مهم این حوزه هستند.
با این حال، اطلاعات تولیدشده توسط این سامانه‌ها باید از نظر دقت و محدودیت‌های کاربرد بررسی شود.


== شبکه‌های عصبی در تشخیص گفتار ==
== بینایی ماشین در ورزش ==


شبکه‌های عصبی می‌توانند برای تبدیل سیگنال صوتی به متن آموزش داده شوند.
در ورزش، بینایی ماشین برای تحلیل حرکت بازیکنان، ردیابی توپ، بررسی وضعیت بدن و تحلیل ویدئو استفاده می‌شود.


این فناوری در دستیارهای صوتی، زیرنویس خودکار، رونویسی جلسات و سامانه‌های دسترس‌پذیری کاربرد دارد.
این فناوری می‌تواند در آموزش ورزشکاران، تحلیل مسابقات و برخی سامانه‌های داوری کمکی کاربرد داشته باشد.


مدل‌های عصبی همچنین در تولید گفتار مصنوعی و پردازش ویژگی‌های صوتی استفاده می‌شوند.
دقت نتیجه به کیفیت دوربین‌ها، زاویهٔ دید و روش پردازش داده وابسته است.


== شبکه‌های عصبی در پزشکی ==
== بینایی ماشین و واقعیت افزوده ==


در پزشکی، شبکه‌های عصبی برای تحلیل تصاویر، پردازش پرونده‌های بالینی، پیش‌بینی برخی خطرهای سلامت و پژوهش دارویی استفاده شده‌اند.
'''واقعیت افزوده''' (Augmented Reality) فناوری‌ای است که اطلاعات یا عناصر دیجیتال را با نمای محیط واقعی ترکیب می‌کند.


برای مثال، شبکهٔ عصبی می‌تواند برای شناسایی الگوهایی در تصاویر پزشکی آموزش داده شود.
بینایی ماشین می‌تواند برای شناسایی سطوح، تخمین حرکت دوربین و تعیین موقعیت عناصر مجازی استفاده شود.


با این حال، عملکرد مطلوب روی یک مجموعهٔ دادهٔ آزمایشی به‌تنهایی برای اثبات ایمنی بالینی کافی نیست.
این فناوری در آموزش، طراحی، بازی و کاربردهای صنعتی مورد استفاده قرار می‌گیرد.


مدل باید در شرایط واقعی و روی جمعیت هدف ارزیابی شود.
== مجموعه‌داده‌های بینایی ماشین ==


همچنین تصمیم‌های پزشکی نیازمند نظارت متخصصان و رعایت الزامات قانونی و حرفه‌ای هستند.
توسعه و ارزیابی مدل‌های بینایی ماشین به مجموعه‌داده‌های مناسب نیاز دارد.


== شبکه‌های عصبی در صنعت ==
این مجموعه‌ها ممکن است شامل تصاویر، برچسب‌های طبقه‌بندی، کادرهای اشیا یا نقشه‌های بخش‌بندی باشند.


شبکه‌های عصبی در صنعت برای پیش‌بینی خرابی تجهیزات، کنترل کیفیت، تحلیل داده‌های حسگر و بهینه‌سازی فرایندها استفاده می‌شوند.
از مجموعه‌داده‌های شناخته‌شده می‌توان به ImageNet، COCO و MNIST اشاره کرد.


برای مثال، یک شبکه می‌تواند بر اساس داده‌های ثبت‌شده از دستگاه‌ها، الگوهایی را شناسایی کند که با افزایش احتمال خرابی ارتباط دارند.
هر مجموعه‌داده برای هدف مشخصی طراحی شده و محدودیت‌های خاص خود را دارد.


این کاربردها می‌توانند به برنامه‌ریزی نگهداری و کاهش توقف‌های ناخواسته کمک کنند.
برای مثال، عملکرد مناسب یک مدل روی یک مجموعه‌دادهٔ معیار لزوماً نشان‌دهندهٔ عملکرد مشابه در همهٔ محیط‌های واقعی نیست.


== شبکه‌های عصبی در اقتصاد و امور مالی ==
== آموزش مدل‌های بینایی ماشین ==


شبکه‌های عصبی در تحلیل داده‌های مالی، کشف تقلب، ارزیابی ریسک و پیش‌بینی به کار می‌روند.
در روش‌های مبتنی بر یادگیری نظارت‌شده، مدل با استفاده از نمونه‌های دارای برچسب آموزش داده می‌شود.


با این حال، استفاده از مدل‌های عصبی در تصمیم‌هایی مانند اعتبارسنجی می‌تواند مسائل مربوط به شفافیت، انصاف و حق اعتراض را مطرح کند.
برای مثال، تصاویر ممکن است با نام اشیای موجود در آنها برچسب‌گذاری شوند.


عملکرد آماری مناسب یک مدل لزوماً به معنای عادلانه‌بودن همهٔ پیامدهای اجتماعی آن نیست.
مدل با مقایسهٔ خروجی خود و برچسب هدف، پارامترهایش را تنظیم می‌کند.


== شبکه‌های عصبی در کشاورزی ==
در روش‌های خودنظارت‌شده، بخشی از اطلاعات آموزشی از ساختار خود داده به دست می‌آید.


در کشاورزی، شبکه‌های عصبی می‌توانند برای تحلیل تصاویر گیاهان، تشخیص بیماری‌ها، پیش‌بینی محصول و مدیریت منابع استفاده شوند.
انتخاب روش آموزش به نوع وظیفه، داده و منابع محاسباتی بستگی دارد.


ترکیب تصاویر ماهواره‌ای، داده‌های حسگرها و مدل‌های یادگیری ماشین می‌تواند به تحلیل وضعیت زمین و محصولات کمک کند.
== افزایش داده ==


== شبکه‌های عصبی در آموزش ==
'''افزایش داده''' (Data Augmentation) به ایجاد تغییرات کنترل‌شده در نمونه‌های آموزشی گفته می‌شود.


شبکه‌های عصبی در سامانه‌های آموزشی تطبیقی، تحلیل داده‌های آموزشی و تولید محتوای آموزشی کاربرد دارند.
برای مثال، ممکن است تصویر چرخانده، برش داده یا روشنایی آن تغییر داده شود.


برای مثال، یک سامانه می‌تواند بر اساس پاسخ‌های دانش‌آموز، تمرین‌های متناسب با سطح او پیشنهاد کند.
هدف این است که مدل با تنوع بیشتری از نمونه‌ها روبه‌رو شود و در شرایط متفاوت عملکرد مناسب‌تری داشته باشد.


اما استفاده از داده‌های آموزشی، به‌ویژه اطلاعات کودکان، نیازمند توجه به حریم خصوصی و امنیت است.
البته همهٔ تغییرات برای همهٔ وظایف مجاز یا مفید نیستند.


== شبکه‌های عصبی و رباتیک ==
برای مثال، در برخی کاربردهای پزشکی، تغییر نامناسب تصویر ممکن است اطلاعات مهمی را مخدوش کند.


در رباتیک، شبکه‌های عصبی برای پردازش داده‌های حسگر، تشخیص اشیا، کنترل حرکت و یادگیری برخی رفتارها استفاده می‌شوند.
== ارزیابی مدل‌های بینایی ماشین ==


ترکیب شبکه‌های عصبی با یادگیری تقویتی می‌تواند به ربات امکان دهد برخی سیاست‌های کنترلی را از تجربه بیاموزد.
ارزیابی مدل‌های بینایی ماشین باید بر اساس وظیفهٔ مورد نظر انجام شود.


با این حال، استفاده در محیط واقعی نیازمند آزمون ایمنی و کنترل خطا است.
در طبقه‌بندی، معیارهایی مانند دقت، بازخوانی و امتیاز F1 استفاده می‌شوند.


== مزایای شبکه‌های عصبی مصنوعی ==
در تشخیص اشیا، معیارهایی مانند میانگین دقت متوسط (mAP) رایج هستند.


یکی از مزایای شبکه‌های عصبی توانایی مدل‌سازی روابط پیچیده و غیرخطی است.
در بخش‌بندی تصویر، معیارهایی مانند اشتراک بر اجتماع (IoU) و ضریب Dice کاربرد دارند.


این مدل‌ها می‌توانند در بسیاری از وظایف، ویژگی‌های مورد نیاز را از داده بیاموزند.
انتخاب معیار باید با هدف عملی سامانه هماهنگ باشد.


همچنین شبکه‌های عصبی برای پردازش داده‌های غیرساخت‌یافته مانند متن، تصویر و صوت مناسب‌اند.
== دقت و خطا ==


با این حال، مزیت یک شبکهٔ عصبی به نوع مسئله، داده، معماری و روش ارزیابی وابسته است.
یکی از مسائل مهم در ارزیابی بینایی ماشین، تفاوت میان دقت آزمایشگاهی و عملکرد واقعی است.


در برخی مسائل، روش‌های ساده‌تر یادگیری ماشین می‌توانند عملکرد مشابه یا حتی بهتری داشته باشند.
مدلی که در مجموعه‌داده‌ای مشخص عملکرد بالایی دارد، ممکن است در محیطی با نور، زاویه یا کیفیت تصویر متفاوت دچار خطا شود.


== محدودیت‌های شبکه‌های عصبی مصنوعی ==
به همین دلیل، ارزیابی باید تا حد امکان شامل داده‌هایی نزدیک به شرایط واقعی استفاده باشد.


شبکه‌های عصبی با وجود توانایی‌های گسترده محدودیت‌هایی دارند.
== محدودیت‌های بینایی ماشین ==


از جمله:
بینایی ماشین با وجود پیشرفت‌های گسترده محدودیت‌هایی دارد.


* نیاز احتمالی به داده‌های فراوان؛
یکی از این محدودیت‌ها وابستگی عملکرد به کیفیت تصویر است.
* هزینهٔ محاسباتی آموزش؛
* خطر بیش‌برازش؛
* دشواری توضیح برخی تصمیم‌ها؛
* حساسیت به کیفیت داده؛
* امکان سوگیری؛
* آسیب‌پذیری در برابر برخی حملات؛
* و کاهش عملکرد در شرایط متفاوت با داده‌های آموزشی.


این محدودیت‌ها به‌ویژه در کاربردهای حساس اهمیت دارند.
نور نامناسب، تاری، انسداد، زاویهٔ دید غیرمعمول و نویز می‌توانند تشخیص را دشوار کنند.


== مسئلهٔ جعبهٔ سیاه ==
محدودیت دیگر، وابستگی بسیاری از مدل‌ها به داده‌های آموزشی است.


برخی شبکه‌های عصبی دارای تعداد بسیار زیادی پارامتر هستند.
اگر شرایط واقعی با داده‌های آموزش تفاوت زیادی داشته باشد، عملکرد مدل ممکن است کاهش یابد.


در چنین مدل‌هایی، توضیح دقیق اینکه چرا یک ورودی به خروجی مشخصی منجر شده ممکن است دشوار باشد.
== تغییر توزیع داده ==


این مسئله معمولاً با اصطلاح '''جعبهٔ سیاه''' توصیف می‌شود.
'''تغییر توزیع داده''' (Distribution Shift) زمانی رخ می‌دهد که داده‌های زمان استفاده با داده‌های آموزش یا ارزیابی تفاوت معناداری داشته باشند.


با این حال، جعبهٔ سیاه بودن به معنای غیرممکن‌بودن همهٔ انواع تحلیل نیست.
برای مثال، مدلی که با تصاویر روز آموزش دیده ممکن است در تصاویر شب عملکرد ضعیف‌تری داشته باشد.


پژوهشگران روش‌هایی برای بررسی حساسیت مدل، تحلیل ویژگی‌ها و مطالعهٔ بازنمایی‌های داخلی توسعه داده‌اند.
این مسئله در سامانه‌های صنعتی، پزشکی و حمل‌ونقل اهمیت ویژه‌ای دارد.
 
== هوش مصنوعی توضیح‌پذیر ==
 
'''هوش مصنوعی توضیح‌پذیر''' (''Explainable AI'') حوزه‌ای است که به بررسی روش‌های توضیح یا تفسیر رفتار مدل‌های هوش مصنوعی می‌پردازد.
 
در شبکه‌های عصبی، این روش‌ها می‌توانند شامل تحلیل اهمیت ویژگی‌ها، بررسی فعال‌سازی‌ها و مطالعهٔ رفتار مدل در برابر تغییر ورودی باشند.
 
توضیح‌پذیری در کاربردهای پزشکی، مالی و اداری اهمیت ویژه‌ای دارد.
 
با این حال، توضیح تولیدشده برای رفتار مدل باید از نظر اعتبار و محدودیت‌های خود نیز بررسی شود.


== سوگیری الگوریتمی ==
== سوگیری الگوریتمی ==


[[سوگیری الگوریتمی]] یکی از مسائل مهم شبکه‌های عصبی مصنوعی است.
[[سوگیری الگوریتمی]] یکی از مسائل مهم بینایی ماشین است.
 
اگر داده‌های آموزشی دارای عدم توازن یا منعکس‌کنندهٔ تبعیض‌های تاریخی باشند، مدل ممکن است الگوهای نامطلوبی را بیاموزد.
 
برای مثال، یک سامانهٔ تشخیص چهره ممکن است برای گروه‌های جمعیتی مختلف نرخ خطای متفاوتی داشته باشد.


بنابراین ارزیابی مدل باید فراتر از دقت کلی باشد و عملکرد آن در شرایط و گروه‌های مختلف نیز بررسی شود.
اگر داده‌های آموزشی پوشش نامتوازنی از شرایط، گروه‌ها یا محیط‌های مختلف داشته باشند، عملکرد مدل ممکن است برای برخی گروه‌ها یا شرایط ضعیف‌تر باشد.


== حریم خصوصی ==
این مسئله در سامانه‌های تشخیص چهره و تصمیم‌گیری مبتنی بر تصویر اهمیت ویژه‌ای دارد.


آموزش شبکه‌های عصبی گاهی به استفاده از مجموعه‌های بزرگ داده نیاز دارد.
ارزیابی منصفانه باید تفاوت نرخ خطا میان گروه‌ها و شرایط مختلف را نیز بررسی کند.


این داده‌ها ممکن است شامل اطلاعات شخصی باشند.
== حریم خصوصی و نظارت تصویری ==


در چنین شرایطی، پرسش‌هایی دربارهٔ رضایت، امنیت، نگهداری داده و امکان افشای اطلاعات مطرح می‌شود.
بینایی ماشین می‌تواند در سامانه‌های نظارتی برای شناسایی اشیا، ردیابی افراد یا تحلیل رفتارهای تصویری استفاده شود.


روش‌هایی مانند حریم خصوصی تفاضلی و یادگیری فدرال برای مدیریت برخی خطرهای مربوط به داده مورد پژوهش قرار گرفته‌اند.
این کاربردها می‌توانند مسائل مهمی دربارهٔ حریم خصوصی، رضایت، نگهداری داده و نظارت عمومی ایجاد کنند.


با این حال، هیچ روش واحدی به‌تنهایی همهٔ خطرهای حریم خصوصی را از میان نمی‌برد.
استفاده از تشخیص چهره برای شناسایی افراد در فضاهای عمومی، به‌ویژه در صورت نبود شفافیت و نظارت مستقل، می‌تواند خطرهایی برای آزادی‌های مدنی به همراه داشته باشد.


== حملات خصمانه ==
ارزیابی این خطرها باید با توجه به کاربرد مشخص، قوانین مربوط و آثار واقعی سامانه انجام شود.


'''حملات خصمانه''' (''Adversarial Attacks'') به تلاش‌هایی گفته می‌شود که با تغییر طراحی‌شدهٔ ورودی، مدل را به خروجی نامطلوب یا نادرست سوق می‌دهند.
== بینایی ماشین و حقوق بشر ==


در برخی شبکه‌های تشخیص تصویر، تغییراتی کوچک در دادهٔ ورودی می‌توانند موجب تغییر طبقه‌بندی شوند.
کاربرد بینایی ماشین در شناسایی افراد، نظارت عمومی و تحلیل رفتار می‌تواند با حقوق بنیادین شهروندان ارتباط پیدا کند.


این مسئله در کاربردهای امنیتی و سامانه‌های حساس اهمیت دارد.
از جمله مسائل مهم می‌توان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و حق برخورداری از رفتار برابر اشاره کرد.


== توهم هوش مصنوعی ==
استفاده از سامانه‌های تشخیص چهره در محیط‌های عمومی ممکن است به شناسایی و ردیابی افراد بدون اطلاع یا رضایت آنان منجر شود.


[[توهم هوش مصنوعی]] بیشتر در ارتباط با سامانه‌های مولد، به‌ویژه مدل‌های زبانی، مطرح می‌شود.
در چنین مواردی، ضرورت قانونی‌بودن، تناسب، شفافیت و پاسخگویی از موضوعات مهم ارزیابی حقوق بشری است.


در این وضعیت، مدل ممکن است محتوایی روان و ظاهراً معتبر تولید کند که از نظر واقعی نادرست باشد.
== بینایی ماشین و امنیت ==


برای مثال، یک مدل زبانی ممکن است عنوان کتاب یا منبعی را تولید کند که وجود خارجی ندارد.
سامانه‌های بینایی ماشین ممکن است در معرض حملات فنی قرار گیرند.


این پدیده را نباید با همهٔ انواع خطای شبکه‌های عصبی یکسان دانست.
یکی از نمونه‌ها، حملات خصمانه است که در آن تغییرات طراحی‌شده در تصویر می‌تواند مدل را به تشخیص نادرست سوق دهد.


خطای طبقه‌بندی تصویر و تولید منبع ساختگی در یک مدل زبانی، دو نوع متفاوت از خطا هستند.
این مسئله در سامانه‌های امنیتی و کاربردهای حساس اهمیت دارد.


== شبکهٔ عصبی مصنوعی و مغز انسان ==
همچنین دست‌کاری داده‌های آموزشی یا تصاویر ورودی می‌تواند بر عملکرد سامانه اثر بگذارد.


یکی از پرسش‌های رایج دربارهٔ شبکه‌های عصبی مصنوعی، میزان شباهت آنها به مغز انسان است.
== تصاویر ساختگی و دیپ‌فیک ==


شبکه‌های عصبی مصنوعی در آغاز از برخی ویژگی‌های نورون‌ها و ارتباطات عصبی الهام گرفتند.
پیشرفت هوش مصنوعی مولد موجب گسترش امکان تولید تصاویر و ویدئوهای مصنوعی شده است.


اما نورون مصنوعی معمولاً یک واحد ریاضی بسیار ساده‌تر از نورون زیستی است.
اصطلاح '''دیپ‌فیک''' معمولاً به محتوای مصنوعی یا دست‌کاری‌شده‌ای اشاره دارد که می‌تواند چهره، صدا یا رفتار فردی را به‌صورت گمراه‌کننده بازنمایی کند.


نورون‌های زیستی دارای فرایندهای پیچیدهٔ الکتروشیمیایی هستند و در شبکه‌هایی با ساختار و پویایی بسیار پیچیده فعالیت می‌کنند.
بینایی ماشین می‌تواند در پژوهش‌های تشخیص دست‌کاری تصویر و تحلیل اصالت محتوا به کار رود.


در مقابل، بسیاری از شبکه‌های عصبی مصنوعی بر عملیات ماتریسی، توابع ریاضی و روش‌های بهینه‌سازی استوارند.
با این حال، هیچ روش تشخیص خودکاری را نباید برای همهٔ انواع تصاویر و ویدئوهای مصنوعی بی‌خطا فرض کرد.


بنابراین شباهت اصطلاحی یا ساختاری میان این دو به معنای یکسان‌بودن سازوکار آنها نیست.
== بینایی ماشین و توهم هوش مصنوعی ==


== آیا شبکهٔ عصبی مصنوعی مانند انسان فکر می‌کند؟ ==
در سامانه‌هایی که بینایی ماشین را با مدل‌های زبانی ترکیب می‌کنند، امکان تولید توصیف‌های نادرست از تصویر وجود دارد.


شبکه‌های عصبی مصنوعی می‌توانند در برخی وظایف عملکردی مشابه یا بهتر از انسان داشته باشند.
برای مثال، مدل ممکن است شیئی را در تصویر توصیف کند که واقعاً وجود ندارد یا رابطهٔ میان اشیا را اشتباه تشخیص دهد.


برای مثال، یک شبکه ممکن است در طبقه‌بندی نوع مشخصی از تصویر به دقت بالایی برسد.
این مسئله با [[توهم هوش مصنوعی]] ارتباط دارد.


اما موفقیت در یک وظیفه به‌تنهایی ثابت نمی‌کند که شبکه دارای تجربهٔ ذهنی، آگاهی یا فهم انسانی است.
در کاربردهای پژوهشی و دانشنامه‌ای، توصیف تولیدشده توسط مدل باید با تصویر اصلی و منابع مستقل تطبیق داده شود.


پرسش دربارهٔ رابطهٔ محاسبات، هوش و آگاهی از موضوعات مورد بحث در فلسفهٔ ذهن و علوم شناختی است.
== تفسیرپذیری بینایی ماشین ==


در نتیجه، باید میان توانایی محاسباتی قابل اندازه‌گیری و ادعاهای فلسفی دربارهٔ آگاهی تمایز گذاشت.
بسیاری از مدل‌های عمیق بینایی ماشین دارای تعداد زیادی پارامتر هستند.


== شبکه‌های عصبی و علیت ==
در چنین مدل‌هایی، توضیح دقیق اینکه چرا تصویر به یک دستهٔ مشخص نسبت داده شده ممکن است دشوار باشد.


شبکه‌های عصبی معمولاً روابط آماری موجود در داده را می‌آموزند.
پژوهشگران روش‌هایی مانند نقشه‌های برجستگی و تحلیل حساسیت را برای بررسی عوامل مؤثر بر پیش‌بینی توسعه داده‌اند.


اما وجود همبستگی میان دو متغیر به‌تنهایی اثبات نمی‌کند که یکی علت دیگری است.
با این حال، نمایش نواحی مورد توجه مدل لزوماً توضیح کامل و قطعی تصمیم آن نیست.


برای مثال، مدلی ممکن است از یک ویژگی برای پیش‌بینی استفاده کند، بدون آن‌که آن ویژگی علت مستقیم پدیدهٔ مورد نظر باشد.
== مصرف انرژی و منابع محاسباتی ==


این تمایز در پزشکی، اقتصاد و علوم اجتماعی اهمیت ویژه‌ای دارد.
آموزش برخی مدل‌های بزرگ بینایی ماشین می‌تواند به سخت‌افزار و انرژی قابل توجهی نیاز داشته باشد.


== شبکه‌های عصبی و تصمیم‌گیری انسانی ==
هزینهٔ محاسباتی به اندازهٔ مدل، وضوح تصویر، حجم داده، تعداد مراحل آموزش و نوع سخت‌افزار بستگی دارد.


استفاده از شبکه‌های عصبی در تصمیم‌گیری می‌تواند به پردازش سریع داده‌ها کمک کند.
در کاربردهای عملی، بهینه‌سازی مدل برای اجرا روی دستگاه‌های کم‌مصرف نیز اهمیت دارد.


با این حال، تصمیم‌های دارای پیامد حقوقی، اقتصادی یا اجتماعی مهم نیازمند ارزیابی دقیق هستند.
== بینایی ماشین و تمرکز قدرت فناوری ==


در چنین کاربردهایی باید مشخص شود:
توسعهٔ مدل‌های بزرگ و مجموعه‌داده‌های گسترده ممکن است به سرمایه و زیرساخت محاسباتی قابل توجه نیاز داشته باشد.


* مدل با چه داده‌هایی آموزش دیده است؛
این مسئله می‌تواند مشارکت مؤسسات دارای منابع محدود را دشوار کند.
* نرخ خطای آن چقدر است؛
* عملکرد آن برای گروه‌های مختلف چگونه است؛
* آیا خروجی قابل بررسی است؛
* و چه نهادی مسئول پیامدهای تصمیم است.


شبکهٔ عصبی نباید صرفاً به دلیل پیچیدگی یا عملکرد آماری مناسب، مرجع غیرقابل اعتراض تلقی شود.
در مقابل، انتشار کدهای پژوهشی، مجموعه‌داده‌های مجاز و مدل‌های قابل استفادهٔ عمومی می‌تواند دسترسی پژوهشگران بیشتری را فراهم سازد.


== شبکه‌های عصبی و تمرکز قدرت فناوری ==
البته انتشار داده‌های تصویری باید با رعایت حقوق افراد و الزامات حریم خصوصی انجام شود.


توسعهٔ برخی شبکه‌های عصبی بسیار بزرگ به منابع محاسباتی و سرمایهٔ قابل توجه نیاز دارد.
== بینایی ماشین و دانشنامه‌نویسی ==


این مسئله می‌تواند توسعهٔ مدل‌های پیشرفته را در تعداد محدودی از شرکت‌ها، دولت‌ها و مؤسسات پژوهشی متمرکز کند.
بینایی ماشین می‌تواند در گردآوری، سامان‌دهی و تحلیل منابع تصویری دانشنامه‌ها کاربرد داشته باشد.


در مقابل، انتشار پژوهش‌های علمی، نرم‌افزارهای آزاد و مدل‌های دارای وزن‌های در دسترس می‌تواند مشارکت گروه‌های بیشتری را ممکن سازد.
برای مثال، این فناوری ممکن است برای شناسایی متن در اسناد اسکن‌شده، طبقه‌بندی تصاویر، تشخیص تصاویر مشابه یا بررسی کیفیت فایل‌های تصویری استفاده شود.


این موضوع در مباحث مربوط به رقابت، دسترسی به فناوری و حکمرانی هوش مصنوعی اهمیت دارد.
در دانشنامه‌نویسی تاریخی، بینایی ماشین می‌تواند به آماده‌سازی اسناد و تصاویر برای بررسی پژوهشگران کمک کند.


== شبکه‌های عصبی و جامعه ==
با این حال، خروجی سامانه نباید جایگزین بررسی منبع اصلی شود.


شبکه‌های عصبی مصنوعی در سامانه‌های توصیه‌گر، موتورهای جست‌وجو، خدمات مالی، پزشکی و تولید محتوا نقش دارند.
تشخیص خودکار چهره، مکان یا تاریخ یک عکس ممکن است اشتباه باشد.


گسترش این فناوری بر شیوهٔ تولید، توزیع و تحلیل اطلاعات تأثیر گذاشته است.
بنابراین اطلاعات مربوط به هویت اشخاص، زمان ثبت تصاویر و اصالت اسناد باید با منابع معتبر راستی‌آزمایی شود.


در عین حال، استفاده از شبکه‌های عصبی در نظارت، رتبه‌بندی افراد یا تصمیم‌گیری خودکار می‌تواند پرسش‌هایی دربارهٔ آزادی‌های مدنی، شفافیت و پاسخگویی ایجاد کند.
== آیندهٔ بینایی ماشین ==


ارزیابی پیامدهای اجتماعی این فناوری باید بر اساس نوع کاربرد و شواهد مربوط به همان سامانه انجام شود.
پژوهش دربارهٔ بینایی ماشین در زمینه‌های متعددی ادامه دارد.


== شبکه‌های عصبی و زبان فارسی ==
از جمله موضوعات مهم می‌توان به توسعهٔ مدل‌های چندوجهی، بهبود تحلیل ویدئو، پردازش سه‌بعدی، کاهش نیاز به داده‌های برچسب‌دار، افزایش کارایی محاسباتی و بهبود قابلیت اعتماد اشاره کرد.


شبکه‌های عصبی در توسعهٔ سامانه‌های پردازش زبان فارسی کاربرد دارند.
یکی از جهت‌گیری‌های مهم، توسعهٔ سامانه‌هایی است که بتوانند اطلاعات بصری را با زبان، صوت و دیگر انواع داده ترکیب کنند.


از جمله کاربردهای آنها می‌توان به تحلیل متن، ترجمه، تشخیص گفتار، طبقه‌بندی اسناد و تولید زبان اشاره کرد.
همچنین افزایش شفافیت، کاهش سوگیری و حفاظت از حریم خصوصی از مسائل مهم آیندهٔ این حوزه خواهند بود.


کیفیت این سامانه‌ها به حجم، تنوع و اعتبار داده‌های فارسی وابسته است.
== تفاوت بینایی ماشین و پردازش تصویر ==


کمبود داده برای برخی گویش‌ها، گونه‌های زبانی یا موضوعات تخصصی می‌تواند بر عملکرد مدل تأثیر بگذارد.
پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند.


مدل‌های ترنسفورمری فارسی مانند ParsBERT نمونه‌ای از پژوهش‌های مبتنی بر شبکه‌های عصبی برای پردازش زبان فارسی هستند.<ref name="parsbert">[https://arxiv.org/abs/2005.12515 Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020.]</ref>
پردازش تصویر معمولاً بر تبدیل یا بهبود داده‌های تصویری تمرکز دارد.


== شبکه‌های عصبی و ایران ==
در مقابل، بینایی ماشین به استخراج اطلاعات و استنتاج دربارهٔ محتوای تصویر می‌پردازد.


پژوهش و کاربرد شبکه‌های عصبی در ایران در حوزه‌هایی مانند پردازش زبان فارسی، تحلیل تصاویر، پزشکی، صنعت و علوم داده انجام شده است.
برای مثال، کاهش نویز یک عکس نمونه‌ای از پردازش تصویر است.


با این حال، ارزیابی میزان توسعه یا کاربرد یک فناوری در کشور نیازمند آمار و منابع مشخص است.
تشخیص اینکه در همان عکس چه اشیایی وجود دارند، نمونه‌ای از وظایف بینایی ماشین است.


همچنین استفاده از شبکه‌های عصبی در سامانه‌های نظارتی، تشخیص چهره یا پردازش اطلاعات شهروندان، در صورت تأثیرگذاری بر حقوق افراد، ضرورت شفافیت و نظارت مستقل را مطرح می‌کند.
البته در بسیاری از سامانه‌ها، این دو حوزه با یکدیگر ترکیب می‌شوند.


هر ادعای مشخص دربارهٔ کاربرد چنین سامانه‌هایی توسط نهادهای حکومتی باید با منابع معتبر و قابل راستی‌آزمایی پشتیبانی شود.
== تفاوت بینایی ماشین و یادگیری عمیق ==


== آیندهٔ شبکه‌های عصبی مصنوعی ==
[[یادگیری عمیق]] حوزه‌ای از یادگیری ماشین است که عمدتاً از شبکه‌های عصبی چندلایه استفاده می‌کند.


پژوهش دربارهٔ شبکه‌های عصبی در زمینه‌های متعددی ادامه دارد.
بینایی ماشین حوزه‌ای کاربردی و پژوهشی برای تحلیل داده‌های بصری است.


از جمله:
بسیاری از روش‌های جدید بینایی ماشین از یادگیری عمیق بهره می‌گیرند، اما همهٔ روش‌های بینایی ماشین مبتنی بر یادگیری عمیق نیستند.


* افزایش کارایی محاسباتی؛
روش‌های هندسی، پردازش تصویر و الگوریتم‌های کلاسیک نیز بخش مهمی از این حوزه را تشکیل می‌دهند.
* کاهش نیاز به داده؛
* بهبود تعمیم؛
* توسعهٔ معماری‌های جدید؛
* یادگیری چندوجهی؛
* تفسیرپذیری؛
* ایمنی؛
* کاهش مصرف انرژی؛
* و ترکیب روش‌های یادگیری با استدلال و دانش ساختاریافته.


یکی از پرسش‌های مهم این است که چگونه می‌توان شبکه‌هایی توسعه داد که در کنار توانایی یادگیری الگوهای پیچیده، از قابلیت اعتماد، شفافیت و پایداری بیشتری برخوردار باشند.
== تفاوت بینایی ماشین و هوش مصنوعی مولد ==


== تفاوت شبکهٔ عصبی مصنوعی با ترنسفورمر ==
بینایی ماشین عمدتاً به تحلیل و استخراج اطلاعات از تصاویر و ویدئوها می‌پردازد.


شبکهٔ عصبی مصنوعی مفهومی گسترده‌تر از [[ترنسفورمر]] است.
[[هوش مصنوعی مولد]] بر تولید داده یا محتوای جدید تمرکز دارد.


ترنسفورمر یکی از معماری‌های شبکهٔ عصبی محسوب می‌شود.
یک سامانهٔ تشخیص اشیا نمونه‌ای از کاربرد بینایی ماشین است.


شبکه‌های پیچشی، بازگشتی، پیش‌خور و گرافی نیز از خانواده‌های دیگر شبکه‌های عصبی هستند.
یک سامانهٔ تولید تصویر از متن نمونه‌ای از هوش مصنوعی مولد محسوب می‌شود.


بنابراین هر ترنسفورمر متعارف نوعی شبکهٔ عصبی مصنوعی است، اما همهٔ شبکه‌های عصبی ترنسفورمر نیستند.
با این حال، سامانه‌های جدید ممکن است هر دو قابلیت را در یک معماری ترکیب کنند.
 
== تفاوت شبکهٔ عصبی مصنوعی با یادگیری عمیق ==
 
شبکهٔ عصبی مصنوعی به نوعی مدل محاسباتی اشاره دارد.
 
[[یادگیری عمیق]] به خانواده‌ای از روش‌های یادگیری اشاره می‌کند که عمدتاً از شبکه‌های عصبی چندلایه استفاده می‌کنند.
 
یک شبکهٔ عصبی ساده لزوماً عمیق نیست.
 
در مقابل، بیشتر سامانه‌های یادگیری عمیق معاصر بر شبکه‌های عصبی مصنوعی استوارند.


== جمع‌بندی ==
== جمع‌بندی ==


'''شبکهٔ عصبی مصنوعی''' یکی از خانواده‌های بنیادی مدل‌های [[یادگیری ماشین]] است که از واحدهای محاسباتی به‌هم‌پیوسته و پارامترهای قابل تنظیم برای پردازش داده و یادگیری الگوها استفاده می‌کند.
'''بینایی ماشین''' یکی از حوزه‌های بنیادی [[هوش مصنوعی]] است که به توسعهٔ روش‌های محاسباتی برای استخراج و تحلیل اطلاعات از تصاویر و ویدئوها می‌پردازد.


ریشه‌های نظری آن به پژوهش‌های میانهٔ سدهٔ بیستم بازمی‌گردد. مدل مک‌کالاک و پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در سال ۱۹۵۸ و گسترش روش‌های آموزش شبکه‌های چندلایه در دههٔ ۱۹۸۰ از مراحل مهم تاریخی آن بودند.<ref name="mcculloch" /><ref name="rosenblatt" /><ref name="rumelhart" />
این حوزه از پژوهش‌های اولیهٔ پردازش تصویر و هندسهٔ تصویری در میانهٔ سدهٔ بیستم شکل گرفت و به‌تدریج به موضوعاتی مانند تشخیص اشیا، تحلیل حرکت، بازسازی سه‌بعدی و درک صحنه گسترش یافت.


از دههٔ ۲۰۱۰، پیشرفت در داده، سخت‌افزار و روش‌های آموزش موجب گسترش کاربرد شبکه‌های عصبی عمیق در پردازش تصویر، گفتار، زبان و دیگر حوزه‌ها شد.
از دههٔ ۲۰۱۰، پیشرفت [[شبکه عصبی مصنوعی|شبکه‌های عصبی مصنوعی]] و [[یادگیری عمیق]] موجب تحول مهمی در بسیاری از وظایف بینایی ماشین شد. توسعهٔ AlexNet، ResNet، U-Net و ترنسفورمرهای بینایی از مراحل اثرگذار این تحول بودند.<ref name="alexnet" /><ref name="resnet" /><ref name="unet" /><ref name="vit" />


امروزه معماری‌هایی مانند شبکه‌های پیچشی، بازگشتی، گرافی و [[ترنسفورمر|ترنسفورمرها]] در طیف گسترده‌ای از سامانه‌های هوش مصنوعی به کار می‌روند.
امروزه بینایی ماشین در پزشکی، صنعت، رباتیک، حمل‌ونقل، کشاورزی، پژوهش و تحلیل اسناد کاربرد دارد.


با این حال، شبکه‌های عصبی دارای محدودیت‌هایی مانند وابستگی به داده، هزینهٔ محاسباتی، خطر بیش‌برازش، [[سوگیری الگوریتمی]]، دشواری توضیح برخی تصمیم‌ها و آسیب‌پذیری امنیتی هستند.
با این حال، محدودیت‌های فنی، وابستگی به کیفیت داده، [[سوگیری الگوریتمی]]، خطر خطا در شرایط واقعی و مسائل مربوط به حریم خصوصی و نظارت تصویری از چالش‌های مهم آن به شمار می‌روند.


از این رو شبکهٔ عصبی مصنوعی را باید یک مدل محاسباتی قدرتمند برای یادگیری و پردازش داده دانست، نه بازسازی کامل مغز انسان یا سامانه‌ای که صحت و قابلیت اعتماد خروجی‌های آن تضمین شده باشد.
اهمیت بینایی ماشین در آن است که یکی از ابزارهای اصلی تبدیل داده‌های بصری به اطلاعات قابل استفاده برای سامانه‌های محاسباتی را فراهم می‌کند؛ ابزاری که با گسترش هوش مصنوعی چندوجهی، نقش آن در فناوری و جامعه افزایش یافته است.


== جستارهای وابسته ==
== جستارهای وابسته ==
خط ۸۵۲: خط ۷۹۴:
* [[یادگیری ماشین]]
* [[یادگیری ماشین]]
* [[یادگیری عمیق]]
* [[یادگیری عمیق]]
* [[شبکه عصبی مصنوعی]]
* [[ترنسفورمر]]
* [[ترنسفورمر]]
* [[مدل زبانی بزرگ]]
* [[مدل زبانی بزرگ]]
* [[هوش مصنوعی مولد]]
* [[هوش مصنوعی مولد]]
* [[پردازش زبان طبیعی]]
* [[پردازش زبان طبیعی]]
* [[توکن (هوش مصنوعی)]]
* [[پرامپت (هوش مصنوعی)]]
* [[توهم هوش مصنوعی]]
* [[توهم هوش مصنوعی]]
* [[سوگیری الگوریتمی]]
* [[سوگیری الگوریتمی]]
* [[بینایی ماشین]]
* [[علم داده]]
* [[علم داده]]
* [[الگوریتم]]
* [[الگوریتم]]
* [[علوم رایانه]]
* [[علوم رایانه]]
* [[رباتیک]]
* [[واقعیت افزوده]]
* [[تشخیص چهره]]
* [[پردازش تصویر]]


== منابع ==
== منابع ==
خط ۸۷۰: خط ۸۱۴:
== کتاب‌شناسی ==
== کتاب‌شناسی ==


* Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020. [https://arxiv.org/abs/2005.12515 متن مقاله]
* Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” ''IEEE Conference on Computer Vision and Pattern Recognition'', 2009. [https://www.image-net.org/static_files/papers/imagenet_cvpr09.pdf متن مقاله]


* Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. ''Deep Learning''. Cambridge, MA: MIT Press, 2016. [https://www.deeplearningbook.org/ متن کتاب]
* Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” ''International Conference on Learning Representations'', 2021. [https://arxiv.org/abs/2010.11929 متن مقاله]


* Goodfellow, Ian, et al. “Generative Adversarial Nets.” ''Advances in Neural Information Processing Systems'' 27 (2014). [https://arxiv.org/abs/1406.2661 متن مقاله]
* Hartley, Richard, and Andrew Zisserman. ''Multiple View Geometry in Computer Vision''. 2nd ed. Cambridge: Cambridge University Press, 2004.


* Hebb, Donald O. ''The Organization of Behavior: A Neuropsychological Theory''. New York: Wiley, 1949.
* He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” ''Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition'', 2016. [https://arxiv.org/abs/1512.03385 متن مقاله]
 
* Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” ''Advances in Neural Information Processing Systems'' 25 (2012). [https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html متن مقاله]


* LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444. [https://doi.org/10.1038/nature14539 متن مقاله]
* LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” ''Nature'' 521 (2015): 436–444. [https://doi.org/10.1038/nature14539 متن مقاله]


* McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” ''The Bulletin of Mathematical Biophysics'' 5 (1943): 115–133. [https://doi.org/10.1007/BF02478259 متن مقاله]
* Marr, David. ''Vision: A Computational Investigation into the Human Representation and Processing of Visual Information''. San Francisco: W. H. Freeman, 1982.
 
* Minsky, Marvin, and Seymour A. Papert. ''Perceptrons: An Introduction to Computational Geometry''. Cambridge, MA: MIT Press, 1969.
 
* Rosenblatt, Frank. “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.” ''Psychological Review'' 65, no. 6 (1958): 386–408. [https://doi.org/10.1037/h0042519 متن مقاله]


* Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” ''Nature'' 323 (1986): 533–536. [https://doi.org/10.1038/323533a0 متن مقاله]
* Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” ''Medical Image Computing and Computer-Assisted Intervention'', 2015. [https://arxiv.org/abs/1505.04597 متن مقاله]


* Vaswani, Ashish, et al. “Attention Is All You Need.” ''Advances in Neural Information Processing Systems'' 30 (2017). [https://arxiv.org/abs/1706.03762 متن مقاله]
* Szeliski, Richard. ''Computer Vision: Algorithms and Applications''. 2nd ed. Cham: Springer, 2022. [https://link.springer.com/book/10.1007/978-3-030-34372-9 معرفی کتاب و مشخصات ناشر]


[[رده:هوش مصنوعی]]
[[رده:هوش مصنوعی]]
[[رده:یادگیری ماشین]]
[[رده:یادگیری ماشین]]
[[رده:یادگیری عمیق]]
[[رده:یادگیری عمیق]]
[[رده:شبکه‌های عصبی مصنوعی]]
[[رده:بینایی ماشین]]
[[رده:پردازش تصویر]]
[[رده:علوم رایانه]]
[[رده:علوم رایانه]]
[[رده:علم داده]]
[[رده:فناوری اطلاعات]]
[[رده:فناوری اطلاعات]]
[[رده:مفاهیم هوش مصنوعی]]
[[رده:مفاهیم هوش مصنوعی]]


{{DEFAULTSORT:شبکه عصبی مصنوعی}}
{{DEFAULTSORT:بینایی ماشین}}
```
```

نسخهٔ کنونی تا ‏۱۰ اکتبر ۲۰۲۶، ساعت ۰۸:۳۴

بینایی ماشین
شناسنامه
نام‌های دیگربینایی رایانه‌ای، بینایی کامپیوتری
حوزههوش مصنوعی، علوم رایانه، یادگیری ماشین، یادگیری عمیق، پردازش تصویر
خاستگاهعلوم رایانه، پردازش سیگنال، هندسه، عکاسی، رباتیک و پژوهش‌های هوش مصنوعی
اندیشه و تاریخ
مفاهیم کلیدیپیکسل، استخراج ویژگی، طبقه‌بندی تصویر، تشخیص شیء، بخش‌بندی تصویر، ردیابی، جریان نوری، بازسازی سه‌بعدی، تخمین عمق، تشخیص چهره
جریان‌های مرتبطبینایی محاسباتی، پردازش تصویر، تشخیص الگو، شبکه عصبی مصنوعی، یادگیری عمیق، ترنسفورمر، رباتیک
تأثیرپذیرفته ازعلوم اعصاب بینایی، روان‌شناسی ادراک، هندسه، آمار، یادگیری ماشین و پردازش سیگنال
تأثیرگذار برخودروهای خودران، رباتیک، تصویربرداری پزشکی، واقعیت افزوده، سامانه‌های نظارتی، هوش مصنوعی مولد و مدل‌های چندوجهی
نقد و ارزیابی

بینایی ماشین (به انگلیسی: Computer Vision)، که با نام‌های بینایی رایانه‌ای و بینایی کامپیوتری نیز شناخته می‌شود، شاخه‌ای از هوش مصنوعی و علوم رایانه است که به توسعهٔ روش‌ها و سامانه‌هایی برای استخراج، پردازش و تفسیر اطلاعات از تصاویر و ویدئوها می‌پردازد. هدف این حوزه آن است که رایانه بتواند از داده‌های بصری، اطلاعاتی دربارهٔ اشیا، ویژگی‌ها، روابط مکانی، حرکت و ساختار محیط به دست آورد و از آنها در انجام وظایف مشخص استفاده کند.[۱]

بینایی ماشین از مبانی ریاضی، هندسه، آمار، پردازش تصویر و یادگیری ماشین بهره می‌گیرد. این حوزه در دهه‌های نخست شکل‌گیری خود عمدتاً بر روش‌های هندسی و الگوریتم‌های طراحی‌شده توسط پژوهشگران استوار بود، اما از دههٔ ۲۰۱۰، استفاده از شبکه‌های عصبی مصنوعی و یادگیری عمیق موجب تحول گسترده‌ای در بسیاری از کاربردهای آن شد.[۲]

امروزه بینایی ماشین در تشخیص اشیا، تحلیل تصاویر پزشکی، هدایت ربات‌ها، خودروهای خودران، کنترل کیفیت صنعتی، کشاورزی هوشمند، تحلیل تصاویر ماهواره‌ای، واقعیت افزوده و سامانه‌های چندوجهی هوش مصنوعی کاربرد دارد. در کنار این قابلیت‌ها، استفاده از آن در شناسایی چهره و نظارت تصویری، پرسش‌های مهمی دربارهٔ حریم خصوصی، حقوق شهروندی، سوگیری الگوریتمی و پاسخگویی ایجاد کرده است.

تعریف و ماهیت بینایی ماشین

بینایی ماشین مجموعه‌ای از نظریه‌ها، الگوریتم‌ها و سامانه‌های محاسباتی است که برای استخراج اطلاعات معنادار از داده‌های بصری توسعه یافته‌اند.

این داده‌ها ممکن است از دوربین‌های معمولی، دوربین‌های عمق‌سنج، سامانه‌های تصویربرداری پزشکی، ماهواره‌ها، میکروسکوپ‌ها یا حسگرهای تخصصی به دست آمده باشند.

برای مثال، یک سامانهٔ بینایی ماشین ممکن است تصویری از یک خیابان را دریافت کند و وظیفه داشته باشد خودروها، عابران پیاده، علائم راهنمایی و خطوط مسیر را شناسایی کند.

سامانه‌ای دیگر ممکن است تصویر پزشکی را بررسی و ناحیه‌ای را که احتمال وجود یک ضایعه در آن بیشتر است مشخص کند.

در هر دو نمونه، هدف تبدیل دادهٔ تصویری به اطلاعات قابل استفاده برای یک وظیفهٔ مشخص است.

با این حال، تشخیص یک الگو در تصویر لزوماً به معنای فهم کامل صحنه به شیوهٔ انسانی نیست.

تفاوت بینایی ماشین و بینایی انسان

بینایی انسان فرایندی زیستی و شناختی است که از تعامل چشم، دستگاه عصبی و مغز شکل می‌گیرد.

انسان هنگام مشاهدهٔ یک صحنه، اطلاعات بصری را با حافظه، تجربه، دانش پیشین و دیگر حواس خود ترکیب می‌کند.

در مقابل، سامانه‌های بینایی ماشین از حسگرها، داده‌های دیجیتال، مدل‌های ریاضی و الگوریتم‌های محاسباتی استفاده می‌کنند.

یک سامانه ممکن است در تشخیص نوع مشخصی از الگو عملکرد بسیار دقیقی داشته باشد، اما در برابر تغییر نور، زاویهٔ دید، شرایط محیط یا داده‌های ناآشنا دچار خطا شود.

بنابراین، توانایی یک سامانه در تشخیص تصویر را نباید معادل برخورداری از ادراک یا آگاهی انسانی دانست.

تاریخچهٔ بینایی ماشین

پژوهش‌های اولیه

ریشه‌های بینایی ماشین به پژوهش‌های مرتبط با پردازش تصویر، هندسهٔ تصویری، تشخیص الگو و هوش مصنوعی در میانهٔ سدهٔ بیستم بازمی‌گردد.

در دهه‌های ۱۹۵۰ و ۱۹۶۰، پژوهشگران تلاش کردند روش‌هایی برای تشخیص اشکال هندسی، استخراج خطوط و بازسازی ساختار اشیا از تصاویر توسعه دهند.

لارنس رابرتس از پژوهشگران اثرگذار اولیه در تحلیل رایانه‌ای تصاویر سه‌بعدی بود.

در این دوره، یکی از پرسش‌های بنیادی آن بود که چگونه می‌توان از یک تصویر دوبعدی، اطلاعاتی دربارهٔ ساختار سه‌بعدی جهان به دست آورد.

گسترش پژوهش‌ها در دههٔ ۱۹۷۰

در دههٔ ۱۹۷۰، پژوهش‌های بینایی ماشین به موضوعاتی مانند تشخیص لبه، بازسازی سه‌بعدی، تحلیل حرکت و بازنمایی هندسی صحنه گسترش یافت.

پژوهشگران تلاش کردند میان ویژگی‌های تصویر و ساختار فیزیکی اشیای موجود در جهان ارتباط برقرار کنند.

در این دوره، هندسه و مدل‌سازی ریاضی نقش مهمی در توسعهٔ الگوریتم‌های بینایی ماشین داشتند.

دیدگاه محاسباتی دیوید مار

دیوید مار، پژوهشگر علوم اعصاب و بینایی محاسباتی، در کتاب Vision: A Computational Investigation into the Human Representation and Processing of Visual Information که در سال ۱۹۸۲ منتشر شد، چارچوبی اثرگذار برای مطالعهٔ بینایی ارائه کرد.

او بر ضرورت بررسی مسئلهٔ بینایی در سطوح مختلف، از هدف محاسباتی گرفته تا بازنمایی و پیاده‌سازی، تأکید داشت.

این دیدگاه در شکل‌گیری مباحث نظری بینایی محاسباتی و علوم شناختی تأثیرگذار بود.

توسعهٔ روش‌های هندسی

در دهه‌های ۱۹۸۰ و ۱۹۹۰، روش‌های هندسی و آماری بینایی ماشین پیشرفت کردند.

موضوعاتی مانند تطبیق نقاط میان تصاویر، تخمین حرکت دوربین، بازسازی سه‌بعدی و تحلیل تصاویر چنددوربینی از محورهای مهم پژوهش بودند.

کتاب Multiple View Geometry in Computer Vision نوشتهٔ ریچارد هارتلی و اندرو زیسرمن از منابع مهم این حوزه است.[۳]

ظهور مجموعه‌داده‌های بزرگ

با افزایش ظرفیت ذخیره‌سازی و توان محاسباتی، مجموعه‌داده‌های تصویری بزرگ‌تری برای آموزش و ارزیابی الگوریتم‌ها ایجاد شدند.

یکی از مهم‌ترین آنها ImageNet بود که در سال ۲۰۰۹ در مقاله‌ای از جیا دنگ و همکاران معرفی شد.

ImageNet مجموعه‌ای گسترده از تصاویر سازمان‌دهی‌شده بر اساس مفاهیم و دسته‌های معنایی است و در توسعهٔ پژوهش‌های تشخیص تصویر نقش مهمی داشته است.[۴]

تحول یادگیری عمیق در سال ۲۰۱۲

یکی از نقاط عطف مهم بینایی ماشین در سال ۲۰۱۲ رخ داد.

الکس کریژفسکی، ایلیا سوتسکِوِر و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقه‌بندی تصاویر ImageNet معرفی کردند.

این مدل که بعدها با نام AlexNet شناخته شد، در رقابت ImageNet سال ۲۰۱۲ عملکرد برجسته‌ای داشت و به گسترش استفاده از یادگیری عمیق در بینایی ماشین کمک کرد.[۵]

پس از آن، شبکه‌های عصبی پیچشی در بسیاری از وظایف تشخیص و تحلیل تصویر به روش‌های اصلی تبدیل شدند.

شبکه‌های عمیق‌تر و ResNet

در سال ۲۰۱۵، کایمینگ هه و همکاران معماری ResNet را معرفی کردند.

این معماری از اتصالات باقیمانده برای تسهیل آموزش شبکه‌های عمیق‌تر استفاده می‌کرد.

ResNet در توسعهٔ شبکه‌های پیچشی عمیق و کاربردهای تشخیص تصویر تأثیرگذار بود.[۶]

ورود ترنسفورمرها به بینایی ماشین

در سال ۲۰۲۰، پژوهشگران مدل Vision Transformer یا ViT را معرفی کردند.

این مدل از معماری ترنسفورمر برای پردازش تصویر استفاده می‌کند.

در این روش، تصویر به قطعه‌هایی تقسیم می‌شود و هر قطعه به بازنمایی عددی تبدیل می‌شود.

سپس روابط میان این قطعه‌ها با استفاده از سازوکار توجه پردازش می‌شود.[۷]

این تحول نشان داد که ترنسفورمرها می‌توانند در کنار شبکه‌های پیچشی، نقش مهمی در تحلیل تصاویر ایفا کنند.

مبانی علمی بینایی ماشین

بینایی ماشین بر مجموعه‌ای از مبانی علمی و فنی استوار است.

این مبانی شامل تشکیل تصویر، پردازش سیگنال، هندسه، آمار، بهینه‌سازی و یادگیری ماشین هستند.

در بسیاری از مسائل، شناخت نحوهٔ تشکیل تصویر به اندازهٔ انتخاب الگوریتم اهمیت دارد.

برای مثال، یک شیء ممکن است به دلیل تغییر نور، فاصله، زاویهٔ دوربین یا انسداد جزئی، ظاهر متفاوتی در تصاویر داشته باشد.

تصویر دیجیتال

تصویر دیجیتال بازنمایی عددی یک تصویر است که معمولاً از آرایه‌ای از پیکسل‌ها تشکیل می‌شود.

در تصاویر خاکستری، هر پیکسل معمولاً مقداری مرتبط با شدت روشنایی دارد.

در تصاویر رنگی، هر پیکسل می‌تواند دارای چند مؤلفهٔ رنگی باشد.

یکی از نمایش‌های رایج تصویر رنگی، مدل RGB است که از سه مؤلفهٔ قرمز، سبز و آبی استفاده می‌کند.

الگوریتم‌های بینایی ماشین این داده‌های عددی را برای استخراج ویژگی‌ها و اطلاعات پردازش می‌کنند.

پیکسل و وضوح تصویر

پیکسل کوچک‌ترین عنصر نمونه‌برداری‌شده در بسیاری از تصاویر دیجیتال است.

وضوح مکانی تصویر معمولاً با تعداد پیکسل‌ها در عرض و ارتفاع بیان می‌شود.

برای مثال، تصویری با ابعاد ۱۹۲۰ در ۱۰۸۰ پیکسل دارای بیش از دو میلیون پیکسل است.

با این حال، وضوح بالاتر لزوماً به معنای کیفیت بهتر همهٔ وظایف بینایی ماشین نیست.

نورپردازی، وضوح اپتیکی، نویز، فشرده‌سازی و کیفیت داده نیز اهمیت دارند.

پردازش تصویر

پردازش تصویر به مجموعه‌ای از روش‌ها برای تغییر، بهبود یا تحلیل داده‌های تصویری گفته می‌شود.

این روش‌ها می‌توانند شامل کاهش نویز، تنظیم روشنایی، افزایش کنتراست، فیلترگذاری و تبدیل هندسی باشند.

پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند، اما مترادف نیستند.

پردازش تصویر ممکن است صرفاً برای بهبود ظاهر تصویر انجام شود.

در مقابل، بینایی ماشین معمولاً به استخراج اطلاعات و انجام وظایف ادراکی یا تحلیلی از تصویر می‌پردازد.

استخراج ویژگی

استخراج ویژگی (Feature Extraction) فرایند شناسایی و بازنمایی اطلاعاتی از تصویر است که برای یک وظیفه مفید هستند.

در روش‌های کلاسیک، ویژگی‌ها ممکن است شامل لبه‌ها، گوشه‌ها، بافت‌ها یا توصیفگرهای محلی باشند.

در روش‌های مبتنی بر یادگیری عمیق، شبکه می‌تواند بازنمایی‌های مورد نیاز را در فرایند آموزش بیاموزد.

این تفاوت یکی از ویژگی‌های مهم تحول بینایی ماشین در دههٔ ۲۰۱۰ بود.

تشخیص لبه

تشخیص لبه (Edge Detection) یکی از روش‌های بنیادی پردازش تصویر است.

لبه‌ها معمولاً با تغییرات قابل توجه شدت روشنایی یا رنگ در تصویر ارتباط دارند.

تشخیص لبه می‌تواند برای شناسایی مرز اشیا، تحلیل شکل‌ها و آماده‌سازی داده برای مراحل بعدی استفاده شود.

الگوریتم Canny از روش‌های شناخته‌شدهٔ تشخیص لبه است.

تشخیص گوشه و نقاط کلیدی

در برخی مسائل، لازم است نقاط شاخص تصویر شناسایی شوند.

این نقاط ممکن است شامل گوشه‌ها یا نواحی دارای الگوی محلی متمایز باشند.

نقاط کلیدی در تطبیق تصاویر، ردیابی، بازسازی سه‌بعدی و تخمین حرکت دوربین کاربرد دارند.

روش‌هایی مانند Harris و SIFT از روش‌های شناخته‌شدهٔ این حوزه هستند.

طبقه‌بندی تصویر

طبقه‌بندی تصویر (Image Classification) یکی از وظایف اصلی بینایی ماشین است.

در این مسئله، سامانه یک تصویر را دریافت و آن را به یک یا چند دستهٔ مشخص نسبت می‌دهد.

برای مثال، مدل ممکن است تشخیص دهد که تصویر مربوط به گربه، سگ، خودرو یا هواپیماست.

طبقه‌بندی تصویر با تشخیص محل دقیق اشیا تفاوت دارد.

یک تصویر ممکن است دارای چندین شیء باشد، در حالی که مدل طبقه‌بندی ساده فقط یک برچسب کلی تولید کند.

تشخیص اشیا

تشخیص اشیا (Object Detection) به شناسایی اشیای موجود در تصویر و تعیین موقعیت آنها گفته می‌شود.

خروجی سامانه معمولاً شامل نوع شیء، میزان اطمینان مدل و مختصات ناحیهٔ مربوط به آن است.

برای مثال، یک سامانه ممکن است در تصویر خیابان چند خودرو و عابر پیاده را تشخیص دهد و برای هرکدام کادر مشخصی رسم کند.

این فناوری در رباتیک، کنترل ترافیک، تحلیل ویدئو و سامانه‌های کمک‌راننده کاربرد دارد.

بخش‌بندی تصویر

بخش‌بندی تصویر (Image Segmentation) فرایندی است که در آن پیکسل‌های تصویر بر اساس ویژگی یا تعلق به نواحی مختلف دسته‌بندی می‌شوند.

بخش‌بندی در پزشکی، تحلیل تصاویر ماهواره‌ای، رباتیک و صنعت کاربرد دارد.

دو نوع مهم آن عبارت‌اند از:

  • بخش‌بندی معنایی؛
  • بخش‌بندی نمونه‌ای.

بخش‌بندی معنایی

در بخش‌بندی معنایی (Semantic Segmentation)، برای هر پیکسل یک دستهٔ معنایی تعیین می‌شود.

برای مثال، در تصویر خیابان، پیکسل‌ها ممکن است به دسته‌هایی مانند جاده، ساختمان، آسمان، خودرو و عابر پیاده تقسیم شوند.

در این روش، اشیای جداگانه‌ای که به یک دسته تعلق دارند لزوماً از یکدیگر متمایز نمی‌شوند.

بخش‌بندی نمونه‌ای

در بخش‌بندی نمونه‌ای (Instance Segmentation)، سامانه علاوه بر شناسایی دستهٔ اشیا، نمونه‌های جداگانهٔ هر دسته را نیز تفکیک می‌کند.

برای مثال، اگر سه خودرو در تصویر وجود داشته باشد، مدل می‌تواند ناحیهٔ هر خودرو را به‌طور مستقل مشخص کند.

این قابلیت در تحلیل صحنه‌های پیچیده اهمیت دارد.

معماری U-Net

U-Net یکی از معماری‌های شناخته‌شدهٔ شبکهٔ عصبی برای بخش‌بندی تصویر است.

این معماری در سال ۲۰۱۵ توسط اولاف رونبرگر، فیلیپ فیشر و توماس بروکس برای بخش‌بندی تصاویر زیست‌پزشکی معرفی شد.

U-Net از مسیر فشرده‌سازی و مسیر گسترش بازنمایی‌ها استفاده می‌کند و برای تعیین موقعیت دقیق ساختارهای موجود در تصویر طراحی شده است.[۸]

این معماری و گونه‌های بعدی آن در بسیاری از مسائل بخش‌بندی تصویر استفاده شده‌اند.

تشخیص چهره

تشخیص چهره اصطلاحی است که در کاربرد عمومی ممکن است به چند وظیفهٔ متفاوت اشاره کند.

یکی از آنها یافتن محل چهره در تصویر است.

وظیفهٔ دیگر، شناسایی یا تأیید هویت فرد بر اساس ویژگی‌های چهره است.

این دو کاربرد از نظر فنی و حقوقی یکسان نیستند.

سامانه‌های شناسایی چهره می‌توانند در احراز هویت و مدیریت دسترسی استفاده شوند، اما کاربرد آنها در نظارت عمومی می‌تواند خطرهایی برای حریم خصوصی و آزادی‌های مدنی ایجاد کند.

تشخیص و تحلیل حرکت

بینایی ماشین می‌تواند برای تحلیل تغییرات تصویر در طول زمان استفاده شود.

این حوزه شامل تشخیص حرکت، ردیابی اشیا و تخمین جهت یا سرعت حرکت است.

برای مثال، یک سامانهٔ نظارت بر ترافیک می‌تواند حرکت خودروها را در چندین فریم متوالی بررسی کند.

در رباتیک نیز تحلیل حرکت به درک تغییر موقعیت اشیا و دوربین کمک می‌کند.

جریان نوری

جریان نوری (Optical Flow) به الگوی حرکت ظاهری نقاط یا ساختارهای تصویری میان فریم‌های متوالی اشاره دارد.

روش‌های تخمین جریان نوری برای تحلیل حرکت، ردیابی و برخی کاربردهای ناوبری استفاده می‌شوند.

با این حال، حرکت ظاهری در تصویر همیشه معادل حرکت واقعی یک شیء در فضای سه‌بعدی نیست.

حرکت دوربین، تغییر نور و دیگر عوامل نیز می‌توانند بر آن اثر بگذارند.

ردیابی اشیا

ردیابی اشیا (Object Tracking) فرایندی است که در آن سامانه تلاش می‌کند موقعیت یک یا چند شیء را در طول زمان دنبال کند.

برای مثال، پس از تشخیص یک خودرو در نخستین فریم ویدئو، سامانه می‌تواند موقعیت آن را در فریم‌های بعدی تخمین بزند.

ردیابی در تحلیل ترافیک، ورزش، رباتیک و پردازش ویدئو کاربرد دارد.

تخمین وضعیت بدن انسان

تخمین وضعیت بدن (Human Pose Estimation) به شناسایی موقعیت نقاط یا مفاصل اصلی بدن در تصویر یا ویدئو گفته می‌شود.

این فناوری در تحلیل حرکت، ورزش، توان‌بخشی، تعامل انسان و رایانه و تولید انیمیشن کاربرد دارد.

عملکرد آن می‌تواند تحت تأثیر زاویهٔ دوربین، پوشش بدن، انسداد و کیفیت تصویر قرار گیرد.

بینایی سه‌بعدی

بینایی سه‌بعدی به روش‌هایی گفته می‌شود که برای استخراج اطلاعات مربوط به عمق، شکل و ساختار فضایی محیط از داده‌های بصری استفاده می‌کنند.

این روش‌ها می‌توانند از تصاویر چنددوربینی، حرکت دوربین، حسگرهای عمق یا ترکیب چند منبع داده بهره بگیرند.

بینایی سه‌بعدی در رباتیک، نقشه‌برداری، واقعیت افزوده و بازسازی دیجیتال اشیا کاربرد دارد.

تخمین عمق

تخمین عمق (Depth Estimation) فرایندی است که در آن فاصلهٔ نقاط یا اشیای صحنه نسبت به دوربین برآورد می‌شود.

این کار می‌تواند با استفاده از دو دوربین، حسگرهای تخصصی یا مدل‌های یادگیری ماشین انجام شود.

تخمین عمق در ناوبری ربات‌ها، خودروهای خودران و بازسازی سه‌بعدی اهمیت دارد.

بینایی استریو

بینایی استریو (Stereo Vision) از تصاویر ثبت‌شده از دو دیدگاه متفاوت برای تخمین ساختار سه‌بعدی استفاده می‌کند.

اختلاف موقعیت ظاهری نقاط متناظر در دو تصویر می‌تواند برای محاسبهٔ عمق به کار رود.

این روش از اصول هندسهٔ تصویری و روابط میان دوربین‌ها استفاده می‌کند.

بازسازی سه‌بعدی

بازسازی سه‌بعدی (3D Reconstruction) فرایند ایجاد مدلی از ساختار سه‌بعدی یک شیء یا صحنه بر اساس داده‌های تصویری است.

این فناوری در معماری، میراث فرهنگی، نقشه‌برداری، پزشکی، صنعت و تولید محتوای دیجیتال کاربرد دارد.

کیفیت بازسازی به عواملی مانند تعداد تصاویر، زاویه‌های دید، بافت سطح و دقت کالیبراسیون وابسته است.

ساختار از حرکت

ساختار از حرکت (Structure from Motion یا SfM) مجموعه‌ای از روش‌هاست که با استفاده از تصاویر ثبت‌شده از موقعیت‌های متفاوت، ساختار سه‌بعدی صحنه و موقعیت نسبی دوربین‌ها را تخمین می‌زند.

این روش در فتوگرامتری، نقشه‌برداری و بازسازی سه‌بعدی کاربرد دارد.

مکان‌یابی و نقشه‌سازی هم‌زمان

مکان‌یابی و نقشه‌سازی هم‌زمان (Simultaneous Localization and Mapping یا SLAM) به مسئلهٔ تخمین موقعیت یک سامانه در محیط و ساخت نقشه‌ای از همان محیط اشاره دارد.

در نوع بصری آن، اطلاعات دوربین برای تخمین حرکت و ساخت نقشه استفاده می‌شود.

این فناوری در رباتیک، پهپادها و واقعیت افزوده اهمیت دارد.

یادگیری ماشین در بینایی ماشین

یادگیری ماشین امکان می‌دهد مدل‌ها برخی روابط و الگوهای تصویری را از داده بیاموزند.

در روش‌های کلاسیک، پژوهشگر ممکن است ابتدا ویژگی‌هایی مانند لبه‌ها یا بافت‌ها را استخراج کند و سپس یک مدل طبقه‌بندی را آموزش دهد.

در روش‌های مبتنی بر یادگیری عمیق، بخش بزرگی از استخراج ویژگی و تصمیم‌گیری می‌تواند در یک معماری قابل آموزش انجام شود.

انتخاب روش مناسب به نوع مسئله، مقدار داده، منابع محاسباتی و نیاز به توضیح‌پذیری وابسته است.

شبکه‌های عصبی پیچشی

شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) یکی از معماری‌های مهم در بینایی ماشین است.

این شبکه از عملیات پیچش برای پردازش الگوهای محلی تصویر استفاده می‌کند.

شبکه‌های پیچشی می‌توانند بازنمایی‌هایی از ویژگی‌های ساده تا ساختارهای پیچیده‌تر بیاموزند.

موفقیت AlexNet در سال ۲۰۱۲ و توسعهٔ معماری‌های بعدی مانند ResNet از مراحل مهم گسترش این روش بودند.[۵][۶]

ترنسفورمر بینایی

ترنسفورمر بینایی (Vision Transformer یا ViT) معماری‌ای است که از سازوکار توجه برای پردازش تصاویر استفاده می‌کند.

در ساختار متعارف آن، تصویر به قطعه‌هایی تقسیم و هر قطعه به یک بازنمایی برداری تبدیل می‌شود.

این بازنمایی‌ها همراه با اطلاعات موقعیتی به لایه‌های ترنسفورمر داده می‌شوند.

مدل می‌تواند روابط میان بخش‌های مختلف تصویر را در فرایند یادگیری محاسبه کند.[۷]

ترنسفورمرهای بینایی در طبقه‌بندی تصویر و دیگر وظایف بینایی ماشین به کار گرفته شده‌اند.

بینایی ماشین و مدل‌های چندوجهی

مدل چندوجهی مدلی است که می‌تواند چند نوع داده مانند متن، تصویر یا صوت را پردازش کند.

بینایی ماشین یکی از اجزای مهم بسیاری از سامانه‌های چندوجهی است.

برای مثال، سامانه‌ای که تصویری را دریافت و دربارهٔ محتوای آن به پرسش‌های متنی پاسخ می‌دهد، باید اطلاعات بصری را با پردازش زبان ترکیب کند.

چنین سامانه‌هایی می‌توانند برای توصیف تصویر، جست‌وجوی بصری و تحلیل اسناد تصویری استفاده شوند.

با این حال، پاسخ متنی آنها ممکن است حاوی خطا یا توهم هوش مصنوعی باشد.

بینایی ماشین و هوش مصنوعی مولد

هوش مصنوعی مولد و بینایی ماشین حوزه‌هایی مرتبط اما متفاوت‌اند.

بینایی ماشین عمدتاً بر استخراج و تحلیل اطلاعات از داده‌های بصری تمرکز دارد.

در مقابل، مدل‌های مولد برای تولید داده یا محتوای جدید آموزش داده می‌شوند.

با این حال، بسیاری از سامانه‌های جدید هر دو قابلیت را ترکیب می‌کنند.

برای مثال، یک سامانه ممکن است ابتدا اجزای تصویر را شناسایی و سپس بر اساس دستور متنی، تصویر تازه‌ای تولید یا تصویر موجود را ویرایش کند.

بینایی ماشین در پزشکی

یکی از کاربردهای مهم بینایی ماشین، تحلیل تصاویر پزشکی است.

این تصاویر می‌توانند شامل رادیوگرافی، سی‌تی‌اسکن، ام‌آر‌آی، سونوگرافی و تصاویر میکروسکوپی باشند.

سامانه‌های بینایی ماشین ممکن است برای شناسایی الگوهای غیرعادی، بخش‌بندی اندام‌ها یا اندازه‌گیری ساختارهای تصویری آموزش داده شوند.

معماری U-Net از نمونه‌های اثرگذار در بخش‌بندی تصاویر زیست‌پزشکی است.[۸]

با این حال، عملکرد یک مدل در محیط آزمایشگاهی لزوماً به معنای اعتبار بالینی آن نیست.

کاربرد پزشکی نیازمند اعتبارسنجی، ارزیابی ایمنی و نظارت متخصصان است.

بینایی ماشین در خودروهای خودران

خودروهای خودران و سامانه‌های کمک‌راننده می‌توانند از بینایی ماشین برای تحلیل محیط اطراف استفاده کنند.

وظایف آنها ممکن است شامل تشخیص خودروها، عابران پیاده، دوچرخه‌سواران، علائم راهنمایی و خطوط جاده باشد.

این سامانه‌ها گاهی داده‌های دوربین را با اطلاعات رادار، لیدار و دیگر حسگرها ترکیب می‌کنند.

با این حال، عملکرد بینایی ماشین ممکن است تحت تأثیر باران، مه، تاریکی، انعکاس نور یا انسداد دید قرار گیرد.

به همین دلیل، ایمنی سامانه‌های خودران به مجموعه‌ای از اجزای فنی، آزمون‌ها و سازوکارهای کنترلی وابسته است.

بینایی ماشین در رباتیک

ربات‌ها می‌توانند از بینایی ماشین برای شناسایی اشیا، تخمین فاصله، تشخیص موانع و هدایت حرکت استفاده کنند.

برای مثال، یک ربات صنعتی ممکن است قطعات موجود روی خط تولید را شناسایی و موقعیت آنها را برای بازوی مکانیکی تعیین کند.

در ربات‌های متحرک، بینایی ماشین می‌تواند در کنار حسگرهای دیگر به ناوبری و نقشه‌سازی کمک کند.

بینایی صنعتی

بینایی صنعتی (Machine Vision) به کاربرد سامانه‌های تصویربرداری و تحلیل تصویر در محیط‌های صنعتی، به‌ویژه تولید و کنترل کیفیت، گفته می‌شود.

بینایی صنعتی با بینایی ماشین ارتباط نزدیک دارد، اما معمولاً بر کاربردهای عملی در خطوط تولید، اندازه‌گیری، بازرسی و هدایت تجهیزات تمرکز می‌کند.

برای مثال، یک سامانهٔ بینایی صنعتی می‌تواند قطعات معیوب را روی نوار نقاله شناسایی کند.

بنابراین بینایی صنعتی را می‌توان یکی از حوزه‌های کاربردی مرتبط با بینایی ماشین دانست، نه مترادف کامل آن.

کنترل کیفیت صنعتی

در خطوط تولید، سامانه‌های بینایی ماشین می‌توانند برای بررسی ظاهر محصولات استفاده شوند.

این بررسی ممکن است شامل تشخیص ترک، خراش، تغییر شکل، نقص مونتاژ یا اشتباه در بسته‌بندی باشد.

کارایی چنین سامانه‌هایی به کیفیت تصویربرداری، نورپردازی و شرایط محیط وابسته است.

بینایی ماشین در کشاورزی

بینایی ماشین در کشاورزی برای تحلیل وضعیت گیاهان، شناسایی برخی آفات و بیماری‌ها، ارزیابی رشد محصول و مدیریت ماشین‌آلات کشاورزی استفاده می‌شود.

تصاویر ممکن است از دوربین‌های زمینی، پهپادها یا ماهواره‌ها به دست آمده باشند.

این سامانه‌ها می‌توانند به کشاورزان در پایش زمین و تصمیم‌گیری کمک کنند.

اما عملکرد مدل باید با شرایط اقلیمی، نوع محصول و داده‌های محلی سازگار باشد.

بینایی ماشین در تصاویر ماهواره‌ای

تحلیل تصاویر ماهواره‌ای یکی از کاربردهای مهم بینایی ماشین و سنجش از دور است.

الگوریتم‌ها می‌توانند برای شناسایی تغییرات پوشش زمین، گسترش مناطق شهری، بررسی جنگل‌ها و پایش برخی رخدادهای محیطی استفاده شوند.

داده‌های ماهواره‌ای ممکن است علاوه بر نور مرئی، شامل باندهای طیفی دیگری باشند.

بنابراین تحلیل آنها گاهی به روش‌های تخصصی پردازش داده‌های چندطیفی نیاز دارد.

بینایی ماشین و محیط زیست

بینایی ماشین می‌تواند در پایش حیات وحش، بررسی پوشش گیاهی، تحلیل تصاویر جنگل‌ها و شناسایی تغییرات محیطی کاربرد داشته باشد.

برای مثال، تصاویر دوربین‌های تله‌ای حیات وحش می‌توانند با استفاده از مدل‌های تشخیص تصویر بررسی شوند.

این فناوری می‌تواند حجم کار تحلیل تصاویر را کاهش دهد، اما نتایج آن باید از نظر خطاهای شناسایی ارزیابی شوند.

بینایی ماشین در میراث فرهنگی

در پژوهش‌های میراث فرهنگی، بینایی ماشین می‌تواند برای بازسازی سه‌بعدی بناها، تحلیل تصاویر آثار تاریخی و تطبیق تصاویر قدیمی و جدید استفاده شود.

روش‌های فتوگرامتری و بازسازی سه‌بعدی در مستندسازی بناها و اشیای تاریخی اهمیت دارند.

این فناوری همچنین می‌تواند به ثبت دیجیتال وضعیت آثار و بررسی تغییرات آنها در طول زمان کمک کند.

بینایی ماشین و اسناد تاریخی

بینایی ماشین در دیجیتال‌سازی و تحلیل اسناد تاریخی کاربرد دارد.

از جمله وظایف مرتبط می‌توان به شناسایی ساختار صفحه، تشخیص نواحی متن، جداسازی تصاویر و آماده‌سازی داده برای تشخیص نویسه‌ها اشاره کرد.

تشخیص نوری نویسه‌ها (OCR) یکی از فناوری‌های مرتبط است که متن موجود در تصویر را به دادهٔ متنی تبدیل می‌کند.

در اسناد تاریخی، کیفیت کاغذ، فرسودگی، نوع خط و وضوح تصویر می‌توانند بر نتیجه تأثیر بگذارند.

بینایی ماشین و زبان فارسی

بینایی ماشین در پردازش اسناد فارسی و شناسایی نوشته‌های فارسی نیز کاربرد دارد.

یکی از مسائل مهم، تشخیص متن در تصاویر و اسناد اسکن‌شده است.

ویژگی‌هایی مانند پیوستگی حروف، شکل‌های متفاوت نویسه‌ها و وجود نقطه‌ها می‌توانند بر طراحی سامانه‌های تشخیص متن تأثیر بگذارند.

در متون تاریخی، تفاوت خط، کیفیت چاپ و آسیب‌دیدگی اسناد دشواری بیشتری ایجاد می‌کند.

سامانه‌های پردازش اسناد فارسی می‌توانند از ترکیب بینایی ماشین و پردازش زبان طبیعی استفاده کنند.

بینایی ماشین در آموزش

بینایی ماشین در ابزارهای آموزشی، تحلیل تصاویر علمی و سامانه‌های کمک‌آموزشی کاربرد دارد.

برای مثال، یک برنامهٔ آموزشی می‌تواند تصویر یک نمودار یا شکل هندسی را دریافت و اجزای آن را شناسایی کند.

در ابزارهای دسترس‌پذیری نیز سامانه‌های توصیف تصویر می‌توانند به کاربران نابینا یا کم‌بینا کمک کنند.

با این حال، اطلاعات تولیدشده توسط این سامانه‌ها باید از نظر دقت و محدودیت‌های کاربرد بررسی شود.

بینایی ماشین در ورزش

در ورزش، بینایی ماشین برای تحلیل حرکت بازیکنان، ردیابی توپ، بررسی وضعیت بدن و تحلیل ویدئو استفاده می‌شود.

این فناوری می‌تواند در آموزش ورزشکاران، تحلیل مسابقات و برخی سامانه‌های داوری کمکی کاربرد داشته باشد.

دقت نتیجه به کیفیت دوربین‌ها، زاویهٔ دید و روش پردازش داده وابسته است.

بینایی ماشین و واقعیت افزوده

واقعیت افزوده (Augmented Reality) فناوری‌ای است که اطلاعات یا عناصر دیجیتال را با نمای محیط واقعی ترکیب می‌کند.

بینایی ماشین می‌تواند برای شناسایی سطوح، تخمین حرکت دوربین و تعیین موقعیت عناصر مجازی استفاده شود.

این فناوری در آموزش، طراحی، بازی و کاربردهای صنعتی مورد استفاده قرار می‌گیرد.

مجموعه‌داده‌های بینایی ماشین

توسعه و ارزیابی مدل‌های بینایی ماشین به مجموعه‌داده‌های مناسب نیاز دارد.

این مجموعه‌ها ممکن است شامل تصاویر، برچسب‌های طبقه‌بندی، کادرهای اشیا یا نقشه‌های بخش‌بندی باشند.

از مجموعه‌داده‌های شناخته‌شده می‌توان به ImageNet، COCO و MNIST اشاره کرد.

هر مجموعه‌داده برای هدف مشخصی طراحی شده و محدودیت‌های خاص خود را دارد.

برای مثال، عملکرد مناسب یک مدل روی یک مجموعه‌دادهٔ معیار لزوماً نشان‌دهندهٔ عملکرد مشابه در همهٔ محیط‌های واقعی نیست.

آموزش مدل‌های بینایی ماشین

در روش‌های مبتنی بر یادگیری نظارت‌شده، مدل با استفاده از نمونه‌های دارای برچسب آموزش داده می‌شود.

برای مثال، تصاویر ممکن است با نام اشیای موجود در آنها برچسب‌گذاری شوند.

مدل با مقایسهٔ خروجی خود و برچسب هدف، پارامترهایش را تنظیم می‌کند.

در روش‌های خودنظارت‌شده، بخشی از اطلاعات آموزشی از ساختار خود داده به دست می‌آید.

انتخاب روش آموزش به نوع وظیفه، داده و منابع محاسباتی بستگی دارد.

افزایش داده

افزایش داده (Data Augmentation) به ایجاد تغییرات کنترل‌شده در نمونه‌های آموزشی گفته می‌شود.

برای مثال، ممکن است تصویر چرخانده، برش داده یا روشنایی آن تغییر داده شود.

هدف این است که مدل با تنوع بیشتری از نمونه‌ها روبه‌رو شود و در شرایط متفاوت عملکرد مناسب‌تری داشته باشد.

البته همهٔ تغییرات برای همهٔ وظایف مجاز یا مفید نیستند.

برای مثال، در برخی کاربردهای پزشکی، تغییر نامناسب تصویر ممکن است اطلاعات مهمی را مخدوش کند.

ارزیابی مدل‌های بینایی ماشین

ارزیابی مدل‌های بینایی ماشین باید بر اساس وظیفهٔ مورد نظر انجام شود.

در طبقه‌بندی، معیارهایی مانند دقت، بازخوانی و امتیاز F1 استفاده می‌شوند.

در تشخیص اشیا، معیارهایی مانند میانگین دقت متوسط (mAP) رایج هستند.

در بخش‌بندی تصویر، معیارهایی مانند اشتراک بر اجتماع (IoU) و ضریب Dice کاربرد دارند.

انتخاب معیار باید با هدف عملی سامانه هماهنگ باشد.

دقت و خطا

یکی از مسائل مهم در ارزیابی بینایی ماشین، تفاوت میان دقت آزمایشگاهی و عملکرد واقعی است.

مدلی که در مجموعه‌داده‌ای مشخص عملکرد بالایی دارد، ممکن است در محیطی با نور، زاویه یا کیفیت تصویر متفاوت دچار خطا شود.

به همین دلیل، ارزیابی باید تا حد امکان شامل داده‌هایی نزدیک به شرایط واقعی استفاده باشد.

محدودیت‌های بینایی ماشین

بینایی ماشین با وجود پیشرفت‌های گسترده محدودیت‌هایی دارد.

یکی از این محدودیت‌ها وابستگی عملکرد به کیفیت تصویر است.

نور نامناسب، تاری، انسداد، زاویهٔ دید غیرمعمول و نویز می‌توانند تشخیص را دشوار کنند.

محدودیت دیگر، وابستگی بسیاری از مدل‌ها به داده‌های آموزشی است.

اگر شرایط واقعی با داده‌های آموزش تفاوت زیادی داشته باشد، عملکرد مدل ممکن است کاهش یابد.

تغییر توزیع داده

تغییر توزیع داده (Distribution Shift) زمانی رخ می‌دهد که داده‌های زمان استفاده با داده‌های آموزش یا ارزیابی تفاوت معناداری داشته باشند.

برای مثال، مدلی که با تصاویر روز آموزش دیده ممکن است در تصاویر شب عملکرد ضعیف‌تری داشته باشد.

این مسئله در سامانه‌های صنعتی، پزشکی و حمل‌ونقل اهمیت ویژه‌ای دارد.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم بینایی ماشین است.

اگر داده‌های آموزشی پوشش نامتوازنی از شرایط، گروه‌ها یا محیط‌های مختلف داشته باشند، عملکرد مدل ممکن است برای برخی گروه‌ها یا شرایط ضعیف‌تر باشد.

این مسئله در سامانه‌های تشخیص چهره و تصمیم‌گیری مبتنی بر تصویر اهمیت ویژه‌ای دارد.

ارزیابی منصفانه باید تفاوت نرخ خطا میان گروه‌ها و شرایط مختلف را نیز بررسی کند.

حریم خصوصی و نظارت تصویری

بینایی ماشین می‌تواند در سامانه‌های نظارتی برای شناسایی اشیا، ردیابی افراد یا تحلیل رفتارهای تصویری استفاده شود.

این کاربردها می‌توانند مسائل مهمی دربارهٔ حریم خصوصی، رضایت، نگهداری داده و نظارت عمومی ایجاد کنند.

استفاده از تشخیص چهره برای شناسایی افراد در فضاهای عمومی، به‌ویژه در صورت نبود شفافیت و نظارت مستقل، می‌تواند خطرهایی برای آزادی‌های مدنی به همراه داشته باشد.

ارزیابی این خطرها باید با توجه به کاربرد مشخص، قوانین مربوط و آثار واقعی سامانه انجام شود.

بینایی ماشین و حقوق بشر

کاربرد بینایی ماشین در شناسایی افراد، نظارت عمومی و تحلیل رفتار می‌تواند با حقوق بنیادین شهروندان ارتباط پیدا کند.

از جمله مسائل مهم می‌توان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و حق برخورداری از رفتار برابر اشاره کرد.

استفاده از سامانه‌های تشخیص چهره در محیط‌های عمومی ممکن است به شناسایی و ردیابی افراد بدون اطلاع یا رضایت آنان منجر شود.

در چنین مواردی، ضرورت قانونی‌بودن، تناسب، شفافیت و پاسخگویی از موضوعات مهم ارزیابی حقوق بشری است.

بینایی ماشین و امنیت

سامانه‌های بینایی ماشین ممکن است در معرض حملات فنی قرار گیرند.

یکی از نمونه‌ها، حملات خصمانه است که در آن تغییرات طراحی‌شده در تصویر می‌تواند مدل را به تشخیص نادرست سوق دهد.

این مسئله در سامانه‌های امنیتی و کاربردهای حساس اهمیت دارد.

همچنین دست‌کاری داده‌های آموزشی یا تصاویر ورودی می‌تواند بر عملکرد سامانه اثر بگذارد.

تصاویر ساختگی و دیپ‌فیک

پیشرفت هوش مصنوعی مولد موجب گسترش امکان تولید تصاویر و ویدئوهای مصنوعی شده است.

اصطلاح دیپ‌فیک معمولاً به محتوای مصنوعی یا دست‌کاری‌شده‌ای اشاره دارد که می‌تواند چهره، صدا یا رفتار فردی را به‌صورت گمراه‌کننده بازنمایی کند.

بینایی ماشین می‌تواند در پژوهش‌های تشخیص دست‌کاری تصویر و تحلیل اصالت محتوا به کار رود.

با این حال، هیچ روش تشخیص خودکاری را نباید برای همهٔ انواع تصاویر و ویدئوهای مصنوعی بی‌خطا فرض کرد.

بینایی ماشین و توهم هوش مصنوعی

در سامانه‌هایی که بینایی ماشین را با مدل‌های زبانی ترکیب می‌کنند، امکان تولید توصیف‌های نادرست از تصویر وجود دارد.

برای مثال، مدل ممکن است شیئی را در تصویر توصیف کند که واقعاً وجود ندارد یا رابطهٔ میان اشیا را اشتباه تشخیص دهد.

این مسئله با توهم هوش مصنوعی ارتباط دارد.

در کاربردهای پژوهشی و دانشنامه‌ای، توصیف تولیدشده توسط مدل باید با تصویر اصلی و منابع مستقل تطبیق داده شود.

تفسیرپذیری بینایی ماشین

بسیاری از مدل‌های عمیق بینایی ماشین دارای تعداد زیادی پارامتر هستند.

در چنین مدل‌هایی، توضیح دقیق اینکه چرا تصویر به یک دستهٔ مشخص نسبت داده شده ممکن است دشوار باشد.

پژوهشگران روش‌هایی مانند نقشه‌های برجستگی و تحلیل حساسیت را برای بررسی عوامل مؤثر بر پیش‌بینی توسعه داده‌اند.

با این حال، نمایش نواحی مورد توجه مدل لزوماً توضیح کامل و قطعی تصمیم آن نیست.

مصرف انرژی و منابع محاسباتی

آموزش برخی مدل‌های بزرگ بینایی ماشین می‌تواند به سخت‌افزار و انرژی قابل توجهی نیاز داشته باشد.

هزینهٔ محاسباتی به اندازهٔ مدل، وضوح تصویر، حجم داده، تعداد مراحل آموزش و نوع سخت‌افزار بستگی دارد.

در کاربردهای عملی، بهینه‌سازی مدل برای اجرا روی دستگاه‌های کم‌مصرف نیز اهمیت دارد.

بینایی ماشین و تمرکز قدرت فناوری

توسعهٔ مدل‌های بزرگ و مجموعه‌داده‌های گسترده ممکن است به سرمایه و زیرساخت محاسباتی قابل توجه نیاز داشته باشد.

این مسئله می‌تواند مشارکت مؤسسات دارای منابع محدود را دشوار کند.

در مقابل، انتشار کدهای پژوهشی، مجموعه‌داده‌های مجاز و مدل‌های قابل استفادهٔ عمومی می‌تواند دسترسی پژوهشگران بیشتری را فراهم سازد.

البته انتشار داده‌های تصویری باید با رعایت حقوق افراد و الزامات حریم خصوصی انجام شود.

بینایی ماشین و دانشنامه‌نویسی

بینایی ماشین می‌تواند در گردآوری، سامان‌دهی و تحلیل منابع تصویری دانشنامه‌ها کاربرد داشته باشد.

برای مثال، این فناوری ممکن است برای شناسایی متن در اسناد اسکن‌شده، طبقه‌بندی تصاویر، تشخیص تصاویر مشابه یا بررسی کیفیت فایل‌های تصویری استفاده شود.

در دانشنامه‌نویسی تاریخی، بینایی ماشین می‌تواند به آماده‌سازی اسناد و تصاویر برای بررسی پژوهشگران کمک کند.

با این حال، خروجی سامانه نباید جایگزین بررسی منبع اصلی شود.

تشخیص خودکار چهره، مکان یا تاریخ یک عکس ممکن است اشتباه باشد.

بنابراین اطلاعات مربوط به هویت اشخاص، زمان ثبت تصاویر و اصالت اسناد باید با منابع معتبر راستی‌آزمایی شود.

آیندهٔ بینایی ماشین

پژوهش دربارهٔ بینایی ماشین در زمینه‌های متعددی ادامه دارد.

از جمله موضوعات مهم می‌توان به توسعهٔ مدل‌های چندوجهی، بهبود تحلیل ویدئو، پردازش سه‌بعدی، کاهش نیاز به داده‌های برچسب‌دار، افزایش کارایی محاسباتی و بهبود قابلیت اعتماد اشاره کرد.

یکی از جهت‌گیری‌های مهم، توسعهٔ سامانه‌هایی است که بتوانند اطلاعات بصری را با زبان، صوت و دیگر انواع داده ترکیب کنند.

همچنین افزایش شفافیت، کاهش سوگیری و حفاظت از حریم خصوصی از مسائل مهم آیندهٔ این حوزه خواهند بود.

تفاوت بینایی ماشین و پردازش تصویر

پردازش تصویر و بینایی ماشین با یکدیگر ارتباط نزدیک دارند.

پردازش تصویر معمولاً بر تبدیل یا بهبود داده‌های تصویری تمرکز دارد.

در مقابل، بینایی ماشین به استخراج اطلاعات و استنتاج دربارهٔ محتوای تصویر می‌پردازد.

برای مثال، کاهش نویز یک عکس نمونه‌ای از پردازش تصویر است.

تشخیص اینکه در همان عکس چه اشیایی وجود دارند، نمونه‌ای از وظایف بینایی ماشین است.

البته در بسیاری از سامانه‌ها، این دو حوزه با یکدیگر ترکیب می‌شوند.

تفاوت بینایی ماشین و یادگیری عمیق

یادگیری عمیق حوزه‌ای از یادگیری ماشین است که عمدتاً از شبکه‌های عصبی چندلایه استفاده می‌کند.

بینایی ماشین حوزه‌ای کاربردی و پژوهشی برای تحلیل داده‌های بصری است.

بسیاری از روش‌های جدید بینایی ماشین از یادگیری عمیق بهره می‌گیرند، اما همهٔ روش‌های بینایی ماشین مبتنی بر یادگیری عمیق نیستند.

روش‌های هندسی، پردازش تصویر و الگوریتم‌های کلاسیک نیز بخش مهمی از این حوزه را تشکیل می‌دهند.

تفاوت بینایی ماشین و هوش مصنوعی مولد

بینایی ماشین عمدتاً به تحلیل و استخراج اطلاعات از تصاویر و ویدئوها می‌پردازد.

هوش مصنوعی مولد بر تولید داده یا محتوای جدید تمرکز دارد.

یک سامانهٔ تشخیص اشیا نمونه‌ای از کاربرد بینایی ماشین است.

یک سامانهٔ تولید تصویر از متن نمونه‌ای از هوش مصنوعی مولد محسوب می‌شود.

با این حال، سامانه‌های جدید ممکن است هر دو قابلیت را در یک معماری ترکیب کنند.

جمع‌بندی

بینایی ماشین یکی از حوزه‌های بنیادی هوش مصنوعی است که به توسعهٔ روش‌های محاسباتی برای استخراج و تحلیل اطلاعات از تصاویر و ویدئوها می‌پردازد.

این حوزه از پژوهش‌های اولیهٔ پردازش تصویر و هندسهٔ تصویری در میانهٔ سدهٔ بیستم شکل گرفت و به‌تدریج به موضوعاتی مانند تشخیص اشیا، تحلیل حرکت، بازسازی سه‌بعدی و درک صحنه گسترش یافت.

از دههٔ ۲۰۱۰، پیشرفت شبکه‌های عصبی مصنوعی و یادگیری عمیق موجب تحول مهمی در بسیاری از وظایف بینایی ماشین شد. توسعهٔ AlexNet، ResNet، U-Net و ترنسفورمرهای بینایی از مراحل اثرگذار این تحول بودند.[۵][۶][۸][۷]

امروزه بینایی ماشین در پزشکی، صنعت، رباتیک، حمل‌ونقل، کشاورزی، پژوهش و تحلیل اسناد کاربرد دارد.

با این حال، محدودیت‌های فنی، وابستگی به کیفیت داده، سوگیری الگوریتمی، خطر خطا در شرایط واقعی و مسائل مربوط به حریم خصوصی و نظارت تصویری از چالش‌های مهم آن به شمار می‌روند.

اهمیت بینایی ماشین در آن است که یکی از ابزارهای اصلی تبدیل داده‌های بصری به اطلاعات قابل استفاده برای سامانه‌های محاسباتی را فراهم می‌کند؛ ابزاری که با گسترش هوش مصنوعی چندوجهی، نقش آن در فناوری و جامعه افزایش یافته است.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Deng, Jia, et al. “ImageNet: A Large-Scale Hierarchical Image Database.” IEEE Conference on Computer Vision and Pattern Recognition, 2009. متن مقاله
  • Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” International Conference on Learning Representations, 2021. متن مقاله
  • Hartley, Richard, and Andrew Zisserman. Multiple View Geometry in Computer Vision. 2nd ed. Cambridge: Cambridge University Press, 2004.
  • He, Kaiming, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. “Deep Residual Learning for Image Recognition.” Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016. متن مقاله
  • Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012). متن مقاله
  • LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444. متن مقاله
  • Marr, David. Vision: A Computational Investigation into the Human Representation and Processing of Visual Information. San Francisco: W. H. Freeman, 1982.
  • Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. “U-Net: Convolutional Networks for Biomedical Image Segmentation.” Medical Image Computing and Computer-Assisted Intervention, 2015. متن مقاله


```