شبکه عصبی مصنوعی: تفاوت میان نسخه‌ها

از ایران پدیا
پرش به ناوبری پرش به جستجو
صفحه‌ای تازه حاوی «```wiki {{جعبه اطلاعات مفهوم | نام = شبکهٔ عصبی مصنوعی | نام اصلی = Artificial Neural Network | نام‌های دیگر = شبکهٔ عصبی، شبکهٔ نورونی مصنوعی، ANN | تصویر = | اندازه تصویر = | توضیح تصویر = | حوزه = هوش مصنوعی، یادگیری ماش...» ایجاد کرد
 
Safa (بحث | مشارکت‌ها)
بدون خلاصۀ ویرایش
 
(یک نسخهٔ میانی ویرایش شده توسط یک کاربر دیگر نشان داده نشد)
خط ۱: خط ۱:
```wiki
{{جعبه اطلاعات مفهوم
{{جعبه اطلاعات مفهوم
| نام                = شبکهٔ عصبی مصنوعی
| نام                = شبکهٔ عصبی مصنوعی
خط ۲۵: خط ۲۴:
}}
}}


'''شبکهٔ عصبی مصنوعی''' (به انگلیسی: ''Artificial Neural Network'' و به اختصار ''ANN'') نوعی مدل محاسباتی در حوزهٔ [[هوش مصنوعی]] و [[یادگیری ماشین]] است که از مجموعه‌ای از واحدهای پردازشی به‌هم‌پیوسته، موسوم به '''نورون‌های مصنوعی'''، تشکیل می‌شود. این واحدها با استفاده از روابط ریاضی، داده‌های ورودی را پردازش می‌کنند و در بسیاری از انواع شبکه‌های عصبی، با تنظیم پارامترهایی مانند وزن‌ها و سوگیری‌ها، الگوهای موجود در داده را می‌آموزند.
'''شبکهٔ عصبی مصنوعی،''' (به انگلیسی: ''Artificial Neural Network'' و به اختصار ''ANN'') نوعی مدل محاسباتی در حوزهٔ [[هوش مصنوعی]] و [[یادگیری ماشین]] است که از مجموعه‌ای از واحدهای پردازشی به‌هم‌پیوسته، موسوم به '''نورون‌های مصنوعی'''، تشکیل می‌شود. این واحدها با استفاده از روابط ریاضی، داده‌های ورودی را پردازش می‌کنند و در بسیاری از انواع شبکه‌های عصبی، با تنظیم پارامترهایی مانند وزن‌ها و سوگیری‌ها، الگوهای موجود در داده را می‌آموزند.


شبکه‌های عصبی مصنوعی در آغاز با الهام از برخی ویژگی‌های دستگاه عصبی موجودات زنده توسعه یافتند؛ با این حال، شبکهٔ عصبی مصنوعی بازسازی دقیق مغز انسان نیست، بلکه مدلی ریاضی و محاسباتی است که می‌تواند برای پیش‌بینی، طبقه‌بندی، تشخیص الگو، پردازش زبان، تحلیل تصویر و تولید داده استفاده شود.<ref name="mcculloch">[https://doi.org/10.1007/BF02478259 McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” ''The Bulletin of Mathematical Biophysics'' 5 (1943): 115–133.]</ref>
شبکه‌های عصبی مصنوعی در آغاز با الهام از برخی ویژگی‌های دستگاه عصبی موجودات زنده توسعه یافتند؛ با این حال، شبکهٔ عصبی مصنوعی بازسازی دقیق مغز انسان نیست، بلکه مدلی ریاضی و محاسباتی است که می‌تواند برای پیش‌بینی، طبقه‌بندی، تشخیص الگو، پردازش زبان، تحلیل تصویر و تولید داده استفاده شود.<ref name="mcculloch">[https://doi.org/10.1007/BF02478259 McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” ''The Bulletin of Mathematical Biophysics'' 5 (1943): 115–133.]</ref>

نسخهٔ کنونی تا ‏۱۰ اکتبر ۲۰۲۶، ساعت ۱۰:۱۲

شبکه عصبی مصنوعی
شناسنامه
نام‌های دیگرشبکهٔ عصبی، شبکهٔ نورونی مصنوعی، ANN
حوزههوش مصنوعی، یادگیری ماشین، یادگیری عمیق، علوم رایانه، علوم شناختی
خاستگاهمنطق ریاضی، علوم اعصاب، علوم رایانه، آمار و پژوهش‌های اولیهٔ هوش مصنوعی
اندیشه و تاریخ
مفاهیم کلیدینورون مصنوعی، وزن، سوگیری، تابع فعال‌سازی، لایهٔ ورودی، لایهٔ پنهان، لایهٔ خروجی، تابع زیان، گرادیان نزولی، پس‌انتشار، تعمیم
جریان‌های مرتبطاتصال‌گرایی، یادگیری بازنمایی، یادگیری عمیق، یادگیری نظارت‌شده، یادگیری خودنظارت‌شده، هوش مصنوعی مولد
تأثیرپذیرفته ازعصب‌شناسی، منطق، آمار، نظریهٔ یادگیری، بهینه‌سازی و علوم شناختی
تأثیرگذار بریادگیری عمیق، ترنسفورمر، مدل زبانی بزرگ، هوش مصنوعی مولد، بینایی ماشین، تشخیص گفتار و رباتیک
نقد و ارزیابی

شبکهٔ عصبی مصنوعی، (به انگلیسی: Artificial Neural Network و به اختصار ANN) نوعی مدل محاسباتی در حوزهٔ هوش مصنوعی و یادگیری ماشین است که از مجموعه‌ای از واحدهای پردازشی به‌هم‌پیوسته، موسوم به نورون‌های مصنوعی، تشکیل می‌شود. این واحدها با استفاده از روابط ریاضی، داده‌های ورودی را پردازش می‌کنند و در بسیاری از انواع شبکه‌های عصبی، با تنظیم پارامترهایی مانند وزن‌ها و سوگیری‌ها، الگوهای موجود در داده را می‌آموزند.

شبکه‌های عصبی مصنوعی در آغاز با الهام از برخی ویژگی‌های دستگاه عصبی موجودات زنده توسعه یافتند؛ با این حال، شبکهٔ عصبی مصنوعی بازسازی دقیق مغز انسان نیست، بلکه مدلی ریاضی و محاسباتی است که می‌تواند برای پیش‌بینی، طبقه‌بندی، تشخیص الگو، پردازش زبان، تحلیل تصویر و تولید داده استفاده شود.[۱]

تاریخ شبکه‌های عصبی مصنوعی به پژوهش‌های میانهٔ سدهٔ بیستم بازمی‌گردد. مدل منطقی وارن مک‌کالاک و والتر پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در دههٔ ۱۹۵۰ و گسترش روش‌های آموزش شبکه‌های چندلایه در دههٔ ۱۹۸۰ از نقاط عطف این حوزه به شمار می‌روند.

از دههٔ ۲۰۱۰، پیشرفت در قدرت محاسباتی، دسترسی به داده‌های بزرگ و توسعهٔ روش‌های آموزش، شبکه‌های عصبی را به یکی از فناوری‌های بنیادی هوش مصنوعی معاصر تبدیل کرد. بسیاری از سامانه‌های یادگیری عمیق، ترنسفورمری و هوش مصنوعی مولد بر انواع شبکه‌های عصبی مصنوعی استوارند.[۲]

تعریف شبکهٔ عصبی مصنوعی

شبکهٔ عصبی مصنوعی را می‌توان مجموعه‌ای از واحدهای محاسباتی تعریف کرد که از طریق ارتباطات دارای وزن، اطلاعات را دریافت، تبدیل و منتقل می‌کنند.

در یک شبکهٔ معمولی، داده وارد لایهٔ نخست می‌شود و پس از عبور از یک یا چند لایهٔ پردازشی، خروجی تولید می‌شود.

در جریان آموزش، پارامترهای شبکه به‌گونه‌ای تنظیم می‌شوند که عملکرد آن در یک وظیفهٔ مشخص بهبود یابد.

برای مثال، اگر شبکه برای تشخیص تصاویر گربه و سگ آموزش داده شود، ابتدا نمونه‌هایی از تصاویر را دریافت می‌کند. سپس بر اساس خروجی‌های خود و اطلاعات آموزشی، پارامترهایش تنظیم می‌شوند تا احتمال تشخیص صحیح تصاویر جدید افزایش یابد.

این فرایند به معنای آگاهی یا فهم انسانی شبکه نیست؛ بلکه نوعی یادگیری محاسباتی است.

خاستگاه نظری

شبکه‌های عصبی مصنوعی از پیوند چند حوزهٔ علمی پدید آمدند.

یکی از این حوزه‌ها عصب‌شناسی بود که ساختار و عملکرد نورون‌های زیستی را بررسی می‌کرد.

حوزهٔ دیگر منطق ریاضی بود که امکان توصیف روابط و عملیات منطقی را فراهم می‌ساخت.

همچنین آمار، نظریهٔ احتمال، علوم شناختی و علوم رایانه در توسعهٔ این مدل‌ها نقش داشتند.

پژوهشگران اولیه تلاش کردند نشان دهند که شبکه‌هایی از واحدهای ساده می‌توانند در ترکیب با یکدیگر رفتارهای محاسباتی پیچیده‌تری ایجاد کنند.

تاریخچه

مدل مک‌کالاک و پیتس؛ ۱۹۴۳

در سال ۱۹۴۳، وارن مک‌کالاک، عصب‌شناس آمریکایی، و والتر پیتس، منطق‌دان، مقاله‌ای با عنوان A Logical Calculus of the Ideas Immanent in Nervous Activity منتشر کردند.

این مقاله یکی از آثار بنیادی در تاریخ مدل‌سازی ریاضی شبکه‌های عصبی محسوب می‌شود.

مک‌کالاک و پیتس مدلی از واحدهای عصبی ارائه کردند که رفتار آنها را می‌شد با منطق گزاره‌ای توصیف کرد.

در این مدل، واحدهای عصبی بر اساس شرایط ورودی و آستانهٔ فعال‌سازی، خروجی‌هایی از نوع فعال یا غیرفعال تولید می‌کردند.

پژوهش آنها نشان داد که شبکه‌هایی از واحدهای ساده می‌توانند برخی عملیات منطقی را بازنمایی کنند.[۱]

این مدل هنوز از بسیاری از قابلیت‌های یادگیری شبکه‌های عصبی جدید برخوردار نبود، اما مبنایی نظری برای پژوهش‌های بعدی فراهم کرد.

نظریهٔ یادگیری هب؛ ۱۹۴۹

دونالد هب، روان‌شناس کانادایی، در کتاب The Organization of Behavior که در سال ۱۹۴۹ منتشر شد، نظریه‌ای دربارهٔ تغییر قدرت ارتباطات عصبی در فرایند یادگیری مطرح کرد.

ایدهٔ بنیادی یادگیری هبی آن است که فعالیت مرتبط واحدهای عصبی می‌تواند با تقویت ارتباط میان آنها همراه باشد.

این دیدگاه بر پژوهش‌های بعدی دربارهٔ یادگیری در شبکه‌های عصبی و مدل‌های اتصال‌گرا تأثیر گذاشت.

البته روش‌های آموزش شبکه‌های عصبی معاصر لزوماً بر قواعد یادگیری هبی استوار نیستند.

پرسپترون فرانک روزنبلات؛ ۱۹۵۸

فرانک روزنبلات در سال ۱۹۵۸ مقالهٔ The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain را منتشر کرد.

پرسپترون یکی از مدل‌های مهم اولیهٔ یادگیری در شبکه‌های عصبی بود.[۳]

پرسپترون می‌توانست با تنظیم وزن‌های خود برخی مسائل طبقه‌بندی را یاد بگیرد.

برای مثال، یک پرسپترون ساده می‌تواند یاد بگیرد که نمونه‌ها را بر اساس ترکیبی خطی از ویژگی‌های ورودی به دو گروه تقسیم کند.

این مدل در تاریخ هوش مصنوعی اهمیت زیادی داشت، زیرا نشان می‌داد می‌توان بخشی از رفتار یک سامانهٔ محاسباتی را از طریق تجربه و تنظیم پارامترها شکل داد.

محدودیت‌های پرسپترون

پرسپترون تک‌لایه دارای محدودیت‌های ریاضی مشخصی بود.

این مدل نمی‌توانست مسائلی را که از نظر خطی جدایی‌پذیر نیستند، مانند مسئلهٔ XOR، به‌درستی حل کند.

ماروین مینسکی و سیمور پیپرت در کتاب Perceptrons که در سال ۱۹۶۹ منتشر شد، محدودیت‌های ریاضی برخی از شبکه‌های پرسپترونی را بررسی کردند.

این نقدها بر مسیر پژوهش شبکه‌های عصبی تأثیر گذاشتند.

با این حال، محدودیت پرسپترون تک‌لایه را نباید به همهٔ شبکه‌های عصبی چندلایه تعمیم داد.

گسترش شبکه‌های چندلایه

شبکه‌های چندلایه امکان ترکیب تبدیل‌های غیرخطی را فراهم کردند.

برخلاف پرسپترون تک‌لایه، یک شبکهٔ چندلایه با ساختار و پارامترهای مناسب می‌تواند روابط پیچیده‌تری را بازنمایی کند.

اما آموزش مؤثر این شبکه‌ها به روش‌هایی نیاز داشت که بتوانند سهم پارامترهای مختلف را در خطای خروجی محاسبه کنند.

این مسئله یکی از موضوعات مهم پژوهش در دهه‌های ۱۹۷۰ و ۱۹۸۰ بود.

پس‌انتشار خطا؛ ۱۹۸۶

در سال ۱۹۸۶، دیوید روملهارت، جفری هینتون و رونالد ویلیامز مقالهٔ Learning Representations by Back-Propagating Errors را در نشریهٔ Nature منتشر کردند.

این مقاله روش آموزش شبکه‌های چندلایه از طریق محاسبهٔ گرادیان و اصلاح وزن‌ها را توضیح داد و به گسترش استفاده از پس‌انتشار در شبکه‌های عصبی کمک کرد.[۴]

البته ریشه‌های ریاضی و کاربردهای پیشین روش‌های مرتبط با پس‌انتشار به قبل از سال ۱۹۸۶ بازمی‌گردد. اهمیت مقالهٔ روملهارت و همکاران در معرفی اثرگذار این روش برای یادگیری بازنمایی‌ها در شبکه‌های چندلایه بود.

گسترش شبکه‌های عصبی در دههٔ ۱۹۹۰

در دههٔ ۱۹۹۰، پژوهش دربارهٔ شبکه‌های عصبی در حوزه‌هایی مانند تشخیص دست‌خط، پردازش تصویر و تشخیص گفتار ادامه یافت.

یان لکون و همکاران از شبکه‌های عصبی پیچشی برای شناسایی نویسه‌ها و ارقام دست‌نویس استفاده کردند.

این پژوهش‌ها نشان دادند که شبکه‌های عصبی می‌توانند در مسائل واقعی تشخیص الگو کاربرد داشته باشند.

تحول یادگیری عمیق در دههٔ ۲۰۱۰

از دههٔ ۲۰۱۰، شبکه‌های عصبی عمیق در بسیاری از وظایف پردازش تصویر، گفتار و زبان پیشرفت چشمگیری نشان دادند.

افزایش توان پردازنده‌های گرافیکی، دسترسی به داده‌های بزرگ و بهبود روش‌های آموزش از عوامل مهم این تحول بودند.

مقالهٔ مروری یان لکون، یوشوا بنجیو و جفری هینتون در سال ۲۰۱۵، نقش شبکه‌های چندلایه را در یادگیری بازنمایی‌های پیچیده و پیشرفت یادگیری عمیق توضیح داد.[۲]

ظهور ترنسفورمر؛ ۲۰۱۷

در سال ۲۰۱۷، معماری ترنسفورمر در مقالهٔ Attention Is All You Need معرفی شد.

این معماری از سازوکار توجه برای پردازش روابط میان عناصر دنباله استفاده می‌کند.

ترنسفورمر یکی از انواع معماری شبکهٔ عصبی مصنوعی است و بعدها پایهٔ بسیاری از مدل‌های زبانی بزرگ شد.[۵]

ساختار شبکهٔ عصبی مصنوعی

شبکه‌های عصبی معمولاً از واحدهای محاسباتی و ارتباطات میان آنها تشکیل می‌شوند.

در شبکه‌های پیش‌خور ساده، این واحدها در لایه‌هایی سازمان‌دهی می‌شوند.

سه نوع اصلی لایه عبارت‌اند از:

  • لایهٔ ورودی
  • لایه‌های پنهان
  • لایهٔ خروجی

البته همهٔ معماری‌های شبکهٔ عصبی به این ساختار ساده محدود نیستند.

شبکه‌های بازگشتی، پیچشی، ترنسفورمری و گرافی ساختارهای متفاوتی دارند.

نورون مصنوعی

نورون مصنوعی واحدی محاسباتی است که مجموعه‌ای از ورودی‌ها را دریافت می‌کند و بر اساس وزن‌ها، سوگیری و تابع فعال‌سازی، خروجی تولید می‌کند.

در یک نورون ساده، ورودی‌ها با وزن‌های مربوط به خود ضرب می‌شوند.

سپس حاصل‌جمع آنها با مقدار سوگیری ترکیب و به تابع فعال‌سازی داده می‌شود.

رابطهٔ ریاضی یک نورون مصنوعی را می‌توان چنین نوشت:

y = f(w₁x₁ + w₂x₂ + ... + wₙxₙ + b)

در این رابطه:

  • x نشان‌دهندهٔ ورودی‌هاست.
  • w نشان‌دهندهٔ وزن‌هاست.
  • b مقدار سوگیری است.
  • f تابع فعال‌سازی است.
  • y خروجی نورون است.

در جریان آموزش، وزن‌ها و سوگیری‌ها می‌توانند تغییر کنند.

وزن در شبکهٔ عصبی

وزن (Weight) پارامتری عددی است که در محاسبهٔ تأثیر یک ورودی بر خروجی استفاده می‌شود.

در یک شبکهٔ عصبی، ارتباطات مختلف می‌توانند وزن‌های متفاوتی داشته باشند.

وزن‌ها معمولاً در فرایند آموزش تنظیم می‌شوند.

در نتیجه، رفتار مدل پس از آموزش به مقادیر آموخته‌شدهٔ این پارامترها وابسته است.

سوگیری در نورون مصنوعی

سوگیری (Bias) در تعریف ریاضی نورون مصنوعی، پارامتری افزوده‌شونده است که به مدل انعطاف بیشتری می‌دهد.

سوگیری به مدل امکان می‌دهد مقدار خروجی تبدیل خطی را مستقل از ورودی‌ها جابه‌جا کند.

این مفهوم با سوگیری الگوریتمی به معنای تبعیض یا عدم توازن در خروجی سامانه متفاوت است.

اشتراک نام این دو اصطلاح نباید موجب یکسان‌انگاری آنها شود.

تابع فعال‌سازی

تابع فعال‌سازی (Activation Function) تابعی است که خروجی محاسبات یک نورون یا لایه را تبدیل می‌کند.

در بسیاری از شبکه‌ها، تابع فعال‌سازی غیرخطی است.

غیرخطی‌بودن اهمیت زیادی دارد، زیرا ترکیب چندین تبدیل خطی بدون تابع غیرخطی همچنان معادل یک تبدیل خطی خواهد بود.

توابع فعال‌سازی شناخته‌شده عبارت‌اند از:

  • Sigmoid
  • Tanh
  • ReLU
  • GELU
  • Softmax

البته Softmax معمولاً برای تبدیل مجموعه‌ای از امتیازها به توزیع احتمال، به‌ویژه در خروجی برخی مدل‌های طبقه‌بندی، استفاده می‌شود.

تابع ReLU

تابع ReLU یا Rectified Linear Unit یکی از توابع فعال‌سازی پرکاربرد در شبکه‌های عصبی است.

فرمول آن چنین است:

f(x) = max(0, x)

اگر مقدار ورودی منفی باشد، خروجی صفر است.

اگر مقدار ورودی مثبت باشد، خروجی همان مقدار ورودی خواهد بود.

سادگی محاسباتی و برخی ویژگی‌های مناسب در فرایند آموزش از دلایل استفادهٔ گسترده از این تابع بوده‌اند.

لایهٔ ورودی

لایهٔ ورودی بخشی از شبکه است که داده‌های اولیه را دریافت می‌کند.

برای مثال، در یک مدل سادهٔ پیش‌بینی قیمت خانه، ورودی‌ها ممکن است شامل مساحت، تعداد اتاق‌ها و سن ساختمان باشند.

در شبکه‌های پردازش تصویر، ورودی ممکن است آرایه‌ای از مقادیر پیکسل‌ها باشد.

در مدل‌های زبانی، ورودی معمولاً پس از توکن‌سازی به بازنمایی‌های عددی تبدیل می‌شود.

لایهٔ پنهان

لایهٔ پنهان بخشی از شبکه است که میان ورودی و خروجی قرار می‌گیرد.

این لایه‌ها داده را به بازنمایی‌های میانی تبدیل می‌کنند.

در شبکه‌های عمیق، چندین لایهٔ پنهان می‌توانند تبدیل‌های پیچیده و سلسله‌مراتبی را انجام دهند.

برای مثال، در پردازش تصویر، لایه‌های مختلف ممکن است الگوهای ساده و سپس ساختارهای پیچیده‌تر را بازنمایی کنند.

لایهٔ خروجی

لایهٔ خروجی نتیجهٔ نهایی محاسبات شبکه را تولید می‌کند.

نوع خروجی به وظیفهٔ شبکه بستگی دارد.

در طبقه‌بندی، خروجی ممکن است مجموعه‌ای از امتیازها یا احتمال‌های مربوط به دسته‌های مختلف باشد.

در رگرسیون، خروجی ممکن است یک مقدار عددی باشد.

در مدل‌های مولد، خروجی می‌تواند توزیع احتمال توکن بعدی یا نوع دیگری از بازنمایی مورد نیاز برای تولید داده باشد.

شبکهٔ پیش‌خور

شبکهٔ عصبی پیش‌خور (Feedforward Neural Network) یکی از ساده‌ترین خانواده‌های شبکه‌های عصبی است.

در این شبکه، اطلاعات در مسیر محاسباتی از ورودی به خروجی حرکت می‌کند و حلقهٔ بازگشتی وجود ندارد.

پرسپترون چندلایه یا MLP یکی از نمونه‌های شناخته‌شدهٔ این خانواده است.

شبکه‌های پیش‌خور در طبقه‌بندی، رگرسیون و به‌عنوان اجزای معماری‌های بزرگ‌تر استفاده می‌شوند.

پرسپترون چندلایه

پرسپترون چندلایه (Multilayer Perceptron یا MLP) شبکه‌ای پیش‌خور است که معمولاً از چندین لایهٔ دارای پارامترهای آموختنی و توابع فعال‌سازی تشکیل می‌شود.

این شبکه می‌تواند روابط غیرخطی میان ورودی و خروجی را مدل‌سازی کند.

MLPها از ساختارهای بنیادی یادگیری ماشین هستند و در بسیاری از معماری‌های پیچیده‌تر نیز به‌عنوان جزء داخلی استفاده می‌شوند.

آموزش شبکهٔ عصبی

آموزش فرایندی است که طی آن پارامترهای شبکه بر اساس داده و هدف یادگیری تنظیم می‌شوند.

در یک مسئلهٔ یادگیری نظارت‌شده، مدل ورودی را دریافت می‌کند و خروجی تولید می‌کند.

سپس خروجی مدل با مقدار هدف مقایسه می‌شود.

اختلاف میان آنها با تابع زیان اندازه‌گیری می‌شود.

الگوریتم بهینه‌سازی تلاش می‌کند پارامترهای مدل را به‌گونه‌ای تغییر دهد که زیان کاهش یابد.

تابع زیان

تابع زیان (Loss Function) معیاری ریاضی برای سنجش اختلاف میان خروجی مدل و هدف آموزشی است.

برای مثال، در پیش‌بینی قیمت خانه، تابع زیان می‌تواند اختلاف میان قیمت پیش‌بینی‌شده و قیمت واقعی را اندازه‌گیری کند.

در مسائل طبقه‌بندی، تابع زیان آنتروپی متقاطع از گزینه‌های رایج است.

انتخاب تابع زیان بر رفتار مدل در فرایند آموزش تأثیر دارد.

گرادیان نزولی

گرادیان نزولی (Gradient Descent) یکی از روش‌های بهینه‌سازی مورد استفاده در آموزش شبکه‌های عصبی است.

این روش بر محاسبهٔ مشتق تابع زیان نسبت به پارامترها استوار است.

گرادیان نشان می‌دهد تغییر پارامترها در جهت‌های مختلف چه اثری بر مقدار زیان دارد.

الگوریتم با استفاده از این اطلاعات، پارامترها را در جهت کاهش زیان تغییر می‌دهد.

نسخه‌های مختلفی از این روش، از جمله گرادیان نزولی تصادفی و بهینه‌ساز Adam، در آموزش شبکه‌های عصبی کاربرد دارند.

پس‌انتشار خطا

پس‌انتشار (Backpropagation) روشی برای محاسبهٔ گرادیان‌های تابع زیان نسبت به پارامترهای شبکه است.

این روش با استفاده از قاعدهٔ زنجیره‌ای مشتق‌گیری، تأثیر پارامترهای لایه‌های مختلف را بر خروجی محاسبه می‌کند.

پس‌انتشار به‌تنهایی الگوریتم بهینه‌سازی نیست؛ بلکه گرادیان‌های لازم برای روش‌هایی مانند گرادیان نزولی را فراهم می‌کند.

این تمایز در توضیح سازوکار آموزش شبکه‌های عصبی اهمیت دارد.[۴]

نرخ یادگیری

نرخ یادگیری (Learning Rate) ابرپارامتری است که اندازهٔ گام تغییر پارامترها را در بسیاری از روش‌های بهینه‌سازی تعیین می‌کند.

اگر نرخ یادگیری بیش از اندازه بزرگ باشد، آموزش ممکن است ناپایدار شود.

اگر بیش از اندازه کوچک باشد، آموزش ممکن است بسیار کند پیش برود.

انتخاب نرخ یادگیری مناسب یکی از مسائل مهم در آموزش شبکه‌های عصبی است.

دورهٔ آموزش و دستهٔ داده

دورهٔ آموزش (Epoch) معمولاً به یک بار عبور کامل الگوریتم آموزش از مجموعهٔ دادهٔ آموزشی اشاره دارد.

دسته (Batch) زیرمجموعه‌ای از نمونه‌های آموزشی است که در یک مرحلهٔ محاسباتی پردازش می‌شود.

اندازهٔ دسته می‌تواند بر مصرف حافظه، سرعت آموزش و رفتار بهینه‌سازی تأثیر بگذارد.

تعمیم

یکی از اهداف اصلی آموزش شبکهٔ عصبی تعمیم (Generalization) است.

مدل مطلوب باید بتواند الگوهایی را بیاموزد که در داده‌های جدید نیز کاربرد داشته باشند.

عملکرد مناسب روی داده‌های آموزشی به‌تنهایی کافی نیست.

به همین دلیل، ارزیابی مدل معمولاً با استفاده از داده‌هایی انجام می‌شود که در آموزش مستقیم آن استفاده نشده‌اند.

بیش‌برازش

بیش‌برازش (Overfitting) زمانی رخ می‌دهد که مدل بیش از اندازه با داده‌های آموزشی، از جمله نویز یا ویژگی‌های اتفاقی آنها، تطبیق پیدا کند.

در این وضعیت، مدل ممکن است روی داده‌های آموزشی عملکرد بسیار خوبی داشته باشد اما روی داده‌های جدید دچار خطا شود.

روش‌هایی مانند منظم‌سازی، افزایش داده، توقف زودهنگام و Dropout برای کاهش خطر بیش‌برازش استفاده می‌شوند.

کم‌برازش

کم‌برازش (Underfitting) زمانی رخ می‌دهد که مدل نتواند ساختار اصلی داده را به اندازهٔ کافی بیاموزد.

این وضعیت ممکن است ناشی از ظرفیت ناکافی مدل، آموزش نامناسب یا انتخاب ویژگی‌های نامناسب باشد.

در کم‌برازش، مدل حتی روی داده‌های آموزشی نیز ممکن است عملکرد ضعیفی داشته باشد.

منظم‌سازی

منظم‌سازی (Regularization) به مجموعه‌ای از روش‌ها گفته می‌شود که برای کنترل پیچیدگی مؤثر مدل و بهبود تعمیم استفاده می‌شوند.

این روش‌ها می‌توانند شامل جریمه‌کردن اندازهٔ وزن‌ها، حذف تصادفی برخی فعال‌سازی‌ها در زمان آموزش یا توقف آموزش بر اساس عملکرد اعتبارسنجی باشند.

هدف منظم‌سازی جلوگیری از وابستگی نامناسب مدل به جزئیات داده‌های آموزشی است.

انواع شبکه‌های عصبی مصنوعی

شبکه‌های عصبی مصنوعی دارای معماری‌های متنوعی هستند.

مهم‌ترین خانواده‌ها شامل شبکه‌های پیش‌خور، پیچشی، بازگشتی، خودرمزگذار، مولد تخاصمی، گرافی و ترنسفورمری هستند.

هر معماری برای نوع خاصی از داده یا وظیفه مناسب‌تر است.

شبکهٔ عصبی پیچشی

شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) یکی از معماری‌های مهم در پردازش تصویر است.

این شبکه از عملیات پیچش برای استخراج ویژگی‌های محلی استفاده می‌کند.

شبکه‌های پیچشی در طبقه‌بندی تصاویر، تشخیص اشیا، تحلیل تصاویر پزشکی و پردازش ویدئو کاربرد داشته‌اند.

پژوهش‌های یان لکون و همکاران در توسعهٔ این معماری نقش مهمی داشتند.

شبکهٔ عصبی بازگشتی

شبکهٔ عصبی بازگشتی (Recurrent Neural Network یا RNN) برای پردازش داده‌های دنباله‌ای طراحی شده است.

در این معماری، وضعیت محاسباتی مراحل پیشین می‌تواند بر پردازش مرحلهٔ بعد تأثیر بگذارد.

شبکه‌های بازگشتی در مدل‌سازی زبان، تشخیص گفتار و تحلیل سری‌های زمانی استفاده شده‌اند.

یکی از محدودیت‌های آنها دشواری یادگیری برخی وابستگی‌های بلندمدت است.

شبکهٔ LSTM

حافظهٔ طولانی کوتاه‌مدت (Long Short-Term Memory یا LSTM) نوعی شبکهٔ بازگشتی است.

این معماری برای بهبود یادگیری وابستگی‌های بلندمدت در داده‌های دنباله‌ای توسعه یافت.

LSTM از سازوکارهای دروازه‌ای برای کنترل جریان اطلاعات استفاده می‌کند.

پیش از گسترش ترنسفورمرها، شبکه‌های LSTM در بسیاری از کاربردهای پردازش زبان و گفتار نقش مهمی داشتند.

شبکهٔ GRU

واحد بازگشتی دروازه‌دار (Gated Recurrent Unit یا GRU) یکی دیگر از گونه‌های شبکه‌های بازگشتی است.

این معماری از سازوکارهای دروازه‌ای برای کنترل جریان اطلاعات استفاده می‌کند.

GRU در برخی کاربردها می‌تواند با ساختاری ساده‌تر از LSTM عملکرد مناسبی ارائه کند.

خودرمزگذار

خودرمزگذار (Autoencoder) نوعی شبکهٔ عصبی است که معمولاً برای یادگیری بازنمایی فشردهٔ داده آموزش داده می‌شود.

در ساختار رایج، شبکه از دو بخش تشکیل می‌شود:

  • رمزگذار؛
  • رمزگشا.

رمزگذار داده را به بازنمایی میانی تبدیل می‌کند.

رمزگشا تلاش می‌کند دادهٔ اولیه را از آن بازنمایی بازسازی کند.

خودرمزگذارها در کاهش ابعاد، یادگیری بازنمایی و برخی کاربردهای تشخیص ناهنجاری استفاده می‌شوند.

شبکهٔ مولد تخاصمی

شبکهٔ مولد تخاصمی (Generative Adversarial Network یا GAN) خانواده‌ای از مدل‌های مولد است.

در ساختار کلاسیک GAN، دو شبکه با یکدیگر در فرایندی رقابتی آموزش می‌بینند.

شبکهٔ مولد تلاش می‌کند نمونه‌های مصنوعی تولید کند.

شبکهٔ تمایزدهنده تلاش می‌کند نمونه‌های واقعی را از نمونه‌های تولیدشده تشخیص دهد.

این معماری در سال ۲۰۱۴ توسط ایان گودفلو و همکاران معرفی شد.[۶]

GANها در تولید و ویرایش تصویر و برخی دیگر از کاربردهای مولد نقش داشته‌اند.

شبکهٔ عصبی گرافی

شبکهٔ عصبی گرافی (Graph Neural Network یا GNN) خانواده‌ای از شبکه‌هاست که برای پردازش داده‌های دارای ساختار گراف استفاده می‌شود.

در یک گراف، داده از گره‌ها و ارتباطات میان آنها تشکیل شده است.

برای مثال، شبکه‌های اجتماعی، ساختار مولکول‌ها و برخی شبکه‌های حمل‌ونقل را می‌توان به‌صورت گراف نمایش داد.

شبکه‌های عصبی گرافی می‌توانند اطلاعات گره‌ها و ارتباطات آنها را در فرایند یادگیری ترکیب کنند.

شبکهٔ عصبی ترنسفورمری

ترنسفورمر یکی از معماری‌های اثرگذار شبکهٔ عصبی مصنوعی است.

این معماری از سازوکار توجه برای مدل‌سازی روابط میان عناصر داده استفاده می‌کند.

برخلاف شبکه‌های بازگشتی سنتی، ترنسفورمر می‌تواند بخش بزرگی از محاسبات مربوط به موقعیت‌های مختلف دنباله را در زمان آموزش به‌صورت موازی انجام دهد.

ترنسفورمرها پایهٔ بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد معاصر هستند.[۵]

شبکه‌های عصبی و یادگیری عمیق

یادگیری عمیق عمدتاً بر شبکه‌های عصبی دارای چندین لایهٔ پردازشی استوار است.

در شبکه‌های عمیق، لایه‌های مختلف می‌توانند بازنمایی‌هایی با سطوح متفاوت انتزاع را بیاموزند.

برای مثال، در پردازش تصویر، شبکه ممکن است از ویژگی‌های ساده مانند لبه‌ها به بازنمایی‌های پیچیده‌تر برسد.

با این حال، همهٔ شبکه‌های عصبی لزوماً عمیق نیستند.

یک پرسپترون ساده نیز نوعی مدل شبکهٔ عصبی است، اما معمولاً در دستهٔ شبکه‌های عمیق قرار نمی‌گیرد.

شبکه‌های عصبی و یادگیری ماشین

یادگیری ماشین حوزه‌ای گسترده‌تر از شبکه‌های عصبی مصنوعی است.

الگوریتم‌های یادگیری ماشین شامل روش‌هایی مانند رگرسیون، درخت تصمیم، جنگل تصادفی، ماشین بردار پشتیبان و خوشه‌بندی نیز می‌شوند.

شبکه‌های عصبی یکی از خانواده‌های مهم مدل‌های یادگیری ماشین هستند.

بنابراین همهٔ روش‌های یادگیری ماشین مبتنی بر شبکهٔ عصبی نیستند.

شبکه‌های عصبی و هوش مصنوعی مولد

هوش مصنوعی مولد به سامانه‌هایی اشاره دارد که می‌توانند داده یا محتوای جدید تولید کنند.

بسیاری از مدل‌های مولد معاصر از شبکه‌های عصبی مصنوعی استفاده می‌کنند.

این مدل‌ها می‌توانند برای تولید متن، تصویر، صوت، موسیقی، ویدئو یا کد آموزش داده شوند.

شبکه‌های مولد تخاصمی، خودرمزگذارهای متغیر، مدل‌های انتشار و مدل‌های زبانی ترنسفورمری از نمونه‌های مهم رویکردهای مولد هستند.

البته همهٔ شبکه‌های عصبی مولد نیستند.

شبکه‌ای که فقط تصاویر را طبقه‌بندی می‌کند، ممکن است هیچ محتوای جدیدی تولید نکند.

شبکه‌های عصبی و مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ از مهم‌ترین کاربردهای شبکه‌های عصبی معاصر هستند.

بسیاری از این مدل‌ها از معماری ترنسفورمر استفاده می‌کنند.

مدل زبانی در فرایند آموزش، روابط آماری و ساختارهای موجود در داده‌های زبانی را می‌آموزد.

در مدل‌های خودرگرسیو، یکی از وظایف اصلی پیش‌بینی توکن بعدی بر اساس توکن‌های پیشین است.

این فرایند به مدل امکان می‌دهد متن تولید کند، به پرسش‌ها پاسخ دهد یا در وظایف مختلف پردازش زبان به کار رود.

شبکه‌های عصبی و پردازش زبان طبیعی

شبکه‌های عصبی در پردازش زبان طبیعی کاربرد گسترده دارند.

از جمله کاربردهای آنها می‌توان به ترجمهٔ ماشینی، تحلیل احساسات، طبقه‌بندی متن، خلاصه‌سازی، پاسخ به پرسش و تولید زبان اشاره کرد.

شبکه‌های بازگشتی و سپس ترنسفورمرها در تحول این حوزه نقش مهمی داشته‌اند.

شبکه‌های عصبی در بینایی ماشین

شبکه‌های عصبی در بینایی ماشین برای تحلیل تصاویر و ویدئو استفاده می‌شوند.

کاربردهای مهم آنها عبارت‌اند از:

  • طبقه‌بندی تصویر؛
  • تشخیص اشیا؛
  • تقسیم‌بندی تصویر؛
  • تشخیص چهره؛
  • تحلیل تصاویر پزشکی؛
  • و پردازش تصاویر ماهواره‌ای.

شبکه‌های پیچشی و ترنسفورمرهای بینایی از معماری‌های مهم این حوزه هستند.

شبکه‌های عصبی در تشخیص گفتار

شبکه‌های عصبی می‌توانند برای تبدیل سیگنال صوتی به متن آموزش داده شوند.

این فناوری در دستیارهای صوتی، زیرنویس خودکار، رونویسی جلسات و سامانه‌های دسترس‌پذیری کاربرد دارد.

مدل‌های عصبی همچنین در تولید گفتار مصنوعی و پردازش ویژگی‌های صوتی استفاده می‌شوند.

شبکه‌های عصبی در پزشکی

در پزشکی، شبکه‌های عصبی برای تحلیل تصاویر، پردازش پرونده‌های بالینی، پیش‌بینی برخی خطرهای سلامت و پژوهش دارویی استفاده شده‌اند.

برای مثال، شبکهٔ عصبی می‌تواند برای شناسایی الگوهایی در تصاویر پزشکی آموزش داده شود.

با این حال، عملکرد مطلوب روی یک مجموعهٔ دادهٔ آزمایشی به‌تنهایی برای اثبات ایمنی بالینی کافی نیست.

مدل باید در شرایط واقعی و روی جمعیت هدف ارزیابی شود.

همچنین تصمیم‌های پزشکی نیازمند نظارت متخصصان و رعایت الزامات قانونی و حرفه‌ای هستند.

شبکه‌های عصبی در صنعت

شبکه‌های عصبی در صنعت برای پیش‌بینی خرابی تجهیزات، کنترل کیفیت، تحلیل داده‌های حسگر و بهینه‌سازی فرایندها استفاده می‌شوند.

برای مثال، یک شبکه می‌تواند بر اساس داده‌های ثبت‌شده از دستگاه‌ها، الگوهایی را شناسایی کند که با افزایش احتمال خرابی ارتباط دارند.

این کاربردها می‌توانند به برنامه‌ریزی نگهداری و کاهش توقف‌های ناخواسته کمک کنند.

شبکه‌های عصبی در اقتصاد و امور مالی

شبکه‌های عصبی در تحلیل داده‌های مالی، کشف تقلب، ارزیابی ریسک و پیش‌بینی به کار می‌روند.

با این حال، استفاده از مدل‌های عصبی در تصمیم‌هایی مانند اعتبارسنجی می‌تواند مسائل مربوط به شفافیت، انصاف و حق اعتراض را مطرح کند.

عملکرد آماری مناسب یک مدل لزوماً به معنای عادلانه‌بودن همهٔ پیامدهای اجتماعی آن نیست.

شبکه‌های عصبی در کشاورزی

در کشاورزی، شبکه‌های عصبی می‌توانند برای تحلیل تصاویر گیاهان، تشخیص بیماری‌ها، پیش‌بینی محصول و مدیریت منابع استفاده شوند.

ترکیب تصاویر ماهواره‌ای، داده‌های حسگرها و مدل‌های یادگیری ماشین می‌تواند به تحلیل وضعیت زمین و محصولات کمک کند.

شبکه‌های عصبی در آموزش

شبکه‌های عصبی در سامانه‌های آموزشی تطبیقی، تحلیل داده‌های آموزشی و تولید محتوای آموزشی کاربرد دارند.

برای مثال، یک سامانه می‌تواند بر اساس پاسخ‌های دانش‌آموز، تمرین‌های متناسب با سطح او پیشنهاد کند.

اما استفاده از داده‌های آموزشی، به‌ویژه اطلاعات کودکان، نیازمند توجه به حریم خصوصی و امنیت است.

شبکه‌های عصبی و رباتیک

در رباتیک، شبکه‌های عصبی برای پردازش داده‌های حسگر، تشخیص اشیا، کنترل حرکت و یادگیری برخی رفتارها استفاده می‌شوند.

ترکیب شبکه‌های عصبی با یادگیری تقویتی می‌تواند به ربات امکان دهد برخی سیاست‌های کنترلی را از تجربه بیاموزد.

با این حال، استفاده در محیط واقعی نیازمند آزمون ایمنی و کنترل خطا است.

مزایای شبکه‌های عصبی مصنوعی

یکی از مزایای شبکه‌های عصبی توانایی مدل‌سازی روابط پیچیده و غیرخطی است.

این مدل‌ها می‌توانند در بسیاری از وظایف، ویژگی‌های مورد نیاز را از داده بیاموزند.

همچنین شبکه‌های عصبی برای پردازش داده‌های غیرساخت‌یافته مانند متن، تصویر و صوت مناسب‌اند.

با این حال، مزیت یک شبکهٔ عصبی به نوع مسئله، داده، معماری و روش ارزیابی وابسته است.

در برخی مسائل، روش‌های ساده‌تر یادگیری ماشین می‌توانند عملکرد مشابه یا حتی بهتری داشته باشند.

محدودیت‌های شبکه‌های عصبی مصنوعی

شبکه‌های عصبی با وجود توانایی‌های گسترده محدودیت‌هایی دارند.

از جمله:

  • نیاز احتمالی به داده‌های فراوان؛
  • هزینهٔ محاسباتی آموزش؛
  • خطر بیش‌برازش؛
  • دشواری توضیح برخی تصمیم‌ها؛
  • حساسیت به کیفیت داده؛
  • امکان سوگیری؛
  • آسیب‌پذیری در برابر برخی حملات؛
  • و کاهش عملکرد در شرایط متفاوت با داده‌های آموزشی.

این محدودیت‌ها به‌ویژه در کاربردهای حساس اهمیت دارند.

مسئلهٔ جعبهٔ سیاه

برخی شبکه‌های عصبی دارای تعداد بسیار زیادی پارامتر هستند.

در چنین مدل‌هایی، توضیح دقیق اینکه چرا یک ورودی به خروجی مشخصی منجر شده ممکن است دشوار باشد.

این مسئله معمولاً با اصطلاح جعبهٔ سیاه توصیف می‌شود.

با این حال، جعبهٔ سیاه بودن به معنای غیرممکن‌بودن همهٔ انواع تحلیل نیست.

پژوهشگران روش‌هایی برای بررسی حساسیت مدل، تحلیل ویژگی‌ها و مطالعهٔ بازنمایی‌های داخلی توسعه داده‌اند.

هوش مصنوعی توضیح‌پذیر

هوش مصنوعی توضیح‌پذیر (Explainable AI) حوزه‌ای است که به بررسی روش‌های توضیح یا تفسیر رفتار مدل‌های هوش مصنوعی می‌پردازد.

در شبکه‌های عصبی، این روش‌ها می‌توانند شامل تحلیل اهمیت ویژگی‌ها، بررسی فعال‌سازی‌ها و مطالعهٔ رفتار مدل در برابر تغییر ورودی باشند.

توضیح‌پذیری در کاربردهای پزشکی، مالی و اداری اهمیت ویژه‌ای دارد.

با این حال، توضیح تولیدشده برای رفتار مدل باید از نظر اعتبار و محدودیت‌های خود نیز بررسی شود.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم شبکه‌های عصبی مصنوعی است.

اگر داده‌های آموزشی دارای عدم توازن یا منعکس‌کنندهٔ تبعیض‌های تاریخی باشند، مدل ممکن است الگوهای نامطلوبی را بیاموزد.

برای مثال، یک سامانهٔ تشخیص چهره ممکن است برای گروه‌های جمعیتی مختلف نرخ خطای متفاوتی داشته باشد.

بنابراین ارزیابی مدل باید فراتر از دقت کلی باشد و عملکرد آن در شرایط و گروه‌های مختلف نیز بررسی شود.

حریم خصوصی

آموزش شبکه‌های عصبی گاهی به استفاده از مجموعه‌های بزرگ داده نیاز دارد.

این داده‌ها ممکن است شامل اطلاعات شخصی باشند.

در چنین شرایطی، پرسش‌هایی دربارهٔ رضایت، امنیت، نگهداری داده و امکان افشای اطلاعات مطرح می‌شود.

روش‌هایی مانند حریم خصوصی تفاضلی و یادگیری فدرال برای مدیریت برخی خطرهای مربوط به داده مورد پژوهش قرار گرفته‌اند.

با این حال، هیچ روش واحدی به‌تنهایی همهٔ خطرهای حریم خصوصی را از میان نمی‌برد.

حملات خصمانه

حملات خصمانه (Adversarial Attacks) به تلاش‌هایی گفته می‌شود که با تغییر طراحی‌شدهٔ ورودی، مدل را به خروجی نامطلوب یا نادرست سوق می‌دهند.

در برخی شبکه‌های تشخیص تصویر، تغییراتی کوچک در دادهٔ ورودی می‌توانند موجب تغییر طبقه‌بندی شوند.

این مسئله در کاربردهای امنیتی و سامانه‌های حساس اهمیت دارد.

توهم هوش مصنوعی

توهم هوش مصنوعی بیشتر در ارتباط با سامانه‌های مولد، به‌ویژه مدل‌های زبانی، مطرح می‌شود.

در این وضعیت، مدل ممکن است محتوایی روان و ظاهراً معتبر تولید کند که از نظر واقعی نادرست باشد.

برای مثال، یک مدل زبانی ممکن است عنوان کتاب یا منبعی را تولید کند که وجود خارجی ندارد.

این پدیده را نباید با همهٔ انواع خطای شبکه‌های عصبی یکسان دانست.

خطای طبقه‌بندی تصویر و تولید منبع ساختگی در یک مدل زبانی، دو نوع متفاوت از خطا هستند.

شبکهٔ عصبی مصنوعی و مغز انسان

یکی از پرسش‌های رایج دربارهٔ شبکه‌های عصبی مصنوعی، میزان شباهت آنها به مغز انسان است.

شبکه‌های عصبی مصنوعی در آغاز از برخی ویژگی‌های نورون‌ها و ارتباطات عصبی الهام گرفتند.

اما نورون مصنوعی معمولاً یک واحد ریاضی بسیار ساده‌تر از نورون زیستی است.

نورون‌های زیستی دارای فرایندهای پیچیدهٔ الکتروشیمیایی هستند و در شبکه‌هایی با ساختار و پویایی بسیار پیچیده فعالیت می‌کنند.

در مقابل، بسیاری از شبکه‌های عصبی مصنوعی بر عملیات ماتریسی، توابع ریاضی و روش‌های بهینه‌سازی استوارند.

بنابراین شباهت اصطلاحی یا ساختاری میان این دو به معنای یکسان‌بودن سازوکار آنها نیست.

آیا شبکهٔ عصبی مصنوعی مانند انسان فکر می‌کند؟

شبکه‌های عصبی مصنوعی می‌توانند در برخی وظایف عملکردی مشابه یا بهتر از انسان داشته باشند.

برای مثال، یک شبکه ممکن است در طبقه‌بندی نوع مشخصی از تصویر به دقت بالایی برسد.

اما موفقیت در یک وظیفه به‌تنهایی ثابت نمی‌کند که شبکه دارای تجربهٔ ذهنی، آگاهی یا فهم انسانی است.

پرسش دربارهٔ رابطهٔ محاسبات، هوش و آگاهی از موضوعات مورد بحث در فلسفهٔ ذهن و علوم شناختی است.

در نتیجه، باید میان توانایی محاسباتی قابل اندازه‌گیری و ادعاهای فلسفی دربارهٔ آگاهی تمایز گذاشت.

شبکه‌های عصبی و علیت

شبکه‌های عصبی معمولاً روابط آماری موجود در داده را می‌آموزند.

اما وجود همبستگی میان دو متغیر به‌تنهایی اثبات نمی‌کند که یکی علت دیگری است.

برای مثال، مدلی ممکن است از یک ویژگی برای پیش‌بینی استفاده کند، بدون آن‌که آن ویژگی علت مستقیم پدیدهٔ مورد نظر باشد.

این تمایز در پزشکی، اقتصاد و علوم اجتماعی اهمیت ویژه‌ای دارد.

شبکه‌های عصبی و تصمیم‌گیری انسانی

استفاده از شبکه‌های عصبی در تصمیم‌گیری می‌تواند به پردازش سریع داده‌ها کمک کند.

با این حال، تصمیم‌های دارای پیامد حقوقی، اقتصادی یا اجتماعی مهم نیازمند ارزیابی دقیق هستند.

در چنین کاربردهایی باید مشخص شود:

  • مدل با چه داده‌هایی آموزش دیده است؛
  • نرخ خطای آن چقدر است؛
  • عملکرد آن برای گروه‌های مختلف چگونه است؛
  • آیا خروجی قابل بررسی است؛
  • و چه نهادی مسئول پیامدهای تصمیم است.

شبکهٔ عصبی نباید صرفاً به دلیل پیچیدگی یا عملکرد آماری مناسب، مرجع غیرقابل اعتراض تلقی شود.

شبکه‌های عصبی و تمرکز قدرت فناوری

توسعهٔ برخی شبکه‌های عصبی بسیار بزرگ به منابع محاسباتی و سرمایهٔ قابل توجه نیاز دارد.

این مسئله می‌تواند توسعهٔ مدل‌های پیشرفته را در تعداد محدودی از شرکت‌ها، دولت‌ها و مؤسسات پژوهشی متمرکز کند.

در مقابل، انتشار پژوهش‌های علمی، نرم‌افزارهای آزاد و مدل‌های دارای وزن‌های در دسترس می‌تواند مشارکت گروه‌های بیشتری را ممکن سازد.

این موضوع در مباحث مربوط به رقابت، دسترسی به فناوری و حکمرانی هوش مصنوعی اهمیت دارد.

شبکه‌های عصبی و جامعه

شبکه‌های عصبی مصنوعی در سامانه‌های توصیه‌گر، موتورهای جست‌وجو، خدمات مالی، پزشکی و تولید محتوا نقش دارند.

گسترش این فناوری بر شیوهٔ تولید، توزیع و تحلیل اطلاعات تأثیر گذاشته است.

در عین حال، استفاده از شبکه‌های عصبی در نظارت، رتبه‌بندی افراد یا تصمیم‌گیری خودکار می‌تواند پرسش‌هایی دربارهٔ آزادی‌های مدنی، شفافیت و پاسخگویی ایجاد کند.

ارزیابی پیامدهای اجتماعی این فناوری باید بر اساس نوع کاربرد و شواهد مربوط به همان سامانه انجام شود.

شبکه‌های عصبی و زبان فارسی

شبکه‌های عصبی در توسعهٔ سامانه‌های پردازش زبان فارسی کاربرد دارند.

از جمله کاربردهای آنها می‌توان به تحلیل متن، ترجمه، تشخیص گفتار، طبقه‌بندی اسناد و تولید زبان اشاره کرد.

کیفیت این سامانه‌ها به حجم، تنوع و اعتبار داده‌های فارسی وابسته است.

کمبود داده برای برخی گویش‌ها، گونه‌های زبانی یا موضوعات تخصصی می‌تواند بر عملکرد مدل تأثیر بگذارد.

مدل‌های ترنسفورمری فارسی مانند ParsBERT نمونه‌ای از پژوهش‌های مبتنی بر شبکه‌های عصبی برای پردازش زبان فارسی هستند.[۷]

شبکه‌های عصبی و ایران

پژوهش و کاربرد شبکه‌های عصبی در ایران در حوزه‌هایی مانند پردازش زبان فارسی، تحلیل تصاویر، پزشکی، صنعت و علوم داده انجام شده است.

با این حال، ارزیابی میزان توسعه یا کاربرد یک فناوری در کشور نیازمند آمار و منابع مشخص است.

همچنین استفاده از شبکه‌های عصبی در سامانه‌های نظارتی، تشخیص چهره یا پردازش اطلاعات شهروندان، در صورت تأثیرگذاری بر حقوق افراد، ضرورت شفافیت و نظارت مستقل را مطرح می‌کند.

هر ادعای مشخص دربارهٔ کاربرد چنین سامانه‌هایی توسط نهادهای حکومتی باید با منابع معتبر و قابل راستی‌آزمایی پشتیبانی شود.

آیندهٔ شبکه‌های عصبی مصنوعی

پژوهش دربارهٔ شبکه‌های عصبی در زمینه‌های متعددی ادامه دارد.

از جمله:

  • افزایش کارایی محاسباتی؛
  • کاهش نیاز به داده؛
  • بهبود تعمیم؛
  • توسعهٔ معماری‌های جدید؛
  • یادگیری چندوجهی؛
  • تفسیرپذیری؛
  • ایمنی؛
  • کاهش مصرف انرژی؛
  • و ترکیب روش‌های یادگیری با استدلال و دانش ساختاریافته.

یکی از پرسش‌های مهم این است که چگونه می‌توان شبکه‌هایی توسعه داد که در کنار توانایی یادگیری الگوهای پیچیده، از قابلیت اعتماد، شفافیت و پایداری بیشتری برخوردار باشند.

تفاوت شبکهٔ عصبی مصنوعی با ترنسفورمر

شبکهٔ عصبی مصنوعی مفهومی گسترده‌تر از ترنسفورمر است.

ترنسفورمر یکی از معماری‌های شبکهٔ عصبی محسوب می‌شود.

شبکه‌های پیچشی، بازگشتی، پیش‌خور و گرافی نیز از خانواده‌های دیگر شبکه‌های عصبی هستند.

بنابراین هر ترنسفورمر متعارف نوعی شبکهٔ عصبی مصنوعی است، اما همهٔ شبکه‌های عصبی ترنسفورمر نیستند.

تفاوت شبکهٔ عصبی مصنوعی با یادگیری عمیق

شبکهٔ عصبی مصنوعی به نوعی مدل محاسباتی اشاره دارد.

یادگیری عمیق به خانواده‌ای از روش‌های یادگیری اشاره می‌کند که عمدتاً از شبکه‌های عصبی چندلایه استفاده می‌کنند.

یک شبکهٔ عصبی ساده لزوماً عمیق نیست.

در مقابل، بیشتر سامانه‌های یادگیری عمیق معاصر بر شبکه‌های عصبی مصنوعی استوارند.

جمع‌بندی

شبکهٔ عصبی مصنوعی یکی از خانواده‌های بنیادی مدل‌های یادگیری ماشین است که از واحدهای محاسباتی به‌هم‌پیوسته و پارامترهای قابل تنظیم برای پردازش داده و یادگیری الگوها استفاده می‌کند.

ریشه‌های نظری آن به پژوهش‌های میانهٔ سدهٔ بیستم بازمی‌گردد. مدل مک‌کالاک و پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در سال ۱۹۵۸ و گسترش روش‌های آموزش شبکه‌های چندلایه در دههٔ ۱۹۸۰ از مراحل مهم تاریخی آن بودند.[۱][۳][۴]

از دههٔ ۲۰۱۰، پیشرفت در داده، سخت‌افزار و روش‌های آموزش موجب گسترش کاربرد شبکه‌های عصبی عمیق در پردازش تصویر، گفتار، زبان و دیگر حوزه‌ها شد.

امروزه معماری‌هایی مانند شبکه‌های پیچشی، بازگشتی، گرافی و ترنسفورمرها در طیف گسترده‌ای از سامانه‌های هوش مصنوعی به کار می‌روند.

با این حال، شبکه‌های عصبی دارای محدودیت‌هایی مانند وابستگی به داده، هزینهٔ محاسباتی، خطر بیش‌برازش، سوگیری الگوریتمی، دشواری توضیح برخی تصمیم‌ها و آسیب‌پذیری امنیتی هستند.

از این رو شبکهٔ عصبی مصنوعی را باید یک مدل محاسباتی قدرتمند برای یادگیری و پردازش داده دانست، نه بازسازی کامل مغز انسان یا سامانه‌ای که صحت و قابلیت اعتماد خروجی‌های آن تضمین شده باشد.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020. متن مقاله
  • Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016. متن کتاب
  • Goodfellow, Ian, et al. “Generative Adversarial Nets.” Advances in Neural Information Processing Systems 27 (2014). متن مقاله
  • Hebb, Donald O. The Organization of Behavior: A Neuropsychological Theory. New York: Wiley, 1949.
  • LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444. متن مقاله
  • McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” The Bulletin of Mathematical Biophysics 5 (1943): 115–133. متن مقاله
  • Minsky, Marvin, and Seymour A. Papert. Perceptrons: An Introduction to Computational Geometry. Cambridge, MA: MIT Press, 1969.
  • Rosenblatt, Frank. “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.” Psychological Review 65, no. 6 (1958): 386–408. متن مقاله
  • Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” Nature 323 (1986): 533–536. متن مقاله
  • Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله


```