شبکه عصبی مصنوعی
| شناسنامه | |
|---|---|
| نامهای دیگر | شبکهٔ عصبی، شبکهٔ نورونی مصنوعی، ANN |
| حوزه | هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، علوم رایانه، علوم شناختی |
| خاستگاه | منطق ریاضی، علوم اعصاب، علوم رایانه، آمار و پژوهشهای اولیهٔ هوش مصنوعی |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | نورون مصنوعی، وزن، سوگیری، تابع فعالسازی، لایهٔ ورودی، لایهٔ پنهان، لایهٔ خروجی، تابع زیان، گرادیان نزولی، پسانتشار، تعمیم |
| جریانهای مرتبط | اتصالگرایی، یادگیری بازنمایی، یادگیری عمیق، یادگیری نظارتشده، یادگیری خودنظارتشده، هوش مصنوعی مولد |
| تأثیرپذیرفته از | عصبشناسی، منطق، آمار، نظریهٔ یادگیری، بهینهسازی و علوم شناختی |
| تأثیرگذار بر | یادگیری عمیق، ترنسفورمر، مدل زبانی بزرگ، هوش مصنوعی مولد، بینایی ماشین، تشخیص گفتار و رباتیک |
| نقد و ارزیابی | |
شبکهٔ عصبی مصنوعی (به انگلیسی: Artificial Neural Network و به اختصار ANN) نوعی مدل محاسباتی در حوزهٔ هوش مصنوعی و یادگیری ماشین است که از مجموعهای از واحدهای پردازشی بههمپیوسته، موسوم به نورونهای مصنوعی، تشکیل میشود. این واحدها با استفاده از روابط ریاضی، دادههای ورودی را پردازش میکنند و در بسیاری از انواع شبکههای عصبی، با تنظیم پارامترهایی مانند وزنها و سوگیریها، الگوهای موجود در داده را میآموزند.
شبکههای عصبی مصنوعی در آغاز با الهام از برخی ویژگیهای دستگاه عصبی موجودات زنده توسعه یافتند؛ با این حال، شبکهٔ عصبی مصنوعی بازسازی دقیق مغز انسان نیست، بلکه مدلی ریاضی و محاسباتی است که میتواند برای پیشبینی، طبقهبندی، تشخیص الگو، پردازش زبان، تحلیل تصویر و تولید داده استفاده شود.[۱]
تاریخ شبکههای عصبی مصنوعی به پژوهشهای میانهٔ سدهٔ بیستم بازمیگردد. مدل منطقی وارن مککالاک و والتر پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در دههٔ ۱۹۵۰ و گسترش روشهای آموزش شبکههای چندلایه در دههٔ ۱۹۸۰ از نقاط عطف این حوزه به شمار میروند.
از دههٔ ۲۰۱۰، پیشرفت در قدرت محاسباتی، دسترسی به دادههای بزرگ و توسعهٔ روشهای آموزش، شبکههای عصبی را به یکی از فناوریهای بنیادی هوش مصنوعی معاصر تبدیل کرد. بسیاری از سامانههای یادگیری عمیق، ترنسفورمری و هوش مصنوعی مولد بر انواع شبکههای عصبی مصنوعی استوارند.[۲]
تعریف شبکهٔ عصبی مصنوعی
شبکهٔ عصبی مصنوعی را میتوان مجموعهای از واحدهای محاسباتی تعریف کرد که از طریق ارتباطات دارای وزن، اطلاعات را دریافت، تبدیل و منتقل میکنند.
در یک شبکهٔ معمولی، داده وارد لایهٔ نخست میشود و پس از عبور از یک یا چند لایهٔ پردازشی، خروجی تولید میشود.
در جریان آموزش، پارامترهای شبکه بهگونهای تنظیم میشوند که عملکرد آن در یک وظیفهٔ مشخص بهبود یابد.
برای مثال، اگر شبکه برای تشخیص تصاویر گربه و سگ آموزش داده شود، ابتدا نمونههایی از تصاویر را دریافت میکند. سپس بر اساس خروجیهای خود و اطلاعات آموزشی، پارامترهایش تنظیم میشوند تا احتمال تشخیص صحیح تصاویر جدید افزایش یابد.
این فرایند به معنای آگاهی یا فهم انسانی شبکه نیست؛ بلکه نوعی یادگیری محاسباتی است.
خاستگاه نظری
شبکههای عصبی مصنوعی از پیوند چند حوزهٔ علمی پدید آمدند.
یکی از این حوزهها عصبشناسی بود که ساختار و عملکرد نورونهای زیستی را بررسی میکرد.
حوزهٔ دیگر منطق ریاضی بود که امکان توصیف روابط و عملیات منطقی را فراهم میساخت.
همچنین آمار، نظریهٔ احتمال، علوم شناختی و علوم رایانه در توسعهٔ این مدلها نقش داشتند.
پژوهشگران اولیه تلاش کردند نشان دهند که شبکههایی از واحدهای ساده میتوانند در ترکیب با یکدیگر رفتارهای محاسباتی پیچیدهتری ایجاد کنند.
تاریخچه
مدل مککالاک و پیتس؛ ۱۹۴۳
در سال ۱۹۴۳، وارن مککالاک، عصبشناس آمریکایی، و والتر پیتس، منطقدان، مقالهای با عنوان A Logical Calculus of the Ideas Immanent in Nervous Activity منتشر کردند.
این مقاله یکی از آثار بنیادی در تاریخ مدلسازی ریاضی شبکههای عصبی محسوب میشود.
مککالاک و پیتس مدلی از واحدهای عصبی ارائه کردند که رفتار آنها را میشد با منطق گزارهای توصیف کرد.
در این مدل، واحدهای عصبی بر اساس شرایط ورودی و آستانهٔ فعالسازی، خروجیهایی از نوع فعال یا غیرفعال تولید میکردند.
پژوهش آنها نشان داد که شبکههایی از واحدهای ساده میتوانند برخی عملیات منطقی را بازنمایی کنند.[۱]
این مدل هنوز از بسیاری از قابلیتهای یادگیری شبکههای عصبی جدید برخوردار نبود، اما مبنایی نظری برای پژوهشهای بعدی فراهم کرد.
نظریهٔ یادگیری هب؛ ۱۹۴۹
دونالد هب، روانشناس کانادایی، در کتاب The Organization of Behavior که در سال ۱۹۴۹ منتشر شد، نظریهای دربارهٔ تغییر قدرت ارتباطات عصبی در فرایند یادگیری مطرح کرد.
ایدهٔ بنیادی یادگیری هبی آن است که فعالیت مرتبط واحدهای عصبی میتواند با تقویت ارتباط میان آنها همراه باشد.
این دیدگاه بر پژوهشهای بعدی دربارهٔ یادگیری در شبکههای عصبی و مدلهای اتصالگرا تأثیر گذاشت.
البته روشهای آموزش شبکههای عصبی معاصر لزوماً بر قواعد یادگیری هبی استوار نیستند.
پرسپترون فرانک روزنبلات؛ ۱۹۵۸
فرانک روزنبلات در سال ۱۹۵۸ مقالهٔ The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain را منتشر کرد.
پرسپترون یکی از مدلهای مهم اولیهٔ یادگیری در شبکههای عصبی بود.[۳]
پرسپترون میتوانست با تنظیم وزنهای خود برخی مسائل طبقهبندی را یاد بگیرد.
برای مثال، یک پرسپترون ساده میتواند یاد بگیرد که نمونهها را بر اساس ترکیبی خطی از ویژگیهای ورودی به دو گروه تقسیم کند.
این مدل در تاریخ هوش مصنوعی اهمیت زیادی داشت، زیرا نشان میداد میتوان بخشی از رفتار یک سامانهٔ محاسباتی را از طریق تجربه و تنظیم پارامترها شکل داد.
محدودیتهای پرسپترون
پرسپترون تکلایه دارای محدودیتهای ریاضی مشخصی بود.
این مدل نمیتوانست مسائلی را که از نظر خطی جداییپذیر نیستند، مانند مسئلهٔ XOR، بهدرستی حل کند.
ماروین مینسکی و سیمور پیپرت در کتاب Perceptrons که در سال ۱۹۶۹ منتشر شد، محدودیتهای ریاضی برخی از شبکههای پرسپترونی را بررسی کردند.
این نقدها بر مسیر پژوهش شبکههای عصبی تأثیر گذاشتند.
با این حال، محدودیت پرسپترون تکلایه را نباید به همهٔ شبکههای عصبی چندلایه تعمیم داد.
گسترش شبکههای چندلایه
شبکههای چندلایه امکان ترکیب تبدیلهای غیرخطی را فراهم کردند.
برخلاف پرسپترون تکلایه، یک شبکهٔ چندلایه با ساختار و پارامترهای مناسب میتواند روابط پیچیدهتری را بازنمایی کند.
اما آموزش مؤثر این شبکهها به روشهایی نیاز داشت که بتوانند سهم پارامترهای مختلف را در خطای خروجی محاسبه کنند.
این مسئله یکی از موضوعات مهم پژوهش در دهههای ۱۹۷۰ و ۱۹۸۰ بود.
پسانتشار خطا؛ ۱۹۸۶
در سال ۱۹۸۶، دیوید روملهارت، جفری هینتون و رونالد ویلیامز مقالهٔ Learning Representations by Back-Propagating Errors را در نشریهٔ Nature منتشر کردند.
این مقاله روش آموزش شبکههای چندلایه از طریق محاسبهٔ گرادیان و اصلاح وزنها را توضیح داد و به گسترش استفاده از پسانتشار در شبکههای عصبی کمک کرد.[۴]
البته ریشههای ریاضی و کاربردهای پیشین روشهای مرتبط با پسانتشار به قبل از سال ۱۹۸۶ بازمیگردد. اهمیت مقالهٔ روملهارت و همکاران در معرفی اثرگذار این روش برای یادگیری بازنماییها در شبکههای چندلایه بود.
گسترش شبکههای عصبی در دههٔ ۱۹۹۰
در دههٔ ۱۹۹۰، پژوهش دربارهٔ شبکههای عصبی در حوزههایی مانند تشخیص دستخط، پردازش تصویر و تشخیص گفتار ادامه یافت.
یان لکون و همکاران از شبکههای عصبی پیچشی برای شناسایی نویسهها و ارقام دستنویس استفاده کردند.
این پژوهشها نشان دادند که شبکههای عصبی میتوانند در مسائل واقعی تشخیص الگو کاربرد داشته باشند.
تحول یادگیری عمیق در دههٔ ۲۰۱۰
از دههٔ ۲۰۱۰، شبکههای عصبی عمیق در بسیاری از وظایف پردازش تصویر، گفتار و زبان پیشرفت چشمگیری نشان دادند.
افزایش توان پردازندههای گرافیکی، دسترسی به دادههای بزرگ و بهبود روشهای آموزش از عوامل مهم این تحول بودند.
مقالهٔ مروری یان لکون، یوشوا بنجیو و جفری هینتون در سال ۲۰۱۵، نقش شبکههای چندلایه را در یادگیری بازنماییهای پیچیده و پیشرفت یادگیری عمیق توضیح داد.[۲]
ظهور ترنسفورمر؛ ۲۰۱۷
در سال ۲۰۱۷، معماری ترنسفورمر در مقالهٔ Attention Is All You Need معرفی شد.
این معماری از سازوکار توجه برای پردازش روابط میان عناصر دنباله استفاده میکند.
ترنسفورمر یکی از انواع معماری شبکهٔ عصبی مصنوعی است و بعدها پایهٔ بسیاری از مدلهای زبانی بزرگ شد.[۵]
ساختار شبکهٔ عصبی مصنوعی
شبکههای عصبی معمولاً از واحدهای محاسباتی و ارتباطات میان آنها تشکیل میشوند.
در شبکههای پیشخور ساده، این واحدها در لایههایی سازماندهی میشوند.
سه نوع اصلی لایه عبارتاند از:
- لایهٔ ورودی
- لایههای پنهان
- لایهٔ خروجی
البته همهٔ معماریهای شبکهٔ عصبی به این ساختار ساده محدود نیستند.
شبکههای بازگشتی، پیچشی، ترنسفورمری و گرافی ساختارهای متفاوتی دارند.
نورون مصنوعی
نورون مصنوعی واحدی محاسباتی است که مجموعهای از ورودیها را دریافت میکند و بر اساس وزنها، سوگیری و تابع فعالسازی، خروجی تولید میکند.
در یک نورون ساده، ورودیها با وزنهای مربوط به خود ضرب میشوند.
سپس حاصلجمع آنها با مقدار سوگیری ترکیب و به تابع فعالسازی داده میشود.
رابطهٔ ریاضی یک نورون مصنوعی را میتوان چنین نوشت:
y = f(w₁x₁ + w₂x₂ + ... + wₙxₙ + b)
در این رابطه:
- x نشاندهندهٔ ورودیهاست.
- w نشاندهندهٔ وزنهاست.
- b مقدار سوگیری است.
- f تابع فعالسازی است.
- y خروجی نورون است.
در جریان آموزش، وزنها و سوگیریها میتوانند تغییر کنند.
وزن در شبکهٔ عصبی
وزن (Weight) پارامتری عددی است که در محاسبهٔ تأثیر یک ورودی بر خروجی استفاده میشود.
در یک شبکهٔ عصبی، ارتباطات مختلف میتوانند وزنهای متفاوتی داشته باشند.
وزنها معمولاً در فرایند آموزش تنظیم میشوند.
در نتیجه، رفتار مدل پس از آموزش به مقادیر آموختهشدهٔ این پارامترها وابسته است.
سوگیری در نورون مصنوعی
سوگیری (Bias) در تعریف ریاضی نورون مصنوعی، پارامتری افزودهشونده است که به مدل انعطاف بیشتری میدهد.
سوگیری به مدل امکان میدهد مقدار خروجی تبدیل خطی را مستقل از ورودیها جابهجا کند.
این مفهوم با سوگیری الگوریتمی به معنای تبعیض یا عدم توازن در خروجی سامانه متفاوت است.
اشتراک نام این دو اصطلاح نباید موجب یکسانانگاری آنها شود.
تابع فعالسازی
تابع فعالسازی (Activation Function) تابعی است که خروجی محاسبات یک نورون یا لایه را تبدیل میکند.
در بسیاری از شبکهها، تابع فعالسازی غیرخطی است.
غیرخطیبودن اهمیت زیادی دارد، زیرا ترکیب چندین تبدیل خطی بدون تابع غیرخطی همچنان معادل یک تبدیل خطی خواهد بود.
توابع فعالسازی شناختهشده عبارتاند از:
- Sigmoid
- Tanh
- ReLU
- GELU
- Softmax
البته Softmax معمولاً برای تبدیل مجموعهای از امتیازها به توزیع احتمال، بهویژه در خروجی برخی مدلهای طبقهبندی، استفاده میشود.
تابع ReLU
تابع ReLU یا Rectified Linear Unit یکی از توابع فعالسازی پرکاربرد در شبکههای عصبی است.
فرمول آن چنین است:
f(x) = max(0, x)
اگر مقدار ورودی منفی باشد، خروجی صفر است.
اگر مقدار ورودی مثبت باشد، خروجی همان مقدار ورودی خواهد بود.
سادگی محاسباتی و برخی ویژگیهای مناسب در فرایند آموزش از دلایل استفادهٔ گسترده از این تابع بودهاند.
لایهٔ ورودی
لایهٔ ورودی بخشی از شبکه است که دادههای اولیه را دریافت میکند.
برای مثال، در یک مدل سادهٔ پیشبینی قیمت خانه، ورودیها ممکن است شامل مساحت، تعداد اتاقها و سن ساختمان باشند.
در شبکههای پردازش تصویر، ورودی ممکن است آرایهای از مقادیر پیکسلها باشد.
در مدلهای زبانی، ورودی معمولاً پس از توکنسازی به بازنماییهای عددی تبدیل میشود.
لایهٔ پنهان
لایهٔ پنهان بخشی از شبکه است که میان ورودی و خروجی قرار میگیرد.
این لایهها داده را به بازنماییهای میانی تبدیل میکنند.
در شبکههای عمیق، چندین لایهٔ پنهان میتوانند تبدیلهای پیچیده و سلسلهمراتبی را انجام دهند.
برای مثال، در پردازش تصویر، لایههای مختلف ممکن است الگوهای ساده و سپس ساختارهای پیچیدهتر را بازنمایی کنند.
لایهٔ خروجی
لایهٔ خروجی نتیجهٔ نهایی محاسبات شبکه را تولید میکند.
نوع خروجی به وظیفهٔ شبکه بستگی دارد.
در طبقهبندی، خروجی ممکن است مجموعهای از امتیازها یا احتمالهای مربوط به دستههای مختلف باشد.
در رگرسیون، خروجی ممکن است یک مقدار عددی باشد.
در مدلهای مولد، خروجی میتواند توزیع احتمال توکن بعدی یا نوع دیگری از بازنمایی مورد نیاز برای تولید داده باشد.
شبکهٔ پیشخور
شبکهٔ عصبی پیشخور (Feedforward Neural Network) یکی از سادهترین خانوادههای شبکههای عصبی است.
در این شبکه، اطلاعات در مسیر محاسباتی از ورودی به خروجی حرکت میکند و حلقهٔ بازگشتی وجود ندارد.
پرسپترون چندلایه یا MLP یکی از نمونههای شناختهشدهٔ این خانواده است.
شبکههای پیشخور در طبقهبندی، رگرسیون و بهعنوان اجزای معماریهای بزرگتر استفاده میشوند.
پرسپترون چندلایه
پرسپترون چندلایه (Multilayer Perceptron یا MLP) شبکهای پیشخور است که معمولاً از چندین لایهٔ دارای پارامترهای آموختنی و توابع فعالسازی تشکیل میشود.
این شبکه میتواند روابط غیرخطی میان ورودی و خروجی را مدلسازی کند.
MLPها از ساختارهای بنیادی یادگیری ماشین هستند و در بسیاری از معماریهای پیچیدهتر نیز بهعنوان جزء داخلی استفاده میشوند.
آموزش شبکهٔ عصبی
آموزش فرایندی است که طی آن پارامترهای شبکه بر اساس داده و هدف یادگیری تنظیم میشوند.
در یک مسئلهٔ یادگیری نظارتشده، مدل ورودی را دریافت میکند و خروجی تولید میکند.
سپس خروجی مدل با مقدار هدف مقایسه میشود.
اختلاف میان آنها با تابع زیان اندازهگیری میشود.
الگوریتم بهینهسازی تلاش میکند پارامترهای مدل را بهگونهای تغییر دهد که زیان کاهش یابد.
تابع زیان
تابع زیان (Loss Function) معیاری ریاضی برای سنجش اختلاف میان خروجی مدل و هدف آموزشی است.
برای مثال، در پیشبینی قیمت خانه، تابع زیان میتواند اختلاف میان قیمت پیشبینیشده و قیمت واقعی را اندازهگیری کند.
در مسائل طبقهبندی، تابع زیان آنتروپی متقاطع از گزینههای رایج است.
انتخاب تابع زیان بر رفتار مدل در فرایند آموزش تأثیر دارد.
گرادیان نزولی
گرادیان نزولی (Gradient Descent) یکی از روشهای بهینهسازی مورد استفاده در آموزش شبکههای عصبی است.
این روش بر محاسبهٔ مشتق تابع زیان نسبت به پارامترها استوار است.
گرادیان نشان میدهد تغییر پارامترها در جهتهای مختلف چه اثری بر مقدار زیان دارد.
الگوریتم با استفاده از این اطلاعات، پارامترها را در جهت کاهش زیان تغییر میدهد.
نسخههای مختلفی از این روش، از جمله گرادیان نزولی تصادفی و بهینهساز Adam، در آموزش شبکههای عصبی کاربرد دارند.
پسانتشار خطا
پسانتشار (Backpropagation) روشی برای محاسبهٔ گرادیانهای تابع زیان نسبت به پارامترهای شبکه است.
این روش با استفاده از قاعدهٔ زنجیرهای مشتقگیری، تأثیر پارامترهای لایههای مختلف را بر خروجی محاسبه میکند.
پسانتشار بهتنهایی الگوریتم بهینهسازی نیست؛ بلکه گرادیانهای لازم برای روشهایی مانند گرادیان نزولی را فراهم میکند.
این تمایز در توضیح سازوکار آموزش شبکههای عصبی اهمیت دارد.[۴]
نرخ یادگیری
نرخ یادگیری (Learning Rate) ابرپارامتری است که اندازهٔ گام تغییر پارامترها را در بسیاری از روشهای بهینهسازی تعیین میکند.
اگر نرخ یادگیری بیش از اندازه بزرگ باشد، آموزش ممکن است ناپایدار شود.
اگر بیش از اندازه کوچک باشد، آموزش ممکن است بسیار کند پیش برود.
انتخاب نرخ یادگیری مناسب یکی از مسائل مهم در آموزش شبکههای عصبی است.
دورهٔ آموزش و دستهٔ داده
دورهٔ آموزش (Epoch) معمولاً به یک بار عبور کامل الگوریتم آموزش از مجموعهٔ دادهٔ آموزشی اشاره دارد.
دسته (Batch) زیرمجموعهای از نمونههای آموزشی است که در یک مرحلهٔ محاسباتی پردازش میشود.
اندازهٔ دسته میتواند بر مصرف حافظه، سرعت آموزش و رفتار بهینهسازی تأثیر بگذارد.
تعمیم
یکی از اهداف اصلی آموزش شبکهٔ عصبی تعمیم (Generalization) است.
مدل مطلوب باید بتواند الگوهایی را بیاموزد که در دادههای جدید نیز کاربرد داشته باشند.
عملکرد مناسب روی دادههای آموزشی بهتنهایی کافی نیست.
به همین دلیل، ارزیابی مدل معمولاً با استفاده از دادههایی انجام میشود که در آموزش مستقیم آن استفاده نشدهاند.
بیشبرازش
بیشبرازش (Overfitting) زمانی رخ میدهد که مدل بیش از اندازه با دادههای آموزشی، از جمله نویز یا ویژگیهای اتفاقی آنها، تطبیق پیدا کند.
در این وضعیت، مدل ممکن است روی دادههای آموزشی عملکرد بسیار خوبی داشته باشد اما روی دادههای جدید دچار خطا شود.
روشهایی مانند منظمسازی، افزایش داده، توقف زودهنگام و Dropout برای کاهش خطر بیشبرازش استفاده میشوند.
کمبرازش
کمبرازش (Underfitting) زمانی رخ میدهد که مدل نتواند ساختار اصلی داده را به اندازهٔ کافی بیاموزد.
این وضعیت ممکن است ناشی از ظرفیت ناکافی مدل، آموزش نامناسب یا انتخاب ویژگیهای نامناسب باشد.
در کمبرازش، مدل حتی روی دادههای آموزشی نیز ممکن است عملکرد ضعیفی داشته باشد.
منظمسازی
منظمسازی (Regularization) به مجموعهای از روشها گفته میشود که برای کنترل پیچیدگی مؤثر مدل و بهبود تعمیم استفاده میشوند.
این روشها میتوانند شامل جریمهکردن اندازهٔ وزنها، حذف تصادفی برخی فعالسازیها در زمان آموزش یا توقف آموزش بر اساس عملکرد اعتبارسنجی باشند.
هدف منظمسازی جلوگیری از وابستگی نامناسب مدل به جزئیات دادههای آموزشی است.
انواع شبکههای عصبی مصنوعی
شبکههای عصبی مصنوعی دارای معماریهای متنوعی هستند.
مهمترین خانوادهها شامل شبکههای پیشخور، پیچشی، بازگشتی، خودرمزگذار، مولد تخاصمی، گرافی و ترنسفورمری هستند.
هر معماری برای نوع خاصی از داده یا وظیفه مناسبتر است.
شبکهٔ عصبی پیچشی
شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) یکی از معماریهای مهم در پردازش تصویر است.
این شبکه از عملیات پیچش برای استخراج ویژگیهای محلی استفاده میکند.
شبکههای پیچشی در طبقهبندی تصاویر، تشخیص اشیا، تحلیل تصاویر پزشکی و پردازش ویدئو کاربرد داشتهاند.
پژوهشهای یان لکون و همکاران در توسعهٔ این معماری نقش مهمی داشتند.
شبکهٔ عصبی بازگشتی
شبکهٔ عصبی بازگشتی (Recurrent Neural Network یا RNN) برای پردازش دادههای دنبالهای طراحی شده است.
در این معماری، وضعیت محاسباتی مراحل پیشین میتواند بر پردازش مرحلهٔ بعد تأثیر بگذارد.
شبکههای بازگشتی در مدلسازی زبان، تشخیص گفتار و تحلیل سریهای زمانی استفاده شدهاند.
یکی از محدودیتهای آنها دشواری یادگیری برخی وابستگیهای بلندمدت است.
شبکهٔ LSTM
حافظهٔ طولانی کوتاهمدت (Long Short-Term Memory یا LSTM) نوعی شبکهٔ بازگشتی است.
این معماری برای بهبود یادگیری وابستگیهای بلندمدت در دادههای دنبالهای توسعه یافت.
LSTM از سازوکارهای دروازهای برای کنترل جریان اطلاعات استفاده میکند.
پیش از گسترش ترنسفورمرها، شبکههای LSTM در بسیاری از کاربردهای پردازش زبان و گفتار نقش مهمی داشتند.
شبکهٔ GRU
واحد بازگشتی دروازهدار (Gated Recurrent Unit یا GRU) یکی دیگر از گونههای شبکههای بازگشتی است.
این معماری از سازوکارهای دروازهای برای کنترل جریان اطلاعات استفاده میکند.
GRU در برخی کاربردها میتواند با ساختاری سادهتر از LSTM عملکرد مناسبی ارائه کند.
خودرمزگذار
خودرمزگذار (Autoencoder) نوعی شبکهٔ عصبی است که معمولاً برای یادگیری بازنمایی فشردهٔ داده آموزش داده میشود.
در ساختار رایج، شبکه از دو بخش تشکیل میشود:
- رمزگذار؛
- رمزگشا.
رمزگذار داده را به بازنمایی میانی تبدیل میکند.
رمزگشا تلاش میکند دادهٔ اولیه را از آن بازنمایی بازسازی کند.
خودرمزگذارها در کاهش ابعاد، یادگیری بازنمایی و برخی کاربردهای تشخیص ناهنجاری استفاده میشوند.
شبکهٔ مولد تخاصمی
شبکهٔ مولد تخاصمی (Generative Adversarial Network یا GAN) خانوادهای از مدلهای مولد است.
در ساختار کلاسیک GAN، دو شبکه با یکدیگر در فرایندی رقابتی آموزش میبینند.
شبکهٔ مولد تلاش میکند نمونههای مصنوعی تولید کند.
شبکهٔ تمایزدهنده تلاش میکند نمونههای واقعی را از نمونههای تولیدشده تشخیص دهد.
این معماری در سال ۲۰۱۴ توسط ایان گودفلو و همکاران معرفی شد.[۶]
GANها در تولید و ویرایش تصویر و برخی دیگر از کاربردهای مولد نقش داشتهاند.
شبکهٔ عصبی گرافی
شبکهٔ عصبی گرافی (Graph Neural Network یا GNN) خانوادهای از شبکههاست که برای پردازش دادههای دارای ساختار گراف استفاده میشود.
در یک گراف، داده از گرهها و ارتباطات میان آنها تشکیل شده است.
برای مثال، شبکههای اجتماعی، ساختار مولکولها و برخی شبکههای حملونقل را میتوان بهصورت گراف نمایش داد.
شبکههای عصبی گرافی میتوانند اطلاعات گرهها و ارتباطات آنها را در فرایند یادگیری ترکیب کنند.
شبکهٔ عصبی ترنسفورمری
ترنسفورمر یکی از معماریهای اثرگذار شبکهٔ عصبی مصنوعی است.
این معماری از سازوکار توجه برای مدلسازی روابط میان عناصر داده استفاده میکند.
برخلاف شبکههای بازگشتی سنتی، ترنسفورمر میتواند بخش بزرگی از محاسبات مربوط به موقعیتهای مختلف دنباله را در زمان آموزش بهصورت موازی انجام دهد.
ترنسفورمرها پایهٔ بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد معاصر هستند.[۵]
شبکههای عصبی و یادگیری عمیق
یادگیری عمیق عمدتاً بر شبکههای عصبی دارای چندین لایهٔ پردازشی استوار است.
در شبکههای عمیق، لایههای مختلف میتوانند بازنماییهایی با سطوح متفاوت انتزاع را بیاموزند.
برای مثال، در پردازش تصویر، شبکه ممکن است از ویژگیهای ساده مانند لبهها به بازنماییهای پیچیدهتر برسد.
با این حال، همهٔ شبکههای عصبی لزوماً عمیق نیستند.
یک پرسپترون ساده نیز نوعی مدل شبکهٔ عصبی است، اما معمولاً در دستهٔ شبکههای عمیق قرار نمیگیرد.
شبکههای عصبی و یادگیری ماشین
یادگیری ماشین حوزهای گستردهتر از شبکههای عصبی مصنوعی است.
الگوریتمهای یادگیری ماشین شامل روشهایی مانند رگرسیون، درخت تصمیم، جنگل تصادفی، ماشین بردار پشتیبان و خوشهبندی نیز میشوند.
شبکههای عصبی یکی از خانوادههای مهم مدلهای یادگیری ماشین هستند.
بنابراین همهٔ روشهای یادگیری ماشین مبتنی بر شبکهٔ عصبی نیستند.
شبکههای عصبی و هوش مصنوعی مولد
هوش مصنوعی مولد به سامانههایی اشاره دارد که میتوانند داده یا محتوای جدید تولید کنند.
بسیاری از مدلهای مولد معاصر از شبکههای عصبی مصنوعی استفاده میکنند.
این مدلها میتوانند برای تولید متن، تصویر، صوت، موسیقی، ویدئو یا کد آموزش داده شوند.
شبکههای مولد تخاصمی، خودرمزگذارهای متغیر، مدلهای انتشار و مدلهای زبانی ترنسفورمری از نمونههای مهم رویکردهای مولد هستند.
البته همهٔ شبکههای عصبی مولد نیستند.
شبکهای که فقط تصاویر را طبقهبندی میکند، ممکن است هیچ محتوای جدیدی تولید نکند.
شبکههای عصبی و مدلهای زبانی بزرگ
مدلهای زبانی بزرگ از مهمترین کاربردهای شبکههای عصبی معاصر هستند.
بسیاری از این مدلها از معماری ترنسفورمر استفاده میکنند.
مدل زبانی در فرایند آموزش، روابط آماری و ساختارهای موجود در دادههای زبانی را میآموزد.
در مدلهای خودرگرسیو، یکی از وظایف اصلی پیشبینی توکن بعدی بر اساس توکنهای پیشین است.
این فرایند به مدل امکان میدهد متن تولید کند، به پرسشها پاسخ دهد یا در وظایف مختلف پردازش زبان به کار رود.
شبکههای عصبی و پردازش زبان طبیعی
شبکههای عصبی در پردازش زبان طبیعی کاربرد گسترده دارند.
از جمله کاربردهای آنها میتوان به ترجمهٔ ماشینی، تحلیل احساسات، طبقهبندی متن، خلاصهسازی، پاسخ به پرسش و تولید زبان اشاره کرد.
شبکههای بازگشتی و سپس ترنسفورمرها در تحول این حوزه نقش مهمی داشتهاند.
شبکههای عصبی در بینایی ماشین
شبکههای عصبی در بینایی ماشین برای تحلیل تصاویر و ویدئو استفاده میشوند.
کاربردهای مهم آنها عبارتاند از:
- طبقهبندی تصویر؛
- تشخیص اشیا؛
- تقسیمبندی تصویر؛
- تشخیص چهره؛
- تحلیل تصاویر پزشکی؛
- و پردازش تصاویر ماهوارهای.
شبکههای پیچشی و ترنسفورمرهای بینایی از معماریهای مهم این حوزه هستند.
شبکههای عصبی در تشخیص گفتار
شبکههای عصبی میتوانند برای تبدیل سیگنال صوتی به متن آموزش داده شوند.
این فناوری در دستیارهای صوتی، زیرنویس خودکار، رونویسی جلسات و سامانههای دسترسپذیری کاربرد دارد.
مدلهای عصبی همچنین در تولید گفتار مصنوعی و پردازش ویژگیهای صوتی استفاده میشوند.
شبکههای عصبی در پزشکی
در پزشکی، شبکههای عصبی برای تحلیل تصاویر، پردازش پروندههای بالینی، پیشبینی برخی خطرهای سلامت و پژوهش دارویی استفاده شدهاند.
برای مثال، شبکهٔ عصبی میتواند برای شناسایی الگوهایی در تصاویر پزشکی آموزش داده شود.
با این حال، عملکرد مطلوب روی یک مجموعهٔ دادهٔ آزمایشی بهتنهایی برای اثبات ایمنی بالینی کافی نیست.
مدل باید در شرایط واقعی و روی جمعیت هدف ارزیابی شود.
همچنین تصمیمهای پزشکی نیازمند نظارت متخصصان و رعایت الزامات قانونی و حرفهای هستند.
شبکههای عصبی در صنعت
شبکههای عصبی در صنعت برای پیشبینی خرابی تجهیزات، کنترل کیفیت، تحلیل دادههای حسگر و بهینهسازی فرایندها استفاده میشوند.
برای مثال، یک شبکه میتواند بر اساس دادههای ثبتشده از دستگاهها، الگوهایی را شناسایی کند که با افزایش احتمال خرابی ارتباط دارند.
این کاربردها میتوانند به برنامهریزی نگهداری و کاهش توقفهای ناخواسته کمک کنند.
شبکههای عصبی در اقتصاد و امور مالی
شبکههای عصبی در تحلیل دادههای مالی، کشف تقلب، ارزیابی ریسک و پیشبینی به کار میروند.
با این حال، استفاده از مدلهای عصبی در تصمیمهایی مانند اعتبارسنجی میتواند مسائل مربوط به شفافیت، انصاف و حق اعتراض را مطرح کند.
عملکرد آماری مناسب یک مدل لزوماً به معنای عادلانهبودن همهٔ پیامدهای اجتماعی آن نیست.
شبکههای عصبی در کشاورزی
در کشاورزی، شبکههای عصبی میتوانند برای تحلیل تصاویر گیاهان، تشخیص بیماریها، پیشبینی محصول و مدیریت منابع استفاده شوند.
ترکیب تصاویر ماهوارهای، دادههای حسگرها و مدلهای یادگیری ماشین میتواند به تحلیل وضعیت زمین و محصولات کمک کند.
شبکههای عصبی در آموزش
شبکههای عصبی در سامانههای آموزشی تطبیقی، تحلیل دادههای آموزشی و تولید محتوای آموزشی کاربرد دارند.
برای مثال، یک سامانه میتواند بر اساس پاسخهای دانشآموز، تمرینهای متناسب با سطح او پیشنهاد کند.
اما استفاده از دادههای آموزشی، بهویژه اطلاعات کودکان، نیازمند توجه به حریم خصوصی و امنیت است.
شبکههای عصبی و رباتیک
در رباتیک، شبکههای عصبی برای پردازش دادههای حسگر، تشخیص اشیا، کنترل حرکت و یادگیری برخی رفتارها استفاده میشوند.
ترکیب شبکههای عصبی با یادگیری تقویتی میتواند به ربات امکان دهد برخی سیاستهای کنترلی را از تجربه بیاموزد.
با این حال، استفاده در محیط واقعی نیازمند آزمون ایمنی و کنترل خطا است.
مزایای شبکههای عصبی مصنوعی
یکی از مزایای شبکههای عصبی توانایی مدلسازی روابط پیچیده و غیرخطی است.
این مدلها میتوانند در بسیاری از وظایف، ویژگیهای مورد نیاز را از داده بیاموزند.
همچنین شبکههای عصبی برای پردازش دادههای غیرساختیافته مانند متن، تصویر و صوت مناسباند.
با این حال، مزیت یک شبکهٔ عصبی به نوع مسئله، داده، معماری و روش ارزیابی وابسته است.
در برخی مسائل، روشهای سادهتر یادگیری ماشین میتوانند عملکرد مشابه یا حتی بهتری داشته باشند.
محدودیتهای شبکههای عصبی مصنوعی
شبکههای عصبی با وجود تواناییهای گسترده محدودیتهایی دارند.
از جمله:
- نیاز احتمالی به دادههای فراوان؛
- هزینهٔ محاسباتی آموزش؛
- خطر بیشبرازش؛
- دشواری توضیح برخی تصمیمها؛
- حساسیت به کیفیت داده؛
- امکان سوگیری؛
- آسیبپذیری در برابر برخی حملات؛
- و کاهش عملکرد در شرایط متفاوت با دادههای آموزشی.
این محدودیتها بهویژه در کاربردهای حساس اهمیت دارند.
مسئلهٔ جعبهٔ سیاه
برخی شبکههای عصبی دارای تعداد بسیار زیادی پارامتر هستند.
در چنین مدلهایی، توضیح دقیق اینکه چرا یک ورودی به خروجی مشخصی منجر شده ممکن است دشوار باشد.
این مسئله معمولاً با اصطلاح جعبهٔ سیاه توصیف میشود.
با این حال، جعبهٔ سیاه بودن به معنای غیرممکنبودن همهٔ انواع تحلیل نیست.
پژوهشگران روشهایی برای بررسی حساسیت مدل، تحلیل ویژگیها و مطالعهٔ بازنماییهای داخلی توسعه دادهاند.
هوش مصنوعی توضیحپذیر
هوش مصنوعی توضیحپذیر (Explainable AI) حوزهای است که به بررسی روشهای توضیح یا تفسیر رفتار مدلهای هوش مصنوعی میپردازد.
در شبکههای عصبی، این روشها میتوانند شامل تحلیل اهمیت ویژگیها، بررسی فعالسازیها و مطالعهٔ رفتار مدل در برابر تغییر ورودی باشند.
توضیحپذیری در کاربردهای پزشکی، مالی و اداری اهمیت ویژهای دارد.
با این حال، توضیح تولیدشده برای رفتار مدل باید از نظر اعتبار و محدودیتهای خود نیز بررسی شود.
سوگیری الگوریتمی
سوگیری الگوریتمی یکی از مسائل مهم شبکههای عصبی مصنوعی است.
اگر دادههای آموزشی دارای عدم توازن یا منعکسکنندهٔ تبعیضهای تاریخی باشند، مدل ممکن است الگوهای نامطلوبی را بیاموزد.
برای مثال، یک سامانهٔ تشخیص چهره ممکن است برای گروههای جمعیتی مختلف نرخ خطای متفاوتی داشته باشد.
بنابراین ارزیابی مدل باید فراتر از دقت کلی باشد و عملکرد آن در شرایط و گروههای مختلف نیز بررسی شود.
حریم خصوصی
آموزش شبکههای عصبی گاهی به استفاده از مجموعههای بزرگ داده نیاز دارد.
این دادهها ممکن است شامل اطلاعات شخصی باشند.
در چنین شرایطی، پرسشهایی دربارهٔ رضایت، امنیت، نگهداری داده و امکان افشای اطلاعات مطرح میشود.
روشهایی مانند حریم خصوصی تفاضلی و یادگیری فدرال برای مدیریت برخی خطرهای مربوط به داده مورد پژوهش قرار گرفتهاند.
با این حال، هیچ روش واحدی بهتنهایی همهٔ خطرهای حریم خصوصی را از میان نمیبرد.
حملات خصمانه
حملات خصمانه (Adversarial Attacks) به تلاشهایی گفته میشود که با تغییر طراحیشدهٔ ورودی، مدل را به خروجی نامطلوب یا نادرست سوق میدهند.
در برخی شبکههای تشخیص تصویر، تغییراتی کوچک در دادهٔ ورودی میتوانند موجب تغییر طبقهبندی شوند.
این مسئله در کاربردهای امنیتی و سامانههای حساس اهمیت دارد.
توهم هوش مصنوعی
توهم هوش مصنوعی بیشتر در ارتباط با سامانههای مولد، بهویژه مدلهای زبانی، مطرح میشود.
در این وضعیت، مدل ممکن است محتوایی روان و ظاهراً معتبر تولید کند که از نظر واقعی نادرست باشد.
برای مثال، یک مدل زبانی ممکن است عنوان کتاب یا منبعی را تولید کند که وجود خارجی ندارد.
این پدیده را نباید با همهٔ انواع خطای شبکههای عصبی یکسان دانست.
خطای طبقهبندی تصویر و تولید منبع ساختگی در یک مدل زبانی، دو نوع متفاوت از خطا هستند.
شبکهٔ عصبی مصنوعی و مغز انسان
یکی از پرسشهای رایج دربارهٔ شبکههای عصبی مصنوعی، میزان شباهت آنها به مغز انسان است.
شبکههای عصبی مصنوعی در آغاز از برخی ویژگیهای نورونها و ارتباطات عصبی الهام گرفتند.
اما نورون مصنوعی معمولاً یک واحد ریاضی بسیار سادهتر از نورون زیستی است.
نورونهای زیستی دارای فرایندهای پیچیدهٔ الکتروشیمیایی هستند و در شبکههایی با ساختار و پویایی بسیار پیچیده فعالیت میکنند.
در مقابل، بسیاری از شبکههای عصبی مصنوعی بر عملیات ماتریسی، توابع ریاضی و روشهای بهینهسازی استوارند.
بنابراین شباهت اصطلاحی یا ساختاری میان این دو به معنای یکسانبودن سازوکار آنها نیست.
آیا شبکهٔ عصبی مصنوعی مانند انسان فکر میکند؟
شبکههای عصبی مصنوعی میتوانند در برخی وظایف عملکردی مشابه یا بهتر از انسان داشته باشند.
برای مثال، یک شبکه ممکن است در طبقهبندی نوع مشخصی از تصویر به دقت بالایی برسد.
اما موفقیت در یک وظیفه بهتنهایی ثابت نمیکند که شبکه دارای تجربهٔ ذهنی، آگاهی یا فهم انسانی است.
پرسش دربارهٔ رابطهٔ محاسبات، هوش و آگاهی از موضوعات مورد بحث در فلسفهٔ ذهن و علوم شناختی است.
در نتیجه، باید میان توانایی محاسباتی قابل اندازهگیری و ادعاهای فلسفی دربارهٔ آگاهی تمایز گذاشت.
شبکههای عصبی و علیت
شبکههای عصبی معمولاً روابط آماری موجود در داده را میآموزند.
اما وجود همبستگی میان دو متغیر بهتنهایی اثبات نمیکند که یکی علت دیگری است.
برای مثال، مدلی ممکن است از یک ویژگی برای پیشبینی استفاده کند، بدون آنکه آن ویژگی علت مستقیم پدیدهٔ مورد نظر باشد.
این تمایز در پزشکی، اقتصاد و علوم اجتماعی اهمیت ویژهای دارد.
شبکههای عصبی و تصمیمگیری انسانی
استفاده از شبکههای عصبی در تصمیمگیری میتواند به پردازش سریع دادهها کمک کند.
با این حال، تصمیمهای دارای پیامد حقوقی، اقتصادی یا اجتماعی مهم نیازمند ارزیابی دقیق هستند.
در چنین کاربردهایی باید مشخص شود:
- مدل با چه دادههایی آموزش دیده است؛
- نرخ خطای آن چقدر است؛
- عملکرد آن برای گروههای مختلف چگونه است؛
- آیا خروجی قابل بررسی است؛
- و چه نهادی مسئول پیامدهای تصمیم است.
شبکهٔ عصبی نباید صرفاً به دلیل پیچیدگی یا عملکرد آماری مناسب، مرجع غیرقابل اعتراض تلقی شود.
شبکههای عصبی و تمرکز قدرت فناوری
توسعهٔ برخی شبکههای عصبی بسیار بزرگ به منابع محاسباتی و سرمایهٔ قابل توجه نیاز دارد.
این مسئله میتواند توسعهٔ مدلهای پیشرفته را در تعداد محدودی از شرکتها، دولتها و مؤسسات پژوهشی متمرکز کند.
در مقابل، انتشار پژوهشهای علمی، نرمافزارهای آزاد و مدلهای دارای وزنهای در دسترس میتواند مشارکت گروههای بیشتری را ممکن سازد.
این موضوع در مباحث مربوط به رقابت، دسترسی به فناوری و حکمرانی هوش مصنوعی اهمیت دارد.
شبکههای عصبی و جامعه
شبکههای عصبی مصنوعی در سامانههای توصیهگر، موتورهای جستوجو، خدمات مالی، پزشکی و تولید محتوا نقش دارند.
گسترش این فناوری بر شیوهٔ تولید، توزیع و تحلیل اطلاعات تأثیر گذاشته است.
در عین حال، استفاده از شبکههای عصبی در نظارت، رتبهبندی افراد یا تصمیمگیری خودکار میتواند پرسشهایی دربارهٔ آزادیهای مدنی، شفافیت و پاسخگویی ایجاد کند.
ارزیابی پیامدهای اجتماعی این فناوری باید بر اساس نوع کاربرد و شواهد مربوط به همان سامانه انجام شود.
شبکههای عصبی و زبان فارسی
شبکههای عصبی در توسعهٔ سامانههای پردازش زبان فارسی کاربرد دارند.
از جمله کاربردهای آنها میتوان به تحلیل متن، ترجمه، تشخیص گفتار، طبقهبندی اسناد و تولید زبان اشاره کرد.
کیفیت این سامانهها به حجم، تنوع و اعتبار دادههای فارسی وابسته است.
کمبود داده برای برخی گویشها، گونههای زبانی یا موضوعات تخصصی میتواند بر عملکرد مدل تأثیر بگذارد.
مدلهای ترنسفورمری فارسی مانند ParsBERT نمونهای از پژوهشهای مبتنی بر شبکههای عصبی برای پردازش زبان فارسی هستند.[۷]
شبکههای عصبی و ایران
پژوهش و کاربرد شبکههای عصبی در ایران در حوزههایی مانند پردازش زبان فارسی، تحلیل تصاویر، پزشکی، صنعت و علوم داده انجام شده است.
با این حال، ارزیابی میزان توسعه یا کاربرد یک فناوری در کشور نیازمند آمار و منابع مشخص است.
همچنین استفاده از شبکههای عصبی در سامانههای نظارتی، تشخیص چهره یا پردازش اطلاعات شهروندان، در صورت تأثیرگذاری بر حقوق افراد، ضرورت شفافیت و نظارت مستقل را مطرح میکند.
هر ادعای مشخص دربارهٔ کاربرد چنین سامانههایی توسط نهادهای حکومتی باید با منابع معتبر و قابل راستیآزمایی پشتیبانی شود.
آیندهٔ شبکههای عصبی مصنوعی
پژوهش دربارهٔ شبکههای عصبی در زمینههای متعددی ادامه دارد.
از جمله:
- افزایش کارایی محاسباتی؛
- کاهش نیاز به داده؛
- بهبود تعمیم؛
- توسعهٔ معماریهای جدید؛
- یادگیری چندوجهی؛
- تفسیرپذیری؛
- ایمنی؛
- کاهش مصرف انرژی؛
- و ترکیب روشهای یادگیری با استدلال و دانش ساختاریافته.
یکی از پرسشهای مهم این است که چگونه میتوان شبکههایی توسعه داد که در کنار توانایی یادگیری الگوهای پیچیده، از قابلیت اعتماد، شفافیت و پایداری بیشتری برخوردار باشند.
تفاوت شبکهٔ عصبی مصنوعی با ترنسفورمر
شبکهٔ عصبی مصنوعی مفهومی گستردهتر از ترنسفورمر است.
ترنسفورمر یکی از معماریهای شبکهٔ عصبی محسوب میشود.
شبکههای پیچشی، بازگشتی، پیشخور و گرافی نیز از خانوادههای دیگر شبکههای عصبی هستند.
بنابراین هر ترنسفورمر متعارف نوعی شبکهٔ عصبی مصنوعی است، اما همهٔ شبکههای عصبی ترنسفورمر نیستند.
تفاوت شبکهٔ عصبی مصنوعی با یادگیری عمیق
شبکهٔ عصبی مصنوعی به نوعی مدل محاسباتی اشاره دارد.
یادگیری عمیق به خانوادهای از روشهای یادگیری اشاره میکند که عمدتاً از شبکههای عصبی چندلایه استفاده میکنند.
یک شبکهٔ عصبی ساده لزوماً عمیق نیست.
در مقابل، بیشتر سامانههای یادگیری عمیق معاصر بر شبکههای عصبی مصنوعی استوارند.
جمعبندی
شبکهٔ عصبی مصنوعی یکی از خانوادههای بنیادی مدلهای یادگیری ماشین است که از واحدهای محاسباتی بههمپیوسته و پارامترهای قابل تنظیم برای پردازش داده و یادگیری الگوها استفاده میکند.
ریشههای نظری آن به پژوهشهای میانهٔ سدهٔ بیستم بازمیگردد. مدل مککالاک و پیتس در سال ۱۹۴۳، پرسپترون فرانک روزنبلات در سال ۱۹۵۸ و گسترش روشهای آموزش شبکههای چندلایه در دههٔ ۱۹۸۰ از مراحل مهم تاریخی آن بودند.[۱][۳][۴]
از دههٔ ۲۰۱۰، پیشرفت در داده، سختافزار و روشهای آموزش موجب گسترش کاربرد شبکههای عصبی عمیق در پردازش تصویر، گفتار، زبان و دیگر حوزهها شد.
امروزه معماریهایی مانند شبکههای پیچشی، بازگشتی، گرافی و ترنسفورمرها در طیف گستردهای از سامانههای هوش مصنوعی به کار میروند.
با این حال، شبکههای عصبی دارای محدودیتهایی مانند وابستگی به داده، هزینهٔ محاسباتی، خطر بیشبرازش، سوگیری الگوریتمی، دشواری توضیح برخی تصمیمها و آسیبپذیری امنیتی هستند.
از این رو شبکهٔ عصبی مصنوعی را باید یک مدل محاسباتی قدرتمند برای یادگیری و پردازش داده دانست، نه بازسازی کامل مغز انسان یا سامانهای که صحت و قابلیت اعتماد خروجیهای آن تضمین شده باشد.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- یادگیری عمیق
- ترنسفورمر
- مدل زبانی بزرگ
- هوش مصنوعی مولد
- پردازش زبان طبیعی
- توکن (هوش مصنوعی)
- پرامپت (هوش مصنوعی)
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- بینایی ماشین
- علم داده
- الگوریتم
- علوم رایانه
منابع
- ↑ ۱٫۰ ۱٫۱ ۱٫۲ McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” The Bulletin of Mathematical Biophysics 5 (1943): 115–133.
- ↑ ۲٫۰ ۲٫۱ LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444.
- ↑ ۳٫۰ ۳٫۱ Rosenblatt, Frank. “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.” Psychological Review 65, no. 6 (1958): 386–408.
- ↑ ۴٫۰ ۴٫۱ ۴٫۲ Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” Nature 323 (1986): 533–536.
- ↑ ۵٫۰ ۵٫۱ Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).
- ↑ Goodfellow, Ian, et al. “Generative Adversarial Nets.” Advances in Neural Information Processing Systems 27 (2014).
- ↑ Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020.
کتابشناسی
- Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020. متن مقاله
- Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016. متن کتاب
- Goodfellow, Ian, et al. “Generative Adversarial Nets.” Advances in Neural Information Processing Systems 27 (2014). متن مقاله
- Hebb, Donald O. The Organization of Behavior: A Neuropsychological Theory. New York: Wiley, 1949.
- LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444. متن مقاله
- McCulloch, Warren S., and Walter Pitts. “A Logical Calculus of the Ideas Immanent in Nervous Activity.” The Bulletin of Mathematical Biophysics 5 (1943): 115–133. متن مقاله
- Minsky, Marvin, and Seymour A. Papert. Perceptrons: An Introduction to Computational Geometry. Cambridge, MA: MIT Press, 1969.
- Rosenblatt, Frank. “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.” Psychological Review 65, no. 6 (1958): 386–408. متن مقاله
- Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” Nature 323 (1986): 533–536. متن مقاله
- Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله
```