ترنسفورمر
- ترنسفورمر
```wiki
| شناسنامه | |
|---|---|
| نامهای دیگر | معماری ترنسفورمر، شبکهٔ عصبی ترنسفورمر، مدل ترنسفورمری |
| حوزه | هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، پردازش زبان طبیعی، علوم رایانه |
| خاستگاه | پژوهشهای یادگیری عمیق، شبکههای عصبی و ترجمهٔ ماشینی |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | سازوکار توجه، خودتوجهی، توجه چندسری، رمزگذار، رمزگشا، تعبیهٔ برداری، کدگذاری موقعیتی، پرسش، کلید، مقدار، ماسک توجه |
| جریانهای مرتبط | یادگیری عمیق، شبکههای عصبی مصنوعی، هوش مصنوعی مولد، مدل زبانی بزرگ، یادگیری خودنظارتشده، یادگیری بازنمایی |
| تأثیرپذیرفته از | شبکههای عصبی، مدلهای دنبالهبهدنباله، سازوکار توجه، یادگیری عمیق و روشهای بهینهسازی |
| تأثیرگذار بر | BERT، GPT، T5، ترنسفورمرهای بینایی، مدلهای چندوجهی و بسیاری از سامانههای هوش مصنوعی مولد |
| نقد و ارزیابی | |
ترنسفورمر (به انگلیسی: Transformer) نوعی معماری شبکهٔ عصبی مصنوعی در حوزهٔ یادگیری عمیق است که برای پردازش دادهها، بهویژه دادههای دنبالهای مانند متن، از سازوکاری موسوم به توجه (Attention) استفاده میکند. ویژگی اصلی این معماری، امکان محاسبهٔ ارتباط میان بخشهای مختلف ورودی بدون نیاز به پردازش بازگشتیِ متوالی، به شیوهٔ رایج در شبکههای عصبی بازگشتی، است.[۱]
ترنسفورمر در سال ۲۰۱۷ توسط گروهی هشتنفره از پژوهشگران در مقالهٔ Attention Is All You Need معرفی شد. این معماری در ابتدا برای بهبود ترجمهٔ ماشینی طراحی شده بود، اما بهتدریج به یکی از مهمترین معماریهای هوش مصنوعی تبدیل شد و زمینهٔ توسعهٔ بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد را فراهم کرد.[۲]
اهمیت ترنسفورمر در آن است که مدل میتواند هنگام پردازش هر بخش از یک متن، روابط آن بخش را با بخشهای دیگر در نظر بگیرد. این ویژگی در درک وابستگیهای زبانی، ترجمه، خلاصهسازی، پاسخ به پرسش و تولید متن کاربرد دارد.
ترنسفورمر محدود به زبان نیست و نسخههایی از آن برای پردازش تصویر، صوت، ویدئو، دادههای علمی و ترکیب چند نوع داده توسعه یافتهاند.
تعریف ترنسفورمر
ترنسفورمر یک معماری محاسباتی برای یادگیری روابط میان عناصر داده است. این معماری معمولاً از لایههای متعدد شبکهٔ عصبی تشکیل میشود که در آنها سازوکار توجه، شبکههای پیشخور و دیگر عملیات ریاضی برای تبدیل داده به بازنماییهای وابسته به زمینه به کار میروند.
در شبکههای بازگشتی سنتی، پردازش یک دنباله غالباً به وضعیت محاسباتی مرحلهٔ پیشین وابسته است. در مقابل، ترنسفورمر میتواند در مرحلهٔ آموزش، روابط میان موقعیتهای مختلف یک دنباله را با عملیات ماتریسی و بهصورت موازی محاسبه کند.
این تفاوت یکی از دلایل اصلی موفقیت ترنسفورمر در مقیاسهای بزرگ است.[۱]
برای مثال، در جملهٔ زیر:
«دانشآموز کتاب را برداشت، زیرا میخواست آن را مطالعه کند.»
مدل باید تشخیص دهد که «آن» به «کتاب» اشاره دارد. سازوکار توجه به مدل امکان میدهد رابطهٔ میان این دو بخش جمله را در محاسبات خود بازنمایی کند.
تاریخچه
شبکههای عصبی پیش از ترنسفورمر
پیش از معرفی ترنسفورمر، شبکههای عصبی بازگشتی یا RNN و گونههای پیشرفتهتر آنها، از جمله LSTM و GRU، از معماریهای مهم پردازش دادههای دنبالهای بودند.
این شبکهها در ترجمهٔ ماشینی، تشخیص گفتار و مدلسازی زبان استفاده میشدند.
یکی از محدودیتهای شبکههای بازگشتی، وابستگی پردازش هر مرحله به مراحل پیشین بود. این وابستگی، موازیسازی محاسبات را دشوار میکرد.
همچنین یادگیری برخی وابستگیهای بلندمدت در دنبالههای طولانی برای این شبکهها چالشبرانگیز بود.
پیدایش سازوکار توجه
پیش از ترنسفورمر، پژوهشگران سازوکار توجه را برای بهبود مدلهای دنبالهبهدنباله توسعه داده بودند.
در سال ۲۰۱۴، دژان باهداناو، کیونگهیون چو و یوشوا بنجیو مقالهٔ Neural Machine Translation by Jointly Learning to Align and Translate را منتشر کردند.
این پژوهش نشان داد که مدل ترجمه میتواند هنگام تولید هر واژه، به بخشهای مرتبط متن مبدأ توجه کند.[۳]
این تحول یکی از زمینههای نظری توسعهٔ ترنسفورمر بود.
معرفی ترنسفورمر در سال ۲۰۱۷
در ژوئن ۲۰۱۷، مقالهٔ Attention Is All You Need توسط هشت پژوهشگر منتشر شد.
نویسندگان عبارت بودند از:
- اشیش واسوانی (Ashish Vaswani)
- نوآم شازیر (Noam Shazeer)
- نیکی پارمار (Niki Parmar)
- یاکوب اوسکورایت (Jakob Uszkoreit)
- لیون جونز (Llion Jones)
- آیدان گومز (Aidan N. Gomez)
- ووکاش کایزر (Łukasz Kaiser)
- ایلیا پولوسوخین (Illia Polosukhin)
این پژوهش معماری جدیدی را معرفی کرد که در مدلسازی دنبالهبهدنباله، نیاز به لایههای بازگشتی و پیچشی را کنار میگذاشت و از توجه بهعنوان سازوکار اصلی ارتباط میان موقعیتهای دنباله استفاده میکرد.[۱]
نویسندگان نشان دادند که این معماری در وظایف ترجمهٔ ماشینی، علاوه بر کیفیت مناسب، امکان موازیسازی بیشتری نسبت به معماریهای بازگشتی متداول آن دوره فراهم میکند.
اهمیت تاریخی مقالهٔ «توجه تنها چیزی است که نیاز دارید»
عنوان مقالهٔ Attention Is All You Need را میتوان «توجه تنها چیزی است که نیاز دارید» ترجمه کرد.
این عنوان به تصمیم پژوهشگران برای جایگزینی ساختارهای بازگشتی و پیچشیِ مدلهای پیشین با معماری مبتنی بر توجه اشاره داشت.
البته ترنسفورمر صرفاً از عملیات توجه تشکیل نشده است؛ شبکههای پیشخور، تعبیههای برداری، اتصالات باقیمانده و نرمالسازی نیز اجزای مهم آن هستند.
مقالهٔ سال ۲۰۱۷ نشان داد که معماری مبتنی بر توجه میتواند در ترجمهٔ ماشینی عملکرد رقابتی و کارایی محاسباتی مناسبی داشته باشد.[۲]
تأثیر این مقاله بعدها از ترجمهٔ ماشینی فراتر رفت و معماری ترنسفورمر در توسعهٔ مدلهای زبانی، بینایی ماشین و هوش مصنوعی مولد نقش اساسی پیدا کرد.
سازوکار توجه
توجه (Attention) روشی محاسباتی است که به مدل اجازه میدهد هنگام پردازش یک عنصر، میزان ارتباط آن را با عناصر دیگر محاسبه کند.
در یک جمله، همهٔ واژهها برای تفسیر یک واژه اهمیت یکسانی ندارند.
برای مثال:
«علی کتابی را که دیروز خریده بود، به دوستش داد.»
برای پردازش «خریده بود»، ارتباط با «علی» و «کتابی» میتواند مهم باشد.
سازوکار توجه امکان میدهد وزن متفاوتی به اطلاعات موقعیتهای مختلف اختصاص داده شود.
این وزنها ثابت نیستند؛ بلکه با توجه به ورودی و پارامترهای آموختهشدهٔ مدل محاسبه میشوند.
خودتوجهی
خودتوجهی (Self-Attention) سازوکاری است که در آن عناصر یک دنباله با عناصر همان دنباله ارتباط برقرار میکنند.
برای مثال در جمله:
«مریم به سارا گفت که کتابش را بیاورد.»
مدل برای تفسیر روابط واژگان باید بخشهای مختلف جمله را در نظر بگیرد.
خودتوجهی میتواند اطلاعات مرتبط با هر واژه را از دیگر واژهها جمعآوری کند.
با این حال، وجود سازوکار توجه تضمین نمیکند که مدل همیشه مرجع ضمیر یا معنای جمله را درست تشخیص دهد.
پرسش، کلید و مقدار
در معماری ترنسفورمر، سازوکار توجه معمولاً بر سه نوع بردار استوار است:
- پرسش (Query یا Q)
- کلید (Key یا K)
- مقدار (Value یا V)
این بردارها از بازنمایی ورودی و با استفاده از تبدیلهای خطی آموختنی محاسبه میشوند.
پرسش مشخص میکند که یک موقعیت در پی چه نوع اطلاعاتی است.
کلید برای محاسبهٔ میزان تطابق یا ارتباط با پرسش به کار میرود.
مقدار، اطلاعاتی است که پس از وزندهی در خروجی توجه مشارکت میکند.
این اصطلاحات نام اجزای ریاضی معماری هستند و نباید آنها را به معنای پرسش و پاسخ آگاهانهٔ انسانی دانست.
توجه حاصلضرب داخلی مقیاسبندیشده
در مقالهٔ اصلی ترنسفورمر، یکی از عملیات بنیادی با عنوان Scaled Dot-Product Attention معرفی شد.
رابطهٔ ریاضی آن چنین است:
Attention(Q,K,V) = softmax(QKᵀ / √dₖ)V
در این رابطه:
- Q ماتریس پرسشهاست.
- K ماتریس کلیدهاست.
- V ماتریس مقدارهاست.
- dₖ بُعد بردارهای کلید است.
- softmax تابعی است که امتیازهای توجه را به وزنهای نرمالشده تبدیل میکند.
ابتدا میزان ارتباط پرسشها و کلیدها محاسبه میشود. سپس این امتیازها مقیاسبندی و نرمال میشوند و برای ترکیب وزندار مقدارها به کار میروند.
مقیاسبندی با ریشهٔ دوم بُعد کلیدها به کنترل بزرگی حاصلضربهای داخلی کمک میکند.[۱]
توجه چندسری
توجه چندسری (Multi-Head Attention) یکی از ویژگیهای مهم ترنسفورمر است.
در این روش، چند عملیات توجه بهطور موازی روی بازنماییهای متفاوت داده انجام میشود.
هر سری توجه میتواند الگوهای متفاوتی از روابط میان عناصر دنباله را بیاموزد.
برای مثال، در یک متن، برخی سریها ممکن است نسبت به روابط نحوی و برخی دیگر نسبت به روابط معنایی یا وابستگیهای موقعیتی حساس شوند.
با این حال، اختصاص یک نقش زبانی مشخص و ثابت به هر سری توجه، توصیفی دقیق برای همهٔ مدلها نیست.
خروجی سریهای مختلف ترکیب و به بازنمایی جدیدی تبدیل میشود.[۱]
ساختار اصلی ترنسفورمر
ترنسفورمر اولیه از دو بخش اصلی تشکیل شده بود:
- رمزگذار
- رمزگشا
این ساختار با عنوان Encoder–Decoder شناخته میشود.
در معماری اصلی، رمزگذار اطلاعات ورودی را پردازش میکرد و رمزگشا بر اساس آن اطلاعات، دنبالهٔ خروجی را تولید میکرد.
این ساختار برای ترجمهٔ ماشینی مناسب بود؛ زیرا متن زبان مبدأ را دریافت و متن زبان مقصد را تولید میکرد.
رمزگذار
رمزگذار (Encoder) بخش پردازشکنندهٔ ورودی در معماری اصلی ترنسفورمر است.
رمزگذار از چند لایه تشکیل میشود که هر یک شامل خودتوجهی چندسری و شبکهٔ پیشخور است.
وظیفهٔ آن تبدیل دنبالهٔ ورودی به بازنماییهایی وابسته به زمینه است.
در مدل اصلی سال ۲۰۱۷، رمزگذار از شش لایهٔ تکرارشونده تشکیل شده بود.[۱]
برای مثال در ترجمهٔ جملهای از فارسی به انگلیسی، رمزگذار میتواند روابط میان واژههای جملهٔ فارسی را بازنمایی کند.
رمزگشا
رمزگشا (Decoder) در معماری اصلی ترنسفورمر وظیفهٔ تولید دنبالهٔ خروجی را بر عهده دارد.
رمزگشا از اطلاعات تولیدشده در مراحل پیشین و بازنماییهای رمزگذار استفاده میکند.
در مدل اولیه، رمزگشا شامل خودتوجهی ماسکدار، توجه به خروجی رمزگذار و شبکهٔ پیشخور بود.
در هنگام تولید خودرگرسیو، مدل خروجی را مرحلهبهمرحله تولید میکند.
توجه ماسکدار
توجه ماسکدار (Masked Attention) برای محدودکردن دسترسی یک موقعیت به اطلاعات برخی موقعیتهای دیگر استفاده میشود.
در مدلهای زبانی خودرگرسیو، ماسک علّی مانع از آن میشود که یک موقعیت در هنگام پیشبینی به توکنهای آینده دسترسی داشته باشد.
برای مثال هنگام پیشبینی واژهٔ بعدی در جمله:
«امروز هوا بسیار ...»
مدل باید بر اساس واژههای پیشین عمل کند، نه واژهای که هنوز قرار است پیشبینی شود.
این سازوکار در آموزش مدلهای زبانی مولد اهمیت اساسی دارد.
توجه متقاطع
توجه متقاطع (Cross-Attention) سازوکاری است که در آن پرسشها از یک دنباله و کلیدها و مقدارها از دنبالهای دیگر به دست میآیند.
در ترنسفورمر رمزگذار–رمزگشا، رمزگشا میتواند با استفاده از توجه متقاطع به بازنماییهای تولیدشده توسط رمزگذار دسترسی پیدا کند.
این ویژگی برای وظایفی مانند ترجمهٔ ماشینی و خلاصهسازی متن مفید است.
تعبیهٔ برداری
پیش از ورود متن به لایههای ترنسفورمر، توکنها معمولاً به بردارهای عددی تبدیل میشوند.
این فرایند تعبیهٔ برداری (Embedding) نام دارد.
برای مثال، یک واژه یا قطعهای از واژه به جای آنکه مستقیماً بهصورت رشتهای از حروف پردازش شود، به یک بردار عددی در فضای چندبُعدی تبدیل میشود.
مقادیر این بردارها در فرایند آموزش آموخته میشوند.
تعبیهٔ برداری امکان استفاده از عملیات ریاضی برای پردازش اطلاعات زبانی را فراهم میکند.
کدگذاری موقعیتی
ترنسفورمر اولیه برخلاف شبکههای بازگشتی، ترتیب عناصر را از طریق یک فرایند بازگشتیِ ذاتی دریافت نمیکرد.
به همین دلیل پژوهشگران از کدگذاری موقعیتی (Positional Encoding) استفاده کردند.
کدگذاری موقعیتی اطلاعاتی دربارهٔ جایگاه عناصر در دنباله به بازنمایی آنها اضافه میکند.
در مقالهٔ اصلی، از توابع سینوسی و کسینوسی برای ساخت یکی از انواع کدگذاری موقعیتی استفاده شد.
در مدلهای بعدی، روشهای گوناگون دیگری برای بازنمایی موقعیت توسعه یافتند.[۱]
شبکهٔ پیشخور
در کنار سازوکار توجه، لایههای ترنسفورمر معمولاً دارای شبکهٔ پیشخور (Feed-Forward Network) هستند.
این شبکه روی بازنمایی هر موقعیت عملیات غیرخطی انجام میدهد.
توجه، اطلاعات موقعیتهای مختلف را با یکدیگر ترکیب میکند؛ در حالی که شبکهٔ پیشخور تبدیلهای بیشتری روی بازنماییهای حاصل انجام میدهد.
این دو جزء مکمل یکدیگرند.
اتصالات باقیمانده و نرمالسازی
ترنسفورمر از اتصالات باقیمانده (Residual Connections) و نرمالسازی لایهای (Layer Normalization) نیز استفاده میکند.
اتصالات باقیمانده به انتقال اطلاعات و بهبود آموزش شبکههای عمیق کمک میکنند.
نرمالسازی نیز در پایداری محاسبات و فرایند آموزش نقش دارد.
این اجزا در معماری اولیه و بسیاری از گونههای بعدی ترنسفورمر اهمیت دارند.
انواع ترنسفورمر
با گسترش پژوهشها، معماری ترنسفورمر به چند خانوادهٔ مهم تقسیم شد.
ترنسفورمر رمزگذارمحور
مدلهای رمزگذارمحور برای ساخت بازنماییهای وابسته به زمینه از ورودی مناسباند.
در این مدلها، موقعیتهای متن میتوانند به اطلاعات دو سوی خود دسترسی داشته باشند، البته جزئیات به نوع ماسک و روش آموزش بستگی دارد.
مدل BERT یکی از نمونههای شناختهشدهٔ این خانواده است.
ترنسفورمر رمزگشامحور
مدلهای رمزگشامحور عمدتاً برای تولید خودرگرسیو دنباله استفاده میشوند.
در این مدلها، پیشبینی هر توکن معمولاً بر اساس توکنهای قبلی انجام میشود.
بسیاری از مدلهای خانوادهٔ GPT از معماری رمزگشامحور استفاده میکنند.
ترنسفورمر رمزگذار–رمزگشا
در این خانواده، رمزگذار ورودی را پردازش میکند و رمزگشا خروجی را تولید میکند.
مدل T5 نمونهای از کاربرد این ساختار است.
این معماری برای وظایفی که در آنها یک دنباله به دنبالهای دیگر تبدیل میشود مناسب است.
ترنسفورمر و BERT
BERT مخفف Bidirectional Encoder Representations from Transformers است.
این مدل در سال ۲۰۱۸ توسط جیکوب دولین و همکاران معرفی شد.
BERT از معماری رمزگذار ترنسفورمر استفاده میکند و برای یادگیری بازنماییهای زبانی وابسته به زمینه طراحی شده است.
یکی از روشهای اصلی پیشآموزش BERT، پیشبینی توکنهای پنهانشده در متن بود.[۴]
این مدل در تحول روشهای پردازش زبان طبیعی نقش مهمی داشت.
ترنسفورمر و GPT
GPT مخفف Generative Pre-trained Transformer است.
خانوادهٔ GPT از معماریهای ترنسفورمری برای مدلسازی و تولید زبان استفاده میکند.
در مدلهای خودرگرسیو این خانواده، سامانه بر اساس توکنهای پیشین، توکن بعدی را پیشبینی میکند.
مقالهٔ Improving Language Understanding by Generative Pre-Training در سال ۲۰۱۸ از آثار اولیهٔ این مسیر پژوهشی بود.[۵]
نسلهای بعدی مدلهای GPT نشان دادند که معماری ترنسفورمر میتواند برای مدلسازی زبان در مقیاس بزرگ به کار رود.
ترنسفورمر و T5
T5 مخفف Text-to-Text Transfer Transformer است.
این مدل، وظایف مختلف پردازش زبان را در قالب تبدیل متن به متن صورتبندی میکند.
برای مثال، ترجمه، خلاصهسازی و پاسخ به پرسش میتوانند به شکل دریافت یک متن و تولید متن دیگر تعریف شوند.
T5 از ساختار رمزگذار–رمزگشا استفاده میکند.[۶]
ترنسفورمر و مدلهای زبانی بزرگ
مدلهای زبانی بزرگ از مهمترین کاربردهای ترنسفورمر هستند.
این مدلها معمولاً با مجموعههای بزرگی از دادههای متنی و روشهای یادگیری خودنظارتشده آموزش داده میشوند.
در بسیاری از مدلهای زبانی مولد، فرایند تولید پاسخ بهصورت زیر انجام میشود:
متن ورودی ↓ تبدیل به توکن ↓ تعبیهٔ برداری ↓ پردازش توسط لایههای ترنسفورمر ↓ محاسبهٔ احتمال توکن بعدی ↓ انتخاب توکن ↓ تکرار فرایند ↓ متن خروجی
توانایی مدلهای زبانی در تولید متن روان، پاسخ به پرسش، خلاصهسازی و تولید کد تا حد زیادی به بازنماییهای آموختهشده و ظرفیت محاسباتی آنها وابسته است.
با این حال، ترنسفورمر بهتنهایی تضمینکنندهٔ صحت اطلاعات یا استدلال بیخطا نیست.
ترنسفورمر و هوش مصنوعی مولد
هوش مصنوعی مولد به سامانههایی گفته میشود که میتوانند محتوای جدیدی مانند متن، تصویر، صوت، ویدئو یا کد تولید کنند.
ترنسفورمر یکی از معماریهای مهم در توسعهٔ این سامانههاست.
در مدلهای زبانی، ترنسفورمر برای پردازش و تولید توالیهای توکن استفاده میشود.
در برخی سامانههای تولید تصویر و ویدئو نیز ترنسفورمر برای پردازش بازنماییهای تصویری یا چندوجهی به کار میرود.
با این حال همهٔ مدلهای مولد از ترنسفورمر استفاده نمیکنند و معماریهای دیگری مانند شبکههای پیچشی و مدلهای انتشار نیز نقش مهمی دارند.
ترنسفورمر در بینایی ماشین
یکی از تحولات مهم پس از معرفی ترنسفورمر، استفاده از آن در بینایی ماشین بود.
در سال ۲۰۲۰، پژوهشگران معماری Vision Transformer یا ViT را معرفی کردند.
در این روش، تصویر به قطعههایی تقسیم میشود و هر قطعه به بازنمایی برداری تبدیل میشود.
سپس این بازنماییها به ترنسفورمر داده میشوند تا روابط میان بخشهای مختلف تصویر پردازش شود.[۷]
این روش نشان داد که معماری ترنسفورمر میتواند فراتر از دادههای زبانی نیز کاربرد داشته باشد.
ترنسفورمر در پردازش تصویر
در پردازش تصویر، ترنسفورمر میتواند برای وظایفی مانند تشخیص اشیا، طبقهبندی تصاویر و تحلیل تصاویر پزشکی به کار رود.
سازوکار توجه به مدل اجازه میدهد روابط میان نواحی مختلف تصویر را محاسبه کند.
این ویژگی در تصاویری که شناخت یک ناحیه به اطلاعات نواحی دورتر وابسته است میتواند سودمند باشد.
ترنسفورمر در تشخیص گفتار
ترنسفورمر در سامانههای تشخیص گفتار نیز کاربرد دارد.
در این حوزه، دادهٔ صوتی به بازنماییهایی تبدیل میشود که مدل میتواند آنها را پردازش کند.
سامانههای مبتنی بر ترنسفورمر میتوانند برای تبدیل گفتار به متن، ترجمهٔ گفتار و پردازش صوت استفاده شوند.
برخی مدلهای گفتار از ساختار رمزگذار–رمزگشا و برخی از معماریهای دیگر بهره میبرند.
ترنسفورمرهای چندوجهی
مدل چندوجهی (Multimodal Model) مدلی است که میتواند بیش از یک نوع داده را پردازش کند.
برای مثال:
- متن و تصویر
- متن و صوت
- تصویر و ویدئو
- متن، تصویر و صوت
ترنسفورمرها در توسعهٔ بسیاری از سامانههای چندوجهی نقش دارند.
این سامانهها ممکن است اطلاعات چند نوع داده را در یک فضای بازنمایی مشترک یا از طریق سازوکارهای ارتباطی میان اجزای مختلف پردازش کنند.
کاربرد در ترجمهٔ ماشینی
ترجمهٔ ماشینی نخستین حوزهٔ اصلی ارزیابی ترنسفورمر بود.
در معماری رمزگذار–رمزگشا، متن زبان مبدأ به بازنماییهای وابسته به زمینه تبدیل میشود و رمزگشا بر اساس آنها متن زبان مقصد را تولید میکند.
ترنسفورمر به دلیل امکان مدلسازی روابط میان موقعیتهای مختلف جمله و موازیسازی مناسب در آموزش، به یکی از معماریهای اثرگذار ترجمهٔ ماشینی تبدیل شد.[۱]
کاربرد در خلاصهسازی
ترنسفورمر در سامانههای خلاصهسازی متن نیز استفاده میشود.
مدل میتواند سندی طولانی را دریافت و متنی کوتاهتر تولید کند.
با این حال خلاصهٔ تولیدشده ممکن است حاوی اطلاعات نادرست یا جزئیاتی باشد که در سند اصلی وجود ندارند.
بنابراین در کاربردهای علمی، حقوقی و دانشنامهای باید تطابق خلاصه با منبع بررسی شود.
کاربرد در برنامهنویسی
مدلهای مبتنی بر ترنسفورمر میتوانند روی مجموعههای بزرگی از کد آموزش ببینند.
این مدلها برای وظایفی مانند تکمیل کد، تولید تابع، توضیح برنامه و پیشنهاد اصلاحات به کار میروند.
با این حال کد تولیدشده ممکن است دارای خطای منطقی، نقص امنیتی یا استفاده از توابع ناموجود باشد.
در نتیجه، آزمون نرمافزار و بررسی مستندات رسمی همچنان ضروری است.
کاربرد در پزشکی
ترنسفورمرها در پژوهشهای پزشکی برای تحلیل متنهای بالینی، تصاویر پزشکی، دادههای زیستی و اطلاعات مولکولی استفاده شدهاند.
از جمله کاربردهای پژوهشی آنها میتوان به تحلیل پروندههای پزشکی و مدلسازی توالیهای زیستی اشاره کرد.
اما استفادهٔ بالینی از این سامانهها به اعتبارسنجی، ارزیابی ایمنی و رعایت الزامات قانونی نیاز دارد.
مزایای ترنسفورمر
یکی از مهمترین مزایای ترنسفورمر امکان موازیسازی بخش بزرگی از محاسبات در زمان آموزش است.
برخلاف شبکههای بازگشتی سنتی، محاسبهٔ بازنمایی موقعیتهای مختلف یک دنباله در بسیاری از تنظیمات ترنسفورمر میتواند بهصورت موازی انجام شود.
مزیت دیگر، توانایی مدلسازی روابط میان موقعیتهای دور از یکدیگر از طریق سازوکار توجه است.
ترنسفورمر همچنین معماری انعطافپذیری دارد و میتواند برای انواع مختلف داده و وظایف توسعه یابد.
محدودیتهای ترنسفورمر
ترنسفورمر با وجود موفقیتهای گسترده محدودیتهایی دارد.
یکی از مسائل مهم، هزینهٔ محاسباتی و حافظه در پردازش دنبالههای طولانی است.
در توجه کامل متعارف، ماتریس امتیازهای توجه برای دنبالهای با طول n دارای n² عنصر است.
بنابراین با افزایش طول دنباله، هزینهٔ ذخیره و محاسبهٔ توجه میتواند بهسرعت افزایش یابد.
البته روشهای بهینهسازی و معماریهای جدید تلاش کردهاند این محدودیت را کاهش دهند.
پیچیدگی محاسباتی توجه
در خودتوجهی کامل، هر موقعیت میتواند با همهٔ موقعیتهای دیگر مقایسه شود.
اگر طول دنباله دو برابر شود، شمار عناصر ماتریس توجه در حالت متعارف تقریباً چهار برابر میشود.
این ویژگی بهویژه هنگام پردازش اسناد بسیار طولانی اهمیت دارد.
پژوهشگران برای کاهش هزینه، روشهایی مانند توجه تنک، توجه محلی و پیادهسازیهای حافظهکارآمد توسعه دادهاند.
FlashAttention
FlashAttention خانوادهای از روشهای پیادهسازی کارآمد توجه است.
هدف این روشها کاهش جابهجایی داده میان سطوح مختلف حافظه و افزایش کارایی محاسبات توجه است.
FlashAttention در مقالهای در سال ۲۰۲۲ معرفی شد و نشان داد که با طراحی مناسب الگوریتم میتوان توجه دقیق را با مصرف حافظهٔ کمتر و کارایی بهتر در سختافزارهای مناسب محاسبه کرد.[۸]
این روش به معنای حذف تمام محدودیتهای محاسباتی ترنسفورمر نیست، اما یکی از پیشرفتهای مهم در بهینهسازی آن به شمار میرود.
پنجرهٔ زمینه
پنجرهٔ زمینه (Context Window) به مقدار اطلاعاتی اشاره دارد که مدل میتواند در یک فرایند پردازش در زمینهٔ خود دریافت کند.
در مدلهای زبانی، این مقدار معمولاً بر حسب توکن بیان میشود.
محدودیت پنجرهٔ زمینه میتواند بر توانایی مدل در پردازش اسناد طولانی اثر بگذارد.
همچنین داشتن پنجرهٔ زمینهٔ بزرگ بهتنهایی تضمین نمیکند که مدل از همهٔ اطلاعات موجود در آن بهدرستی استفاده کند.
محدودیت در پردازش متون طولانی
حتی زمانی که یک مدل میتواند متن بسیار طولانی دریافت کند، ممکن است در بازیابی یا استفادهٔ دقیق از برخی اطلاعات عملکرد نامتوازنی داشته باشد.
پژوهشهایی دربارهٔ مدلهای زبانی نشان دادهاند که موقعیت اطلاعات در متن میتواند بر عملکرد مدل اثر بگذارد.
برای نمونه، مطالعهٔ Lost in the Middle نشان داد که برخی مدلها در استفاده از اطلاعاتی که در میانهٔ زمینههای طولانی قرار دارند با دشواری روبهرو میشوند.[۹]
ترنسفورمر و توهم هوش مصنوعی
یکی از مسائل مهم در مدلهای مولد مبتنی بر ترنسفورمر، توهم هوش مصنوعی است.
مدل ممکن است متن روان و منسجمی تولید کند که بخشی از اطلاعات آن نادرست یا ساختگی باشد.
برای مثال ممکن است:
- منبع علمی ناموجود معرفی کند؛
- تاریخ رویدادی را اشتباه بنویسد؛
- نقلقولی ساختگی تولید کند؛
- یا اطلاعاتی را به شخصی نسبت دهد که در منبع اصلی وجود ندارد.
توهم ویژگی ضروری همهٔ خروجیهای ترنسفورمر نیست و نباید آن را صرفاً نتیجهٔ وجود سازوکار توجه دانست.
این مسئله با دادههای آموزشی، هدفهای آموزش، نحوهٔ ارزیابی، زمینهٔ ورودی و شیوهٔ استفاده از مدل ارتباط دارد.
ترنسفورمر و سوگیری الگوریتمی
سوگیری الگوریتمی یکی از مسائل مهم سامانههای مبتنی بر یادگیری عمیق است.
مدلهای ترنسفورمری ممکن است الگوهای نامتوازن یا تبعیضآمیز موجود در دادههای آموزشی را بازتولید کنند.
برای مثال، اگر دادههای آموزشی دربارهٔ گروههای اجتماعی مختلف پوشش نامتوازنی داشته باشند، عملکرد مدل نیز ممکن است میان این گروهها متفاوت باشد.
بررسی سوگیری نیازمند ارزیابی دادهها، خروجیها و پیامدهای استفاده از سامانه است.
تفسیرپذیری ترنسفورمر
یکی از حوزههای پژوهشی مهم، بررسی نحوهٔ عملکرد درونی مدلهای ترنسفورمری است.
پژوهشگران تلاش میکنند مشخص کنند که مدل چگونه اطلاعات را در لایهها و بردارهای خود بازنمایی میکند.
وزنهای توجه میتوانند بخشی از رفتار محاسباتی مدل را نشان دهند، اما بهتنهایی توضیح کامل و قطعی علت یک پیشبینی نیستند.
از این رو تفسیرپذیری مدلهای بزرگ همچنان موضوع پژوهش است.
ترنسفورمر و حریم خصوصی
آموزش مدلهای بزرگ ممکن است به مجموعههای وسیعی از دادهها نیاز داشته باشد.
این مسئله پرسشهایی دربارهٔ منشأ داده، رضایت صاحبان اطلاعات، امنیت و امکان بازتولید دادههای حساس ایجاد میکند.
در برخی شرایط، مدلهای یادگیری ماشین میتوانند اطلاعاتی از دادههای آموزشی را حفظ یا بازتولید کنند.
بنابراین مدیریت داده و ارزیابی خطرهای حریم خصوصی بخشی از توسعهٔ مسئولانهٔ این سامانههاست.
ترنسفورمر و امنیت
سامانههای مبتنی بر ترنسفورمر میتوانند در معرض حملات مختلف قرار گیرند.
در مدلهای زبانی متصل به ابزارها یا اسناد خارجی، یکی از خطرها تزریق پرامپت (Prompt Injection) است.
در این وضعیت، متن غیرقابل اعتماد ممکن است حاوی دستورهایی باشد که برای تغییر رفتار سامانه طراحی شدهاند.
این خطر صرفاً با معماری ترنسفورمر تعریف نمیشود، بلکه به نحوهٔ طراحی و اتصال سامانه به منابع و ابزارها نیز وابسته است.
ترنسفورمر و مصرف انرژی
آموزش و اجرای مدلهای بزرگ ترنسفورمری میتواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.
این منابع شامل پردازندههای گرافیکی، شتابدهندههای تخصصی، حافظه، ذخیرهسازی، برق و تجهیزات خنککننده هستند.
مصرف واقعی انرژی به اندازهٔ مدل، تعداد عملیات، نوع سختافزار، میزان استفاده و کارایی مرکز داده وابسته است.
به همین دلیل نمیتوان برای همهٔ مدلهای ترنسفورمری یک مقدار ثابت مصرف انرژی تعیین کرد.
ترنسفورمر و تمرکز قدرت فناوری
توسعه و آموزش برخی مدلهای بسیار بزرگ به سرمایه و زیرساخت گسترده نیاز دارد.
این مسئله میتواند دسترسی به توسعهٔ مدلهای پیشرفته را برای مؤسسات دارای منابع محدود دشوار کند.
در مقابل، انتشار مدلهای متنباز یا دارای وزنهای در دسترس، توسعهٔ ابزارهای کارآمد و روشهای کاهش هزینه میتواند امکان مشارکت گروههای بیشتری را فراهم کند.
این موضوع در مباحث اقتصاد فناوری، رقابت و دسترسی عمومی به هوش مصنوعی اهمیت دارد.
ترنسفورمر و جامعه
گسترش مدلهای مبتنی بر ترنسفورمر بر شیوهٔ تولید و پردازش اطلاعات تأثیر گذاشته است.
سامانههای زبانی میتوانند در نگارش، ترجمه، آموزش، برنامهنویسی، پژوهش و خدمات اطلاعاتی به کار روند.
در عین حال، تولید انبوه محتوای مصنوعی میتواند مسائل تازهای دربارهٔ اصالت محتوا، حقوق مؤلف، صحت اطلاعات و اعتماد عمومی ایجاد کند.
ارزیابی پیامدهای اجتماعی این فناوری باید میان قابلیتهای فنی مدل و نحوهٔ استفادهٔ انسانها و سازمانها از آن تمایز بگذارد.
ترنسفورمر و دانشنامهنویسی
مدلهای زبانی مبتنی بر ترنسفورمر میتوانند در فرایند تهیهٔ مقالههای دانشنامهای به کار روند.
از جمله کاربردهای آنها میتوان به موارد زیر اشاره کرد:
- پیشنهاد ساختار مقاله؛
- خلاصهسازی اسناد؛
- استخراج اصطلاحات؛
- کمک به ویرایش زبانی؛
- ترجمهٔ منابع؛
- و شناسایی موضوعات مرتبط.
با این حال، استفاده از این مدلها برای دانشنامهنویسی نیازمند راستیآزمایی مستقل است.
مدل ممکن است منبعی غیرواقعی تولید کند یا اطلاعات صحیح و نادرست را در یک پاراگراف ترکیب کند.
بنابراین اعتبار یک مقالهٔ دانشنامهای باید بر اساس منابع واقعی، معتبر و قابل بررسی تعیین شود، نه صرفاً کیفیت نثر تولیدشده.
ترنسفورمر و زبان فارسی
معماری ترنسفورمر در توسعهٔ سامانههای پردازش زبان فارسی نیز کاربرد دارد.
مدلهای مبتنی بر این معماری میتوانند برای تحلیل متن فارسی، طبقهبندی اسناد، تشخیص موجودیتهای نامدار، ترجمه، خلاصهسازی و پاسخ به پرسش آموزش داده شوند.
یکی از نمونههای پژوهشی شناختهشده، ParsBERT است که برای پردازش زبان فارسی توسعه یافت.[۱۰]
کیفیت چنین مدلهایی به عواملی مانند تنوع دادههای فارسی، شیوهٔ توکنسازی، پوشش گونههای زبانی و روش ارزیابی وابسته است.
تفاوت ترنسفورمر و یادگیری عمیق
یادگیری عمیق یک حوزهٔ گسترده از یادگیری ماشین است.
ترنسفورمر یکی از معماریهای مورد استفاده در این حوزه است.
یادگیری عمیق شامل خانوادههای دیگری مانند شبکههای عصبی پیچشی، شبکههای بازگشتی و معماریهای گوناگون مولد نیز میشود.
بنابراین:
ترنسفورمر نوعی معماری یادگیری عمیق است، اما همهٔ مدلهای یادگیری عمیق ترنسفورمر نیستند.
تفاوت ترنسفورمر و مدل زبانی بزرگ
ترنسفورمر یک معماری شبکهٔ عصبی است.
مدل زبانی بزرگ سامانهای است که برای مدلسازی زبان با مقیاس قابل توجهی از پارامترها و دادهها آموزش دیده است.
بسیاری از مدلهای زبانی بزرگ از معماری ترنسفورمر استفاده میکنند.
اما این دو اصطلاح مترادف نیستند.
یک ترنسفورمر میتواند برای طبقهبندی تصویر یا پردازش صوت به کار رود، بدون آنکه مدل زبانی بزرگ باشد.
تفاوت ترنسفورمر و هوش مصنوعی مولد
هوش مصنوعی مولد به دستهای از سامانهها اشاره دارد که محتوای جدید تولید میکنند.
ترنسفورمر یک معماری محاسباتی است که میتواند در ساخت برخی از این سامانهها استفاده شود.
بسیاری از مدلهای مولد معاصر بر ترنسفورمر متکی هستند، اما همهٔ مدلهای ترنسفورمری مولد نیستند.
برای مثال BERT عمدتاً برای یادگیری بازنماییهای زبانی و وظایف درک متن طراحی شده است، در حالی که مدلهای رمزگشامحور خودرگرسیو برای تولید توالی مناسباند.
آیندهٔ ترنسفورمر
پژوهش دربارهٔ ترنسفورمر در زمینههای مختلف ادامه دارد.
از جمله موضوعات مهم میتوان به افزایش کارایی محاسباتی، گسترش پنجرهٔ زمینه، بهبود پردازش چندوجهی، کاهش مصرف حافظه و توسعهٔ روشهای تفسیرپذیری اشاره کرد.
همچنین معماریهای جایگزین یا ترکیبی برای مدلسازی دنبالهها توسعه یافتهاند.
یکی از نمونههای پژوهشی، خانوادهٔ مدلهای فضای حالت مانند Mamba است که با هدف مدلسازی کارآمد دنبالههای طولانی معرفی شدهاند.[۱۱]
وجود چنین معماریهایی نشان میدهد که پژوهش هوش مصنوعی به ترنسفورمر محدود نیست.
جمعبندی
ترنسفورمر یکی از معماریهای اثرگذار در تاریخ یادگیری عمیق است که در سال ۲۰۱۷ با مقالهٔ Attention Is All You Need معرفی شد.
این معماری با استفاده از سازوکار توجه، بهویژه خودتوجهی، امکان مدلسازی روابط میان عناصر دنباله را فراهم کرد و نیاز به پردازش بازگشتیِ متوالی را در ساختار اصلی خود کنار گذاشت.[۱]
ترنسفورمر در ابتدا برای ترجمهٔ ماشینی توسعه یافت، اما بهتدریج در پردازش زبان طبیعی، بینایی ماشین، تشخیص گفتار، مدلهای چندوجهی و هوش مصنوعی مولد گسترش پیدا کرد.
معماریهای BERT، GPT، T5 و ترنسفورمرهای بینایی از نمونههای مهم تحولاتی هستند که بر پایهٔ این فناوری شکل گرفتهاند.
با وجود این پیشرفتها، هزینهٔ محاسباتی، محدودیت پردازش دنبالههای طولانی، توهم هوش مصنوعی، سوگیری الگوریتمی، تفسیرپذیری و حریم خصوصی از مسائل مهم سامانههای مبتنی بر ترنسفورمر باقی ماندهاند.
اهمیت تاریخی ترنسفورمر در آن است که یکی از زیرساختهای اصلی موج جدید هوش مصنوعی را فراهم کرد و زمینهٔ توسعهٔ بسیاری از سامانههایی را به وجود آورد که امروزه قادر به پردازش و تولید زبان، تصویر، صوت و دیگر انواع داده هستند.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- یادگیری عمیق
- شبکه عصبی مصنوعی
- هوش مصنوعی مولد
- مدل زبانی بزرگ
- پردازش زبان طبیعی
- توکن (هوش مصنوعی)
- پرامپت (هوش مصنوعی)
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- بینایی ماشین
- علم داده
- الگوریتم
- علوم رایانه
منابع
- ↑ ۱٫۰ ۱٫۱ ۱٫۲ ۱٫۳ ۱٫۴ ۱٫۵ ۱٫۶ ۱٫۷ ۱٫۸ Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).
- ↑ ۲٫۰ ۲٫۱ Google Research، “Attention Is All You Need”، ۲۰۱۷.
- ↑ Bahdanau, Dzmitry, Kyunghyun Cho, and Yoshua Bengio. “Neural Machine Translation by Jointly Learning to Align and Translate.” 2014.
- ↑ Devlin, Jacob, et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” 2018.
- ↑ Radford, Alec, et al. “Improving Language Understanding by Generative Pre-Training.” OpenAI, 2018.
- ↑ Raffel, Colin, et al. “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.” 2019.
- ↑ Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” 2020.
- ↑ Dao, Tri, et al. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.” 2022.
- ↑ Liu, Nelson F., et al. “Lost in the Middle: How Language Models Use Long Contexts.” 2023.
- ↑ Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020.
- ↑ Gu, Albert, and Tri Dao. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” 2023.
کتابشناسی
- Bahdanau, Dzmitry, Kyunghyun Cho, and Yoshua Bengio. “Neural Machine Translation by Jointly Learning to Align and Translate.” International Conference on Learning Representations, 2015. متن مقاله
- Dao, Tri, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher Ré. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.” Advances in Neural Information Processing Systems 35 (2022). متن مقاله
- Devlin, Jacob, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” Proceedings of NAACL-HLT, 2019. متن مقاله
- Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” International Conference on Learning Representations, 2021. متن مقاله
- Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020. متن مقاله
- Gu, Albert, and Tri Dao. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” 2023. متن مقاله
- Liu, Nelson F., et al. “Lost in the Middle: How Language Models Use Long Contexts.” Transactions of the Association for Computational Linguistics 12 (2024). متن مقاله
- Radford, Alec, Karthik Narasimhan, Tim Salimans, and Ilya Sutskever. “Improving Language Understanding by Generative Pre-Training.” OpenAI, 2018. متن مقاله
- Raffel, Colin, et al. “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.” Journal of Machine Learning Research 21 (2020): 1–67. متن مقاله
- Vaswani, Ashish, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, and Illia Polosukhin. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله
```