ترنسفورمر

از ایران پدیا
پرش به ناوبری پرش به جستجو
ترنسفورمر
شناسنامه
نام‌های دیگرمعماری ترنسفورمر، شبکهٔ عصبی ترنسفورمر، مدل ترنسفورمری
حوزههوش مصنوعی، یادگیری ماشین، یادگیری عمیق، پردازش زبان طبیعی، علوم رایانه
خاستگاهپژوهش‌های یادگیری عمیق، شبکه‌های عصبی و ترجمهٔ ماشینی
اندیشه و تاریخ
مفاهیم کلیدیسازوکار توجه، خودتوجهی، توجه چندسری، رمزگذار، رمزگشا، تعبیهٔ برداری، کدگذاری موقعیتی، پرسش، کلید، مقدار، ماسک توجه
جریان‌های مرتبطیادگیری عمیق، شبکه‌های عصبی مصنوعی، هوش مصنوعی مولد، مدل زبانی بزرگ، یادگیری خودنظارت‌شده، یادگیری بازنمایی
تأثیرپذیرفته ازشبکه‌های عصبی، مدل‌های دنباله‌به‌دنباله، سازوکار توجه، یادگیری عمیق و روش‌های بهینه‌سازی
تأثیرگذار برBERT، GPT، T5، ترنسفورمرهای بینایی، مدل‌های چندوجهی و بسیاری از سامانه‌های هوش مصنوعی مولد
نقد و ارزیابی

ترنسفورمر (به انگلیسی: Transformer) نوعی معماری شبکهٔ عصبی مصنوعی در حوزهٔ یادگیری عمیق است که برای پردازش داده‌ها، به‌ویژه داده‌های دنباله‌ای مانند متن، از سازوکاری موسوم به توجه (Attention) استفاده می‌کند. ویژگی اصلی این معماری، امکان محاسبهٔ ارتباط میان بخش‌های مختلف ورودی بدون نیاز به پردازش بازگشتیِ متوالی، به شیوهٔ رایج در شبکه‌های عصبی بازگشتی، است.[۱]

ترنسفورمر در سال ۲۰۱۷ توسط گروهی هشت‌نفره از پژوهشگران در مقالهٔ Attention Is All You Need معرفی شد. این معماری در ابتدا برای بهبود ترجمهٔ ماشینی طراحی شده بود، اما به‌تدریج به یکی از مهم‌ترین معماری‌های هوش مصنوعی تبدیل شد و زمینهٔ توسعهٔ بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد را فراهم کرد.[۲]

اهمیت ترنسفورمر در آن است که مدل می‌تواند هنگام پردازش هر بخش از یک متن، روابط آن بخش را با بخش‌های دیگر در نظر بگیرد. این ویژگی در درک وابستگی‌های زبانی، ترجمه، خلاصه‌سازی، پاسخ به پرسش و تولید متن کاربرد دارد.

ترنسفورمر محدود به زبان نیست و نسخه‌هایی از آن برای پردازش تصویر، صوت، ویدئو، داده‌های علمی و ترکیب چند نوع داده توسعه یافته‌اند.

تعریف ترنسفورمر

ترنسفورمر یک معماری محاسباتی برای یادگیری روابط میان عناصر داده است. این معماری معمولاً از لایه‌های متعدد شبکهٔ عصبی تشکیل می‌شود که در آنها سازوکار توجه، شبکه‌های پیش‌خور و دیگر عملیات ریاضی برای تبدیل داده به بازنمایی‌های وابسته به زمینه به کار می‌روند.

در شبکه‌های بازگشتی سنتی، پردازش یک دنباله غالباً به وضعیت محاسباتی مرحلهٔ پیشین وابسته است. در مقابل، ترنسفورمر می‌تواند در مرحلهٔ آموزش، روابط میان موقعیت‌های مختلف یک دنباله را با عملیات ماتریسی و به‌صورت موازی محاسبه کند.

این تفاوت یکی از دلایل اصلی موفقیت ترنسفورمر در مقیاس‌های بزرگ است.[۱]

برای مثال، در جملهٔ زیر:

«دانش‌آموز کتاب را برداشت، زیرا می‌خواست آن را مطالعه کند.»

مدل باید تشخیص دهد که «آن» به «کتاب» اشاره دارد. سازوکار توجه به مدل امکان می‌دهد رابطهٔ میان این دو بخش جمله را در محاسبات خود بازنمایی کند.

تاریخچه

شبکه‌های عصبی پیش از ترنسفورمر

پیش از معرفی ترنسفورمر، شبکه‌های عصبی بازگشتی یا RNN و گونه‌های پیشرفته‌تر آنها، از جمله LSTM و GRU، از معماری‌های مهم پردازش داده‌های دنباله‌ای بودند.

این شبکه‌ها در ترجمهٔ ماشینی، تشخیص گفتار و مدل‌سازی زبان استفاده می‌شدند.

یکی از محدودیت‌های شبکه‌های بازگشتی، وابستگی پردازش هر مرحله به مراحل پیشین بود. این وابستگی، موازی‌سازی محاسبات را دشوار می‌کرد.

همچنین یادگیری برخی وابستگی‌های بلندمدت در دنباله‌های طولانی برای این شبکه‌ها چالش‌برانگیز بود.

پیدایش سازوکار توجه

پیش از ترنسفورمر، پژوهشگران سازوکار توجه را برای بهبود مدل‌های دنباله‌به‌دنباله توسعه داده بودند.

در سال ۲۰۱۴، دژان باهداناو، کیونگ‌هیون چو و یوشوا بنجیو مقالهٔ Neural Machine Translation by Jointly Learning to Align and Translate را منتشر کردند.

این پژوهش نشان داد که مدل ترجمه می‌تواند هنگام تولید هر واژه، به بخش‌های مرتبط متن مبدأ توجه کند.[۳]

این تحول یکی از زمینه‌های نظری توسعهٔ ترنسفورمر بود.

معرفی ترنسفورمر در سال ۲۰۱۷

در ژوئن ۲۰۱۷، مقالهٔ Attention Is All You Need توسط هشت پژوهشگر منتشر شد.

نویسندگان عبارت بودند از:

  • اشیش واسوانی (Ashish Vaswani)
  • نوآم شازیر (Noam Shazeer)
  • نیکی پارمار (Niki Parmar)
  • یاکوب اوسکورایت (Jakob Uszkoreit)
  • لیون جونز (Llion Jones)
  • آیدان گومز (Aidan N. Gomez)
  • ووکاش کایزر (Łukasz Kaiser)
  • ایلیا پولوسوخین (Illia Polosukhin)

این پژوهش معماری جدیدی را معرفی کرد که در مدل‌سازی دنباله‌به‌دنباله، نیاز به لایه‌های بازگشتی و پیچشی را کنار می‌گذاشت و از توجه به‌عنوان سازوکار اصلی ارتباط میان موقعیت‌های دنباله استفاده می‌کرد.[۱]

نویسندگان نشان دادند که این معماری در وظایف ترجمهٔ ماشینی، علاوه بر کیفیت مناسب، امکان موازی‌سازی بیشتری نسبت به معماری‌های بازگشتی متداول آن دوره فراهم می‌کند.

اهمیت تاریخی مقالهٔ «توجه تنها چیزی است که نیاز دارید»

عنوان مقالهٔ Attention Is All You Need را می‌توان «توجه تنها چیزی است که نیاز دارید» ترجمه کرد.

این عنوان به تصمیم پژوهشگران برای جایگزینی ساختارهای بازگشتی و پیچشیِ مدل‌های پیشین با معماری مبتنی بر توجه اشاره داشت.

البته ترنسفورمر صرفاً از عملیات توجه تشکیل نشده است؛ شبکه‌های پیش‌خور، تعبیه‌های برداری، اتصالات باقیمانده و نرمال‌سازی نیز اجزای مهم آن هستند.

مقالهٔ سال ۲۰۱۷ نشان داد که معماری مبتنی بر توجه می‌تواند در ترجمهٔ ماشینی عملکرد رقابتی و کارایی محاسباتی مناسبی داشته باشد.[۲]

تأثیر این مقاله بعدها از ترجمهٔ ماشینی فراتر رفت و معماری ترنسفورمر در توسعهٔ مدل‌های زبانی، بینایی ماشین و هوش مصنوعی مولد نقش اساسی پیدا کرد.

سازوکار توجه

توجه (Attention) روشی محاسباتی است که به مدل اجازه می‌دهد هنگام پردازش یک عنصر، میزان ارتباط آن را با عناصر دیگر محاسبه کند.

در یک جمله، همهٔ واژه‌ها برای تفسیر یک واژه اهمیت یکسانی ندارند.

برای مثال:

«علی کتابی را که دیروز خریده بود، به دوستش داد.»

برای پردازش «خریده بود»، ارتباط با «علی» و «کتابی» می‌تواند مهم باشد.

سازوکار توجه امکان می‌دهد وزن متفاوتی به اطلاعات موقعیت‌های مختلف اختصاص داده شود.

این وزن‌ها ثابت نیستند؛ بلکه با توجه به ورودی و پارامترهای آموخته‌شدهٔ مدل محاسبه می‌شوند.

خودتوجهی

خودتوجهی (Self-Attention) سازوکاری است که در آن عناصر یک دنباله با عناصر همان دنباله ارتباط برقرار می‌کنند.

برای مثال در جمله:

«مریم به سارا گفت که کتابش را بیاورد.»

مدل برای تفسیر روابط واژگان باید بخش‌های مختلف جمله را در نظر بگیرد.

خودتوجهی می‌تواند اطلاعات مرتبط با هر واژه را از دیگر واژه‌ها جمع‌آوری کند.

با این حال، وجود سازوکار توجه تضمین نمی‌کند که مدل همیشه مرجع ضمیر یا معنای جمله را درست تشخیص دهد.

پرسش، کلید و مقدار

در معماری ترنسفورمر، سازوکار توجه معمولاً بر سه نوع بردار استوار است:

  • پرسش (Query یا Q)
  • کلید (Key یا K)
  • مقدار (Value یا V)

این بردارها از بازنمایی ورودی و با استفاده از تبدیل‌های خطی آموختنی محاسبه می‌شوند.

پرسش مشخص می‌کند که یک موقعیت در پی چه نوع اطلاعاتی است.

کلید برای محاسبهٔ میزان تطابق یا ارتباط با پرسش به کار می‌رود.

مقدار، اطلاعاتی است که پس از وزن‌دهی در خروجی توجه مشارکت می‌کند.

این اصطلاحات نام اجزای ریاضی معماری هستند و نباید آنها را به معنای پرسش و پاسخ آگاهانهٔ انسانی دانست.

توجه حاصل‌ضرب داخلی مقیاس‌بندی‌شده

در مقالهٔ اصلی ترنسفورمر، یکی از عملیات بنیادی با عنوان Scaled Dot-Product Attention معرفی شد.

رابطهٔ ریاضی آن چنین است:

Attention(Q,K,V) = softmax(QKᵀ / √dₖ)V

در این رابطه:

  • Q ماتریس پرسش‌هاست.
  • K ماتریس کلیدهاست.
  • V ماتریس مقدارهاست.
  • dₖ بُعد بردارهای کلید است.
  • softmax تابعی است که امتیازهای توجه را به وزن‌های نرمال‌شده تبدیل می‌کند.

ابتدا میزان ارتباط پرسش‌ها و کلیدها محاسبه می‌شود. سپس این امتیازها مقیاس‌بندی و نرمال می‌شوند و برای ترکیب وزن‌دار مقدارها به کار می‌روند.

مقیاس‌بندی با ریشهٔ دوم بُعد کلیدها به کنترل بزرگی حاصل‌ضرب‌های داخلی کمک می‌کند.[۱]

توجه چندسری

توجه چندسری (Multi-Head Attention) یکی از ویژگی‌های مهم ترنسفورمر است.

در این روش، چند عملیات توجه به‌طور موازی روی بازنمایی‌های متفاوت داده انجام می‌شود.

هر سری توجه می‌تواند الگوهای متفاوتی از روابط میان عناصر دنباله را بیاموزد.

برای مثال، در یک متن، برخی سری‌ها ممکن است نسبت به روابط نحوی و برخی دیگر نسبت به روابط معنایی یا وابستگی‌های موقعیتی حساس شوند.

با این حال، اختصاص یک نقش زبانی مشخص و ثابت به هر سری توجه، توصیفی دقیق برای همهٔ مدل‌ها نیست.

خروجی سری‌های مختلف ترکیب و به بازنمایی جدیدی تبدیل می‌شود.[۱]

ساختار اصلی ترنسفورمر

ترنسفورمر اولیه از دو بخش اصلی تشکیل شده بود:

  • رمزگذار
  • رمزگشا

این ساختار با عنوان Encoder–Decoder شناخته می‌شود.

در معماری اصلی، رمزگذار اطلاعات ورودی را پردازش می‌کرد و رمزگشا بر اساس آن اطلاعات، دنبالهٔ خروجی را تولید می‌کرد.

این ساختار برای ترجمهٔ ماشینی مناسب بود؛ زیرا متن زبان مبدأ را دریافت و متن زبان مقصد را تولید می‌کرد.

رمزگذار

رمزگذار (Encoder) بخش پردازش‌کنندهٔ ورودی در معماری اصلی ترنسفورمر است.

رمزگذار از چند لایه تشکیل می‌شود که هر یک شامل خودتوجهی چندسری و شبکهٔ پیش‌خور است.

وظیفهٔ آن تبدیل دنبالهٔ ورودی به بازنمایی‌هایی وابسته به زمینه است.

در مدل اصلی سال ۲۰۱۷، رمزگذار از شش لایهٔ تکرارشونده تشکیل شده بود.[۱]

برای مثال در ترجمهٔ جمله‌ای از فارسی به انگلیسی، رمزگذار می‌تواند روابط میان واژه‌های جملهٔ فارسی را بازنمایی کند.

رمزگشا

رمزگشا (Decoder) در معماری اصلی ترنسفورمر وظیفهٔ تولید دنبالهٔ خروجی را بر عهده دارد.

رمزگشا از اطلاعات تولیدشده در مراحل پیشین و بازنمایی‌های رمزگذار استفاده می‌کند.

در مدل اولیه، رمزگشا شامل خودتوجهی ماسک‌دار، توجه به خروجی رمزگذار و شبکهٔ پیش‌خور بود.

در هنگام تولید خودرگرسیو، مدل خروجی را مرحله‌به‌مرحله تولید می‌کند.

توجه ماسک‌دار

توجه ماسک‌دار (Masked Attention) برای محدودکردن دسترسی یک موقعیت به اطلاعات برخی موقعیت‌های دیگر استفاده می‌شود.

در مدل‌های زبانی خودرگرسیو، ماسک علّی مانع از آن می‌شود که یک موقعیت در هنگام پیش‌بینی به توکن‌های آینده دسترسی داشته باشد.

برای مثال هنگام پیش‌بینی واژهٔ بعدی در جمله:

«امروز هوا بسیار ...»

مدل باید بر اساس واژه‌های پیشین عمل کند، نه واژه‌ای که هنوز قرار است پیش‌بینی شود.

این سازوکار در آموزش مدل‌های زبانی مولد اهمیت اساسی دارد.

توجه متقاطع

توجه متقاطع (Cross-Attention) سازوکاری است که در آن پرسش‌ها از یک دنباله و کلیدها و مقدارها از دنباله‌ای دیگر به دست می‌آیند.

در ترنسفورمر رمزگذار–رمزگشا، رمزگشا می‌تواند با استفاده از توجه متقاطع به بازنمایی‌های تولیدشده توسط رمزگذار دسترسی پیدا کند.

این ویژگی برای وظایفی مانند ترجمهٔ ماشینی و خلاصه‌سازی متن مفید است.

تعبیهٔ برداری

پیش از ورود متن به لایه‌های ترنسفورمر، توکن‌ها معمولاً به بردارهای عددی تبدیل می‌شوند.

این فرایند تعبیهٔ برداری (Embedding) نام دارد.

برای مثال، یک واژه یا قطعه‌ای از واژه به جای آن‌که مستقیماً به‌صورت رشته‌ای از حروف پردازش شود، به یک بردار عددی در فضای چندبُعدی تبدیل می‌شود.

مقادیر این بردارها در فرایند آموزش آموخته می‌شوند.

تعبیهٔ برداری امکان استفاده از عملیات ریاضی برای پردازش اطلاعات زبانی را فراهم می‌کند.

کدگذاری موقعیتی

ترنسفورمر اولیه برخلاف شبکه‌های بازگشتی، ترتیب عناصر را از طریق یک فرایند بازگشتیِ ذاتی دریافت نمی‌کرد.

به همین دلیل پژوهشگران از کدگذاری موقعیتی (Positional Encoding) استفاده کردند.

کدگذاری موقعیتی اطلاعاتی دربارهٔ جایگاه عناصر در دنباله به بازنمایی آنها اضافه می‌کند.

در مقالهٔ اصلی، از توابع سینوسی و کسینوسی برای ساخت یکی از انواع کدگذاری موقعیتی استفاده شد.

در مدل‌های بعدی، روش‌های گوناگون دیگری برای بازنمایی موقعیت توسعه یافتند.[۱]

شبکهٔ پیش‌خور

در کنار سازوکار توجه، لایه‌های ترنسفورمر معمولاً دارای شبکهٔ پیش‌خور (Feed-Forward Network) هستند.

این شبکه روی بازنمایی هر موقعیت عملیات غیرخطی انجام می‌دهد.

توجه، اطلاعات موقعیت‌های مختلف را با یکدیگر ترکیب می‌کند؛ در حالی که شبکهٔ پیش‌خور تبدیل‌های بیشتری روی بازنمایی‌های حاصل انجام می‌دهد.

این دو جزء مکمل یکدیگرند.

اتصالات باقیمانده و نرمال‌سازی

ترنسفورمر از اتصالات باقیمانده (Residual Connections) و نرمال‌سازی لایه‌ای (Layer Normalization) نیز استفاده می‌کند.

اتصالات باقیمانده به انتقال اطلاعات و بهبود آموزش شبکه‌های عمیق کمک می‌کنند.

نرمال‌سازی نیز در پایداری محاسبات و فرایند آموزش نقش دارد.

این اجزا در معماری اولیه و بسیاری از گونه‌های بعدی ترنسفورمر اهمیت دارند.

انواع ترنسفورمر

با گسترش پژوهش‌ها، معماری ترنسفورمر به چند خانوادهٔ مهم تقسیم شد.

ترنسفورمر رمزگذارمحور

مدل‌های رمزگذارمحور برای ساخت بازنمایی‌های وابسته به زمینه از ورودی مناسب‌اند.

در این مدل‌ها، موقعیت‌های متن می‌توانند به اطلاعات دو سوی خود دسترسی داشته باشند، البته جزئیات به نوع ماسک و روش آموزش بستگی دارد.

مدل BERT یکی از نمونه‌های شناخته‌شدهٔ این خانواده است.

ترنسفورمر رمزگشامحور

مدل‌های رمزگشامحور عمدتاً برای تولید خودرگرسیو دنباله استفاده می‌شوند.

در این مدل‌ها، پیش‌بینی هر توکن معمولاً بر اساس توکن‌های قبلی انجام می‌شود.

بسیاری از مدل‌های خانوادهٔ GPT از معماری رمزگشامحور استفاده می‌کنند.

ترنسفورمر رمزگذار–رمزگشا

در این خانواده، رمزگذار ورودی را پردازش می‌کند و رمزگشا خروجی را تولید می‌کند.

مدل T5 نمونه‌ای از کاربرد این ساختار است.

این معماری برای وظایفی که در آنها یک دنباله به دنباله‌ای دیگر تبدیل می‌شود مناسب است.

ترنسفورمر و BERT

BERT مخفف Bidirectional Encoder Representations from Transformers است.

این مدل در سال ۲۰۱۸ توسط جیکوب دولین و همکاران معرفی شد.

BERT از معماری رمزگذار ترنسفورمر استفاده می‌کند و برای یادگیری بازنمایی‌های زبانی وابسته به زمینه طراحی شده است.

یکی از روش‌های اصلی پیش‌آموزش BERT، پیش‌بینی توکن‌های پنهان‌شده در متن بود.[۴]

این مدل در تحول روش‌های پردازش زبان طبیعی نقش مهمی داشت.

ترنسفورمر و GPT

GPT مخفف Generative Pre-trained Transformer است.

خانوادهٔ GPT از معماری‌های ترنسفورمری برای مدل‌سازی و تولید زبان استفاده می‌کند.

در مدل‌های خودرگرسیو این خانواده، سامانه بر اساس توکن‌های پیشین، توکن بعدی را پیش‌بینی می‌کند.

مقالهٔ Improving Language Understanding by Generative Pre-Training در سال ۲۰۱۸ از آثار اولیهٔ این مسیر پژوهشی بود.[۵]

نسل‌های بعدی مدل‌های GPT نشان دادند که معماری ترنسفورمر می‌تواند برای مدل‌سازی زبان در مقیاس بزرگ به کار رود.

ترنسفورمر و T5

T5 مخفف Text-to-Text Transfer Transformer است.

این مدل، وظایف مختلف پردازش زبان را در قالب تبدیل متن به متن صورت‌بندی می‌کند.

برای مثال، ترجمه، خلاصه‌سازی و پاسخ به پرسش می‌توانند به شکل دریافت یک متن و تولید متن دیگر تعریف شوند.

T5 از ساختار رمزگذار–رمزگشا استفاده می‌کند.[۶]

ترنسفورمر و مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ از مهم‌ترین کاربردهای ترنسفورمر هستند.

این مدل‌ها معمولاً با مجموعه‌های بزرگی از داده‌های متنی و روش‌های یادگیری خودنظارت‌شده آموزش داده می‌شوند.

در بسیاری از مدل‌های زبانی مولد، فرایند تولید پاسخ به‌صورت زیر انجام می‌شود:

متن ورودی
↓
تبدیل به توکن
↓
تعبیهٔ برداری
↓
پردازش توسط لایه‌های ترنسفورمر
↓
محاسبهٔ احتمال توکن بعدی
↓
انتخاب توکن
↓
تکرار فرایند
↓
متن خروجی

توانایی مدل‌های زبانی در تولید متن روان، پاسخ به پرسش، خلاصه‌سازی و تولید کد تا حد زیادی به بازنمایی‌های آموخته‌شده و ظرفیت محاسباتی آنها وابسته است.

با این حال، ترنسفورمر به‌تنهایی تضمین‌کنندهٔ صحت اطلاعات یا استدلال بی‌خطا نیست.

ترنسفورمر و هوش مصنوعی مولد

هوش مصنوعی مولد به سامانه‌هایی گفته می‌شود که می‌توانند محتوای جدیدی مانند متن، تصویر، صوت، ویدئو یا کد تولید کنند.

ترنسفورمر یکی از معماری‌های مهم در توسعهٔ این سامانه‌هاست.

در مدل‌های زبانی، ترنسفورمر برای پردازش و تولید توالی‌های توکن استفاده می‌شود.

در برخی سامانه‌های تولید تصویر و ویدئو نیز ترنسفورمر برای پردازش بازنمایی‌های تصویری یا چندوجهی به کار می‌رود.

با این حال همهٔ مدل‌های مولد از ترنسفورمر استفاده نمی‌کنند و معماری‌های دیگری مانند شبکه‌های پیچشی و مدل‌های انتشار نیز نقش مهمی دارند.

ترنسفورمر در بینایی ماشین

یکی از تحولات مهم پس از معرفی ترنسفورمر، استفاده از آن در بینایی ماشین بود.

در سال ۲۰۲۰، پژوهشگران معماری Vision Transformer یا ViT را معرفی کردند.

در این روش، تصویر به قطعه‌هایی تقسیم می‌شود و هر قطعه به بازنمایی برداری تبدیل می‌شود.

سپس این بازنمایی‌ها به ترنسفورمر داده می‌شوند تا روابط میان بخش‌های مختلف تصویر پردازش شود.[۷]

این روش نشان داد که معماری ترنسفورمر می‌تواند فراتر از داده‌های زبانی نیز کاربرد داشته باشد.

ترنسفورمر در پردازش تصویر

در پردازش تصویر، ترنسفورمر می‌تواند برای وظایفی مانند تشخیص اشیا، طبقه‌بندی تصاویر و تحلیل تصاویر پزشکی به کار رود.

سازوکار توجه به مدل اجازه می‌دهد روابط میان نواحی مختلف تصویر را محاسبه کند.

این ویژگی در تصاویری که شناخت یک ناحیه به اطلاعات نواحی دورتر وابسته است می‌تواند سودمند باشد.

ترنسفورمر در تشخیص گفتار

ترنسفورمر در سامانه‌های تشخیص گفتار نیز کاربرد دارد.

در این حوزه، دادهٔ صوتی به بازنمایی‌هایی تبدیل می‌شود که مدل می‌تواند آنها را پردازش کند.

سامانه‌های مبتنی بر ترنسفورمر می‌توانند برای تبدیل گفتار به متن، ترجمهٔ گفتار و پردازش صوت استفاده شوند.

برخی مدل‌های گفتار از ساختار رمزگذار–رمزگشا و برخی از معماری‌های دیگر بهره می‌برند.

ترنسفورمرهای چندوجهی

مدل چندوجهی (Multimodal Model) مدلی است که می‌تواند بیش از یک نوع داده را پردازش کند.

برای مثال:

  • متن و تصویر
  • متن و صوت
  • تصویر و ویدئو
  • متن، تصویر و صوت

ترنسفورمرها در توسعهٔ بسیاری از سامانه‌های چندوجهی نقش دارند.

این سامانه‌ها ممکن است اطلاعات چند نوع داده را در یک فضای بازنمایی مشترک یا از طریق سازوکارهای ارتباطی میان اجزای مختلف پردازش کنند.

کاربرد در ترجمهٔ ماشینی

ترجمهٔ ماشینی نخستین حوزهٔ اصلی ارزیابی ترنسفورمر بود.

در معماری رمزگذار–رمزگشا، متن زبان مبدأ به بازنمایی‌های وابسته به زمینه تبدیل می‌شود و رمزگشا بر اساس آنها متن زبان مقصد را تولید می‌کند.

ترنسفورمر به دلیل امکان مدل‌سازی روابط میان موقعیت‌های مختلف جمله و موازی‌سازی مناسب در آموزش، به یکی از معماری‌های اثرگذار ترجمهٔ ماشینی تبدیل شد.[۱]

کاربرد در خلاصه‌سازی

ترنسفورمر در سامانه‌های خلاصه‌سازی متن نیز استفاده می‌شود.

مدل می‌تواند سندی طولانی را دریافت و متنی کوتاه‌تر تولید کند.

با این حال خلاصهٔ تولیدشده ممکن است حاوی اطلاعات نادرست یا جزئیاتی باشد که در سند اصلی وجود ندارند.

بنابراین در کاربردهای علمی، حقوقی و دانشنامه‌ای باید تطابق خلاصه با منبع بررسی شود.

کاربرد در برنامه‌نویسی

مدل‌های مبتنی بر ترنسفورمر می‌توانند روی مجموعه‌های بزرگی از کد آموزش ببینند.

این مدل‌ها برای وظایفی مانند تکمیل کد، تولید تابع، توضیح برنامه و پیشنهاد اصلاحات به کار می‌روند.

با این حال کد تولیدشده ممکن است دارای خطای منطقی، نقص امنیتی یا استفاده از توابع ناموجود باشد.

در نتیجه، آزمون نرم‌افزار و بررسی مستندات رسمی همچنان ضروری است.

کاربرد در پزشکی

ترنسفورمرها در پژوهش‌های پزشکی برای تحلیل متن‌های بالینی، تصاویر پزشکی، داده‌های زیستی و اطلاعات مولکولی استفاده شده‌اند.

از جمله کاربردهای پژوهشی آنها می‌توان به تحلیل پرونده‌های پزشکی و مدل‌سازی توالی‌های زیستی اشاره کرد.

اما استفادهٔ بالینی از این سامانه‌ها به اعتبارسنجی، ارزیابی ایمنی و رعایت الزامات قانونی نیاز دارد.

مزایای ترنسفورمر

یکی از مهم‌ترین مزایای ترنسفورمر امکان موازی‌سازی بخش بزرگی از محاسبات در زمان آموزش است.

برخلاف شبکه‌های بازگشتی سنتی، محاسبهٔ بازنمایی موقعیت‌های مختلف یک دنباله در بسیاری از تنظیمات ترنسفورمر می‌تواند به‌صورت موازی انجام شود.

مزیت دیگر، توانایی مدل‌سازی روابط میان موقعیت‌های دور از یکدیگر از طریق سازوکار توجه است.

ترنسفورمر همچنین معماری انعطاف‌پذیری دارد و می‌تواند برای انواع مختلف داده و وظایف توسعه یابد.

محدودیت‌های ترنسفورمر

ترنسفورمر با وجود موفقیت‌های گسترده محدودیت‌هایی دارد.

یکی از مسائل مهم، هزینهٔ محاسباتی و حافظه در پردازش دنباله‌های طولانی است.

در توجه کامل متعارف، ماتریس امتیازهای توجه برای دنباله‌ای با طول n دارای n² عنصر است.

بنابراین با افزایش طول دنباله، هزینهٔ ذخیره و محاسبهٔ توجه می‌تواند به‌سرعت افزایش یابد.

البته روش‌های بهینه‌سازی و معماری‌های جدید تلاش کرده‌اند این محدودیت را کاهش دهند.

پیچیدگی محاسباتی توجه

در خودتوجهی کامل، هر موقعیت می‌تواند با همهٔ موقعیت‌های دیگر مقایسه شود.

اگر طول دنباله دو برابر شود، شمار عناصر ماتریس توجه در حالت متعارف تقریباً چهار برابر می‌شود.

این ویژگی به‌ویژه هنگام پردازش اسناد بسیار طولانی اهمیت دارد.

پژوهشگران برای کاهش هزینه، روش‌هایی مانند توجه تنک، توجه محلی و پیاده‌سازی‌های حافظه‌کارآمد توسعه داده‌اند.

FlashAttention

FlashAttention خانواده‌ای از روش‌های پیاده‌سازی کارآمد توجه است.

هدف این روش‌ها کاهش جابه‌جایی داده میان سطوح مختلف حافظه و افزایش کارایی محاسبات توجه است.

FlashAttention در مقاله‌ای در سال ۲۰۲۲ معرفی شد و نشان داد که با طراحی مناسب الگوریتم می‌توان توجه دقیق را با مصرف حافظهٔ کمتر و کارایی بهتر در سخت‌افزارهای مناسب محاسبه کرد.[۸]

این روش به معنای حذف تمام محدودیت‌های محاسباتی ترنسفورمر نیست، اما یکی از پیشرفت‌های مهم در بهینه‌سازی آن به شمار می‌رود.

پنجرهٔ زمینه

پنجرهٔ زمینه (Context Window) به مقدار اطلاعاتی اشاره دارد که مدل می‌تواند در یک فرایند پردازش در زمینهٔ خود دریافت کند.

در مدل‌های زبانی، این مقدار معمولاً بر حسب توکن بیان می‌شود.

محدودیت پنجرهٔ زمینه می‌تواند بر توانایی مدل در پردازش اسناد طولانی اثر بگذارد.

همچنین داشتن پنجرهٔ زمینهٔ بزرگ به‌تنهایی تضمین نمی‌کند که مدل از همهٔ اطلاعات موجود در آن به‌درستی استفاده کند.

محدودیت در پردازش متون طولانی

حتی زمانی که یک مدل می‌تواند متن بسیار طولانی دریافت کند، ممکن است در بازیابی یا استفادهٔ دقیق از برخی اطلاعات عملکرد نامتوازنی داشته باشد.

پژوهش‌هایی دربارهٔ مدل‌های زبانی نشان داده‌اند که موقعیت اطلاعات در متن می‌تواند بر عملکرد مدل اثر بگذارد.

برای نمونه، مطالعهٔ Lost in the Middle نشان داد که برخی مدل‌ها در استفاده از اطلاعاتی که در میانهٔ زمینه‌های طولانی قرار دارند با دشواری روبه‌رو می‌شوند.[۹]

ترنسفورمر و توهم هوش مصنوعی

یکی از مسائل مهم در مدل‌های مولد مبتنی بر ترنسفورمر، توهم هوش مصنوعی است.

مدل ممکن است متن روان و منسجمی تولید کند که بخشی از اطلاعات آن نادرست یا ساختگی باشد.

برای مثال ممکن است:

  • منبع علمی ناموجود معرفی کند؛
  • تاریخ رویدادی را اشتباه بنویسد؛
  • نقل‌قولی ساختگی تولید کند؛
  • یا اطلاعاتی را به شخصی نسبت دهد که در منبع اصلی وجود ندارد.

توهم ویژگی ضروری همهٔ خروجی‌های ترنسفورمر نیست و نباید آن را صرفاً نتیجهٔ وجود سازوکار توجه دانست.

این مسئله با داده‌های آموزشی، هدف‌های آموزش، نحوهٔ ارزیابی، زمینهٔ ورودی و شیوهٔ استفاده از مدل ارتباط دارد.

ترنسفورمر و سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم سامانه‌های مبتنی بر یادگیری عمیق است.

مدل‌های ترنسفورمری ممکن است الگوهای نامتوازن یا تبعیض‌آمیز موجود در داده‌های آموزشی را بازتولید کنند.

برای مثال، اگر داده‌های آموزشی دربارهٔ گروه‌های اجتماعی مختلف پوشش نامتوازنی داشته باشند، عملکرد مدل نیز ممکن است میان این گروه‌ها متفاوت باشد.

بررسی سوگیری نیازمند ارزیابی داده‌ها، خروجی‌ها و پیامدهای استفاده از سامانه است.

تفسیرپذیری ترنسفورمر

یکی از حوزه‌های پژوهشی مهم، بررسی نحوهٔ عملکرد درونی مدل‌های ترنسفورمری است.

پژوهشگران تلاش می‌کنند مشخص کنند که مدل چگونه اطلاعات را در لایه‌ها و بردارهای خود بازنمایی می‌کند.

وزن‌های توجه می‌توانند بخشی از رفتار محاسباتی مدل را نشان دهند، اما به‌تنهایی توضیح کامل و قطعی علت یک پیش‌بینی نیستند.

از این رو تفسیرپذیری مدل‌های بزرگ همچنان موضوع پژوهش است.

ترنسفورمر و حریم خصوصی

آموزش مدل‌های بزرگ ممکن است به مجموعه‌های وسیعی از داده‌ها نیاز داشته باشد.

این مسئله پرسش‌هایی دربارهٔ منشأ داده، رضایت صاحبان اطلاعات، امنیت و امکان بازتولید داده‌های حساس ایجاد می‌کند.

در برخی شرایط، مدل‌های یادگیری ماشین می‌توانند اطلاعاتی از داده‌های آموزشی را حفظ یا بازتولید کنند.

بنابراین مدیریت داده و ارزیابی خطرهای حریم خصوصی بخشی از توسعهٔ مسئولانهٔ این سامانه‌هاست.

ترنسفورمر و امنیت

سامانه‌های مبتنی بر ترنسفورمر می‌توانند در معرض حملات مختلف قرار گیرند.

در مدل‌های زبانی متصل به ابزارها یا اسناد خارجی، یکی از خطرها تزریق پرامپت (Prompt Injection) است.

در این وضعیت، متن غیرقابل اعتماد ممکن است حاوی دستورهایی باشد که برای تغییر رفتار سامانه طراحی شده‌اند.

این خطر صرفاً با معماری ترنسفورمر تعریف نمی‌شود، بلکه به نحوهٔ طراحی و اتصال سامانه به منابع و ابزارها نیز وابسته است.

ترنسفورمر و مصرف انرژی

آموزش و اجرای مدل‌های بزرگ ترنسفورمری می‌تواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.

این منابع شامل پردازنده‌های گرافیکی، شتاب‌دهنده‌های تخصصی، حافظه، ذخیره‌سازی، برق و تجهیزات خنک‌کننده هستند.

مصرف واقعی انرژی به اندازهٔ مدل، تعداد عملیات، نوع سخت‌افزار، میزان استفاده و کارایی مرکز داده وابسته است.

به همین دلیل نمی‌توان برای همهٔ مدل‌های ترنسفورمری یک مقدار ثابت مصرف انرژی تعیین کرد.

ترنسفورمر و تمرکز قدرت فناوری

توسعه و آموزش برخی مدل‌های بسیار بزرگ به سرمایه و زیرساخت گسترده نیاز دارد.

این مسئله می‌تواند دسترسی به توسعهٔ مدل‌های پیشرفته را برای مؤسسات دارای منابع محدود دشوار کند.

در مقابل، انتشار مدل‌های متن‌باز یا دارای وزن‌های در دسترس، توسعهٔ ابزارهای کارآمد و روش‌های کاهش هزینه می‌تواند امکان مشارکت گروه‌های بیشتری را فراهم کند.

این موضوع در مباحث اقتصاد فناوری، رقابت و دسترسی عمومی به هوش مصنوعی اهمیت دارد.

ترنسفورمر و جامعه

گسترش مدل‌های مبتنی بر ترنسفورمر بر شیوهٔ تولید و پردازش اطلاعات تأثیر گذاشته است.

سامانه‌های زبانی می‌توانند در نگارش، ترجمه، آموزش، برنامه‌نویسی، پژوهش و خدمات اطلاعاتی به کار روند.

در عین حال، تولید انبوه محتوای مصنوعی می‌تواند مسائل تازه‌ای دربارهٔ اصالت محتوا، حقوق مؤلف، صحت اطلاعات و اعتماد عمومی ایجاد کند.

ارزیابی پیامدهای اجتماعی این فناوری باید میان قابلیت‌های فنی مدل و نحوهٔ استفادهٔ انسان‌ها و سازمان‌ها از آن تمایز بگذارد.

ترنسفورمر و دانشنامه‌نویسی

مدل‌های زبانی مبتنی بر ترنسفورمر می‌توانند در فرایند تهیهٔ مقاله‌های دانشنامه‌ای به کار روند.

از جمله کاربردهای آنها می‌توان به موارد زیر اشاره کرد:

  • پیشنهاد ساختار مقاله؛
  • خلاصه‌سازی اسناد؛
  • استخراج اصطلاحات؛
  • کمک به ویرایش زبانی؛
  • ترجمهٔ منابع؛
  • و شناسایی موضوعات مرتبط.

با این حال، استفاده از این مدل‌ها برای دانشنامه‌نویسی نیازمند راستی‌آزمایی مستقل است.

مدل ممکن است منبعی غیرواقعی تولید کند یا اطلاعات صحیح و نادرست را در یک پاراگراف ترکیب کند.

بنابراین اعتبار یک مقالهٔ دانشنامه‌ای باید بر اساس منابع واقعی، معتبر و قابل بررسی تعیین شود، نه صرفاً کیفیت نثر تولیدشده.

ترنسفورمر و زبان فارسی

معماری ترنسفورمر در توسعهٔ سامانه‌های پردازش زبان فارسی نیز کاربرد دارد.

مدل‌های مبتنی بر این معماری می‌توانند برای تحلیل متن فارسی، طبقه‌بندی اسناد، تشخیص موجودیت‌های نام‌دار، ترجمه، خلاصه‌سازی و پاسخ به پرسش آموزش داده شوند.

یکی از نمونه‌های پژوهشی شناخته‌شده، ParsBERT است که برای پردازش زبان فارسی توسعه یافت.[۱۰]

کیفیت چنین مدل‌هایی به عواملی مانند تنوع داده‌های فارسی، شیوهٔ توکن‌سازی، پوشش گونه‌های زبانی و روش ارزیابی وابسته است.

تفاوت ترنسفورمر و یادگیری عمیق

یادگیری عمیق یک حوزهٔ گسترده از یادگیری ماشین است.

ترنسفورمر یکی از معماری‌های مورد استفاده در این حوزه است.

یادگیری عمیق شامل خانواده‌های دیگری مانند شبکه‌های عصبی پیچشی، شبکه‌های بازگشتی و معماری‌های گوناگون مولد نیز می‌شود.

بنابراین:

ترنسفورمر نوعی معماری یادگیری عمیق است، اما همهٔ مدل‌های یادگیری عمیق ترنسفورمر نیستند.

تفاوت ترنسفورمر و مدل زبانی بزرگ

ترنسفورمر یک معماری شبکهٔ عصبی است.

مدل زبانی بزرگ سامانه‌ای است که برای مدل‌سازی زبان با مقیاس قابل توجهی از پارامترها و داده‌ها آموزش دیده است.

بسیاری از مدل‌های زبانی بزرگ از معماری ترنسفورمر استفاده می‌کنند.

اما این دو اصطلاح مترادف نیستند.

یک ترنسفورمر می‌تواند برای طبقه‌بندی تصویر یا پردازش صوت به کار رود، بدون آن‌که مدل زبانی بزرگ باشد.

تفاوت ترنسفورمر و هوش مصنوعی مولد

هوش مصنوعی مولد به دسته‌ای از سامانه‌ها اشاره دارد که محتوای جدید تولید می‌کنند.

ترنسفورمر یک معماری محاسباتی است که می‌تواند در ساخت برخی از این سامانه‌ها استفاده شود.

بسیاری از مدل‌های مولد معاصر بر ترنسفورمر متکی هستند، اما همهٔ مدل‌های ترنسفورمری مولد نیستند.

برای مثال BERT عمدتاً برای یادگیری بازنمایی‌های زبانی و وظایف درک متن طراحی شده است، در حالی که مدل‌های رمزگشامحور خودرگرسیو برای تولید توالی مناسب‌اند.

آیندهٔ ترنسفورمر

پژوهش دربارهٔ ترنسفورمر در زمینه‌های مختلف ادامه دارد.

از جمله موضوعات مهم می‌توان به افزایش کارایی محاسباتی، گسترش پنجرهٔ زمینه، بهبود پردازش چندوجهی، کاهش مصرف حافظه و توسعهٔ روش‌های تفسیرپذیری اشاره کرد.

همچنین معماری‌های جایگزین یا ترکیبی برای مدل‌سازی دنباله‌ها توسعه یافته‌اند.

یکی از نمونه‌های پژوهشی، خانوادهٔ مدل‌های فضای حالت مانند Mamba است که با هدف مدل‌سازی کارآمد دنباله‌های طولانی معرفی شده‌اند.[۱۱]

وجود چنین معماری‌هایی نشان می‌دهد که پژوهش هوش مصنوعی به ترنسفورمر محدود نیست.

جمع‌بندی

ترنسفورمر یکی از معماری‌های اثرگذار در تاریخ یادگیری عمیق است که در سال ۲۰۱۷ با مقالهٔ Attention Is All You Need معرفی شد.

این معماری با استفاده از سازوکار توجه، به‌ویژه خودتوجهی، امکان مدل‌سازی روابط میان عناصر دنباله را فراهم کرد و نیاز به پردازش بازگشتیِ متوالی را در ساختار اصلی خود کنار گذاشت.[۱]

ترنسفورمر در ابتدا برای ترجمهٔ ماشینی توسعه یافت، اما به‌تدریج در پردازش زبان طبیعی، بینایی ماشین، تشخیص گفتار، مدل‌های چندوجهی و هوش مصنوعی مولد گسترش پیدا کرد.

معماری‌های BERT، GPT، T5 و ترنسفورمرهای بینایی از نمونه‌های مهم تحولاتی هستند که بر پایهٔ این فناوری شکل گرفته‌اند.

با وجود این پیشرفت‌ها، هزینهٔ محاسباتی، محدودیت پردازش دنباله‌های طولانی، توهم هوش مصنوعی، سوگیری الگوریتمی، تفسیرپذیری و حریم خصوصی از مسائل مهم سامانه‌های مبتنی بر ترنسفورمر باقی مانده‌اند.

اهمیت تاریخی ترنسفورمر در آن است که یکی از زیرساخت‌های اصلی موج جدید هوش مصنوعی را فراهم کرد و زمینهٔ توسعهٔ بسیاری از سامانه‌هایی را به وجود آورد که امروزه قادر به پردازش و تولید زبان، تصویر، صوت و دیگر انواع داده هستند.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Bahdanau, Dzmitry, Kyunghyun Cho, and Yoshua Bengio. “Neural Machine Translation by Jointly Learning to Align and Translate.” International Conference on Learning Representations, 2015. متن مقاله
  • Dao, Tri, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher Ré. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.” Advances in Neural Information Processing Systems 35 (2022). متن مقاله
  • Devlin, Jacob, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” Proceedings of NAACL-HLT, 2019. متن مقاله
  • Dosovitskiy, Alexey, et al. “An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale.” International Conference on Learning Representations, 2021. متن مقاله
  • Farahani, Mehrdad, et al. “ParsBERT: Transformer-based Model for Persian Language Understanding.” 2020. متن مقاله
  • Gu, Albert, and Tri Dao. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” 2023. متن مقاله
  • Liu, Nelson F., et al. “Lost in the Middle: How Language Models Use Long Contexts.” Transactions of the Association for Computational Linguistics 12 (2024). متن مقاله
  • Radford, Alec, Karthik Narasimhan, Tim Salimans, and Ilya Sutskever. “Improving Language Understanding by Generative Pre-Training.” OpenAI, 2018. متن مقاله
  • Raffel, Colin, et al. “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.” Journal of Machine Learning Research 21 (2020): 1–67. متن مقاله
  • Vaswani, Ashish, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, and Illia Polosukhin. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله


```