هوش مصنوعی چندوجهی

از ایران پدیا
نسخهٔ تاریخ ‏۱۰ اکتبر ۲۰۲۶، ساعت ۰۹:۵۳ توسط Safa (بحث | مشارکت‌ها)
پرش به ناوبری پرش به جستجو
هوش مصنوعی چندوجهی
شناسنامه
نام‌های دیگرهوش مصنوعی چندرسانه‌ای، هوش مصنوعی چندوجهی (Multimodal AI)
حوزههوش مصنوعی، یادگیری ماشین، یادگیری عمیق، بینایی ماشین، پردازش زبان طبیعی
خاستگاهعلوم شناختی، تشخیص الگو، پردازش سیگنال، بینایی ماشین، پردازش گفتار و یادگیری ماشین
اندیشه و تاریخ
مفاهیم کلیدیوجه داده، بازنمایی مشترک، هم‌ترازی، همجوشی داده، رمزگذار، رمزگشا، توجه متقاطع، یادگیری تقابلی، مدل بینایی-زبان، مدل همه‌وجهی
جریان‌های مرتبطیادگیری چندوجهی، یادگیری بازنمایی، مدل‌های بینایی-زبان، ترنسفورمر، مدل زبانی بزرگ، هوش مصنوعی مولد
تأثیرپذیرفته ازعلوم اعصاب، ادراک چندحسی، آمار، پردازش تصویر، پردازش زبان طبیعی و یادگیری عمیق
تأثیرگذار بردستیارهای هوشمند، سامانه‌های تحلیل تصویر و ویدئو، رباتیک، تولید محتوای چندرسانه‌ای و مدل‌های بنیادین چندوجهی
نقد و ارزیابی

هوش مصنوعی چندوجهی، (به انگلیسی: Multimodal Artificial Intelligence یا Multimodal AI) شاخه‌ای از هوش مصنوعی است که به توسعهٔ سامانه‌هایی برای پردازش، ارتباط‌دادن و ترکیب چند نوع داده، از جمله متن، تصویر، صوت، ویدئو و اطلاعات حسگرها می‌پردازد. برخلاف سامانه‌های تک‌وجهی که عمدتاً با یک نوع داده کار می‌کنند، سامانه‌های چندوجهی می‌توانند از اطلاعات موجود در چند وجه برای انجام وظایفی مانند توصیف تصویر، پاسخ‌گویی به پرسش دربارهٔ ویدئو، تحلیل گفتار همراه با تصویر و تولید محتوای چندرسانه‌ای استفاده کنند.[۱]

مفهوم چندوجهی‌بودن از این واقعیت الهام می‌گیرد که انسان محیط پیرامون خود را تنها از طریق یک حس دریافت نمی‌کند. ادراک انسانی از ترکیب اطلاعات دیداری، شنیداری، لمسی و دیگر حواس شکل می‌گیرد. با این حال، هوش مصنوعی چندوجهی بازسازی کامل ادراک انسان نیست، بلکه مجموعه‌ای از روش‌های ریاضی و محاسباتی برای پردازش و ارتباط‌دادن داده‌های متفاوت است.

پژوهش دربارهٔ ترکیب داده‌های چندوجهی سابقه‌ای طولانی دارد، اما پیشرفت یادگیری عمیق، شبکه‌های عصبی مصنوعی و معماری ترنسفورمر در دهه‌های ۲۰۱۰ و ۲۰۲۰ موجب توسعهٔ نسل تازه‌ای از مدل‌های چندوجهی شد. مدل‌هایی مانند CLIP، Flamingo، BLIP-2 و LLaVA نمونه‌هایی از پژوهش‌های اثرگذار در ارتباط‌دادن تصویر و زبان هستند.[۲][۳]

امروزه هوش مصنوعی چندوجهی در سامانه‌های گفت‌وگومحور، دستیارهای صوتی، تحلیل اسناد، پزشکی، رباتیک، آموزش، دسترس‌پذیری و هوش مصنوعی مولد کاربرد دارد. در کنار این قابلیت‌ها، مسائل مربوط به توهم هوش مصنوعی، سوگیری الگوریتمی، حریم خصوصی، جعل محتوای تصویری و صوتی و اعتبارسنجی اطلاعات از چالش‌های مهم آن به شمار می‌روند.

تعریف هوش مصنوعی چندوجهی

هوش مصنوعی چندوجهی به سامانه‌هایی گفته می‌شود که برای انجام یک وظیفه، اطلاعات مربوط به دو یا چند وجه داده را پردازش می‌کنند یا میان آنها ارتباط برقرار می‌سازند.

در این تعریف، «وجه» یا Modality به نوع یا شیوهٔ بازنمایی اطلاعات اشاره دارد.

برای مثال، متن و تصویر دو وجه متفاوت هستند. صوت و ویدئو نیز می‌توانند وجوه دیگری محسوب شوند.

یک سامانهٔ چندوجهی ممکن است تصویری را دریافت کند و بر اساس پرسش متنی کاربر، دربارهٔ محتوای آن پاسخ دهد.

سامانه‌ای دیگر ممکن است گفتار و تصویر یک سخنران را هم‌زمان تحلیل کند.

در نوعی دیگر، مدل می‌تواند دستور متنی را دریافت و تصویر یا صدای متناسب با آن تولید کند.

با این حال، صرف وجود چند نوع فایل در یک نرم‌افزار به معنای برخورداری آن از هوش مصنوعی چندوجهی نیست. ویژگی اصلی چنین سامانه‌ای توانایی پردازش یا ایجاد ارتباط محاسباتی میان وجوه مختلف داده است.

مفهوم وجه در هوش مصنوعی

وجه (Modality) اصطلاحی برای توصیف نوع اطلاعات یا کانالی است که داده از طریق آن دریافت یا بازنمایی می‌شود.

در پژوهش‌های هوش مصنوعی، وجوه مختلف ممکن است شامل موارد زیر باشند:

  • متن و زبان نوشتاری؛
  • تصویر ثابت؛
  • صوت و گفتار؛
  • ویدئو؛
  • داده‌های عمق و ساختار سه‌بعدی؛
  • اطلاعات مکانی و حرکتی؛
  • داده‌های حسگرهای محیطی؛
  • و سیگنال‌های زیستی.

همهٔ مدل‌های چندوجهی از تمام این وجوه پشتیبانی نمی‌کنند.

برای مثال، یک مدل بینایی-زبان ممکن است تنها برای پردازش تصویر و متن طراحی شده باشد، در حالی که مدلی دیگر از صوت، تصویر و متن استفاده کند.

تفاوت دادهٔ چندوجهی و دادهٔ چندرسانه‌ای

اصطلاح «چندرسانه‌ای» معمولاً به محتوایی اشاره دارد که از چند رسانه مانند متن، تصویر و صوت تشکیل شده است.

در مقابل، اصطلاح «چندوجهی» در یادگیری ماشین بر نوع داده و شیوهٔ پردازش یا ارتباط‌دادن آن تأکید دارد.

برای مثال، یک صفحهٔ اینترنتی که شامل متن و تصویر است، محتوایی چندرسانه‌ای دارد.

اما سامانه‌ای که بتواند رابطهٔ معنایی میان متن و تصویر همان صفحه را تحلیل کند، ممکن است از روش‌های هوش مصنوعی چندوجهی استفاده کند.

بنابراین این دو اصطلاح با یکدیگر ارتباط دارند، اما مترادف کامل نیستند.

خاستگاه نظری

ریشه‌های هوش مصنوعی چندوجهی به چند حوزهٔ علمی بازمی‌گردد.

یکی از این حوزه‌ها علوم شناختی است که چگونگی ترکیب اطلاعات حسی در ادراک انسان را بررسی می‌کند.

حوزهٔ دیگر پردازش سیگنال است که روش‌های تحلیل داده‌هایی مانند صوت و تصویر را توسعه داده است.

بینایی ماشین، پردازش زبان طبیعی و تشخیص گفتار نیز در شکل‌گیری این حوزه نقش داشته‌اند.

در یادگیری ماشین، مسئلهٔ بنیادی آن است که چگونه می‌توان اطلاعات موجود در چند منبع متفاوت را به شکلی ترکیب کرد که مدل بتواند روابط میان آنها را بیاموزد.

پژوهش مروری تاداس بالتروشایتیس، چایتانیا آهوجا و لوئی-فیلیپ مورنسی پنج مسئلهٔ مهم یادگیری چندوجهی را بازنمایی، ترجمه، هم‌ترازی، همجوشی و یادگیری مشترک معرفی می‌کند.[۱]

تاریخچه

پژوهش‌های اولیهٔ ترکیب داده‌ها

پژوهش‌های مربوط به ترکیب اطلاعات دیداری و شنیداری پیش از ظهور مدل‌های زبانی بزرگ وجود داشتند.

در سامانه‌های تشخیص گفتار، پژوهشگران دریافتند که اطلاعات مربوط به حرکت لب‌ها می‌تواند در کنار سیگنال صوتی برای تشخیص گفتار مفید باشد.

در رباتیک نیز ترکیب اطلاعات دوربین با داده‌های حسگرهای حرکتی و فاصله‌سنج سابقه‌ای طولانی دارد.

این پژوهش‌ها نشان دادند که ترکیب چند منبع اطلاعاتی می‌تواند در برخی شرایط به بهبود عملکرد سامانه کمک کند.

گسترش یادگیری چندوجهی در دههٔ ۲۰۱۰

در دههٔ ۲۰۱۰، پیشرفت یادگیری عمیق امکان توسعهٔ مدل‌هایی را فراهم کرد که بازنمایی‌های تصویری، متنی و صوتی را از داده می‌آموختند.

در این دوره، پژوهش دربارهٔ توصیف خودکار تصویر، پاسخ‌گویی بصری به پرسش و جست‌وجوی تصویر بر اساس متن گسترش یافت.

همچنین مجموعه‌داده‌های دارای جفت تصویر و متن در آموزش مدل‌های چندوجهی اهمیت بیشتری پیدا کردند.

ترنسفورمر و تحول پردازش زبان؛ ۲۰۱۷

در سال ۲۰۱۷، مقالهٔ Attention Is All You Need معماری ترنسفورمر را معرفی کرد.

این معماری با استفاده از سازوکار توجه، امکان مدل‌سازی روابط میان عناصر دنباله را فراهم می‌کرد.[۴]

ترنسفورمر ابتدا در زمینهٔ پردازش زبان توسعه یافت، اما بعدها در معماری‌های تصویری و چندوجهی نیز به کار گرفته شد.

معرفی CLIP؛ ۲۰۲۱

در سال ۲۰۲۱، الک ردفورد و همکاران مدل CLIP را در مقالهٔ Learning Transferable Visual Models From Natural Language Supervision معرفی کردند.

CLIP از آموزش تقابلی برای یادگیری ارتباط میان تصاویر و توصیف‌های متنی استفاده می‌کند.

پژوهشگران گزارش کردند که مدل را با مجموعه‌ای شامل حدود ۴۰۰ میلیون جفت تصویر و متن آموزش داده‌اند.

یکی از ویژگی‌های مهم CLIP توانایی استفاده از توصیف‌های متنی برای طبقه‌بندی تصاویر، بدون آموزش اختصاصی برای هر دستهٔ جدید، بود.[۲]

CLIP از نمونه‌های اثرگذار در گسترش یادگیری بازنمایی مشترک تصویر و متن به شمار می‌رود.

معرفی Flamingo؛ ۲۰۲۲

در سال ۲۰۲۲، پژوهشگران دیپ‌مایند مدل Flamingo را معرفی کردند.

این مدل برای پردازش ترکیب‌هایی از متن و داده‌های تصویری طراحی شده بود و می‌توانست تصاویر یا ویدئوها را همراه با متن دریافت کند.

یکی از اهداف پژوهش Flamingo، انجام وظایف تازه با استفاده از تعداد محدودی نمونهٔ آموزشی در متن ورودی بود.

این مدل از اجزای ازپیش‌آموزش‌دیدهٔ زبانی و بصری و سازوکارهای ارتباط میان آنها استفاده می‌کرد.[۳]

معرفی BLIP-2؛ ۲۰۲۳

مدل BLIP-2 در پژوهشی از جون‌جیه لی و همکاران معرفی شد.

این معماری برای ایجاد ارتباط میان رمزگذار تصویری ازپیش‌آموزش‌دیده و مدل زبانی بزرگ توسعه یافت.

یکی از ویژگی‌های آن استفاده از یک بخش واسط برای انتقال اطلاعات تصویری به فضای قابل استفاده برای مدل زبانی بود.

این رویکرد نشان داد که می‌توان با استفاده از اجزای ازپیش‌آموزش‌دیده، سامانه‌های بینایی-زبان ایجاد کرد.[۵]

معرفی LLaVA؛ ۲۰۲۳

در سال ۲۰۲۳، پژوهشگران مدل LLaVA را در مقالهٔ Visual Instruction Tuning معرفی کردند.

این مدل با هدف ترکیب توانایی‌های پردازش تصویر و گفت‌وگوی زبانی توسعه یافت.

در این رویکرد، اطلاعات تصویری به بازنمایی‌هایی تبدیل می‌شوند که مدل زبانی بتواند در تولید پاسخ از آنها استفاده کند.

LLaVA از نمونه‌های مهم پژوهش دربارهٔ آموزش دستوری مدل‌های بینایی-زبان است.[۶]

مدل‌های چندوجهی یکپارچه

در سال‌های بعد، پژوهش دربارهٔ مدل‌هایی گسترش یافت که می‌توانستند چند نوع داده را در یک سامانه پردازش کنند.

برخی مدل‌ها برای دریافت تصویر و متن و تولید پاسخ متنی طراحی شدند.

برخی دیگر قابلیت پردازش صوت، ویدئو یا تولید خروجی‌های چندوجهی را نیز توسعه دادند.

گزارش فنی Gemini در سال ۲۰۲۳ نمونه‌ای از پژوهش دربارهٔ خانواده‌ای از مدل‌های چندوجهی بود که برای پردازش انواع مختلف اطلاعات طراحی شده بودند.[۷]

ساختار هوش مصنوعی چندوجهی

ساختار سامانه‌های چندوجهی بسته به نوع داده و وظیفه متفاوت است.

با این حال، بسیاری از این سامانه‌ها از چند جزء اصلی تشکیل می‌شوند:

  • بخش دریافت و آماده‌سازی داده؛
  • رمزگذارهای اختصاصی وجوه مختلف؛
  • سازوکار هم‌ترازی یا ترکیب بازنمایی‌ها؛
  • بخش پردازش مشترک؛
  • و بخش تولید خروجی.

برای مثال، در یک سامانهٔ پاسخ‌گویی به پرسش دربارهٔ تصویر، ابتدا تصویر و پرسش متنی پردازش می‌شوند.

سپس اطلاعات تصویری و زبانی با یکدیگر ارتباط پیدا می‌کنند.

در مرحلهٔ بعد، مدل بر اساس این اطلاعات پاسخ تولید می‌کند.

رمزگذار

رمزگذار (Encoder) بخشی از مدل است که دادهٔ ورودی را به بازنمایی عددی تبدیل می‌کند.

در سامانه‌های چندوجهی، ممکن است برای هر وجه رمزگذار متفاوتی وجود داشته باشد.

برای مثال، رمزگذار تصویر می‌تواند از شبکهٔ عصبی پیچشی یا ترنسفورمر بینایی استفاده کند.

رمزگذار متن نیز می‌تواند بر اساس معماری ترنسفورمر طراحی شده باشد.

هدف رمزگذار ایجاد بازنمایی‌ای است که اطلاعات مورد نیاز برای وظیفهٔ مدل را حفظ کند.

رمزگشا

رمزگشا (Decoder) بخشی از معماری است که از بازنمایی‌های پردازش‌شده برای تولید خروجی استفاده می‌کند.

در یک سامانهٔ چندوجهی، خروجی ممکن است متن، تصویر، صوت یا نوع دیگری از داده باشد.

برای مثال، یک مدل بینایی-زبان می‌تواند تصویر را دریافت کند و با استفاده از رمزگشای زبانی، توضیحی دربارهٔ آن تولید کند.

همهٔ مدل‌های چندوجهی الزاماً دارای رمزگشای مولد نیستند.

مدل‌هایی مانند CLIP می‌توانند برای محاسبهٔ شباهت میان بازنمایی‌ها استفاده شوند، بدون آن‌که متن یا تصویر تازه‌ای تولید کنند.

بازنمایی مشترک

بازنمایی مشترک (Joint Representation) یکی از مفاهیم مهم یادگیری چندوجهی است.

در این رویکرد، اطلاعات چند وجه به شکلی بازنمایی می‌شوند که روابط میان آنها قابل یادگیری یا مقایسه باشد.

برای مثال، تصویر یک درخت و عبارت «درخت سبز» می‌توانند در فضای بازنمایی دارای ارتباط معنایی باشند.

این ارتباط امکان انجام وظایفی مانند جست‌وجوی تصویر بر اساس متن را فراهم می‌کند.

هم‌ترازی چندوجهی

هم‌ترازی (Alignment) به ایجاد ارتباط میان عناصر متعلق به وجوه متفاوت گفته می‌شود.

برای مثال، در ویدئوی سخنرانی، کلمات گفتار باید با بخش‌های زمانی مربوط به تصویر و صدا ارتباط پیدا کنند.

در تحلیل تصویر و متن نیز ممکن است لازم باشد مشخص شود کدام عبارت به کدام شیء یا ناحیهٔ تصویر اشاره دارد.

هم‌ترازی یکی از مسائل بنیادی یادگیری چندوجهی است.[۱]

همجوشی داده

همجوشی (Fusion) فرایند ترکیب اطلاعات چند وجه برای انجام یک وظیفه است.

این ترکیب می‌تواند در مراحل مختلف پردازش انجام شود.

سه رویکرد شناخته‌شده عبارت‌اند از:

  • همجوشی زودهنگام؛
  • همجوشی دیرهنگام؛
  • همجوشی میانی.

انتخاب روش مناسب به نوع داده، معماری و هدف سامانه وابسته است.

همجوشی زودهنگام

در همجوشی زودهنگام (Early Fusion)، اطلاعات وجوه مختلف در مراحل اولیهٔ پردازش ترکیب می‌شوند.

برای مثال، ویژگی‌های استخراج‌شده از صوت و تصویر ممکن است به یک بازنمایی مشترک تبدیل شوند.

این روش امکان یادگیری روابط میان وجوه را از مراحل اولیه فراهم می‌کند.

با این حال، تفاوت ساختار داده‌ها و مشکل هم‌زمان‌سازی می‌تواند اجرای آن را دشوار کند.

همجوشی دیرهنگام

در همجوشی دیرهنگام (Late Fusion)، هر وجه ابتدا به‌صورت مستقل پردازش می‌شود.

سپس نتایج یا پیش‌بینی‌های مربوط به وجوه مختلف با یکدیگر ترکیب می‌شوند.

برای مثال، یک مدل می‌تواند از صوت و مدلی دیگر از تصویر پیش‌بینی تولید کند و سامانه در مرحلهٔ پایانی این نتایج را ترکیب کند.

همجوشی میانی

در همجوشی میانی (Intermediate Fusion)، اطلاعات پس از بخشی از پردازش اختصاصی هر وجه و پیش از تولید خروجی نهایی ترکیب می‌شوند.

این رویکرد می‌تواند امکان یادگیری روابط پیچیده‌تر میان بازنمایی‌ها را فراهم کند.

بسیاری از معماری‌های جدید چندوجهی از شکل‌هایی از ترکیب بازنمایی‌های میانی استفاده می‌کنند.

توجه متقاطع

توجه متقاطع (Cross-Attention) یکی از سازوکارهای مهم در برخی مدل‌های چندوجهی است.

در این روش، بازنمایی‌های یک وجه می‌توانند هنگام پردازش به اطلاعات وجه دیگر توجه کنند.

برای مثال، هنگام تولید پاسخ متنی دربارهٔ تصویر، بخش زبانی مدل می‌تواند از اطلاعات تصویری استفاده کند.

توجه متقاطع در برخی معماری‌های بینایی-زبان، از جمله Flamingo، نقش مهمی دارد.[۳]

یادگیری تقابلی

یادگیری تقابلی (Contrastive Learning) روشی است که در آن مدل می‌آموزد بازنمایی‌های نمونه‌های مرتبط را به یکدیگر نزدیک و نمونه‌های نامرتبط را از یکدیگر متمایز کند.

در مدل CLIP، تصویر و متن متناظر با آن به‌عنوان نمونه‌های مرتبط در نظر گرفته می‌شوند.

این روش می‌تواند به یادگیری ارتباط معنایی میان تصویر و زبان کمک کند.[۲]

یادگیری انتقالی

یادگیری انتقالی (Transfer Learning) به استفاده از دانشی گفته می‌شود که مدل در یک مرحله یا وظیفهٔ پیشین آموخته است.

در سامانه‌های چندوجهی، ممکن است رمزگذار تصویر یا مدل زبانی ازپیش‌آموزش‌دیده در معماری جدید استفاده شود.

این رویکرد می‌تواند هزینهٔ آموزش از ابتدا را کاهش دهد.

با این حال، میزان موفقیت آن به سازگاری مدل‌های اولیه با وظیفهٔ جدید وابسته است.

یادگیری خودنظارت‌شده

یادگیری خودنظارت‌شده (Self-Supervised Learning) روشی است که در آن اطلاعات لازم برای تعریف وظیفهٔ آموزشی از ساختار خود داده استخراج می‌شود.

برای مثال، مدل می‌تواند با استفاده از ارتباط میان تصویر و متن همراه آن آموزش ببیند.

این روش در توسعهٔ مدل‌های بنیادین چندوجهی اهمیت دارد، زیرا تهیهٔ برچسب‌های انسانی برای همهٔ داده‌ها بسیار پرهزینه است.

مدل بینایی-زبان

مدل بینایی-زبان (Vision-Language Model یا VLM) خانواده‌ای از مدل‌های چندوجهی است که اطلاعات تصویری و زبانی را پردازش می‌کند.

این مدل‌ها می‌توانند برای وظایفی مانند توصیف تصویر، پاسخ‌گویی به پرسش‌های بصری، جست‌وجوی تصویر و تحلیل اسناد استفاده شوند.

CLIP، Flamingo، BLIP-2 و LLaVA از نمونه‌های شناخته‌شدهٔ پژوهش در این حوزه هستند.

با این حال، قابلیت‌های این مدل‌ها یکسان نیستند.

برخی برای یادگیری شباهت میان تصویر و متن طراحی شده‌اند و برخی دیگر برای تولید پاسخ‌های زبانی بر اساس تصویر.

مدل صوت-زبان

مدل صوت-زبان سامانه‌ای است که اطلاعات صوتی و زبانی را پردازش یا مرتبط می‌کند.

این مدل‌ها ممکن است برای تشخیص گفتار، پاسخ‌گویی دربارهٔ محتوای صوتی، ترجمهٔ گفتار یا تولید پاسخ صوتی استفاده شوند.

در برخی سامانه‌ها، صوت ابتدا به متن تبدیل می‌شود و سپس مدل زبانی آن را پردازش می‌کند.

در برخی معماری‌های دیگر، اطلاعات صوتی به‌صورت مستقیم‌تر وارد مدل می‌شود.

این دو رویکرد از نظر حفظ اطلاعات غیرکلامی صوت، مانند آهنگ گفتار یا صداهای محیطی، می‌توانند تفاوت داشته باشند.

مدل ویدئو-زبان

مدل ویدئو-زبان برای پردازش ارتباط میان ویدئو و زبان طراحی می‌شود.

ویدئو علاوه بر اطلاعات تصویری، دارای بعد زمانی است.

بنابراین تحلیل ویدئو ممکن است به شناسایی ترتیب رویدادها، حرکت اشیا و تغییرات صحنه نیاز داشته باشد.

برای مثال، یک سامانه می‌تواند ویدئویی را دریافت کند و دربارهٔ رویدادهای آن توضیح دهد.

اما تشخیص درست ترتیب زمانی و روابط علت و معلولی در ویدئو همچنان از مسائل دشوار پژوهشی است.

مدل‌های همه‌وجهی

اصطلاح همه‌وجهی (Omni-modal) گاهی برای توصیف سامانه‌هایی به کار می‌رود که چندین نوع ورودی و خروجی را در معماری نسبتاً یکپارچه پردازش می‌کنند.

این اصطلاح به معنای پشتیبانی واقعی از همهٔ انواع داده نیست.

قابلیت‌های هر مدل باید بر اساس مستندات فنی و ارزیابی مستقل مشخص شود.

هوش مصنوعی چندوجهی و ترنسفورمر

ترنسفورمر یکی از معماری‌های اثرگذار در توسعهٔ مدل‌های چندوجهی است.

سازوکار توجه در این معماری می‌تواند برای پردازش روابط میان عناصر متن، تصویر یا دیگر داده‌ها استفاده شود.

در برخی مدل‌ها، هر وجه ابتدا به بازنمایی‌های عددی تبدیل می‌شود و سپس این بازنمایی‌ها وارد بخش‌های ترنسفورمری می‌شوند.

با این حال، همهٔ سامانه‌های چندوجهی مبتنی بر ترنسفورمر نیستند.

روش‌های آماری، شبکه‌های پیچشی و معماری‌های دیگر نیز در یادگیری چندوجهی کاربرد دارند.

هوش مصنوعی چندوجهی و مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ معمولاً برای پردازش و تولید زبان توسعه یافته‌اند.

در برخی سامانه‌های چندوجهی، یک مدل زبانی بزرگ با رمزگذار تصویر یا صوت ترکیب می‌شود.

در این حالت، مدل می‌تواند اطلاعات غیرمتنی را در تولید پاسخ زبانی به کار گیرد.

اما هر مدل زبانی بزرگ الزاماً چندوجهی نیست.

همچنین یک سامانهٔ چندوجهی لزوماً مدل زبانی بزرگ ندارد.

برای مثال، سامانه‌ای که صوت و تصویر را برای تشخیص یک رویداد ترکیب می‌کند، ممکن است بدون مدل زبانی بزرگ عمل کند.

هوش مصنوعی چندوجهی و هوش مصنوعی مولد

هوش مصنوعی مولد به سامانه‌هایی گفته می‌شود که می‌توانند محتوای جدید تولید کنند.

هوش مصنوعی چندوجهی بر پردازش یا ارتباط‌دادن چند نوع داده تمرکز دارد.

این دو مفهوم هم‌پوشانی دارند، اما یکسان نیستند.

برای مثال، CLIP مدلی چندوجهی است که هدف اصلی آن تولید متن یا تصویر نیست.

در مقابل، یک مدل تولید متن که فقط ورودی و خروجی متنی دارد، می‌تواند مولد باشد اما چندوجهی نباشد.

سامانه‌ای که تصویر را دریافت و پاسخ متنی تولید می‌کند، نمونه‌ای از هم‌پوشانی این دو حوزه است.

پاسخ‌گویی بصری به پرسش

پاسخ‌گویی بصری به پرسش (Visual Question Answering یا VQA) یکی از وظایف مهم هوش مصنوعی چندوجهی است.

در این وظیفه، سامانه یک تصویر و یک پرسش متنی دریافت می‌کند.

سپس باید بر اساس اطلاعات تصویر پاسخ دهد.

برای مثال، اگر تصویری از یک خیابان به مدل داده شود، کاربر می‌تواند بپرسد: «چند خودرو در تصویر دیده می‌شود؟»

مدل برای پاسخ درست باید محتوای تصویر را پردازش و آن را با معنای پرسش مرتبط کند.

توصیف خودکار تصویر

توصیف خودکار تصویر (Image Captioning) به تولید توضیح متنی دربارهٔ محتوای تصویر گفته می‌شود.

این فناوری در سامان‌دهی آرشیوهای تصویری، جست‌وجو و ابزارهای دسترس‌پذیری کاربرد دارد.

با این حال، توصیف تولیدشده ممکن است شامل جزئیات نادرست باشد.

بنابراین در کاربردهای حساس، متن باید با تصویر اصلی تطبیق داده شود.

جست‌وجوی متن به تصویر

در جست‌وجوی متن به تصویر، کاربر عبارتی متنی وارد می‌کند و سامانه تصاویر مرتبط را بازیابی می‌کند.

این روش می‌تواند از بازنمایی‌های مشترک متن و تصویر استفاده کند.

برای مثال، کاربر می‌تواند عبارت «پل تاریخی بر فراز رودخانه» را جست‌وجو کند و سامانه تصاویر مرتبط را پیشنهاد دهد.

مدل CLIP از پژوهش‌های اثرگذار در یادگیری بازنمایی‌های قابل مقایسهٔ تصویر و متن است.[۲]

جست‌وجوی تصویر به متن

در این کاربرد، تصویر به‌عنوان ورودی استفاده می‌شود و سامانه متن یا اسناد مرتبط را جست‌وجو می‌کند.

برای مثال، تصویر یک اثر تاریخی ممکن است برای یافتن توضیحات مرتبط در یک پایگاه اطلاعاتی استفاده شود.

نتیجهٔ جست‌وجو باید بر اساس منابع معتبر ارزیابی شود، زیرا شباهت بصری به‌تنهایی اثبات‌کنندهٔ هویت یا اصالت یک شیء نیست.

تحلیل اسناد چندوجهی

اسناد دیجیتال و اسکن‌شده ممکن است شامل متن، تصویر، نمودار، نقشه و ساختار صفحه باشند.

تحلیل چنین اسنادی به ترکیب اطلاعات دیداری و زبانی نیاز دارد.

برای مثال، سامانه باید بتواند عنوان، پاراگراف، زیرنویس تصویر و ارتباط میان آنها را تشخیص دهد.

این فناوری در دیجیتال‌سازی آرشیوها، پردازش اسناد اداری و پژوهش تاریخی کاربرد دارد.

هوش مصنوعی چندوجهی در پزشکی

در پزشکی، اطلاعات مربوط به یک بیمار ممکن است شامل متن پرونده، تصاویر پزشکی، نتایج آزمایش و سیگنال‌های زیستی باشد.

مدل‌های چندوجهی می‌توانند برای بررسی روابط میان این داده‌ها توسعه یابند.

برای مثال، پژوهشگران ممکن است اطلاعات تصویربرداری پزشکی را با گزارش‌های متنی مرتبط کنند.

با این حال، استفادهٔ بالینی از چنین مدل‌هایی نیازمند ارزیابی مستقل، اعتبارسنجی روی جمعیت هدف و نظارت متخصصان است.

توانایی تولید پاسخ متنی دربارهٔ تصویر پزشکی به‌تنهایی اثبات‌کنندهٔ صلاحیت تشخیصی سامانه نیست.

هوش مصنوعی چندوجهی در آموزش

در آموزش، سامانه‌های چندوجهی می‌توانند متن، نمودار، تصویر و صوت را برای ارائهٔ توضیح یا تمرین ترکیب کنند.

برای مثال، دانش‌آموز می‌تواند تصویری از یک مسئلهٔ هندسی ارائه دهد و دربارهٔ آن پرسش کند.

مدل می‌تواند اطلاعات تصویری و زبانی را برای تولید پاسخ به کار گیرد.

با این حال، درستی محاسبات و توضیحات باید بررسی شود.

همچنین استفاده از اطلاعات شخصی دانش‌آموزان نیازمند رعایت حریم خصوصی است.

هوش مصنوعی چندوجهی در رباتیک

در رباتیک، سامانه ممکن است داده‌های دوربین، حسگرهای فاصله، اطلاعات حرکتی و فرمان‌های زبانی را دریافت کند.

ترکیب این اطلاعات می‌تواند برای شناسایی اشیا، ناوبری و اجرای برخی وظایف استفاده شود.

برای مثال، یک ربات می‌تواند دستور «جعبهٔ قرمز را بردار» دریافت کند.

اجرای این دستور به ارتباط‌دادن زبان با داده‌های بصری و سپس کنترل حرکت نیاز دارد.

در محیط واقعی، خطای تشخیص یا تفسیر فرمان ممکن است پیامد فیزیکی داشته باشد؛ از این رو آزمون ایمنی اهمیت ویژه‌ای دارد.

هوش مصنوعی چندوجهی در حمل‌ونقل

در سامانه‌های حمل‌ونقل، داده‌های دوربین، رادار، لیدار و دیگر حسگرها ممکن است با یکدیگر ترکیب شوند.

هدف می‌تواند ایجاد برآورد دقیق‌تری از وضعیت محیط باشد.

برای مثال، یک سامانهٔ کمک‌راننده ممکن است اطلاعات تصویری را با اندازه‌گیری فاصله ترکیب کند.

با این حال، ترکیب چند حسگر به‌تنهایی تضمین‌کنندهٔ ایمنی نیست.

کیفیت داده، شرایط محیط و طراحی سامانه همچنان اهمیت دارند.

هوش مصنوعی چندوجهی در صنعت

در صنعت، مدل‌های چندوجهی می‌توانند داده‌های تصویری، صوتی و حسگرهای تجهیزات را ترکیب کنند.

برای مثال، سامانه‌ای ممکن است تصویر یک قطعه، صدای دستگاه و داده‌های لرزش را برای شناسایی وضعیت غیرعادی بررسی کند.

این رویکرد می‌تواند در کنترل کیفیت و نگهداری تجهیزات کاربرد داشته باشد.

عملکرد آن به کیفیت داده و شرایط واقعی محیط صنعتی وابسته است.

هوش مصنوعی چندوجهی در کشاورزی

در کشاورزی، ترکیب تصاویر گیاهان، داده‌های هواشناسی، اطلاعات خاک و حسگرهای محیطی می‌تواند برای تحلیل وضعیت محصول استفاده شود.

برای مثال، سامانه ممکن است تصویر برگ را همراه با اطلاعات رطوبت و دما بررسی کند.

این کاربردها می‌توانند به پایش وضعیت زمین و تصمیم‌گیری کمک کنند.

با این حال، نتیجهٔ مدل باید با داده‌های محلی و بررسی‌های میدانی ارزیابی شود.

هوش مصنوعی چندوجهی و دسترس‌پذیری

یکی از کاربردهای مهم هوش مصنوعی چندوجهی، توسعهٔ ابزارهای کمک‌کننده به افراد دارای معلولیت است.

برای مثال، سامانه‌های توصیف تصویر می‌توانند اطلاعات بصری را به متن یا گفتار تبدیل کنند.

ابزارهای تبدیل گفتار به متن نیز می‌توانند به دسترسی افراد ناشنوا یا کم‌شنوا به محتوای صوتی کمک کنند.

در برخی سامانه‌ها، تصویر، متن و صوت برای ایجاد تعامل مناسب‌تر ترکیب می‌شوند.

با این حال، خطای سامانه در تشخیص اشیا یا توصیف محیط می‌تواند برای کاربران پیامد عملی داشته باشد.

هوش مصنوعی چندوجهی و زبان فارسی

مدل‌های چندوجهی می‌توانند در پردازش اسناد، تصاویر و گفتار فارسی کاربرد داشته باشند.

برای مثال، سامانه‌ای ممکن است تصویری از یک سند فارسی دریافت کند و محتوای آن را استخراج یا خلاصه کند.

در چنین کاربردهایی، کیفیت تشخیص نویسه‌ها، پردازش راست‌به‌چپ و شناخت ساختار زبان فارسی اهمیت دارد.

همچنین تفاوت میان زبان رسمی، گفتار محاوره‌ای و گویش‌های مختلف می‌تواند بر عملکرد مدل تأثیر بگذارد.

ارزیابی مدل‌های چندوجهی فارسی باید با استفاده از داده‌های متنوع و معیارهای مناسب انجام شود.

هوش مصنوعی چندوجهی و اسناد تاریخی

در پژوهش تاریخی، اسناد ممکن است شامل متن، تصویر، نقشه، دست‌خط و نشانه‌های بصری باشند.

مدل‌های چندوجهی می‌توانند در شناسایی ساختار صفحه، استخراج متن و ارتباط‌دادن تصاویر با توضیحات کمک کنند.

برای مثال، سامانه ممکن است یک صفحهٔ روزنامهٔ قدیمی را دریافت و عنوان‌ها، تصاویر و متن‌های مرتبط را جدا کند.

اما چنین سامانه‌ای ممکن است نام اشخاص، تاریخ‌ها یا جزئیات تصویر را اشتباه تشخیص دهد.

بنابراین در پژوهش تاریخی، خروجی مدل باید با سند اصلی و منابع مستقل بررسی شود.

هوش مصنوعی چندوجهی و دانشنامه‌نویسی

هوش مصنوعی چندوجهی می‌تواند در گردآوری و سازمان‌دهی منابع دانشنامه‌ای کاربرد داشته باشد.

برای مثال، این فناوری ممکن است در تحلیل تصاویر تاریخی، استخراج متن از اسناد اسکن‌شده، جست‌وجوی تصاویر مشابه و تهیهٔ توضیحات اولیه برای تصاویر استفاده شود.

در دانشنامه‌نویسی، استفاده از این قابلیت‌ها می‌تواند سرعت بررسی منابع را افزایش دهد.

با این حال، مدل ممکن است دربارهٔ هویت اشخاص، محل ثبت تصویر، زمان رویداد یا اصالت سند اطلاعات نادرست تولید کند.

بنابراین خروجی مدل باید به‌عنوان نتیجه‌ای قابل بررسی تلقی شود، نه منبع مستقل و قطعی.

در نگارش مقاله‌های دانشنامه‌ای، ارجاع باید به منبع اصلی یا پژوهش معتبر داده شود، نه صرفاً به توضیح تولیدشده توسط سامانهٔ هوش مصنوعی.

هوش مصنوعی چندوجهی و ایران

هوش مصنوعی چندوجهی می‌تواند در حوزه‌هایی مانند پردازش اسناد فارسی، تحلیل تصاویر پزشکی، آموزش، صنعت و پژوهش‌های زبان فارسی کاربرد داشته باشد.

با این حال، برای ارزیابی میزان توسعه یا کاربرد واقعی این فناوری در ایران، به داده‌ها و پژوهش‌های مشخص نیاز است.

همچنین استفاده از سامانه‌های ترکیب تصویر، صوت و اطلاعات هویتی در نظارت عمومی می‌تواند مسائل مهمی دربارهٔ حریم خصوصی و حقوق شهروندی ایجاد کند.

هر ادعای مشخص دربارهٔ به‌کارگیری چنین سامانه‌هایی توسط یک نهاد باید بر اساس اسناد قابل راستی‌آزمایی مطرح شود.

مزایای هوش مصنوعی چندوجهی

یکی از مزایای بالقوهٔ هوش مصنوعی چندوجهی، استفاده از اطلاعات مکمل موجود در چند نوع داده است.

برای مثال، در شرایطی که کیفیت صوت پایین است، اطلاعات تصویری ممکن است در برخی سامانه‌ها به تشخیص گفتار کمک کند.

در تحلیل اسناد نیز ترکیب متن و ساختار بصری صفحه می‌تواند اطلاعات بیشتری نسبت به پردازش متن به‌تنهایی فراهم کند.

مزیت دیگر، امکان طراحی تعامل طبیعی‌تر با کاربر است.

کاربر می‌تواند به‌جای توصیف کامل یک تصویر، خود تصویر را همراه با پرسش ارائه دهد.

با این حال، چندوجهی‌بودن به‌تنهایی تضمین‌کنندهٔ عملکرد بهتر نیست.

اگر داده‌های یکی از وجوه نامعتبر یا ناسازگار باشند، ترکیب آنها ممکن است به خطا منجر شود.

محدودیت‌های فنی

مدل‌های چندوجهی با محدودیت‌های مختلفی روبه‌رو هستند.

یکی از آنها تفاوت ساختار داده‌هاست.

متن معمولاً به‌صورت دنباله‌ای از توکن‌ها پردازش می‌شود، در حالی که تصویر دارای ساختار مکانی و ویدئو دارای ساختار مکانی و زمانی است.

صوت نیز دارای ویژگی‌های زمانی و فرکانسی است.

ایجاد ارتباط میان این داده‌ها به طراحی معماری و روش آموزش مناسب نیاز دارد.

محدودیت دیگر، هزینهٔ محاسباتی است.

پردازش تصاویر با وضوح بالا یا ویدئوهای طولانی ممکن است به حافظه و توان پردازشی قابل توجهی نیاز داشته باشد.

مسئلهٔ هم‌زمان‌سازی

در برخی کاربردهای چندوجهی، داده‌های مختلف باید از نظر زمانی با یکدیگر هماهنگ باشند.

برای مثال، در تحلیل گفتار همراه با تصویر، حرکت لب‌ها باید با سیگنال صوتی مرتبط شود.

اگر داده‌ها از نظر زمانی ناهماهنگ باشند، عملکرد مدل ممکن است کاهش یابد.

این مسئله در تحلیل ویدئو، رباتیک و سامانه‌های تعاملی اهمیت دارد.

تعارض میان وجوه داده

گاهی اطلاعات وجوه مختلف با یکدیگر ناسازگار هستند.

برای مثال، متن همراه یک تصویر ممکن است محتوای تصویر را نادرست توصیف کند.

در چنین شرایطی، مدل باید بتواند با عدم قطعیت یا تعارض اطلاعات برخورد کند.

اما سامانه‌های چندوجهی ممکن است به یکی از وجوه بیش از اندازه اتکا کنند یا از دادهٔ نادرست نتیجه بگیرند.

این مسئله در ارزیابی قابلیت اعتماد مدل اهمیت دارد.

توهم هوش مصنوعی چندوجهی

توهم هوش مصنوعی در سامانه‌های چندوجهی نیز ممکن است رخ دهد.

برای مثال، مدل ممکن است تصویری را دریافت کند و شیئی را توصیف کند که در تصویر وجود ندارد.

همچنین ممکن است متن موجود در تصویر را نادرست بخواند یا دربارهٔ ترتیب رویدادهای ویدئو نتیجهٔ اشتباه بگیرد.

در برخی موارد، پاسخ تولیدشده از نظر زبانی روان و قانع‌کننده است، اما با دادهٔ تصویری یا صوتی مطابقت ندارد.

بنابراین روان‌بودن پاسخ نباید با درستی آن یکسان دانسته شود.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از چالش‌های مهم هوش مصنوعی چندوجهی است.

داده‌های آموزشی ممکن است از نظر زبان، فرهنگ، جنسیت، سن، شرایط محیطی یا گروه‌های جمعیتی نامتوازن باشند.

این عدم توازن می‌تواند بر عملکرد مدل در تشخیص چهره، تحلیل گفتار یا توصیف تصویر تأثیر بگذارد.

برای مثال، مدلی که با داده‌های محدود از یک زبان آموزش دیده ممکن است در پردازش گویش‌های دیگر عملکرد ضعیف‌تری داشته باشد.

ارزیابی مدل باید تفاوت عملکرد در شرایط و گروه‌های مختلف را بررسی کند.

حریم خصوصی

مدل‌های چندوجهی ممکن است اطلاعات حساسی را از تصاویر، صداها یا اسناد استخراج کنند.

برای مثال، تصویر می‌تواند حاوی چهره، محل زندگی یا اطلاعات شناسایی‌کننده باشد.

صوت نیز ممکن است ویژگی‌های صدای فرد یا محتوای مکالمه را در بر داشته باشد.

ترکیب چند نوع داده می‌تواند امکان استنتاج اطلاعاتی را فراهم کند که از بررسی هر وجه به‌تنهایی به‌آسانی به دست نمی‌آیند.

به همین دلیل، گردآوری، ذخیره‌سازی و پردازش داده‌های چندوجهی نیازمند توجه ویژه به حریم خصوصی است.

نظارت و شناسایی افراد

ترکیب اطلاعات تصویری، صوتی و مکانی می‌تواند در سامانه‌های شناسایی و ردیابی افراد استفاده شود.

چنین کاربردهایی ممکن است برای مدیریت دسترسی یا امنیت طراحی شوند.

اما استفاده از آنها در نظارت عمومی می‌تواند خطرهایی برای آزادی‌های مدنی ایجاد کند.

از جمله مسائل مهم می‌توان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و امکان نظارت بدون رضایت افراد اشاره کرد.

ارزیابی حقوقی و اجتماعی این سامانه‌ها باید بر اساس کاربرد مشخص، ضرورت، تناسب و سازوکارهای پاسخگویی انجام شود.

دیپ‌فیک و جعل محتوای چندرسانه‌ای

پیشرفت مدل‌های مولد چندوجهی امکان تولید یا دست‌کاری تصاویر، صداها و ویدئوها را گسترش داده است.

اصطلاح دیپ‌فیک معمولاً به محتوای مصنوعی یا دست‌کاری‌شده‌ای اشاره دارد که می‌تواند ظاهر یا صدای یک فرد را به شکلی گمراه‌کننده بازنمایی کند.

چنین محتوایی ممکن است برای سرگرمی، تولید هنری یا کاربردهای مجاز ایجاد شود، اما امکان استفادهٔ فریبکارانه نیز دارد.

از جمله خطرها می‌توان به جعل هویت، انتشار اطلاعات نادرست و آسیب به اعتبار اشخاص اشاره کرد.

در بررسی اصالت محتوا، اتکا به تشخیص خودکار به‌تنهایی کافی نیست و باید منشأ فایل، زمینهٔ انتشار و شواهد مستقل نیز بررسی شوند.

امنیت مدل‌های چندوجهی

سامانه‌های چندوجهی ممکن است در معرض حملات فنی قرار گیرند.

برای مثال، دادهٔ تصویری یا صوتی می‌تواند حاوی محتوایی باشد که با هدف تأثیرگذاری نامناسب بر رفتار مدل طراحی شده است.

در سامانه‌هایی که تصویر و متن را با یک مدل زبانی ترکیب می‌کنند، امکان حملات تزریق دستور از طریق محتوای ورودی نیز مطرح است.

این مسئله به‌ویژه زمانی اهمیت دارد که سامانه بتواند به ابزارها یا اطلاعات حساس دسترسی داشته باشد.

تفسیرپذیری

برخی مدل‌های چندوجهی دارای معماری‌های پیچیده و تعداد زیادی پارامتر هستند.

در چنین مدل‌هایی، توضیح اینکه کدام بخش از تصویر، صوت یا متن بیشترین تأثیر را بر خروجی داشته ممکن است دشوار باشد.

پژوهشگران از روش‌هایی مانند تحلیل توجه، بررسی حساسیت و مطالعهٔ بازنمایی‌های داخلی برای شناخت رفتار مدل استفاده می‌کنند.

با این حال، این روش‌ها لزوماً توضیح کامل و قطعی دربارهٔ سازوکار تصمیم‌گیری ارائه نمی‌دهند.

ارزیابی مدل‌های چندوجهی

ارزیابی مدل‌های چندوجهی باید بر اساس نوع وظیفه انجام شود.

برای مثال، در پاسخ‌گویی بصری به پرسش، درستی پاسخ نسبت به تصویر اهمیت دارد.

در جست‌وجوی متن به تصویر، کیفیت بازیابی نتایج مرتبط بررسی می‌شود.

در تحلیل ویدئو، دقت تشخیص رویدادها و ترتیب زمانی آنها اهمیت دارد.

در تولید محتوای چندوجهی، علاوه بر کیفیت خروجی، سازگاری آن با ورودی و خطر تولید محتوای گمراه‌کننده باید بررسی شود.

هیچ معیار واحدی برای سنجش همهٔ قابلیت‌های مدل‌های چندوجهی کافی نیست.

مسئلهٔ داده‌های آموزشی

آموزش مدل‌های چندوجهی ممکن است به مجموعه‌های بزرگی از داده‌های تصویری، متنی یا صوتی نیاز داشته باشد.

کیفیت، تنوع و اعتبار این داده‌ها بر عملکرد مدل تأثیر دارند.

همچنین گردآوری داده‌ها ممکن است مسائل مربوط به حق مؤلف، رضایت افراد و استفاده از اطلاعات شخصی را مطرح کند.

در برخی مجموعه‌داده‌ها، توضیحات متنی ممکن است با تصاویر مرتبط نباشند یا اطلاعات نادرست داشته باشند.

چنین مشکلاتی می‌توانند در فرایند آموزش به مدل منتقل شوند.

مصرف انرژی و هزینهٔ محاسباتی

پردازش هم‌زمان چند نوع داده می‌تواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.

برای مثال، تحلیل ویدئو معمولاً شامل پردازش تعداد زیادی فریم است.

پردازش صوت نیز ممکن است به تحلیل دنباله‌های زمانی طولانی نیاز داشته باشد.

هزینهٔ محاسباتی به اندازهٔ مدل، نوع داده، معماری، سخت‌افزار و روش آموزش وابسته است.

بهینه‌سازی مصرف حافظه و انرژی از موضوعات مهم پژوهش در این حوزه است.

تمرکز قدرت فناوری

توسعهٔ برخی مدل‌های چندوجهی بزرگ به داده، سرمایه و زیرساخت محاسباتی گسترده نیاز دارد.

این مسئله می‌تواند توسعهٔ پیشرفته‌ترین مدل‌ها را در اختیار تعداد محدودی از شرکت‌ها و مؤسسات دارای منابع مالی و فنی قرار دهد.

در مقابل، انتشار پژوهش‌های علمی، ابزارهای متن‌باز و مدل‌های دارای وزن‌های در دسترس می‌تواند مشارکت پژوهشگران بیشتری را امکان‌پذیر کند.

البته انتشار داده‌ها و مدل‌ها نیز باید با توجه به خطرهای امنیتی، حریم خصوصی و حقوق اشخاص ارزیابی شود.

آیا هوش مصنوعی چندوجهی مانند انسان درک می‌کند؟

یکی از پرسش‌های رایج دربارهٔ هوش مصنوعی چندوجهی، میزان شباهت آن به ادراک انسانی است.

سامانه‌های چندوجهی می‌توانند روابطی میان تصویر، متن و صوت بیاموزند.

اما موفقیت در این وظایف به‌تنهایی نشان‌دهندهٔ برخورداری از تجربهٔ ذهنی یا آگاهی انسانی نیست.

ادراک انسان از تعامل پیچیدهٔ دستگاه عصبی، بدن، محیط، حافظه و تجربه شکل می‌گیرد.

در مقابل، مدل‌های چندوجهی معاصر از عملیات محاسباتی و پارامترهای آموخته‌شده استفاده می‌کنند.

بنابراین باید میان توانایی پردازش و ترکیب اطلاعات با ادعاهای فلسفی دربارهٔ آگاهی و فهم انسانی تمایز گذاشت.

تفاوت هوش مصنوعی چندوجهی و بینایی ماشین

بینایی ماشین عمدتاً به تحلیل اطلاعات تصویری و ویدئویی می‌پردازد.

در مقابل، هوش مصنوعی چندوجهی به پردازش و ارتباط‌دادن چند نوع داده توجه دارد.

برای مثال، مدلی که تنها اشیای موجود در تصویر را شناسایی می‌کند، نمونه‌ای از کاربرد بینایی ماشین است.

اما سامانه‌ای که تصویر و پرسش متنی را دریافت و بر اساس هر دو پاسخ تولید می‌کند، نمونه‌ای از کاربرد هوش مصنوعی چندوجهی محسوب می‌شود.

بینایی ماشین می‌تواند یکی از اجزای سامانهٔ چندوجهی باشد.

تفاوت هوش مصنوعی چندوجهی و مدل زبانی بزرگ

مدل زبانی بزرگ معمولاً به مدلی اشاره دارد که برای پردازش و تولید زبان در مقیاس بزرگ آموزش دیده است.

در مقابل، هوش مصنوعی چندوجهی به توانایی پردازش یا ارتباط‌دادن چند وجه داده اشاره می‌کند.

برخی مدل‌های زبانی بزرگ تنها با متن کار می‌کنند.

برخی دیگر با افزودن اجزای تصویری، صوتی یا دیگر سازوکارها به سامانه‌های چندوجهی تبدیل می‌شوند.

بنابراین بزرگی مدل زبانی به‌تنهایی به معنای چندوجهی‌بودن آن نیست.

تفاوت هوش مصنوعی چندوجهی و هوش مصنوعی مولد

هوش مصنوعی مولد به توانایی تولید محتوای جدید اشاره دارد.

هوش مصنوعی چندوجهی به پردازش یا ارتباط‌دادن چند نوع داده مربوط است.

این دو مفهوم می‌توانند مستقل یا هم‌پوشان باشند.

یک مدل تولید متن می‌تواند مولد و تک‌وجهی باشد.

یک مدل مقایسهٔ تصویر و متن می‌تواند چندوجهی باشد، بدون آن‌که وظیفهٔ اصلی آن تولید محتوا باشد.

یک سامانهٔ تولید تصویر بر اساس متن نیز می‌تواند هم مولد و هم چندوجهی محسوب شود.

آیندهٔ هوش مصنوعی چندوجهی

پژوهش دربارهٔ هوش مصنوعی چندوجهی در زمینه‌های مختلف ادامه دارد.

از جمله جهت‌گیری‌های مهم می‌توان به توسعهٔ مدل‌های یکپارچه‌تر، بهبود تحلیل ویدئو، کاهش هزینهٔ محاسباتی، افزایش دقت هم‌ترازی داده‌ها و بهبود قابلیت اعتماد اشاره کرد.

همچنین توسعهٔ سامانه‌هایی که بتوانند اطلاعات تصویری، صوتی و زبانی را در تعامل‌های پیوسته پردازش کنند، از موضوعات مهم این حوزه است.

با این حال، پیشرفت فنی باید همراه با ارزیابی ایمنی، حریم خصوصی، شفافیت و پیامدهای اجتماعی باشد.

جمع‌بندی

هوش مصنوعی چندوجهی یکی از حوزه‌های مهم هوش مصنوعی معاصر است که به توسعهٔ سامانه‌هایی برای پردازش و ارتباط‌دادن چند نوع داده، از جمله متن، تصویر، صوت و ویدئو می‌پردازد.

این حوزه از پژوهش‌های قدیمی‌تر در ادراک چندحسی، پردازش سیگنال، بینایی ماشین و یادگیری ماشین شکل گرفت و با پیشرفت یادگیری عمیق و ترنسفورمر وارد مرحلهٔ تازه‌ای شد.

مدل‌هایی مانند CLIP، Flamingo، BLIP-2 و LLaVA از نمونه‌های اثرگذار در توسعهٔ سامانه‌های بینایی-زبان هستند.[۲][۳][۵][۶]

امروزه هوش مصنوعی چندوجهی در آموزش، پزشکی، رباتیک، تحلیل اسناد، دسترس‌پذیری و تولید محتوا کاربرد دارد.

با این حال، چندوجهی‌بودن به معنای درستی تضمین‌شدهٔ خروجی نیست. خطا در تشخیص، ناسازگاری داده‌ها، توهم هوش مصنوعی، سوگیری الگوریتمی، خطر جعل محتوای تصویری و صوتی و مسائل مربوط به حریم خصوصی از چالش‌های مهم این فناوری به شمار می‌روند.

اهمیت هوش مصنوعی چندوجهی در آن است که امکان ارتباط محاسباتی میان انواع متفاوت اطلاعات را فراهم می‌کند و زمینهٔ توسعهٔ سامانه‌هایی را ایجاد می‌کند که می‌توانند وظایف پیچیده‌تری را با استفاده از چند منبع داده انجام دهند.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Alayrac, Jean-Baptiste, et al. “Flamingo: A Visual Language Model for Few-Shot Learning.” Advances in Neural Information Processing Systems 35 (2022). متن مقاله
  • Baltrušaitis, Tadas, Chaitanya Ahuja, and Louis-Philippe Morency. “Multimodal Machine Learning: A Survey and Taxonomy.” IEEE Transactions on Pattern Analysis and Machine Intelligence 41, no. 2 (2019): 423–443. متن مقاله
  • Li, Junnan, et al. “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.” Proceedings of the 40th International Conference on Machine Learning, 2023. متن مقاله
  • Liu, Haotian, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. “Visual Instruction Tuning.” Advances in Neural Information Processing Systems 36 (2023). متن مقاله
  • Radford, Alec, et al. “Learning Transferable Visual Models From Natural Language Supervision.” Proceedings of the 38th International Conference on Machine Learning, 2021. متن مقاله
  • Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله


```