هوش مصنوعی چندوجهی
| شناسنامه | |
|---|---|
| نامهای دیگر | هوش مصنوعی چندرسانهای، هوش مصنوعی چندوجهی (Multimodal AI) |
| حوزه | هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، بینایی ماشین، پردازش زبان طبیعی |
| خاستگاه | علوم شناختی، تشخیص الگو، پردازش سیگنال، بینایی ماشین، پردازش گفتار و یادگیری ماشین |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | وجه داده، بازنمایی مشترک، همترازی، همجوشی داده، رمزگذار، رمزگشا، توجه متقاطع، یادگیری تقابلی، مدل بینایی-زبان، مدل همهوجهی |
| جریانهای مرتبط | یادگیری چندوجهی، یادگیری بازنمایی، مدلهای بینایی-زبان، ترنسفورمر، مدل زبانی بزرگ، هوش مصنوعی مولد |
| تأثیرپذیرفته از | علوم اعصاب، ادراک چندحسی، آمار، پردازش تصویر، پردازش زبان طبیعی و یادگیری عمیق |
| تأثیرگذار بر | دستیارهای هوشمند، سامانههای تحلیل تصویر و ویدئو، رباتیک، تولید محتوای چندرسانهای و مدلهای بنیادین چندوجهی |
| نقد و ارزیابی | |
هوش مصنوعی چندوجهی، (به انگلیسی: Multimodal Artificial Intelligence یا Multimodal AI) شاخهای از هوش مصنوعی است که به توسعهٔ سامانههایی برای پردازش، ارتباطدادن و ترکیب چند نوع داده، از جمله متن، تصویر، صوت، ویدئو و اطلاعات حسگرها میپردازد. برخلاف سامانههای تکوجهی که عمدتاً با یک نوع داده کار میکنند، سامانههای چندوجهی میتوانند از اطلاعات موجود در چند وجه برای انجام وظایفی مانند توصیف تصویر، پاسخگویی به پرسش دربارهٔ ویدئو، تحلیل گفتار همراه با تصویر و تولید محتوای چندرسانهای استفاده کنند.[۱]
مفهوم چندوجهیبودن از این واقعیت الهام میگیرد که انسان محیط پیرامون خود را تنها از طریق یک حس دریافت نمیکند. ادراک انسانی از ترکیب اطلاعات دیداری، شنیداری، لمسی و دیگر حواس شکل میگیرد. با این حال، هوش مصنوعی چندوجهی بازسازی کامل ادراک انسان نیست، بلکه مجموعهای از روشهای ریاضی و محاسباتی برای پردازش و ارتباطدادن دادههای متفاوت است.
پژوهش دربارهٔ ترکیب دادههای چندوجهی سابقهای طولانی دارد، اما پیشرفت یادگیری عمیق، شبکههای عصبی مصنوعی و معماری ترنسفورمر در دهههای ۲۰۱۰ و ۲۰۲۰ موجب توسعهٔ نسل تازهای از مدلهای چندوجهی شد. مدلهایی مانند CLIP، Flamingo، BLIP-2 و LLaVA نمونههایی از پژوهشهای اثرگذار در ارتباطدادن تصویر و زبان هستند.[۲][۳]
امروزه هوش مصنوعی چندوجهی در سامانههای گفتوگومحور، دستیارهای صوتی، تحلیل اسناد، پزشکی، رباتیک، آموزش، دسترسپذیری و هوش مصنوعی مولد کاربرد دارد. در کنار این قابلیتها، مسائل مربوط به توهم هوش مصنوعی، سوگیری الگوریتمی، حریم خصوصی، جعل محتوای تصویری و صوتی و اعتبارسنجی اطلاعات از چالشهای مهم آن به شمار میروند.
تعریف هوش مصنوعی چندوجهی
هوش مصنوعی چندوجهی به سامانههایی گفته میشود که برای انجام یک وظیفه، اطلاعات مربوط به دو یا چند وجه داده را پردازش میکنند یا میان آنها ارتباط برقرار میسازند.
در این تعریف، «وجه» یا Modality به نوع یا شیوهٔ بازنمایی اطلاعات اشاره دارد.
برای مثال، متن و تصویر دو وجه متفاوت هستند. صوت و ویدئو نیز میتوانند وجوه دیگری محسوب شوند.
یک سامانهٔ چندوجهی ممکن است تصویری را دریافت کند و بر اساس پرسش متنی کاربر، دربارهٔ محتوای آن پاسخ دهد.
سامانهای دیگر ممکن است گفتار و تصویر یک سخنران را همزمان تحلیل کند.
در نوعی دیگر، مدل میتواند دستور متنی را دریافت و تصویر یا صدای متناسب با آن تولید کند.
با این حال، صرف وجود چند نوع فایل در یک نرمافزار به معنای برخورداری آن از هوش مصنوعی چندوجهی نیست. ویژگی اصلی چنین سامانهای توانایی پردازش یا ایجاد ارتباط محاسباتی میان وجوه مختلف داده است.
مفهوم وجه در هوش مصنوعی
وجه (Modality) اصطلاحی برای توصیف نوع اطلاعات یا کانالی است که داده از طریق آن دریافت یا بازنمایی میشود.
در پژوهشهای هوش مصنوعی، وجوه مختلف ممکن است شامل موارد زیر باشند:
- متن و زبان نوشتاری؛
- تصویر ثابت؛
- صوت و گفتار؛
- ویدئو؛
- دادههای عمق و ساختار سهبعدی؛
- اطلاعات مکانی و حرکتی؛
- دادههای حسگرهای محیطی؛
- و سیگنالهای زیستی.
همهٔ مدلهای چندوجهی از تمام این وجوه پشتیبانی نمیکنند.
برای مثال، یک مدل بینایی-زبان ممکن است تنها برای پردازش تصویر و متن طراحی شده باشد، در حالی که مدلی دیگر از صوت، تصویر و متن استفاده کند.
تفاوت دادهٔ چندوجهی و دادهٔ چندرسانهای
اصطلاح «چندرسانهای» معمولاً به محتوایی اشاره دارد که از چند رسانه مانند متن، تصویر و صوت تشکیل شده است.
در مقابل، اصطلاح «چندوجهی» در یادگیری ماشین بر نوع داده و شیوهٔ پردازش یا ارتباطدادن آن تأکید دارد.
برای مثال، یک صفحهٔ اینترنتی که شامل متن و تصویر است، محتوایی چندرسانهای دارد.
اما سامانهای که بتواند رابطهٔ معنایی میان متن و تصویر همان صفحه را تحلیل کند، ممکن است از روشهای هوش مصنوعی چندوجهی استفاده کند.
بنابراین این دو اصطلاح با یکدیگر ارتباط دارند، اما مترادف کامل نیستند.
خاستگاه نظری
ریشههای هوش مصنوعی چندوجهی به چند حوزهٔ علمی بازمیگردد.
یکی از این حوزهها علوم شناختی است که چگونگی ترکیب اطلاعات حسی در ادراک انسان را بررسی میکند.
حوزهٔ دیگر پردازش سیگنال است که روشهای تحلیل دادههایی مانند صوت و تصویر را توسعه داده است.
بینایی ماشین، پردازش زبان طبیعی و تشخیص گفتار نیز در شکلگیری این حوزه نقش داشتهاند.
در یادگیری ماشین، مسئلهٔ بنیادی آن است که چگونه میتوان اطلاعات موجود در چند منبع متفاوت را به شکلی ترکیب کرد که مدل بتواند روابط میان آنها را بیاموزد.
پژوهش مروری تاداس بالتروشایتیس، چایتانیا آهوجا و لوئی-فیلیپ مورنسی پنج مسئلهٔ مهم یادگیری چندوجهی را بازنمایی، ترجمه، همترازی، همجوشی و یادگیری مشترک معرفی میکند.[۱]
تاریخچه
پژوهشهای اولیهٔ ترکیب دادهها
پژوهشهای مربوط به ترکیب اطلاعات دیداری و شنیداری پیش از ظهور مدلهای زبانی بزرگ وجود داشتند.
در سامانههای تشخیص گفتار، پژوهشگران دریافتند که اطلاعات مربوط به حرکت لبها میتواند در کنار سیگنال صوتی برای تشخیص گفتار مفید باشد.
در رباتیک نیز ترکیب اطلاعات دوربین با دادههای حسگرهای حرکتی و فاصلهسنج سابقهای طولانی دارد.
این پژوهشها نشان دادند که ترکیب چند منبع اطلاعاتی میتواند در برخی شرایط به بهبود عملکرد سامانه کمک کند.
گسترش یادگیری چندوجهی در دههٔ ۲۰۱۰
در دههٔ ۲۰۱۰، پیشرفت یادگیری عمیق امکان توسعهٔ مدلهایی را فراهم کرد که بازنماییهای تصویری، متنی و صوتی را از داده میآموختند.
در این دوره، پژوهش دربارهٔ توصیف خودکار تصویر، پاسخگویی بصری به پرسش و جستوجوی تصویر بر اساس متن گسترش یافت.
همچنین مجموعهدادههای دارای جفت تصویر و متن در آموزش مدلهای چندوجهی اهمیت بیشتری پیدا کردند.
ترنسفورمر و تحول پردازش زبان؛ ۲۰۱۷
در سال ۲۰۱۷، مقالهٔ Attention Is All You Need معماری ترنسفورمر را معرفی کرد.
این معماری با استفاده از سازوکار توجه، امکان مدلسازی روابط میان عناصر دنباله را فراهم میکرد.[۴]
ترنسفورمر ابتدا در زمینهٔ پردازش زبان توسعه یافت، اما بعدها در معماریهای تصویری و چندوجهی نیز به کار گرفته شد.
معرفی CLIP؛ ۲۰۲۱
در سال ۲۰۲۱، الک ردفورد و همکاران مدل CLIP را در مقالهٔ Learning Transferable Visual Models From Natural Language Supervision معرفی کردند.
CLIP از آموزش تقابلی برای یادگیری ارتباط میان تصاویر و توصیفهای متنی استفاده میکند.
پژوهشگران گزارش کردند که مدل را با مجموعهای شامل حدود ۴۰۰ میلیون جفت تصویر و متن آموزش دادهاند.
یکی از ویژگیهای مهم CLIP توانایی استفاده از توصیفهای متنی برای طبقهبندی تصاویر، بدون آموزش اختصاصی برای هر دستهٔ جدید، بود.[۲]
CLIP از نمونههای اثرگذار در گسترش یادگیری بازنمایی مشترک تصویر و متن به شمار میرود.
معرفی Flamingo؛ ۲۰۲۲
در سال ۲۰۲۲، پژوهشگران دیپمایند مدل Flamingo را معرفی کردند.
این مدل برای پردازش ترکیبهایی از متن و دادههای تصویری طراحی شده بود و میتوانست تصاویر یا ویدئوها را همراه با متن دریافت کند.
یکی از اهداف پژوهش Flamingo، انجام وظایف تازه با استفاده از تعداد محدودی نمونهٔ آموزشی در متن ورودی بود.
این مدل از اجزای ازپیشآموزشدیدهٔ زبانی و بصری و سازوکارهای ارتباط میان آنها استفاده میکرد.[۳]
معرفی BLIP-2؛ ۲۰۲۳
مدل BLIP-2 در پژوهشی از جونجیه لی و همکاران معرفی شد.
این معماری برای ایجاد ارتباط میان رمزگذار تصویری ازپیشآموزشدیده و مدل زبانی بزرگ توسعه یافت.
یکی از ویژگیهای آن استفاده از یک بخش واسط برای انتقال اطلاعات تصویری به فضای قابل استفاده برای مدل زبانی بود.
این رویکرد نشان داد که میتوان با استفاده از اجزای ازپیشآموزشدیده، سامانههای بینایی-زبان ایجاد کرد.[۵]
معرفی LLaVA؛ ۲۰۲۳
در سال ۲۰۲۳، پژوهشگران مدل LLaVA را در مقالهٔ Visual Instruction Tuning معرفی کردند.
این مدل با هدف ترکیب تواناییهای پردازش تصویر و گفتوگوی زبانی توسعه یافت.
در این رویکرد، اطلاعات تصویری به بازنماییهایی تبدیل میشوند که مدل زبانی بتواند در تولید پاسخ از آنها استفاده کند.
LLaVA از نمونههای مهم پژوهش دربارهٔ آموزش دستوری مدلهای بینایی-زبان است.[۶]
مدلهای چندوجهی یکپارچه
در سالهای بعد، پژوهش دربارهٔ مدلهایی گسترش یافت که میتوانستند چند نوع داده را در یک سامانه پردازش کنند.
برخی مدلها برای دریافت تصویر و متن و تولید پاسخ متنی طراحی شدند.
برخی دیگر قابلیت پردازش صوت، ویدئو یا تولید خروجیهای چندوجهی را نیز توسعه دادند.
گزارش فنی Gemini در سال ۲۰۲۳ نمونهای از پژوهش دربارهٔ خانوادهای از مدلهای چندوجهی بود که برای پردازش انواع مختلف اطلاعات طراحی شده بودند.[۷]
ساختار هوش مصنوعی چندوجهی
ساختار سامانههای چندوجهی بسته به نوع داده و وظیفه متفاوت است.
با این حال، بسیاری از این سامانهها از چند جزء اصلی تشکیل میشوند:
- بخش دریافت و آمادهسازی داده؛
- رمزگذارهای اختصاصی وجوه مختلف؛
- سازوکار همترازی یا ترکیب بازنماییها؛
- بخش پردازش مشترک؛
- و بخش تولید خروجی.
برای مثال، در یک سامانهٔ پاسخگویی به پرسش دربارهٔ تصویر، ابتدا تصویر و پرسش متنی پردازش میشوند.
سپس اطلاعات تصویری و زبانی با یکدیگر ارتباط پیدا میکنند.
در مرحلهٔ بعد، مدل بر اساس این اطلاعات پاسخ تولید میکند.
رمزگذار
رمزگذار (Encoder) بخشی از مدل است که دادهٔ ورودی را به بازنمایی عددی تبدیل میکند.
در سامانههای چندوجهی، ممکن است برای هر وجه رمزگذار متفاوتی وجود داشته باشد.
برای مثال، رمزگذار تصویر میتواند از شبکهٔ عصبی پیچشی یا ترنسفورمر بینایی استفاده کند.
رمزگذار متن نیز میتواند بر اساس معماری ترنسفورمر طراحی شده باشد.
هدف رمزگذار ایجاد بازنماییای است که اطلاعات مورد نیاز برای وظیفهٔ مدل را حفظ کند.
رمزگشا
رمزگشا (Decoder) بخشی از معماری است که از بازنماییهای پردازششده برای تولید خروجی استفاده میکند.
در یک سامانهٔ چندوجهی، خروجی ممکن است متن، تصویر، صوت یا نوع دیگری از داده باشد.
برای مثال، یک مدل بینایی-زبان میتواند تصویر را دریافت کند و با استفاده از رمزگشای زبانی، توضیحی دربارهٔ آن تولید کند.
همهٔ مدلهای چندوجهی الزاماً دارای رمزگشای مولد نیستند.
مدلهایی مانند CLIP میتوانند برای محاسبهٔ شباهت میان بازنماییها استفاده شوند، بدون آنکه متن یا تصویر تازهای تولید کنند.
بازنمایی مشترک
بازنمایی مشترک (Joint Representation) یکی از مفاهیم مهم یادگیری چندوجهی است.
در این رویکرد، اطلاعات چند وجه به شکلی بازنمایی میشوند که روابط میان آنها قابل یادگیری یا مقایسه باشد.
برای مثال، تصویر یک درخت و عبارت «درخت سبز» میتوانند در فضای بازنمایی دارای ارتباط معنایی باشند.
این ارتباط امکان انجام وظایفی مانند جستوجوی تصویر بر اساس متن را فراهم میکند.
همترازی چندوجهی
همترازی (Alignment) به ایجاد ارتباط میان عناصر متعلق به وجوه متفاوت گفته میشود.
برای مثال، در ویدئوی سخنرانی، کلمات گفتار باید با بخشهای زمانی مربوط به تصویر و صدا ارتباط پیدا کنند.
در تحلیل تصویر و متن نیز ممکن است لازم باشد مشخص شود کدام عبارت به کدام شیء یا ناحیهٔ تصویر اشاره دارد.
همترازی یکی از مسائل بنیادی یادگیری چندوجهی است.[۱]
همجوشی داده
همجوشی (Fusion) فرایند ترکیب اطلاعات چند وجه برای انجام یک وظیفه است.
این ترکیب میتواند در مراحل مختلف پردازش انجام شود.
سه رویکرد شناختهشده عبارتاند از:
- همجوشی زودهنگام؛
- همجوشی دیرهنگام؛
- همجوشی میانی.
انتخاب روش مناسب به نوع داده، معماری و هدف سامانه وابسته است.
همجوشی زودهنگام
در همجوشی زودهنگام (Early Fusion)، اطلاعات وجوه مختلف در مراحل اولیهٔ پردازش ترکیب میشوند.
برای مثال، ویژگیهای استخراجشده از صوت و تصویر ممکن است به یک بازنمایی مشترک تبدیل شوند.
این روش امکان یادگیری روابط میان وجوه را از مراحل اولیه فراهم میکند.
با این حال، تفاوت ساختار دادهها و مشکل همزمانسازی میتواند اجرای آن را دشوار کند.
همجوشی دیرهنگام
در همجوشی دیرهنگام (Late Fusion)، هر وجه ابتدا بهصورت مستقل پردازش میشود.
سپس نتایج یا پیشبینیهای مربوط به وجوه مختلف با یکدیگر ترکیب میشوند.
برای مثال، یک مدل میتواند از صوت و مدلی دیگر از تصویر پیشبینی تولید کند و سامانه در مرحلهٔ پایانی این نتایج را ترکیب کند.
همجوشی میانی
در همجوشی میانی (Intermediate Fusion)، اطلاعات پس از بخشی از پردازش اختصاصی هر وجه و پیش از تولید خروجی نهایی ترکیب میشوند.
این رویکرد میتواند امکان یادگیری روابط پیچیدهتر میان بازنماییها را فراهم کند.
بسیاری از معماریهای جدید چندوجهی از شکلهایی از ترکیب بازنماییهای میانی استفاده میکنند.
توجه متقاطع
توجه متقاطع (Cross-Attention) یکی از سازوکارهای مهم در برخی مدلهای چندوجهی است.
در این روش، بازنماییهای یک وجه میتوانند هنگام پردازش به اطلاعات وجه دیگر توجه کنند.
برای مثال، هنگام تولید پاسخ متنی دربارهٔ تصویر، بخش زبانی مدل میتواند از اطلاعات تصویری استفاده کند.
توجه متقاطع در برخی معماریهای بینایی-زبان، از جمله Flamingo، نقش مهمی دارد.[۳]
یادگیری تقابلی
یادگیری تقابلی (Contrastive Learning) روشی است که در آن مدل میآموزد بازنماییهای نمونههای مرتبط را به یکدیگر نزدیک و نمونههای نامرتبط را از یکدیگر متمایز کند.
در مدل CLIP، تصویر و متن متناظر با آن بهعنوان نمونههای مرتبط در نظر گرفته میشوند.
این روش میتواند به یادگیری ارتباط معنایی میان تصویر و زبان کمک کند.[۲]
یادگیری انتقالی
یادگیری انتقالی (Transfer Learning) به استفاده از دانشی گفته میشود که مدل در یک مرحله یا وظیفهٔ پیشین آموخته است.
در سامانههای چندوجهی، ممکن است رمزگذار تصویر یا مدل زبانی ازپیشآموزشدیده در معماری جدید استفاده شود.
این رویکرد میتواند هزینهٔ آموزش از ابتدا را کاهش دهد.
با این حال، میزان موفقیت آن به سازگاری مدلهای اولیه با وظیفهٔ جدید وابسته است.
یادگیری خودنظارتشده
یادگیری خودنظارتشده (Self-Supervised Learning) روشی است که در آن اطلاعات لازم برای تعریف وظیفهٔ آموزشی از ساختار خود داده استخراج میشود.
برای مثال، مدل میتواند با استفاده از ارتباط میان تصویر و متن همراه آن آموزش ببیند.
این روش در توسعهٔ مدلهای بنیادین چندوجهی اهمیت دارد، زیرا تهیهٔ برچسبهای انسانی برای همهٔ دادهها بسیار پرهزینه است.
مدل بینایی-زبان
مدل بینایی-زبان (Vision-Language Model یا VLM) خانوادهای از مدلهای چندوجهی است که اطلاعات تصویری و زبانی را پردازش میکند.
این مدلها میتوانند برای وظایفی مانند توصیف تصویر، پاسخگویی به پرسشهای بصری، جستوجوی تصویر و تحلیل اسناد استفاده شوند.
CLIP، Flamingo، BLIP-2 و LLaVA از نمونههای شناختهشدهٔ پژوهش در این حوزه هستند.
با این حال، قابلیتهای این مدلها یکسان نیستند.
برخی برای یادگیری شباهت میان تصویر و متن طراحی شدهاند و برخی دیگر برای تولید پاسخهای زبانی بر اساس تصویر.
مدل صوت-زبان
مدل صوت-زبان سامانهای است که اطلاعات صوتی و زبانی را پردازش یا مرتبط میکند.
این مدلها ممکن است برای تشخیص گفتار، پاسخگویی دربارهٔ محتوای صوتی، ترجمهٔ گفتار یا تولید پاسخ صوتی استفاده شوند.
در برخی سامانهها، صوت ابتدا به متن تبدیل میشود و سپس مدل زبانی آن را پردازش میکند.
در برخی معماریهای دیگر، اطلاعات صوتی بهصورت مستقیمتر وارد مدل میشود.
این دو رویکرد از نظر حفظ اطلاعات غیرکلامی صوت، مانند آهنگ گفتار یا صداهای محیطی، میتوانند تفاوت داشته باشند.
مدل ویدئو-زبان
مدل ویدئو-زبان برای پردازش ارتباط میان ویدئو و زبان طراحی میشود.
ویدئو علاوه بر اطلاعات تصویری، دارای بعد زمانی است.
بنابراین تحلیل ویدئو ممکن است به شناسایی ترتیب رویدادها، حرکت اشیا و تغییرات صحنه نیاز داشته باشد.
برای مثال، یک سامانه میتواند ویدئویی را دریافت کند و دربارهٔ رویدادهای آن توضیح دهد.
اما تشخیص درست ترتیب زمانی و روابط علت و معلولی در ویدئو همچنان از مسائل دشوار پژوهشی است.
مدلهای همهوجهی
اصطلاح همهوجهی (Omni-modal) گاهی برای توصیف سامانههایی به کار میرود که چندین نوع ورودی و خروجی را در معماری نسبتاً یکپارچه پردازش میکنند.
این اصطلاح به معنای پشتیبانی واقعی از همهٔ انواع داده نیست.
قابلیتهای هر مدل باید بر اساس مستندات فنی و ارزیابی مستقل مشخص شود.
هوش مصنوعی چندوجهی و ترنسفورمر
ترنسفورمر یکی از معماریهای اثرگذار در توسعهٔ مدلهای چندوجهی است.
سازوکار توجه در این معماری میتواند برای پردازش روابط میان عناصر متن، تصویر یا دیگر دادهها استفاده شود.
در برخی مدلها، هر وجه ابتدا به بازنماییهای عددی تبدیل میشود و سپس این بازنماییها وارد بخشهای ترنسفورمری میشوند.
با این حال، همهٔ سامانههای چندوجهی مبتنی بر ترنسفورمر نیستند.
روشهای آماری، شبکههای پیچشی و معماریهای دیگر نیز در یادگیری چندوجهی کاربرد دارند.
هوش مصنوعی چندوجهی و مدلهای زبانی بزرگ
مدلهای زبانی بزرگ معمولاً برای پردازش و تولید زبان توسعه یافتهاند.
در برخی سامانههای چندوجهی، یک مدل زبانی بزرگ با رمزگذار تصویر یا صوت ترکیب میشود.
در این حالت، مدل میتواند اطلاعات غیرمتنی را در تولید پاسخ زبانی به کار گیرد.
اما هر مدل زبانی بزرگ الزاماً چندوجهی نیست.
همچنین یک سامانهٔ چندوجهی لزوماً مدل زبانی بزرگ ندارد.
برای مثال، سامانهای که صوت و تصویر را برای تشخیص یک رویداد ترکیب میکند، ممکن است بدون مدل زبانی بزرگ عمل کند.
هوش مصنوعی چندوجهی و هوش مصنوعی مولد
هوش مصنوعی مولد به سامانههایی گفته میشود که میتوانند محتوای جدید تولید کنند.
هوش مصنوعی چندوجهی بر پردازش یا ارتباطدادن چند نوع داده تمرکز دارد.
این دو مفهوم همپوشانی دارند، اما یکسان نیستند.
برای مثال، CLIP مدلی چندوجهی است که هدف اصلی آن تولید متن یا تصویر نیست.
در مقابل، یک مدل تولید متن که فقط ورودی و خروجی متنی دارد، میتواند مولد باشد اما چندوجهی نباشد.
سامانهای که تصویر را دریافت و پاسخ متنی تولید میکند، نمونهای از همپوشانی این دو حوزه است.
پاسخگویی بصری به پرسش
پاسخگویی بصری به پرسش (Visual Question Answering یا VQA) یکی از وظایف مهم هوش مصنوعی چندوجهی است.
در این وظیفه، سامانه یک تصویر و یک پرسش متنی دریافت میکند.
سپس باید بر اساس اطلاعات تصویر پاسخ دهد.
برای مثال، اگر تصویری از یک خیابان به مدل داده شود، کاربر میتواند بپرسد: «چند خودرو در تصویر دیده میشود؟»
مدل برای پاسخ درست باید محتوای تصویر را پردازش و آن را با معنای پرسش مرتبط کند.
توصیف خودکار تصویر
توصیف خودکار تصویر (Image Captioning) به تولید توضیح متنی دربارهٔ محتوای تصویر گفته میشود.
این فناوری در ساماندهی آرشیوهای تصویری، جستوجو و ابزارهای دسترسپذیری کاربرد دارد.
با این حال، توصیف تولیدشده ممکن است شامل جزئیات نادرست باشد.
بنابراین در کاربردهای حساس، متن باید با تصویر اصلی تطبیق داده شود.
جستوجوی متن به تصویر
در جستوجوی متن به تصویر، کاربر عبارتی متنی وارد میکند و سامانه تصاویر مرتبط را بازیابی میکند.
این روش میتواند از بازنماییهای مشترک متن و تصویر استفاده کند.
برای مثال، کاربر میتواند عبارت «پل تاریخی بر فراز رودخانه» را جستوجو کند و سامانه تصاویر مرتبط را پیشنهاد دهد.
مدل CLIP از پژوهشهای اثرگذار در یادگیری بازنماییهای قابل مقایسهٔ تصویر و متن است.[۲]
جستوجوی تصویر به متن
در این کاربرد، تصویر بهعنوان ورودی استفاده میشود و سامانه متن یا اسناد مرتبط را جستوجو میکند.
برای مثال، تصویر یک اثر تاریخی ممکن است برای یافتن توضیحات مرتبط در یک پایگاه اطلاعاتی استفاده شود.
نتیجهٔ جستوجو باید بر اساس منابع معتبر ارزیابی شود، زیرا شباهت بصری بهتنهایی اثباتکنندهٔ هویت یا اصالت یک شیء نیست.
تحلیل اسناد چندوجهی
اسناد دیجیتال و اسکنشده ممکن است شامل متن، تصویر، نمودار، نقشه و ساختار صفحه باشند.
تحلیل چنین اسنادی به ترکیب اطلاعات دیداری و زبانی نیاز دارد.
برای مثال، سامانه باید بتواند عنوان، پاراگراف، زیرنویس تصویر و ارتباط میان آنها را تشخیص دهد.
این فناوری در دیجیتالسازی آرشیوها، پردازش اسناد اداری و پژوهش تاریخی کاربرد دارد.
هوش مصنوعی چندوجهی در پزشکی
در پزشکی، اطلاعات مربوط به یک بیمار ممکن است شامل متن پرونده، تصاویر پزشکی، نتایج آزمایش و سیگنالهای زیستی باشد.
مدلهای چندوجهی میتوانند برای بررسی روابط میان این دادهها توسعه یابند.
برای مثال، پژوهشگران ممکن است اطلاعات تصویربرداری پزشکی را با گزارشهای متنی مرتبط کنند.
با این حال، استفادهٔ بالینی از چنین مدلهایی نیازمند ارزیابی مستقل، اعتبارسنجی روی جمعیت هدف و نظارت متخصصان است.
توانایی تولید پاسخ متنی دربارهٔ تصویر پزشکی بهتنهایی اثباتکنندهٔ صلاحیت تشخیصی سامانه نیست.
هوش مصنوعی چندوجهی در آموزش
در آموزش، سامانههای چندوجهی میتوانند متن، نمودار، تصویر و صوت را برای ارائهٔ توضیح یا تمرین ترکیب کنند.
برای مثال، دانشآموز میتواند تصویری از یک مسئلهٔ هندسی ارائه دهد و دربارهٔ آن پرسش کند.
مدل میتواند اطلاعات تصویری و زبانی را برای تولید پاسخ به کار گیرد.
با این حال، درستی محاسبات و توضیحات باید بررسی شود.
همچنین استفاده از اطلاعات شخصی دانشآموزان نیازمند رعایت حریم خصوصی است.
هوش مصنوعی چندوجهی در رباتیک
در رباتیک، سامانه ممکن است دادههای دوربین، حسگرهای فاصله، اطلاعات حرکتی و فرمانهای زبانی را دریافت کند.
ترکیب این اطلاعات میتواند برای شناسایی اشیا، ناوبری و اجرای برخی وظایف استفاده شود.
برای مثال، یک ربات میتواند دستور «جعبهٔ قرمز را بردار» دریافت کند.
اجرای این دستور به ارتباطدادن زبان با دادههای بصری و سپس کنترل حرکت نیاز دارد.
در محیط واقعی، خطای تشخیص یا تفسیر فرمان ممکن است پیامد فیزیکی داشته باشد؛ از این رو آزمون ایمنی اهمیت ویژهای دارد.
هوش مصنوعی چندوجهی در حملونقل
در سامانههای حملونقل، دادههای دوربین، رادار، لیدار و دیگر حسگرها ممکن است با یکدیگر ترکیب شوند.
هدف میتواند ایجاد برآورد دقیقتری از وضعیت محیط باشد.
برای مثال، یک سامانهٔ کمکراننده ممکن است اطلاعات تصویری را با اندازهگیری فاصله ترکیب کند.
با این حال، ترکیب چند حسگر بهتنهایی تضمینکنندهٔ ایمنی نیست.
کیفیت داده، شرایط محیط و طراحی سامانه همچنان اهمیت دارند.
هوش مصنوعی چندوجهی در صنعت
در صنعت، مدلهای چندوجهی میتوانند دادههای تصویری، صوتی و حسگرهای تجهیزات را ترکیب کنند.
برای مثال، سامانهای ممکن است تصویر یک قطعه، صدای دستگاه و دادههای لرزش را برای شناسایی وضعیت غیرعادی بررسی کند.
این رویکرد میتواند در کنترل کیفیت و نگهداری تجهیزات کاربرد داشته باشد.
عملکرد آن به کیفیت داده و شرایط واقعی محیط صنعتی وابسته است.
هوش مصنوعی چندوجهی در کشاورزی
در کشاورزی، ترکیب تصاویر گیاهان، دادههای هواشناسی، اطلاعات خاک و حسگرهای محیطی میتواند برای تحلیل وضعیت محصول استفاده شود.
برای مثال، سامانه ممکن است تصویر برگ را همراه با اطلاعات رطوبت و دما بررسی کند.
این کاربردها میتوانند به پایش وضعیت زمین و تصمیمگیری کمک کنند.
با این حال، نتیجهٔ مدل باید با دادههای محلی و بررسیهای میدانی ارزیابی شود.
هوش مصنوعی چندوجهی و دسترسپذیری
یکی از کاربردهای مهم هوش مصنوعی چندوجهی، توسعهٔ ابزارهای کمککننده به افراد دارای معلولیت است.
برای مثال، سامانههای توصیف تصویر میتوانند اطلاعات بصری را به متن یا گفتار تبدیل کنند.
ابزارهای تبدیل گفتار به متن نیز میتوانند به دسترسی افراد ناشنوا یا کمشنوا به محتوای صوتی کمک کنند.
در برخی سامانهها، تصویر، متن و صوت برای ایجاد تعامل مناسبتر ترکیب میشوند.
با این حال، خطای سامانه در تشخیص اشیا یا توصیف محیط میتواند برای کاربران پیامد عملی داشته باشد.
هوش مصنوعی چندوجهی و زبان فارسی
مدلهای چندوجهی میتوانند در پردازش اسناد، تصاویر و گفتار فارسی کاربرد داشته باشند.
برای مثال، سامانهای ممکن است تصویری از یک سند فارسی دریافت کند و محتوای آن را استخراج یا خلاصه کند.
در چنین کاربردهایی، کیفیت تشخیص نویسهها، پردازش راستبهچپ و شناخت ساختار زبان فارسی اهمیت دارد.
همچنین تفاوت میان زبان رسمی، گفتار محاورهای و گویشهای مختلف میتواند بر عملکرد مدل تأثیر بگذارد.
ارزیابی مدلهای چندوجهی فارسی باید با استفاده از دادههای متنوع و معیارهای مناسب انجام شود.
هوش مصنوعی چندوجهی و اسناد تاریخی
در پژوهش تاریخی، اسناد ممکن است شامل متن، تصویر، نقشه، دستخط و نشانههای بصری باشند.
مدلهای چندوجهی میتوانند در شناسایی ساختار صفحه، استخراج متن و ارتباطدادن تصاویر با توضیحات کمک کنند.
برای مثال، سامانه ممکن است یک صفحهٔ روزنامهٔ قدیمی را دریافت و عنوانها، تصاویر و متنهای مرتبط را جدا کند.
اما چنین سامانهای ممکن است نام اشخاص، تاریخها یا جزئیات تصویر را اشتباه تشخیص دهد.
بنابراین در پژوهش تاریخی، خروجی مدل باید با سند اصلی و منابع مستقل بررسی شود.
هوش مصنوعی چندوجهی و دانشنامهنویسی
هوش مصنوعی چندوجهی میتواند در گردآوری و سازماندهی منابع دانشنامهای کاربرد داشته باشد.
برای مثال، این فناوری ممکن است در تحلیل تصاویر تاریخی، استخراج متن از اسناد اسکنشده، جستوجوی تصاویر مشابه و تهیهٔ توضیحات اولیه برای تصاویر استفاده شود.
در دانشنامهنویسی، استفاده از این قابلیتها میتواند سرعت بررسی منابع را افزایش دهد.
با این حال، مدل ممکن است دربارهٔ هویت اشخاص، محل ثبت تصویر، زمان رویداد یا اصالت سند اطلاعات نادرست تولید کند.
بنابراین خروجی مدل باید بهعنوان نتیجهای قابل بررسی تلقی شود، نه منبع مستقل و قطعی.
در نگارش مقالههای دانشنامهای، ارجاع باید به منبع اصلی یا پژوهش معتبر داده شود، نه صرفاً به توضیح تولیدشده توسط سامانهٔ هوش مصنوعی.
هوش مصنوعی چندوجهی و ایران
هوش مصنوعی چندوجهی میتواند در حوزههایی مانند پردازش اسناد فارسی، تحلیل تصاویر پزشکی، آموزش، صنعت و پژوهشهای زبان فارسی کاربرد داشته باشد.
با این حال، برای ارزیابی میزان توسعه یا کاربرد واقعی این فناوری در ایران، به دادهها و پژوهشهای مشخص نیاز است.
همچنین استفاده از سامانههای ترکیب تصویر، صوت و اطلاعات هویتی در نظارت عمومی میتواند مسائل مهمی دربارهٔ حریم خصوصی و حقوق شهروندی ایجاد کند.
هر ادعای مشخص دربارهٔ بهکارگیری چنین سامانههایی توسط یک نهاد باید بر اساس اسناد قابل راستیآزمایی مطرح شود.
مزایای هوش مصنوعی چندوجهی
یکی از مزایای بالقوهٔ هوش مصنوعی چندوجهی، استفاده از اطلاعات مکمل موجود در چند نوع داده است.
برای مثال، در شرایطی که کیفیت صوت پایین است، اطلاعات تصویری ممکن است در برخی سامانهها به تشخیص گفتار کمک کند.
در تحلیل اسناد نیز ترکیب متن و ساختار بصری صفحه میتواند اطلاعات بیشتری نسبت به پردازش متن بهتنهایی فراهم کند.
مزیت دیگر، امکان طراحی تعامل طبیعیتر با کاربر است.
کاربر میتواند بهجای توصیف کامل یک تصویر، خود تصویر را همراه با پرسش ارائه دهد.
با این حال، چندوجهیبودن بهتنهایی تضمینکنندهٔ عملکرد بهتر نیست.
اگر دادههای یکی از وجوه نامعتبر یا ناسازگار باشند، ترکیب آنها ممکن است به خطا منجر شود.
محدودیتهای فنی
مدلهای چندوجهی با محدودیتهای مختلفی روبهرو هستند.
یکی از آنها تفاوت ساختار دادههاست.
متن معمولاً بهصورت دنبالهای از توکنها پردازش میشود، در حالی که تصویر دارای ساختار مکانی و ویدئو دارای ساختار مکانی و زمانی است.
صوت نیز دارای ویژگیهای زمانی و فرکانسی است.
ایجاد ارتباط میان این دادهها به طراحی معماری و روش آموزش مناسب نیاز دارد.
محدودیت دیگر، هزینهٔ محاسباتی است.
پردازش تصاویر با وضوح بالا یا ویدئوهای طولانی ممکن است به حافظه و توان پردازشی قابل توجهی نیاز داشته باشد.
مسئلهٔ همزمانسازی
در برخی کاربردهای چندوجهی، دادههای مختلف باید از نظر زمانی با یکدیگر هماهنگ باشند.
برای مثال، در تحلیل گفتار همراه با تصویر، حرکت لبها باید با سیگنال صوتی مرتبط شود.
اگر دادهها از نظر زمانی ناهماهنگ باشند، عملکرد مدل ممکن است کاهش یابد.
این مسئله در تحلیل ویدئو، رباتیک و سامانههای تعاملی اهمیت دارد.
تعارض میان وجوه داده
گاهی اطلاعات وجوه مختلف با یکدیگر ناسازگار هستند.
برای مثال، متن همراه یک تصویر ممکن است محتوای تصویر را نادرست توصیف کند.
در چنین شرایطی، مدل باید بتواند با عدم قطعیت یا تعارض اطلاعات برخورد کند.
اما سامانههای چندوجهی ممکن است به یکی از وجوه بیش از اندازه اتکا کنند یا از دادهٔ نادرست نتیجه بگیرند.
این مسئله در ارزیابی قابلیت اعتماد مدل اهمیت دارد.
توهم هوش مصنوعی چندوجهی
توهم هوش مصنوعی در سامانههای چندوجهی نیز ممکن است رخ دهد.
برای مثال، مدل ممکن است تصویری را دریافت کند و شیئی را توصیف کند که در تصویر وجود ندارد.
همچنین ممکن است متن موجود در تصویر را نادرست بخواند یا دربارهٔ ترتیب رویدادهای ویدئو نتیجهٔ اشتباه بگیرد.
در برخی موارد، پاسخ تولیدشده از نظر زبانی روان و قانعکننده است، اما با دادهٔ تصویری یا صوتی مطابقت ندارد.
بنابراین روانبودن پاسخ نباید با درستی آن یکسان دانسته شود.
سوگیری الگوریتمی
سوگیری الگوریتمی یکی از چالشهای مهم هوش مصنوعی چندوجهی است.
دادههای آموزشی ممکن است از نظر زبان، فرهنگ، جنسیت، سن، شرایط محیطی یا گروههای جمعیتی نامتوازن باشند.
این عدم توازن میتواند بر عملکرد مدل در تشخیص چهره، تحلیل گفتار یا توصیف تصویر تأثیر بگذارد.
برای مثال، مدلی که با دادههای محدود از یک زبان آموزش دیده ممکن است در پردازش گویشهای دیگر عملکرد ضعیفتری داشته باشد.
ارزیابی مدل باید تفاوت عملکرد در شرایط و گروههای مختلف را بررسی کند.
حریم خصوصی
مدلهای چندوجهی ممکن است اطلاعات حساسی را از تصاویر، صداها یا اسناد استخراج کنند.
برای مثال، تصویر میتواند حاوی چهره، محل زندگی یا اطلاعات شناساییکننده باشد.
صوت نیز ممکن است ویژگیهای صدای فرد یا محتوای مکالمه را در بر داشته باشد.
ترکیب چند نوع داده میتواند امکان استنتاج اطلاعاتی را فراهم کند که از بررسی هر وجه بهتنهایی بهآسانی به دست نمیآیند.
به همین دلیل، گردآوری، ذخیرهسازی و پردازش دادههای چندوجهی نیازمند توجه ویژه به حریم خصوصی است.
نظارت و شناسایی افراد
ترکیب اطلاعات تصویری، صوتی و مکانی میتواند در سامانههای شناسایی و ردیابی افراد استفاده شود.
چنین کاربردهایی ممکن است برای مدیریت دسترسی یا امنیت طراحی شوند.
اما استفاده از آنها در نظارت عمومی میتواند خطرهایی برای آزادیهای مدنی ایجاد کند.
از جمله مسائل مهم میتوان به حق حریم خصوصی، آزادی بیان، آزادی تجمع و امکان نظارت بدون رضایت افراد اشاره کرد.
ارزیابی حقوقی و اجتماعی این سامانهها باید بر اساس کاربرد مشخص، ضرورت، تناسب و سازوکارهای پاسخگویی انجام شود.
دیپفیک و جعل محتوای چندرسانهای
پیشرفت مدلهای مولد چندوجهی امکان تولید یا دستکاری تصاویر، صداها و ویدئوها را گسترش داده است.
اصطلاح دیپفیک معمولاً به محتوای مصنوعی یا دستکاریشدهای اشاره دارد که میتواند ظاهر یا صدای یک فرد را به شکلی گمراهکننده بازنمایی کند.
چنین محتوایی ممکن است برای سرگرمی، تولید هنری یا کاربردهای مجاز ایجاد شود، اما امکان استفادهٔ فریبکارانه نیز دارد.
از جمله خطرها میتوان به جعل هویت، انتشار اطلاعات نادرست و آسیب به اعتبار اشخاص اشاره کرد.
در بررسی اصالت محتوا، اتکا به تشخیص خودکار بهتنهایی کافی نیست و باید منشأ فایل، زمینهٔ انتشار و شواهد مستقل نیز بررسی شوند.
امنیت مدلهای چندوجهی
سامانههای چندوجهی ممکن است در معرض حملات فنی قرار گیرند.
برای مثال، دادهٔ تصویری یا صوتی میتواند حاوی محتوایی باشد که با هدف تأثیرگذاری نامناسب بر رفتار مدل طراحی شده است.
در سامانههایی که تصویر و متن را با یک مدل زبانی ترکیب میکنند، امکان حملات تزریق دستور از طریق محتوای ورودی نیز مطرح است.
این مسئله بهویژه زمانی اهمیت دارد که سامانه بتواند به ابزارها یا اطلاعات حساس دسترسی داشته باشد.
تفسیرپذیری
برخی مدلهای چندوجهی دارای معماریهای پیچیده و تعداد زیادی پارامتر هستند.
در چنین مدلهایی، توضیح اینکه کدام بخش از تصویر، صوت یا متن بیشترین تأثیر را بر خروجی داشته ممکن است دشوار باشد.
پژوهشگران از روشهایی مانند تحلیل توجه، بررسی حساسیت و مطالعهٔ بازنماییهای داخلی برای شناخت رفتار مدل استفاده میکنند.
با این حال، این روشها لزوماً توضیح کامل و قطعی دربارهٔ سازوکار تصمیمگیری ارائه نمیدهند.
ارزیابی مدلهای چندوجهی
ارزیابی مدلهای چندوجهی باید بر اساس نوع وظیفه انجام شود.
برای مثال، در پاسخگویی بصری به پرسش، درستی پاسخ نسبت به تصویر اهمیت دارد.
در جستوجوی متن به تصویر، کیفیت بازیابی نتایج مرتبط بررسی میشود.
در تحلیل ویدئو، دقت تشخیص رویدادها و ترتیب زمانی آنها اهمیت دارد.
در تولید محتوای چندوجهی، علاوه بر کیفیت خروجی، سازگاری آن با ورودی و خطر تولید محتوای گمراهکننده باید بررسی شود.
هیچ معیار واحدی برای سنجش همهٔ قابلیتهای مدلهای چندوجهی کافی نیست.
مسئلهٔ دادههای آموزشی
آموزش مدلهای چندوجهی ممکن است به مجموعههای بزرگی از دادههای تصویری، متنی یا صوتی نیاز داشته باشد.
کیفیت، تنوع و اعتبار این دادهها بر عملکرد مدل تأثیر دارند.
همچنین گردآوری دادهها ممکن است مسائل مربوط به حق مؤلف، رضایت افراد و استفاده از اطلاعات شخصی را مطرح کند.
در برخی مجموعهدادهها، توضیحات متنی ممکن است با تصاویر مرتبط نباشند یا اطلاعات نادرست داشته باشند.
چنین مشکلاتی میتوانند در فرایند آموزش به مدل منتقل شوند.
مصرف انرژی و هزینهٔ محاسباتی
پردازش همزمان چند نوع داده میتواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.
برای مثال، تحلیل ویدئو معمولاً شامل پردازش تعداد زیادی فریم است.
پردازش صوت نیز ممکن است به تحلیل دنبالههای زمانی طولانی نیاز داشته باشد.
هزینهٔ محاسباتی به اندازهٔ مدل، نوع داده، معماری، سختافزار و روش آموزش وابسته است.
بهینهسازی مصرف حافظه و انرژی از موضوعات مهم پژوهش در این حوزه است.
تمرکز قدرت فناوری
توسعهٔ برخی مدلهای چندوجهی بزرگ به داده، سرمایه و زیرساخت محاسباتی گسترده نیاز دارد.
این مسئله میتواند توسعهٔ پیشرفتهترین مدلها را در اختیار تعداد محدودی از شرکتها و مؤسسات دارای منابع مالی و فنی قرار دهد.
در مقابل، انتشار پژوهشهای علمی، ابزارهای متنباز و مدلهای دارای وزنهای در دسترس میتواند مشارکت پژوهشگران بیشتری را امکانپذیر کند.
البته انتشار دادهها و مدلها نیز باید با توجه به خطرهای امنیتی، حریم خصوصی و حقوق اشخاص ارزیابی شود.
آیا هوش مصنوعی چندوجهی مانند انسان درک میکند؟
یکی از پرسشهای رایج دربارهٔ هوش مصنوعی چندوجهی، میزان شباهت آن به ادراک انسانی است.
سامانههای چندوجهی میتوانند روابطی میان تصویر، متن و صوت بیاموزند.
اما موفقیت در این وظایف بهتنهایی نشاندهندهٔ برخورداری از تجربهٔ ذهنی یا آگاهی انسانی نیست.
ادراک انسان از تعامل پیچیدهٔ دستگاه عصبی، بدن، محیط، حافظه و تجربه شکل میگیرد.
در مقابل، مدلهای چندوجهی معاصر از عملیات محاسباتی و پارامترهای آموختهشده استفاده میکنند.
بنابراین باید میان توانایی پردازش و ترکیب اطلاعات با ادعاهای فلسفی دربارهٔ آگاهی و فهم انسانی تمایز گذاشت.
تفاوت هوش مصنوعی چندوجهی و بینایی ماشین
بینایی ماشین عمدتاً به تحلیل اطلاعات تصویری و ویدئویی میپردازد.
در مقابل، هوش مصنوعی چندوجهی به پردازش و ارتباطدادن چند نوع داده توجه دارد.
برای مثال، مدلی که تنها اشیای موجود در تصویر را شناسایی میکند، نمونهای از کاربرد بینایی ماشین است.
اما سامانهای که تصویر و پرسش متنی را دریافت و بر اساس هر دو پاسخ تولید میکند، نمونهای از کاربرد هوش مصنوعی چندوجهی محسوب میشود.
بینایی ماشین میتواند یکی از اجزای سامانهٔ چندوجهی باشد.
تفاوت هوش مصنوعی چندوجهی و مدل زبانی بزرگ
مدل زبانی بزرگ معمولاً به مدلی اشاره دارد که برای پردازش و تولید زبان در مقیاس بزرگ آموزش دیده است.
در مقابل، هوش مصنوعی چندوجهی به توانایی پردازش یا ارتباطدادن چند وجه داده اشاره میکند.
برخی مدلهای زبانی بزرگ تنها با متن کار میکنند.
برخی دیگر با افزودن اجزای تصویری، صوتی یا دیگر سازوکارها به سامانههای چندوجهی تبدیل میشوند.
بنابراین بزرگی مدل زبانی بهتنهایی به معنای چندوجهیبودن آن نیست.
تفاوت هوش مصنوعی چندوجهی و هوش مصنوعی مولد
هوش مصنوعی مولد به توانایی تولید محتوای جدید اشاره دارد.
هوش مصنوعی چندوجهی به پردازش یا ارتباطدادن چند نوع داده مربوط است.
این دو مفهوم میتوانند مستقل یا همپوشان باشند.
یک مدل تولید متن میتواند مولد و تکوجهی باشد.
یک مدل مقایسهٔ تصویر و متن میتواند چندوجهی باشد، بدون آنکه وظیفهٔ اصلی آن تولید محتوا باشد.
یک سامانهٔ تولید تصویر بر اساس متن نیز میتواند هم مولد و هم چندوجهی محسوب شود.
آیندهٔ هوش مصنوعی چندوجهی
پژوهش دربارهٔ هوش مصنوعی چندوجهی در زمینههای مختلف ادامه دارد.
از جمله جهتگیریهای مهم میتوان به توسعهٔ مدلهای یکپارچهتر، بهبود تحلیل ویدئو، کاهش هزینهٔ محاسباتی، افزایش دقت همترازی دادهها و بهبود قابلیت اعتماد اشاره کرد.
همچنین توسعهٔ سامانههایی که بتوانند اطلاعات تصویری، صوتی و زبانی را در تعاملهای پیوسته پردازش کنند، از موضوعات مهم این حوزه است.
با این حال، پیشرفت فنی باید همراه با ارزیابی ایمنی، حریم خصوصی، شفافیت و پیامدهای اجتماعی باشد.
جمعبندی
هوش مصنوعی چندوجهی یکی از حوزههای مهم هوش مصنوعی معاصر است که به توسعهٔ سامانههایی برای پردازش و ارتباطدادن چند نوع داده، از جمله متن، تصویر، صوت و ویدئو میپردازد.
این حوزه از پژوهشهای قدیمیتر در ادراک چندحسی، پردازش سیگنال، بینایی ماشین و یادگیری ماشین شکل گرفت و با پیشرفت یادگیری عمیق و ترنسفورمر وارد مرحلهٔ تازهای شد.
مدلهایی مانند CLIP، Flamingo، BLIP-2 و LLaVA از نمونههای اثرگذار در توسعهٔ سامانههای بینایی-زبان هستند.[۲][۳][۵][۶]
امروزه هوش مصنوعی چندوجهی در آموزش، پزشکی، رباتیک، تحلیل اسناد، دسترسپذیری و تولید محتوا کاربرد دارد.
با این حال، چندوجهیبودن به معنای درستی تضمینشدهٔ خروجی نیست. خطا در تشخیص، ناسازگاری دادهها، توهم هوش مصنوعی، سوگیری الگوریتمی، خطر جعل محتوای تصویری و صوتی و مسائل مربوط به حریم خصوصی از چالشهای مهم این فناوری به شمار میروند.
اهمیت هوش مصنوعی چندوجهی در آن است که امکان ارتباط محاسباتی میان انواع متفاوت اطلاعات را فراهم میکند و زمینهٔ توسعهٔ سامانههایی را ایجاد میکند که میتوانند وظایف پیچیدهتری را با استفاده از چند منبع داده انجام دهند.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- یادگیری عمیق
- شبکه عصبی مصنوعی
- ترنسفورمر
- بینایی ماشین
- پردازش زبان طبیعی
- مدل زبانی بزرگ
- هوش مصنوعی مولد
- توکن (هوش مصنوعی)
- پرامپت (هوش مصنوعی)
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- تشخیص گفتار
- پردازش تصویر
- رباتیک
- علم داده
- علوم رایانه
منابع
- ↑ ۱٫۰ ۱٫۱ ۱٫۲ Baltrušaitis, Tadas, Chaitanya Ahuja, and Louis-Philippe Morency. “Multimodal Machine Learning: A Survey and Taxonomy.” IEEE Transactions on Pattern Analysis and Machine Intelligence 41, no. 2 (2019): 423–443.
- ↑ ۲٫۰ ۲٫۱ ۲٫۲ ۲٫۳ ۲٫۴ Radford, Alec, et al. “Learning Transferable Visual Models From Natural Language Supervision.” Proceedings of the 38th International Conference on Machine Learning, 2021.
- ↑ ۳٫۰ ۳٫۱ ۳٫۲ ۳٫۳ Alayrac, Jean-Baptiste, et al. “Flamingo: A Visual Language Model for Few-Shot Learning.” 2022.
- ↑ Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).
- ↑ ۵٫۰ ۵٫۱ Li, Junnan, et al. “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.” 2023.
- ↑ ۶٫۰ ۶٫۱ Liu, Haotian, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. “Visual Instruction Tuning.” 2023.
- ↑ Gemini Team, et al. “Gemini: A Family of Highly Capable Multimodal Models.” 2023.
کتابشناسی
- Alayrac, Jean-Baptiste, et al. “Flamingo: A Visual Language Model for Few-Shot Learning.” Advances in Neural Information Processing Systems 35 (2022). متن مقاله
- Baltrušaitis, Tadas, Chaitanya Ahuja, and Louis-Philippe Morency. “Multimodal Machine Learning: A Survey and Taxonomy.” IEEE Transactions on Pattern Analysis and Machine Intelligence 41, no. 2 (2019): 423–443. متن مقاله
- Gemini Team, et al. “Gemini: A Family of Highly Capable Multimodal Models.” 2023. متن گزارش فنی
- Li, Junnan, et al. “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.” Proceedings of the 40th International Conference on Machine Learning, 2023. متن مقاله
- Liu, Haotian, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. “Visual Instruction Tuning.” Advances in Neural Information Processing Systems 36 (2023). متن مقاله
- Radford, Alec, et al. “Learning Transferable Visual Models From Natural Language Supervision.” Proceedings of the 38th International Conference on Machine Learning, 2021. متن مقاله
- Vaswani, Ashish, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017). متن مقاله
```