آقای امیر رضا فاتح دانشجوی دکتری دکتر محمد رضا جاهد مطلق و دکتر محمدرضا محمدی مورخ: ۱۴۰۵/۰۶/۲۲ ساعت: ۱۶:۰۰ از رساله دکتری خودباعنوان «ناحیه بندی معنایی تصاویر با مجموعه دادگان محمدود به کمک تطبیق گرهای مبتنی بر متن و تصویر» دفاع خواهند نمود .(ادامه مطلب)
دانشجو:امیر رضا فاتح استاد راهنما:دکتر محمد رضا جاهد مطلق و دکتر محمدرضا محمدی
اعضاء هیات داوری: : دکتر محسن سریانی
دکتر سیدصالح اعتمادی
دکتر بابک نجار اعرابی (دانشگاه تهران)
دکتر محمدعلی کیوان راد (دانشگاه مالک اشتر)
تاریخ دفاع: ۱۴۰۵/۰۶/۲۲ ساعت: ۱۶ بعد از ظهر محل: دانشکده کامپیوتر
چکیده: ناحیهبندی معنایی یکی از مسائل بنیادین در بینایی ماشین است که کاربردهای گستردهای در تصویربرداری پزشکی، خودروهای خودران و تحلیل تصاویر دارد. در سالهای اخیر، مدلهای مبتنی بر یادگیری عمیق به رویکردی کارآمد برای حل این مسئله تبدیل شدهاند. با این حال، وابستگی شدید این مدلها به مجموعهدادههای بزرگ با برچسبگذاری نقطهبهنقطه (پیکسلی)، توسعه آنها را در حوزههای با داده محدود با چالش مواجه کرده است. ناحیهبندی با نمونه محدود بهعنوان راهکاری امیدبخش برای این چالش مطرح شده است که هدف آن، ناحیهبندی اشیاء در تصاویر جدید با در اختیار داشتن تنها یک یا چند نمونه برچسبدار (پشتیبان) است. هدف اصلی این رساله، ارتقای دقت و کارایی روشهای ناحیهبندی با نمونه محدود از طریق استخراج مؤثر ویژگیها و بهرهگیری از دانشهای پیشین و چندوجهی است. برای دستیابی به این هدف، مسیر پژوهش در چند گام پیوسته و مکمل طی شده است. در گام نخست، با تمرکز بر طراحی معماریهای سبک و کارآمد، یک شبکه کدگشای چندمقیاسی پیشنهاد شده است. این معماری با بهرهگیری از بخش تولید ماسک زمینهای و کدگشای تبدیلگر مکانی، قادر به استخراج ارتباط میان تصاویر پشتیبان و کوئری بدون از دست دادن اطلاعات مکانی است و توانسته تعادل مطلوبی میان دقت و سرعت ایجاد کند. در گام بعدی، به منظور ارتقای قابلیت تعمیمپذیری و تکیه بر دانش جامعتر، رویکرد پژوهش به سمت تطبیق مدل SAMمعطوف گردید. در این مرحله، با طراحی تطبیقگرهای بصری سبک، دانش غنیِ این مدلهای پیشآموخته بدون نیاز به بازآموزی سنگین به دامنه جدید منتقل شد تا قابلیت ناحیهبندی تکنمونه به شکل چشمگیری فراهم گردد. در نهایت، از آنجا که تکیه صرف بر اطلاعات بصری در سناریوهای با داده بسیار اندک (تکنمونه) گاهی با ابهام همراه است، این رویکرد با یک سازوکار چندوجهی تکمیل شد. در این مرحله، با فرض دسترسی به نام کلاس بهعنوان یک راهنمای کمکی، از دانش زبانی استخراجشده از مدلهای زبانی بزرگ بهره گرفته شد. با تزریق توصیفات دقیق متنی و تلفیق وزنی آنها با ویژگیهای بصری، مدل توانست به درک معنایی عمیقتری از اشیاء دست یابد. یافتهها نشان میدهد که این همافزایی میان متن و تصویر، عملکرد مدل را بهویژه در شرایط کمبود اطلاعات بصری، بهطور مؤثری بهبود میبخشد. نتایج ارزیابیهای جامع بر روی مجموعهدادههای استاندارد PASCALو COCO کارایی برتر روشهای پیشنهادی را بهخوبی اثبات میکند؛ بهگونهای که در سناریوی سخت تکشات، به ترتیب به دقت ۶۹.۴% و ۵۱.۰% بر روی این دو مجموعهداده دست یافتهایم.
چکیده (انگلیسی)
Semantic segmentation is a fundamental task in computer vision with extensive applications in medical imaging, autonomous driving, and image analysis. However, the heavy reliance of deep learning models on large-scale pixel-level annotated datasets hinders their deployment in data-scarce domains. Few-Shot Segmentation (FSS) has emerged as a promising solution, aiming to segment objects in query images given only one or a few labeled support examples. This thesis proposes novel frameworks to advance FSS through three main phases. In the first phase, the focus is on designing efficient and lightweight architectures. To this end, a Multi-Scale Decoder Network (MSDNet) is proposed, incorporating a Contextual Mask Generation module and a Spatial Transformer Decoder. This architecture effectively captures the correlation between support and query images without losing spatial information, achieving an optimal balance between accuracy and efficiency. In the second phase, leveraging the emergence of foundation models, the research shifts towards adapting the Segment Anything Model (SAM) for FSS tasks. In this stage, lightweight visual adapters are designed to transfer the knowledge of pre-trained models to the new domain without heavy training, enabling effective one-shot segmentation capabilities. In the third phase, to address the inherent ambiguities in the one-shot scenario, a multi-modal approach is developed. Assuming access to the class name as auxiliary information, linguistic knowledge extracted from Large Language Models (LLMs) is utilized. By injecting detailed textual descriptions and fusing them with visual features, the model gains a deeper semantic understanding of objects. The findings indicate that this convergence of text and vision significantly enhances performance, particularly when visual information is insufficient. Evaluations on standard benchmarks, Pascal-۵i and COCO-۲۰i, demonstrate the superior performance of the proposed methods compared to state-of-the-art approaches.