این دوره با عنوان «طراحی و پیادهسازی مدلهای پایه پردازش تصویر»، یک نقشهراه کامل و منسجم برای ورود به دنیای بینایی کامپیوتر (Computer Vision) محسوب میشود. ساختار آن به گونهای طراحی شده که مهارتآموز را از سطح صفر و مفاهیم پایهای پیکسلها، تا …
این دوره با عنوان «طراحی و پیادهسازی مدلهای پایه پردازش تصویر»، یک نقشهراه کامل و منسجم برای ورود به دنیای بینایی کامپیوتر (Computer Vision) محسوب میشود. ساختار آن به گونهای طراحی شده که مهارتآموز را از سطح صفر و مفاهیم پایهای پیکسلها، تا پیادهسازی پیچیدهترین معماریهای یادگیری عمیق برای مسائل دنیای واقعی، هدایت کند. نقطه قوت این دوره، تلفیق همزمان دانش نظری بنیادین با تمرینهای عملی سنگین با استفاده از کتابخانههای استاندارد صنعتی مانند OpenCV، TensorFlow، Keras و Detectron2 است.
در ابتدا، دوره با پردازش کلاسیک تصویر آغاز میشود؛ جایی که هنرجو با فضاهای رنگی، فیلترهای Gaussian و Sobel، تشخیص لبه با Canny و استخراج ویژگیهای دستساز مانند HOG و SIFT آشنا میشود. این فصل پایهای محکم برای درک چیستی «ویژگی» در تصویر فراهم میکند. بلافاصله پس از آن، دوره وارد مبحث شبکههای کانولوشنی (CNN) میشود و هنرجو از صفر یک مدل طبقهبندی روی دیتاست CIFAR-10 ساخته و با مفاهیمی چون بیشبرازش، افزایش داده (Data Augmentation) و ماتریس درهمریختگی آشنا میگردد.
سپس نوبت به معماریهای پیشرفتهای میرسد که انقلاب بینایی کامپیوتر را رقم زدند؛ از AlexNet و VGG گرفته تا ResNet و Inception. در این بخش، هنرجو نه تنها با مفاهیم عمیقی مانند بلوکهای Residual و Bottleneck آشنا میشود، بلکه میآموزد چطور با استفاده از Functional API، شبکههای چندشاخه و پیچیده طراحی کند. بلافاصله، دوره با یکی از کاربردیترین مباحث یعنی «یادگیری انتقالی» (Transfer Learning) ادامه مییابد و راههای استفاده از مدلهای وزنیدادهشده مانند VGG16 و ResNet50 و تنظیم دقیق (Fine-tuning) آنها روی دیتاستهای سفارشی را به هنرجو آموزش میدهد.
بخش میانی و تخصصیتر دوره، به مسائل چالشبرانگیز تشخیص اشیاء (Object Detection) و بخشبندی اختصاص دارد. هنرجو ضمن درک تفاوت مدلهای یکمرحلهای (YOLO) و دو مرحلهای (Faster R-CNN)، با مفاهیمی مثل Anchor Boxes و Non-Maximum Suppression آشنا شده و آنها را پیادهسازی میکند. در ادامه، پای به حوزه بخشبندی میگذارد و با معماری U-Net برای بخشبندی معنایی (Semantic Segmentation) و معماری Mask R-CNN برای بخشبندی نمونهای (Instance Segmentation) کار میکند و میآموزد چطور ماسکهای پیکسلی دقیق برای هر شیء استخراج کند.
در نهایت، دوره با یک کاربرد فوقالعاده جذاب به نام «سامانههای بازیابی تصویر» (Image Retrieval) به پایان میرسد. این بخش به هنرجو میآموزد که چگونه تصاویر را به بردارهای ویژگی (Feature Vectors) تبدیل کرده و با استفاده از کتابخانههای جستجوی سریع مانند Faiss، یک موتور جستجوی تصویر مبتنی بر محتوا (CBIR) پیادهسازی کند.
مهمترین دستاورد این دوره، تبدیل یک برنامهنویس معمولی به یک متخصص مسلح به ابزارهای روز است؛ کسی که نه تنها تئوری پشت الگوریتمها را میداند، بلکه کدهای اجرایی آن را نوشته و توانایی حل مسائل صنعتی از پزشکی تا خودروهای خودران و فروشگاههای آنلاین را پیدا میکند. این دوره پلی است محکم از تئوری آکادمیک به پیادهسازی صنعتی و آمادهسازی برای پروژههای واقعی در حوزه هوش مصنوعی.
برای این دوره هنوز سرفصلی ثبت نشده است.