CSC 8607 – Introduction au deep learning

Portail informatique

CI5 : Image Captioning avec RNN et Attention sur ResNet

Dans ce TP, vous allez implémenter un modèle d’image captioning utilisant un ResNet pré-entraîné comme extracteur de caractéristiques, combiné à un RNN avec un module d’attention. Ce projet permettra de pratiquer le transfer learning, la gestion du learning rate scheduling, et la mise en œuvre d’un module d’attention personnalisé.

L'objectif de cette application est de prendre une image comme entrée et de produire une légende textuelle pertinente en sortie, c’est-à-dire un modèle de "captioning d'image". Pour cela, nous allons utiliser le dataset Flickr30k contenant plus de 30 000 images avec des descriptions associées.

Objectifs

  • Comprendre et manipuler un dataset d'image captioning (Flickr30k).
  • Mettre en place une pipeline de chargement de données avec des transformations adaptées.
  • Pratiquer le transfert d'apprentissage en utilisant un ResNet50 pré-entraîné.
  • Apprendre à geler les paramètres d'un modèle pour en extraire des caractéristiques fixes.
  • Implémenter un module d'attention personnalisé sur les sorties d'une couche convolutionnelle.
  • Créer une architecture LSTM modifiée intégrant un mécanisme d'attention.
  • Utiliser des embeddings pré-entraînés (Word2Vec) pour la représentation des séquences textuelles.
  • Maîtriser les concepts de tokenisation et détokenisation pour la manipulation de séquences.
  • Concevoir une boucle d'entraînement incluant une planification du taux d'apprentissage (Step Decay).
  • Évaluer l'évolution du modèle en générant des légendes pour des images au fil des epochs.