Valutazione di modelli multimodali locali nel riconoscimento dei passi di un'attività
Triennale Sperimentale 5–6 mesi

Valutazione di modelli multimodali locali nel riconoscimento dei passi di un'attività

In breve

Mettere alla prova un modello multimodale eseguibile sul proprio computer nel riconoscere i passi di un'attività in un video, confrontandolo con un modello specializzato.

Oggi un modello multimodale (MLLM) eseguibile sul proprio computer descrive un video di cucina quasi come farebbe una persona. Non è però noto quanto sia accurato nel riconoscere, secondo per secondo, il passo della ricetta in corso, né quanto sia lento rispetto a un modello piccolo addestrato apposta.

L’obiettivo della tesi è misurarlo con esperimenti su dataset di video di attività: progettare i prompt giusti, costringere il modello a rispondere solo con i passi possibili, e confrontarlo in accuratezza e velocità con un metodo specializzato.

Per iniziare

  • Bai et al., Qwen2.5-VL Technical Report, arXiv 2502.13923, 2025.
  • An et al., MiniROAD: Minimal RNN Framework for Online Action Detection, ICCV 2023.

Ti interessa questa tesi? Scrivimi indicando il tuo corso di laurea e gli esami sostenuti.